# Construindo IdiomX: linguagem além do literal

HTML canônico: https://dsti.school/pt/techblog/idiomx-compreensao-multilingue-expressoes-idiomaticas

Esta versão em português brasileiro é gerada pelo mesmo build do site estático da DSTI que a página HTML canônica. Ela se destina à leitura por máquinas e à consulta concisa.

[DSTI TechBlog](https://dsti.school/pt/techblog)  /  Alunos

Alunos Projeto estudantil · contribuição pública

“Derrame o chá” não é uma instrução que envolva uma bebida. O aluno do DSTI, Ayman Ali Sharara, construiu o IdiomX para testar se os sistemas de IA multilíngues podem detectar o uso idiomático, recuperar expressões figurativas e explicar o significado em inglês, árabe e francês.

AS Ayman Ali Sharara Aluno DSTI · MSc in Data Science & AI · Online assíncrono

26 de maio de 2026 13 minutos de leitura Aprendizado profundo com projeto Python

IdiomX PNL multilíngue linguagem figurada recuperação semântica inglês-árabe-francês projeto de estudante

## Uma expressão. Significado além das palavras.

Expressão observada “Derrame o chá”
Interpretação de expressões idiomáticas

EN Revele fofocas ou segredos pessoais.

RA كشف الشائعات أو الأسرار

França Révéler des potins.

Mais de 190 mil exemplos contextuais

Mais de 12 mil expressões idiomáticas

3 idiomas alinhados

4 tarefas de referência

As expressões idiomáticas expõem uma lacuna entre o reconhecimento de palavras e a compreensão da linguagem. Os seus significados são muitas vezes não composicionais: conhecer cada palavra individual não é suficiente para recuperar o que a expressão significa no contexto. Um sistema pode analisar perfeitamente “quebrar uma perna” e ainda assim confundir incentivo com lesão.

AS
Um projeto estudantil construído para escrutínio público IdiomX começou dentro do curso DSTI Aprendizado profundo com Python , supervisionado por Pr Hanna Abi Akl. Ayman completou o trabalho como estudante no [MSc in Data Science & AI](https://dsti.school/pt/msc-in-data-science-and-ai), estudando através do [Assíncrono on-line](https://dsti.school/pt/online-assincrono) modo. O conjunto de dados resultante, pipeline de construção, modelos, cadernos, papéis e demonstrações são acessíveis ao público.

## 01 Quando a linguagem deixa de ser literal

Os humanos distinguem rotineiramente leituras literais e figurativas do contexto. “Ela derramou o chá na mesa” descreve um acidente; “ela derramou o chá sobre a reunião” descreve a divulgação. Essa distinção permanece difícil para sistemas de linguagem natural porque a sobreposição lexical pode ser quase idêntica enquanto o significado muda completamente.

O projeto original partiu de uma limitação prática: muitos recursos idiomáticos são modestos em escala, limitados na cobertura linguística ou concebidos em torno de uma tarefa isolada. Em vez disso, IdiomX trata a compreensão idiomática como uma sequência de problemas relacionados - desde o reconhecimento do uso figurativo até a recuperação e explicação do significado entre idiomas.

A questão do design: pode um recurso reproduzível apoiar a detecção, a recuperação semântica, o alinhamento interlingual e a recuperação de significado interpretável em vez de avaliar cada capacidade isoladamente?

![Capa do projeto IdiomX ilustrando a compreensão do idioma multilíngue](https://media.dsti.school/wp-content/uploads/2026/05/25102835/IdiomX_Cover.avif)

> **Figure caption:** IdiomX enquadra a compreensão da linguagem figurativa como um problema multilíngue de dados, modelagem e avaliação.

## 02 Construindo um conjunto de dados multilíngue em escala

O lançamento público contém mais de 190.000 exemplos contextuais abrangendo mais de 12.000 expressões idiomáticas. As expressões inglesas estão ligadas às representações semânticas árabes e francesas, juntamente com rótulos de uso idiomáticos, literais e limítrofes e metadados linguísticos de apoio.

≈196K linhas no conjunto de dados Hugging Face completo atual

Mais de 12 mil expressões idiomáticas únicas representadas

EN · AR · FR Alinhamento semântico inglês, árabe e francês

≈1.04 relatou fator de reutilização de frase após a limpeza

O processo de construção combina recursos lexicais, geração controlada e validação. Sua estrutura modular é tão importante quanto seu tamanho: o objetivo é tornar cada etapa inspecionável e repetível, em vez de publicar um arquivo final opaco.

1

### Coleção

Extraia expressões idiomáticas de candidatos de fontes, incluindo dados derivados do Wikcionário e WordNet, enquanto amplia a cobertura com candidatos modernos e gerados.

2

### Limpeza e normalização

Filtre ruídos, padronize expressões, remova duplicatas e prepare registros consistentes para enriquecimento e avaliação.

3

### Enriquecimento LLM controlado

Use GPT-4.1-mini para gerar significados, exemplos contextuais e campos semânticos alinhados em inglês, árabe e francês.

4

### Validação estruturada

Combine pontuação de similaridade semântica, verificações baseadas em regras, desduplicação e divisões com reconhecimento de vazamento para oferecer suporte a benchmarking confiável.

![Pipeline de preparação de dados IdiomX](https://media.dsti.school/wp-content/uploads/2026/05/25135940/IdiomX_Data_perep_Pipeline_v2.avif)

> **Figure caption:** O fluxo de trabalho de preparação de dados passa de fontes lexicais heterogêneas para exemplos normalizados, enriquecidos e validados.

## 03 Mais do que um conjunto de dados: um benchmark progressivo

IdiomX é organizado como uma progressão. A primeira tarefa pergunta se um modelo reconhece o uso figurativo. As tarefas posteriores perguntam se é possível recuperar uma expressão idiomática apropriada do contexto, alinhar o significado entre os idiomas e retornar uma explicação que uma pessoa possa inspecionar.

![Conjunto de dados IdiomX completo e pipeline de benchmark](https://media.dsti.school/wp-content/uploads/2026/05/25140144/IdiomX_full_pipeline_V1.avif)

> **Figure caption:** O fluxo de trabalho completo une construção de conjuntos de dados, treinamento de modelos, benchmarking de recuperação, interpretação multilíngue e artefatos prontos para implantação.

## 04 Quatro tarefas, do reconhecimento à interpretação

Tarefa 1

### Detecção de expressões idiomáticas

Determine se uma expressão está sendo usada idiomaticamente ou literalmente em sua frase.

Comparado

TF-IDF com regressão logística, DistilBERT e RoBERTa

Melhor relatado

RoBERTa

Capacidade

Desambiguação contextual

Tarefa 2

### Recuperação de contexto para expressão idiomática

Dada uma frase contextual, classifique as expressões idiomáticas que melhor expressam seu significado figurativo subjacente.

Comparado

Recuperação densa, lexical e híbrida com reclassificação

Melhor relatado

Recuperação híbrida com um reclassificador ajustado

Capacidade

Recuperação semântica

Tarefa 3

### Recuperação de árabe para o inglês

Use um contexto árabe para recuperar a expressão idiomática correspondente em inglês, testando o alinhamento semântico entre os idiomas.

Comparado

MiniLM multilíngue, E5 multilíngue e E5 ajustado

Melhor relatado

E5 ajustado

Capacidade

Alinhamento translingual

Tarefa 4

### Interpretação de expressões idiomáticas

Recupere a expressão idiomática canônica e explique seu significado em inglês, árabe e francês.

Comparado

Recuperação densa e híbrida, com e sem reclassificação

Melhor relatado

Recuperação híbrida com reclassificação

Capacidade

Fundamentação semântica explicável

## 05 O que os experimentos de benchmark encontraram

O projeto relata que os transformadores contextuais melhoram substancialmente a detecção de expressões idiomáticas, enquanto a recuperação híbrida léxico-densa supera a recuperação densa sozinha. O ajuste fino é particularmente importante para a tarefa de árabe para o inglês, onde as formas superficiais fornecem pouca ajuda lexical direta.

Tarefa | Configuração principal relatada | Resultado principal

Detecção | RoBERTa | 92,6% de precisão · F1 0,926

Contexto → expressão idiomática | Recuperação híbrida + reclassificador ajustado | Primeiro-1 88,5%

Árabe → expressão idiomática em inglês | E5 ajustado | Primeiro-1 57,8%

Interpretação | Recuperação híbrida + reclassificador | Top 1 67,4%

Os números não são intercambiáveis: cada tarefa testa um espaço de busca e uma dificuldade diferentes. Seu valor combinado é a progressão da classificação em direção à recuperação multilíngue e à produção interpretável.

### Uma saída da Tarefa 4 foi projetada para ser legível

Entrada Derrame o chá

Significado canônico Revele fofocas ou segredos pessoais

Saída multilíngue Explicações em inglês, árabe e francês

## 06 Por que a compreensão da linguagem figurada é importante

Expressões idiomáticas não são casos extremos confinados a dicionários. Eles aparecem em conversas, solicitações de suporte, redes sociais, legendas, material didático e instruções do dia a dia. Os sistemas que os interpretam literalmente podem interpretar mal a intenção, mesmo quando cada token individual é familiar.

IA conversacional Chatbots e assistentes que reconhecem melhor o que os usuários realmente querem dizer.

Tradução Sistemas que buscam um significado equivalente em vez de traduzir palavra por palavra.

Aprendizagem de línguas Ferramentas que recuperam explicações, contextos e equivalentes em vários idiomas.

Pesquisa semântica Recuperação baseada no significado pretendido e não na sobreposição de formas superficiais.

Análise de conteúdo Melhor tratamento de gírias, linguagem figurativa e uso dependente do contexto.

Interação humano-robô Interfaces que lidam de forma mais confiável com a fala natural e culturalmente situada.

### O que continua difícil

- Alguns exemplos são gerados por LLM, portanto o enriquecimento controlado não elimina a necessidade de revisão crítica.
- A interpretação idiomática pode legitimamente variar de acordo com o contexto, a cultura e o registro.
- As entradas abertas podem recuperar uma expressão idiomática relacionada em vez da expressão exata pretendida.
- A recuperação interlingual permanece materialmente mais difícil do que a detecção monolíngue.

## 07 O projeto é aberto: dados, código, artigo científico e demonstrações

IdiomX separa o pipeline de construção do conjunto de dados do repositório de modelagem e benchmark. Isto torna a proveniência do recurso mais fácil de inspecionar, ao mesmo tempo que mantém os notebooks das tarefas, os artefatos treinados e as demonstrações organizadas em torno da avaliação.

AS

### Ayman Ali Sharara

Aluno DSTI no MSc in Data Science & AI, estudando via Online assíncrono. Seu trabalho abrange PNL multilíngue, engenharia de dados, sistemas de recuperação e aplicações práticas de IA. IdiomX foi desenvolvido como seu projeto Deep Learning com Python.

[MSc in Data Science & AI](https://dsti.school/pt/msc-in-data-science-and-ai)[Assíncrono on-line](https://dsti.school/pt/online-assincrono)

[LinkedIn](https://www.linkedin.com/in/ayman-sharara/)[GitHub](https://github.com/aymanshar)[Hugging Face](https://huggingface.co/aymansharara)

Artigo adaptado para o DSTI TechBlog da contribuição original do projeto estudantil de Ayman Sharara e da documentação pública atual do projeto. A redação e a apresentação foram revisadas, preservando os métodos, reivindicações e resultados relatados do projeto.

---

© DSTI School of Engineering 2026 - Todos os direitos reservados. Instituição privada de ensino superior - V350 - 2 de agosto de 2026
