As expressões idiomáticas expõem uma lacuna entre o reconhecimento de palavras e a compreensão da linguagem. Os seus significados são muitas vezes não composicionais: conhecer cada palavra individual não é suficiente para recuperar o que a expressão significa no contexto. Um sistema pode analisar perfeitamente “quebrar uma perna” e ainda assim confundir incentivo com lesão.
01Quando a linguagem deixa de ser literal
Os humanos distinguem rotineiramente leituras literais e figurativas do contexto. “Ela derramou o chá na mesa” descreve um acidente; “ela derramou o chá sobre a reunião” descreve a divulgação. Essa distinção permanece difícil para sistemas de linguagem natural porque a sobreposição lexical pode ser quase idêntica enquanto o significado muda completamente.
O projeto original partiu de uma limitação prática: muitos recursos idiomáticos são modestos em escala, limitados na cobertura linguística ou concebidos em torno de uma tarefa isolada. Em vez disso, IdiomX trata a compreensão idiomática como uma sequência de problemas relacionados - desde o reconhecimento do uso figurativo até a recuperação e explicação do significado entre idiomas.

02Construindo um conjunto de dados multilíngue em escala
O lançamento público contém mais de 190.000 exemplos contextuais abrangendo mais de 12.000 expressões idiomáticas. As expressões inglesas estão ligadas às representações semânticas árabes e francesas, juntamente com rótulos de uso idiomáticos, literais e limítrofes e metadados linguísticos de apoio.
O processo de construção combina recursos lexicais, geração controlada e validação. Sua estrutura modular é tão importante quanto seu tamanho: o objetivo é tornar cada etapa inspecionável e repetível, em vez de publicar um arquivo final opaco.
Coleção
Extraia expressões idiomáticas de candidatos de fontes, incluindo dados derivados do Wikcionário e WordNet, enquanto amplia a cobertura com candidatos modernos e gerados.
Limpeza e normalização
Filtre ruídos, padronize expressões, remova duplicatas e prepare registros consistentes para enriquecimento e avaliação.
Enriquecimento LLM controlado
Use GPT-4.1-mini para gerar significados, exemplos contextuais e campos semânticos alinhados em inglês, árabe e francês.
Validação estruturada
Combine pontuação de similaridade semântica, verificações baseadas em regras, desduplicação e divisões com reconhecimento de vazamento para oferecer suporte a benchmarking confiável.

03Mais do que um conjunto de dados: um benchmark progressivo
IdiomX é organizado como uma progressão. A primeira tarefa pergunta se um modelo reconhece o uso figurativo. As tarefas posteriores perguntam se é possível recuperar uma expressão idiomática apropriada do contexto, alinhar o significado entre os idiomas e retornar uma explicação que uma pessoa possa inspecionar.

04Quatro tarefas, do reconhecimento à interpretação
Detecção de expressões idiomáticas
Determine se uma expressão está sendo usada idiomaticamente ou literalmente em sua frase.
- Comparado
- TF-IDF com regressão logística, DistilBERT e RoBERTa
- Melhor relatado
- RoBERTa
- Capacidade
- Desambiguação contextual
Recuperação de contexto para expressão idiomática
Dada uma frase contextual, classifique as expressões idiomáticas que melhor expressam seu significado figurativo subjacente.
- Comparado
- Recuperação densa, lexical e híbrida com reclassificação
- Melhor relatado
- Recuperação híbrida com um reclassificador ajustado
- Capacidade
- Recuperação semântica
Recuperação de árabe para o inglês
Use um contexto árabe para recuperar a expressão idiomática correspondente em inglês, testando o alinhamento semântico entre os idiomas.
- Comparado
- MiniLM multilíngue, E5 multilíngue e E5 ajustado
- Melhor relatado
- E5 ajustado
- Capacidade
- Alinhamento translingual
Interpretação de expressões idiomáticas
Recupere a expressão idiomática canônica e explique seu significado em inglês, árabe e francês.
- Comparado
- Recuperação densa e híbrida, com e sem reclassificação
- Melhor relatado
- Recuperação híbrida com reclassificação
- Capacidade
- Fundamentação semântica explicável
05O que os experimentos de benchmark encontraram
O projeto relata que os transformadores contextuais melhoram substancialmente a detecção de expressões idiomáticas, enquanto a recuperação híbrida léxico-densa supera a recuperação densa sozinha. O ajuste fino é particularmente importante para a tarefa de árabe para o inglês, onde as formas superficiais fornecem pouca ajuda lexical direta.
| Tarefa | Configuração principal relatada | Resultado principal |
|---|---|---|
| Detecção | RoBERTa | 92,6% de precisão · F1 0,926 |
| Contexto → expressão idiomática | Recuperação híbrida + reclassificador ajustado | Primeiro-1 88,5% |
| Árabe → expressão idiomática em inglês | E5 ajustado | Primeiro-1 57,8% |
| Interpretação | Recuperação híbrida + reclassificador | Top 1 67,4% |
Os números não são intercambiáveis: cada tarefa testa um espaço de busca e uma dificuldade diferentes. Seu valor combinado é a progressão da classificação em direção à recuperação multilíngue e à produção interpretável.
Uma saída da Tarefa 4 foi projetada para ser legível
06Por que a compreensão da linguagem figurada é importante
Expressões idiomáticas não são casos extremos confinados a dicionários. Eles aparecem em conversas, solicitações de suporte, redes sociais, legendas, material didático e instruções do dia a dia. Os sistemas que os interpretam literalmente podem interpretar mal a intenção, mesmo quando cada token individual é familiar.
07O projeto é aberto: dados, código, artigo científico e demonstrações
IdiomX separa o pipeline de construção do conjunto de dados do repositório de modelagem e benchmark. Isto torna a proveniência do recurso mais fácil de inspecionar, ao mesmo tempo que mantém os notebooks das tarefas, os artefatos treinados e as demonstrações organizadas em torno da avaliação.
Ayman Ali Sharara
Aluno DSTI no MSc in Data Science & AI, estudando via Online assíncrono. Seu trabalho abrange PNL multilíngue, engenharia de dados, sistemas de recuperação e aplicações práticas de IA. IdiomX foi desenvolvido como seu projeto Deep Learning com Python.
Artigo adaptado para o DSTI TechBlog da contribuição original do projeto estudantil de Ayman Sharara e da documentação pública atual do projeto. A redação e a apresentação foram revisadas, preservando os métodos, reivindicações e resultados relatados do projeto.