AlunosPrOjetos, experimentos e contribuições públicas
Nesta página
Visão geralQuando a linguagem deixa de ser literalConstruindo um conjunto de dados multilíngue em escalaMais do que um conjunto de dados: um benchmark progressivoQuatro tarefas, do reconhecimento à interpretaçãoO que os experimentos de benchmark encontraramPor que a compreensão da linguagem figurada é importanteO projeto é aberto: dados, código, artigo científico e demonstrações
DSTI TechBlog  /  Alunos
AlunosProjeto estudantil · contribuição pública

Construindo IdiomX: linguagem além do literal

“Derrame o chá” não é uma instrução que envolva uma bebida. O aluno do DSTI, Ayman Ali Sharara, construiu o IdiomX para testar se os sistemas de IA multilíngues podem detectar o uso idiomático, recuperar expressões figurativas e explicar o significado em inglês, árabe e francês.

IdiomXPNL multilínguelinguagem figuradarecuperação semânticainglês-árabe-francêsprojeto de estudante

As expressões idiomáticas expõem uma lacuna entre o reconhecimento de palavras e a compreensão da linguagem. Os seus significados são muitas vezes não composicionais: conhecer cada palavra individual não é suficiente para recuperar o que a expressão significa no contexto. Um sistema pode analisar perfeitamente “quebrar uma perna” e ainda assim confundir incentivo com lesão.

01Quando a linguagem deixa de ser literal

Os humanos distinguem rotineiramente leituras literais e figurativas do contexto. “Ela derramou o chá na mesa” descreve um acidente; “ela derramou o chá sobre a reunião” descreve a divulgação. Essa distinção permanece difícil para sistemas de linguagem natural porque a sobreposição lexical pode ser quase idêntica enquanto o significado muda completamente.

O projeto original partiu de uma limitação prática: muitos recursos idiomáticos são modestos em escala, limitados na cobertura linguística ou concebidos em torno de uma tarefa isolada. Em vez disso, IdiomX trata a compreensão idiomática como uma sequência de problemas relacionados - desde o reconhecimento do uso figurativo até a recuperação e explicação do significado entre idiomas.

A questão do design: pode um recurso reproduzível apoiar a detecção, a recuperação semântica, o alinhamento interlingual e a recuperação de significado interpretável em vez de avaliar cada capacidade isoladamente?
Capa do projeto IdiomX ilustrando a compreensão do idioma multilíngue
IdiomX enquadra a compreensão da linguagem figurativa como um problema multilíngue de dados, modelagem e avaliação.

02Construindo um conjunto de dados multilíngue em escala

O lançamento público contém mais de 190.000 exemplos contextuais abrangendo mais de 12.000 expressões idiomáticas. As expressões inglesas estão ligadas às representações semânticas árabes e francesas, juntamente com rótulos de uso idiomáticos, literais e limítrofes e metadados linguísticos de apoio.

≈196Klinhas no conjunto de dados Hugging Face completo atual
Mais de 12 milexpressões idiomáticas únicas representadas
EN · AR · FRAlinhamento semântico inglês, árabe e francês
≈1.04relatou fator de reutilização de frase após a limpeza

O processo de construção combina recursos lexicais, geração controlada e validação. Sua estrutura modular é tão importante quanto seu tamanho: o objetivo é tornar cada etapa inspecionável e repetível, em vez de publicar um arquivo final opaco.

1

Coleção

Extraia expressões idiomáticas de candidatos de fontes, incluindo dados derivados do Wikcionário e WordNet, enquanto amplia a cobertura com candidatos modernos e gerados.

2

Limpeza e normalização

Filtre ruídos, padronize expressões, remova duplicatas e prepare registros consistentes para enriquecimento e avaliação.

3

Enriquecimento LLM controlado

Use GPT-4.1-mini para gerar significados, exemplos contextuais e campos semânticos alinhados em inglês, árabe e francês.

4

Validação estruturada

Combine pontuação de similaridade semântica, verificações baseadas em regras, desduplicação e divisões com reconhecimento de vazamento para oferecer suporte a benchmarking confiável.

Pipeline de preparação de dados IdiomX
O fluxo de trabalho de preparação de dados passa de fontes lexicais heterogêneas para exemplos normalizados, enriquecidos e validados.

03Mais do que um conjunto de dados: um benchmark progressivo

IdiomX é organizado como uma progressão. A primeira tarefa pergunta se um modelo reconhece o uso figurativo. As tarefas posteriores perguntam se é possível recuperar uma expressão idiomática apropriada do contexto, alinhar o significado entre os idiomas e retornar uma explicação que uma pessoa possa inspecionar.

Conjunto de dados IdiomX completo e pipeline de benchmark
O fluxo de trabalho completo une construção de conjuntos de dados, treinamento de modelos, benchmarking de recuperação, interpretação multilíngue e artefatos prontos para implantação.

04Quatro tarefas, do reconhecimento à interpretação

Tarefa 1

Detecção de expressões idiomáticas

Determine se uma expressão está sendo usada idiomaticamente ou literalmente em sua frase.

Comparado
TF-IDF com regressão logística, DistilBERT e RoBERTa
Melhor relatado
RoBERTa
Capacidade
Desambiguação contextual
Tarefa 2

Recuperação de contexto para expressão idiomática

Dada uma frase contextual, classifique as expressões idiomáticas que melhor expressam seu significado figurativo subjacente.

Comparado
Recuperação densa, lexical e híbrida com reclassificação
Melhor relatado
Recuperação híbrida com um reclassificador ajustado
Capacidade
Recuperação semântica
Tarefa 3

Recuperação de árabe para o inglês

Use um contexto árabe para recuperar a expressão idiomática correspondente em inglês, testando o alinhamento semântico entre os idiomas.

Comparado
MiniLM multilíngue, E5 multilíngue e E5 ajustado
Melhor relatado
E5 ajustado
Capacidade
Alinhamento translingual
Tarefa 4

Interpretação de expressões idiomáticas

Recupere a expressão idiomática canônica e explique seu significado em inglês, árabe e francês.

Comparado
Recuperação densa e híbrida, com e sem reclassificação
Melhor relatado
Recuperação híbrida com reclassificação
Capacidade
Fundamentação semântica explicável

05O que os experimentos de benchmark encontraram

O projeto relata que os transformadores contextuais melhoram substancialmente a detecção de expressões idiomáticas, enquanto a recuperação híbrida léxico-densa supera a recuperação densa sozinha. O ajuste fino é particularmente importante para a tarefa de árabe para o inglês, onde as formas superficiais fornecem pouca ajuda lexical direta.

TarefaConfiguração principal relatadaResultado principal
DetecçãoRoBERTa92,6% de precisão · F1 0,926
Contexto → expressão idiomáticaRecuperação híbrida + reclassificador ajustadoPrimeiro-1 88,5%
Árabe → expressão idiomática em inglêsE5 ajustadoPrimeiro-1 57,8%
InterpretaçãoRecuperação híbrida + reclassificadorTop 1 67,4%

Os números não são intercambiáveis: cada tarefa testa um espaço de busca e uma dificuldade diferentes. Seu valor combinado é a progressão da classificação em direção à recuperação multilíngue e à produção interpretável.

Uma saída da Tarefa 4 foi projetada para ser legível

EntradaDerrame o chá
Significado canônicoRevele fofocas ou segredos pessoais
Saída multilíngueExplicações em inglês, árabe e francês

06Por que a compreensão da linguagem figurada é importante

Expressões idiomáticas não são casos extremos confinados a dicionários. Eles aparecem em conversas, solicitações de suporte, redes sociais, legendas, material didático e instruções do dia a dia. Os sistemas que os interpretam literalmente podem interpretar mal a intenção, mesmo quando cada token individual é familiar.

IA conversacionalChatbots e assistentes que reconhecem melhor o que os usuários realmente querem dizer.
TraduçãoSistemas que buscam um significado equivalente em vez de traduzir palavra por palavra.
Aprendizagem de línguasFerramentas que recuperam explicações, contextos e equivalentes em vários idiomas.
Pesquisa semânticaRecuperação baseada no significado pretendido e não na sobreposição de formas superficiais.
Análise de conteúdoMelhor tratamento de gírias, linguagem figurativa e uso dependente do contexto.
Interação humano-robôInterfaces que lidam de forma mais confiável com a fala natural e culturalmente situada.

07O projeto é aberto: dados, código, artigo científico e demonstrações

IdiomX separa o pipeline de construção do conjunto de dados do repositório de modelagem e benchmark. Isto torna a proveniência do recurso mais fácil de inspecionar, ao mesmo tempo que mantém os notebooks das tarefas, os artefatos treinados e as demonstrações organizadas em torno da avaliação.

Ayman Ali Sharara

Aluno DSTI no MSc in Data Science & AI, estudando via Online assíncrono. Seu trabalho abrange PNL multilíngue, engenharia de dados, sistemas de recuperação e aplicações práticas de IA. IdiomX foi desenvolvido como seu projeto Deep Learning com Python.

Artigo adaptado para o DSTI TechBlog da contribuição original do projeto estudantil de Ayman Sharara e da documentação pública atual do projeto. A redação e a apresentação foram revisadas, preservando os métodos, reivindicações e resultados relatados do projeto.