A linguagem da saúde mental pode mudar com o tempo. A IEEE Big Data Cup 2025 pediu aos participantes que trabalhassem com dados anônimos do Reddit e previssem o nível ordinal de risco de suicídio da próxima postagem de um usuário a partir das cinco postagens anteriores e seus carimbos de data e hora. A solução de Jannic combinou classificação de modelo de linguagem grande baseada em prompt com agregação temporal simples. Ganhou o primeiro lugar e um prêmio de US$ 1.000.
Assunto e escopoEste artigo discute pesquisas sobre previsão de risco de suicídio. Os modelos descritos produzem estimativas estatísticas, não diagnósticos clínicos, e o trabalho requer explicitamente proteção da privacidade, supervisão humana qualificada e avaliação cuidadosa antes de qualquer uso operacional.
01O desafio: prever o próximo estado
A Conferência Internacional IEEE sobre Big Data reúne pesquisas sobre processamento de dados em grande escala, aprendizado de máquina e aplicações do mundo real. A Big Data Cup de 2025, patrocinada pela Universidade Politécnica de Hong Kong, concentrou-se na previsão do risco de suicídio a partir de publicações nas redes sociais.
Para cada sequência, o modelo recebe as cinco postagens mais recentes do usuário e seus carimbos de data/hora. Deve prever o nível de risco de um sexto post que ainda não foi escrito. Essa distinção é importante. A classificação da linguagem visível pergunta: “O que este texto expressa?” A previsão pergunta: “Dada a trajetória recente, o que provavelmente acontecerá a seguir?”
Quase metade de todas as postagens rotuladas se enquadram na categoria de idealização, enquanto as postagens em nível de tentativa são raras. O modelo, portanto, precisa aprender um alvo ordenado e desequilibrado, em vez de quatro classes intercambiáveis.

02Quatro níveis ordenados, não quatro rótulos não relacionados
Cada postagem recebe um dos quatro níveis de risco. A sua ordem tem significado: uma previsão a um passo de distância não é equivalente a uma previsão no extremo oposto da escala.
Sinais de alerta gerais.
Pensamentos suicidas explícitos.
Intenção de agir.
Referência a ações suicidas.
É por isso que a pesquisa relata tanto F1 ponderado quanto erro médio absoluto. F1 reflete a qualidade da classificação em uma distribuição de rótulos desequilibrada. O erro absoluto médio reflete a distância entre as posições previstas e reais na escala ordinal.
03Um método de duas etapas: entenda cada postagem e depois modele a trajetória
A arquitetura central separa a interpretação semântica da previsão temporal. Grandes modelos de linguagem classificam postagens individuais. Um segundo estágio leve combina essas classificações ao longo do tempo.
Classificação no nível da postagem
Os modelos GPT-5, GPT-4o e GPT-5-mini, orientados por prompts, atribuem um nível de risco ordinal a cada postagem observada. A abordagem é zero-shot, sem ajuste fino.
Agregação temporal
A sequência de previsões no nível da postagem e carimbos de data/hora é combinada para prever o nível de risco da próxima postagem não vista.
O primeiro estágio usa instruções validadas em pesquisas anteriores de PNL em saúde mental. A segunda pergunta quanto peso colocar em cada observação anterior, especialmente quando as postagens estão espaçadas irregularmente.
Uma das conclusões mais nítidas é que a escolha da agregação importa muito menos do que a qualidade das classificações no nível da postagem. As cinco estratégias apresentam desempenho dentro de 0,4% uma da outra. Uma vez que as postagens individuais sejam bem classificadas, até mesmo uma média simples é competitiva.

04Previsões LLM contra linhas de base neurais compactas
A pesquisa também avalia três métodos neurais que aprendem diretamente a partir de sequências de postagens, sem chamadas externas de modelo.
| Abordagem | Representação e lógica temporal | Característica operacional |
|---|---|---|
| MiniLM | Incorporações de frases compactas, agrupamento ponderado pelo tempo e um cabeçalho de regressão ordinal. | Modelo local pequeno, mas mais fraco na observação final invisível. |
| GRU | Processamento sequencial que aprende interações entre dicas de linguagem e ritmo de postagem. | Melhor linha de base neural; precisão geral dentro de 0,02% de GPT-5. |
| DistilBERT + LoRA | Adaptação do transformador com parâmetros eficientes enquanto a maioria dos pesos do modelo permanece congelada. | Implantação local sem dependência de API externa. |
| GPT + agregação | Classificação de postagem baseada em Prompt seguida por agregação temporal interpretável. | Mais forte nas sequências de observação final e barato para armazenar em cache. |
As pontuações gerais estão próximas. A separação importante aparece no subconjunto mais difícil: sequências em que o modelo deve prever a postagem final invisível. Aqui, o conhecimento semântico pré-treinado da abordagem LLM generaliza melhor do que os modelos treinados apenas nos dados limitados do desafio.
F1 nas sequências de observação final
05Qual a melhor configuração alcançada
GPT-5 combinado com a média linear ponderada produziu o resultado geral mais forte.
Um MAE de 0,30 significa que os erros são geralmente locais na escala ordinal: é mais provável que o modelo confunda categorias adjacentes do que salte de um indicador geral para uma previsão em nível de tentativa.
LLMModelos semânticos hospedados
- Melhor desempenho em observações finais não vistas.
- As classificações de postagem podem ser armazenadas em cache e reutilizadas.
- A agregação simples limita o ajuste e a sobrecarga computacional.
- O processamento externo requer tratamento cuidadoso de dados confidenciais.
LocalModelos de sequência neural
- Nenhuma dependência de chamadas externas de API.
- Potencialmente preferível onde os dados devem permanecer dentro de um ambiente controlado.
- O desempenho geral permanece competitivo.
- A generalização é mais fraca no subconjunto de observação final genuinamente preditiva.
06Ética antes da automação
A previsão do risco de suicídio não é um problema comum de classificação ou recomendação. O documento trata a implantação como uma responsabilidade sociotécnica e não como um simples limite de precisão.
Quatro limites inegociáveis
Os resultados são estimativas estatísticas e não podem substituir a avaliação por profissionais de saúde mental qualificados.
O uso operacional exigiria manuseio seguro, conformidade com as políticas da plataforma e fortes salvaguardas de proteção de dados.
Os falsos positivos podem causar angústia ou intervenção desnecessária; falsos negativos podem deixar passar pessoas que podem se beneficiar de apoio.
Estimativas de incerteza, monitoramento de vieses e revisão humana são partes necessárias de qualquer sistema responsável.
A tecnologia poderá eventualmente apoiar uma intervenção precoce, identificando padrões de mudança em grande escala. Deve complementar o acesso a profissionais qualificados, nunca substituir o vínculo humano no centro dos cuidados de saúde mental.
07Pesquisa, replicação e o ex-aluno por trás do trabalho
A abordagem foi publicada como Time-Aware Ordinal Modelling of Sequential Text Data nos anais da Conferência Internacional IEEE 2025 sobre Big Data. O repositório público contém a solução do desafio e uma cópia do artigo.
Jannic Alexander Cutura
Ex-aluno do DSTI, pesquisador e professor do DSTI School of Engineering e engenheiro de dados do Banco Central Europeu. Seus interesses de pesquisa incluem processamento de linguagem natural, aprendizado de máquina e aplicações de IA em domínios de bem-estar social.
Aviso do autor: as opiniões apresentadas neste trabalho são exclusivamente do autor e não representam as opiniões do Banco Central Europeu ou do Eurosistema de bancos centrais. Artigo adaptado para DSTI TechBlog da contribuição original do autor no WordPress; a redação e a apresentação foram revisadas sem alterar as afirmações da pesquisa, os métodos ou os resultados relatados.