Ex-alunosPesquisa, carreiras e impacto além da graduação
Nesta página
Visão geralO desafio: prever o próximo estadoQuatro níveis ordenados, não quatro rótulos não relacionadosUm método de duas etapas: entenda cada postagem e depois modele a trajetóriaPrevisões LLM contra linhas de base neurais compactasQual a melhor configuração alcançadaÉtica antes da automaçãoPesquisa, replicação e o ex-aluno por trás do trabalho
DSTI TechBlog  /  Ex-alunos
Ex-alunosPesquisa de ex-alunos em ação

PrVedindo risco de saúde mental através das redes sociais

O alvo difícil não é a postagem que já está na tela. É o nível de risco do próximo post — que ainda não foi escrito. O ex-aluno do DSTI, Jannic Alexander Cutura, explica o LLM de dois estágios e a abordagem de modelagem temporal que ficou em primeiro lugar na IEEE Big Data Cup 2025.

saúde mental-aiclassificação ordinalmodelagem temporalLLMsPNLIA responsável

A linguagem da saúde mental pode mudar com o tempo. A IEEE Big Data Cup 2025 pediu aos participantes que trabalhassem com dados anônimos do Reddit e previssem o nível ordinal de risco de suicídio da próxima postagem de um usuário a partir das cinco postagens anteriores e seus carimbos de data e hora. A solução de Jannic combinou classificação de modelo de linguagem grande baseada em prompt com agregação temporal simples. Ganhou o primeiro lugar e um prêmio de US$ 1.000.

!

Assunto e escopoEste artigo discute pesquisas sobre previsão de risco de suicídio. Os modelos descritos produzem estimativas estatísticas, não diagnósticos clínicos, e o trabalho requer explicitamente proteção da privacidade, supervisão humana qualificada e avaliação cuidadosa antes de qualquer uso operacional.

Esta não é uma classificação de texto comum. O texto de destino está ausente. O sistema deve inferir uma futuro estado ordinal de uma sequência curta e irregular de observações anteriores.

01O desafio: prever o próximo estado

A Conferência Internacional IEEE sobre Big Data reúne pesquisas sobre processamento de dados em grande escala, aprendizado de máquina e aplicações do mundo real. A Big Data Cup de 2025, patrocinada pela Universidade Politécnica de Hong Kong, concentrou-se na previsão do risco de suicídio a partir de publicações nas redes sociais.

Para cada sequência, o modelo recebe as cinco postagens mais recentes do usuário e seus carimbos de data/hora. Deve prever o nível de risco de um sexto post que ainda não foi escrito. Essa distinção é importante. A classificação da linguagem visível pergunta: “O que este texto expressa?” A previsão pergunta: “Dada a trajetória recente, o que provavelmente acontecerá a seguir?”

7.000+postar sequências no conjunto de dados de pesquisa
395usuários únicos representados nos dados anonimizados do Reddit
<5%postagens de nível de tentativa, criando uma tarefa fortemente desequilibrada

Quase metade de todas as postagens rotuladas se enquadram na categoria de idealização, enquanto as postagens em nível de tentativa são raras. O modelo, portanto, precisa aprender um alvo ordenado e desequilibrado, em vez de quatro classes intercambiáveis.

Nuvem de palavras produzida a partir de linguagem no conjunto de dados anônimos de pesquisa de mídia social
Idioma representado nos dados do projeto. A pesquisa funciona com postagens anônimas do Reddit marcadas como risco de suicídio ordinal.

02Quatro níveis ordenados, não quatro rótulos não relacionados

Cada postagem recebe um dos quatro níveis de risco. A sua ordem tem significado: uma previsão a um passo de distância não é equivalente a uma previsão no extremo oposto da escala.

Nível 1Indicador

Sinais de alerta gerais.

Nível 2Ideação

Pensamentos suicidas explícitos.

Nível 3Comportamento

Intenção de agir.

Nível 4Tentar

Referência a ações suicidas.

É por isso que a pesquisa relata tanto F1 ponderado quanto erro médio absoluto. F1 reflete a qualidade da classificação em uma distribuição de rótulos desequilibrada. O erro absoluto médio reflete a distância entre as posições previstas e reais na escala ordinal.

03Um método de duas etapas: entenda cada postagem e depois modele a trajetória

A arquitetura central separa a interpretação semântica da previsão temporal. Grandes modelos de linguagem classificam postagens individuais. Um segundo estágio leve combina essas classificações ao longo do tempo.

1

Classificação no nível da postagem

Os modelos GPT-5, GPT-4o e GPT-5-mini, orientados por prompts, atribuem um nível de risco ordinal a cada postagem observada. A abordagem é zero-shot, sem ajuste fino.

2

Agregação temporal

A sequência de previsões no nível da postagem e carimbos de data/hora é combinada para prever o nível de risco da próxima postagem não vista.

O primeiro estágio usa instruções validadas em pesquisas anteriores de PNL em saúde mental. A segunda pergunta quanto peso colocar em cada observação anterior, especialmente quando as postagens estão espaçadas irregularmente.

Média simplesPonderação de recência linearDecadência exponencialPonderação tempo-distânciaPrevisão ARIMA

Uma das conclusões mais nítidas é que a escolha da agregação importa muito menos do que a qualidade das classificações no nível da postagem. As cinco estratégias apresentam desempenho dentro de 0,4% uma da outra. Uma vez que as postagens individuais sejam bem classificadas, até mesmo uma média simples é competitiva.

Visão geral da estrutura de dois estágios que combina classificação pós-nível com agregação temporal
A estrutura de modelagem em dois estágios: classificação semântica das postagens observadas seguida por uma previsão temporal leve do alvo não visto.

04Previsões LLM contra linhas de base neurais compactas

A pesquisa também avalia três métodos neurais que aprendem diretamente a partir de sequências de postagens, sem chamadas externas de modelo.

AbordagemRepresentação e lógica temporalCaracterística operacional
MiniLMIncorporações de frases compactas, agrupamento ponderado pelo tempo e um cabeçalho de regressão ordinal.Modelo local pequeno, mas mais fraco na observação final invisível.
GRUProcessamento sequencial que aprende interações entre dicas de linguagem e ritmo de postagem.Melhor linha de base neural; precisão geral dentro de 0,02% de GPT-5.
DistilBERT + LoRAAdaptação do transformador com parâmetros eficientes enquanto a maioria dos pesos do modelo permanece congelada.Implantação local sem dependência de API externa.
GPT + agregaçãoClassificação de postagem baseada em Prompt seguida por agregação temporal interpretável.Mais forte nas sequências de observação final e barato para armazenar em cache.

As pontuações gerais estão próximas. A separação importante aparece no subconjunto mais difícil: sequências em que o modelo deve prever a postagem final invisível. Aqui, o conhecimento semântico pré-treinado da abordagem LLM generaliza melhor do que os modelos treinados apenas nos dados limitados do desafio.

F1 nas sequências de observação final

GPT-5
0.46
GRU
0.38
MiniLM
0.25

05Qual a melhor configuração alcançada

GPT-5 combinado com a média linear ponderada produziu o resultado geral mais forte.

0.72pontuação geral ponderada da F1
0.30erro médio absoluto na escala ordinal de quatro pontos
≈US$25custo único para classificar as postagens de treinamento com GPT-5
<1msagregação temporal após as previsões de pós-nível serem armazenadas em cache

Um MAE de 0,30 significa que os erros são geralmente locais na escala ordinal: é mais provável que o modelo confunda categorias adjacentes do que salte de um indicador geral para uma previsão em nível de tentativa.

LLMModelos semânticos hospedados

  • Melhor desempenho em observações finais não vistas.
  • As classificações de postagem podem ser armazenadas em cache e reutilizadas.
  • A agregação simples limita o ajuste e a sobrecarga computacional.
  • O processamento externo requer tratamento cuidadoso de dados confidenciais.

LocalModelos de sequência neural

  • Nenhuma dependência de chamadas externas de API.
  • Potencialmente preferível onde os dados devem permanecer dentro de um ambiente controlado.
  • O desempenho geral permanece competitivo.
  • A generalização é mais fraca no subconjunto de observação final genuinamente preditiva.

06Ética antes da automação

A previsão do risco de suicídio não é um problema comum de classificação ou recomendação. O documento trata a implantação como uma responsabilidade sociotécnica e não como um simples limite de precisão.

Quatro limites inegociáveis

Não é um diagnóstico

Os resultados são estimativas estatísticas e não podem substituir a avaliação por profissionais de saúde mental qualificados.

Privacia por design

O uso operacional exigiria manuseio seguro, conformidade com as políticas da plataforma e fortes salvaguardas de proteção de dados.

Ambas as direções do erro são importantes

Os falsos positivos podem causar angústia ou intervenção desnecessária; falsos negativos podem deixar passar pessoas que podem se beneficiar de apoio.

Supervisão humana

Estimativas de incerteza, monitoramento de vieses e revisão humana são partes necessárias de qualquer sistema responsável.

A tecnologia poderá eventualmente apoiar uma intervenção precoce, identificando padrões de mudança em grande escala. Deve complementar o acesso a profissionais qualificados, nunca substituir o vínculo humano no centro dos cuidados de saúde mental.

07Pesquisa, replicação e o ex-aluno por trás do trabalho

A abordagem foi publicada como Time-Aware Ordinal Modelling of Sequential Text Data nos anais da Conferência Internacional IEEE 2025 sobre Big Data. O repositório público contém a solução do desafio e uma cópia do artigo.

Jannic Alexander Cutura

Ex-aluno do DSTI, pesquisador e professor do DSTI School of Engineering e engenheiro de dados do Banco Central Europeu. Seus interesses de pesquisa incluem processamento de linguagem natural, aprendizado de máquina e aplicações de IA em domínios de bem-estar social.

Aviso do autor: as opiniões apresentadas neste trabalho são exclusivamente do autor e não representam as opiniões do Banco Central Europeu ou do Eurosistema de bancos centrais. Artigo adaptado para DSTI TechBlog da contribuição original do autor no WordPress; a redação e a apresentação foram revisadas sem alterar as afirmações da pesquisa, os métodos ou os resultados relatados.