# PrVedindo risco de saúde mental através das redes sociais

HTML canônico: https://dsti.school/pt/techblog/previsao-risco-saude-mental-redes-sociais

Esta versão em português brasileiro é gerada pelo mesmo build do site estático da DSTI que a página HTML canônica. Ela se destina à leitura por máquinas e à consulta concisa.

[DSTI TechBlog](https://dsti.school/pt/techblog)  /  Ex-alunos

Ex-alunos Pesquisa de ex-alunos em ação

O alvo difícil não é a postagem que já está na tela. É o nível de risco do próximo post — que ainda não foi escrito. O ex-aluno do DSTI, Jannic Alexander Cutura, explica o LLM de dois estágios e a abordagem de modelagem temporal que ficou em primeiro lugar na IEEE Big Data Cup 2025.

JC Jannic Alexander Cutura Ex-aluno do DSTI · Pesquisador e professor · Processamento de linguagem natural e engenharia de dados

30 de março de 2026 12 minutos de leitura IEEE Copa Big Data 2025 · 1º lugar

saúde mental-ai classificação ordinal modelagem temporal LLMs PNL IA responsável

## Cinco postagens observadas. Um alvo invisível.

Postagens observadas

P1 t-5

P2 t−4

P3 t-3

P4 t−2

P5 t-1
Alvo futuro Postagem não escrita

t

A questão da modelagem A compreensão semântica de postagens individuais pode ser combinada com um modelo leve de como o risco muda ao longo do tempo?

1º Copa de Big Data IEEE 2025

7.000+ sequências de postagens rotuladas

395 usuários exclusivos do Reddit

4 níveis de risco ordenados

A linguagem da saúde mental pode mudar com o tempo. A IEEE Big Data Cup 2025 pediu aos participantes que trabalhassem com dados anônimos do Reddit e previssem o nível ordinal de risco de suicídio da próxima postagem de um usuário a partir das cinco postagens anteriores e seus carimbos de data e hora. A solução de Jannic combinou classificação de modelo de linguagem grande baseada em prompt com agregação temporal simples. Ganhou o primeiro lugar e um prêmio de US$ 1.000.

!
Assunto e escopo Este artigo discute pesquisas sobre previsão de risco de suicídio. Os modelos descritos produzem estimativas estatísticas, não diagnósticos clínicos, e o trabalho requer explicitamente proteção da privacidade, supervisão humana qualificada e avaliação cuidadosa antes de qualquer uso operacional.

Esta não é uma classificação de texto comum. O texto de destino está ausente. O sistema deve inferir uma futuro estado ordinal de uma sequência curta e irregular de observações anteriores.

## 01 O desafio: prever o próximo estado

A Conferência Internacional IEEE sobre Big Data reúne pesquisas sobre processamento de dados em grande escala, aprendizado de máquina e aplicações do mundo real. A Big Data Cup de 2025, patrocinada pela Universidade Politécnica de Hong Kong, concentrou-se na previsão do risco de suicídio a partir de publicações nas redes sociais.

Para cada sequência, o modelo recebe as cinco postagens mais recentes do usuário e seus carimbos de data/hora. Deve prever o nível de risco de um sexto post que ainda não foi escrito. Essa distinção é importante. A classificação da linguagem visível pergunta: “O que este texto expressa?” A previsão pergunta: “Dada a trajetória recente, o que provavelmente acontecerá a seguir?”

7.000+ postar sequências no conjunto de dados de pesquisa

395 usuários únicos representados nos dados anonimizados do Reddit

<5% postagens de nível de tentativa, criando uma tarefa fortemente desequilibrada

Quase metade de todas as postagens rotuladas se enquadram na categoria de idealização, enquanto as postagens em nível de tentativa são raras. O modelo, portanto, precisa aprender um alvo ordenado e desequilibrado, em vez de quatro classes intercambiáveis.

![Nuvem de palavras produzida a partir de linguagem no conjunto de dados anônimos de pesquisa de mídia social](https://media.dsti.school/wp-content/uploads/2026/03/26095244/wordcloud.avif)

> **Figure caption:** Idioma representado nos dados do projeto. A pesquisa funciona com postagens anônimas do Reddit marcadas como risco de suicídio ordinal.

## 02 Quatro níveis ordenados, não quatro rótulos não relacionados

Cada postagem recebe um dos quatro níveis de risco. A sua ordem tem significado: uma previsão a um passo de distância não é equivalente a uma previsão no extremo oposto da escala.

Nível 1 Indicador
Sinais de alerta gerais.

Nível 2 Ideação
Pensamentos suicidas explícitos.

Nível 3 Comportamento
Intenção de agir.

Nível 4 Tentar
Referência a ações suicidas.

É por isso que a pesquisa relata tanto F1 ponderado quanto erro médio absoluto. F1 reflete a qualidade da classificação em uma distribuição de rótulos desequilibrada. O erro absoluto médio reflete a distância entre as posições previstas e reais na escala ordinal.

## 03 Um método de duas etapas: entenda cada postagem e depois modele a trajetória

A arquitetura central separa a interpretação semântica da previsão temporal. Grandes modelos de linguagem classificam postagens individuais. Um segundo estágio leve combina essas classificações ao longo do tempo.

1

### Classificação no nível da postagem

Os modelos GPT-5, GPT-4o e GPT-5-mini, orientados por prompts, atribuem um nível de risco ordinal a cada postagem observada. A abordagem é zero-shot, sem ajuste fino.
2

### Agregação temporal

A sequência de previsões no nível da postagem e carimbos de data/hora é combinada para prever o nível de risco da próxima postagem não vista.

O primeiro estágio usa instruções validadas em pesquisas anteriores de PNL em saúde mental. A segunda pergunta quanto peso colocar em cada observação anterior, especialmente quando as postagens estão espaçadas irregularmente.

Média simples Ponderação de recência linear Decadência exponencial Ponderação tempo-distância Previsão ARIMA

Uma das conclusões mais nítidas é que a escolha da agregação importa muito menos do que a qualidade das classificações no nível da postagem. As cinco estratégias apresentam desempenho dentro de 0,4% uma da outra. Uma vez que as postagens individuais sejam bem classificadas, até mesmo uma média simples é competitiva.

![Visão geral da estrutura de dois estágios que combina classificação pós-nível com agregação temporal](https://media.dsti.school/wp-content/uploads/2026/03/26100936/verview-of-the-two-stage-modeling-framework-scaled.avif)

> **Figure caption:** A estrutura de modelagem em dois estágios: classificação semântica das postagens observadas seguida por uma previsão temporal leve do alvo não visto.

## 04 Previsões LLM contra linhas de base neurais compactas

A pesquisa também avalia três métodos neurais que aprendem diretamente a partir de sequências de postagens, sem chamadas externas de modelo.

Abordagem | Representação e lógica temporal | Característica operacional

MiniLM | Incorporações de frases compactas, agrupamento ponderado pelo tempo e um cabeçalho de regressão ordinal. | Modelo local pequeno, mas mais fraco na observação final invisível.

GRU | Processamento sequencial que aprende interações entre dicas de linguagem e ritmo de postagem. | Melhor linha de base neural; precisão geral dentro de 0,02% de GPT-5.

DistilBERT + LoRA | Adaptação do transformador com parâmetros eficientes enquanto a maioria dos pesos do modelo permanece congelada. | Implantação local sem dependência de API externa.

GPT + agregação | Classificação de postagem baseada em Prompt seguida por agregação temporal interpretável. | Mais forte nas sequências de observação final e barato para armazenar em cache.

As pontuações gerais estão próximas. A separação importante aparece no subconjunto mais difícil: sequências em que o modelo deve prever a postagem final invisível. Aqui, o conhecimento semântico pré-treinado da abordagem LLM generaliza melhor do que os modelos treinados apenas nos dados limitados do desafio.

### F1 nas sequências de observação final

GPT-5

0.46

GRU

0.38

MiniLM

0.25

## 05 Qual a melhor configuração alcançada

GPT-5 combinado com a média linear ponderada produziu o resultado geral mais forte.

0.72 pontuação geral ponderada da F1

0.30 erro médio absoluto na escala ordinal de quatro pontos

≈US$25 custo único para classificar as postagens de treinamento com GPT-5

<1ms agregação temporal após as previsões de pós-nível serem armazenadas em cache

Um MAE de 0,30 significa que os erros são geralmente locais na escala ordinal: é mais provável que o modelo confunda categorias adjacentes do que salte de um indicador geral para uma previsão em nível de tentativa.

### LLM Modelos semânticos hospedados

- Melhor desempenho em observações finais não vistas.
- As classificações de postagem podem ser armazenadas em cache e reutilizadas.
- A agregação simples limita o ajuste e a sobrecarga computacional.
- O processamento externo requer tratamento cuidadoso de dados confidenciais.

### Local Modelos de sequência neural

- Nenhuma dependência de chamadas externas de API.
- Potencialmente preferível onde os dados devem permanecer dentro de um ambiente controlado.
- O desempenho geral permanece competitivo.
- A generalização é mais fraca no subconjunto de observação final genuinamente preditiva.

## 06 Ética antes da automação

A previsão do risco de suicídio não é um problema comum de classificação ou recomendação. O documento trata a implantação como uma responsabilidade sociotécnica e não como um simples limite de precisão.

### Quatro limites inegociáveis

Não é um diagnóstico
Os resultados são estimativas estatísticas e não podem substituir a avaliação por profissionais de saúde mental qualificados.

Privacia por design
O uso operacional exigiria manuseio seguro, conformidade com as políticas da plataforma e fortes salvaguardas de proteção de dados.

Ambas as direções do erro são importantes
Os falsos positivos podem causar angústia ou intervenção desnecessária; falsos negativos podem deixar passar pessoas que podem se beneficiar de apoio.

Supervisão humana
Estimativas de incerteza, monitoramento de vieses e revisão humana são partes necessárias de qualquer sistema responsável.

A tecnologia poderá eventualmente apoiar uma intervenção precoce, identificando padrões de mudança em grande escala. Deve complementar o acesso a profissionais qualificados, nunca substituir o vínculo humano no centro dos cuidados de saúde mental.

## 07 Pesquisa, replicação e o ex-aluno por trás do trabalho

A abordagem foi publicada como Time-Aware Ordinal Modelling of Sequential Text Data nos anais da Conferência Internacional IEEE 2025 sobre Big Data. O repositório público contém a solução do desafio e uma cópia do artigo.

JC

### Jannic Alexander Cutura

Ex-aluno do DSTI, pesquisador e professor do DSTI School of Engineering e engenheiro de dados do Banco Central Europeu. Seus interesses de pesquisa incluem processamento de linguagem natural, aprendizado de máquina e aplicações de IA em domínios de bem-estar social.

[LinkedIn](https://www.linkedin.com/in/jannic-cutura/)[GitHub](https://github.com/JannicCutura)[Site](https://www.janniccutura.net/)

Aviso do autor: as opiniões apresentadas neste trabalho são exclusivamente do autor e não representam as opiniões do Banco Central Europeu ou do Eurosistema de bancos centrais. Artigo adaptado para DSTI TechBlog da contribuição original do autor no WordPress; a redação e a apresentação foram revisadas sem alterar as afirmações da pesquisa, os métodos ou os resultados relatados.

---

© DSTI School of Engineering 2026 - Todos os direitos reservados. Instituição privada de ensino superior - V350 - 2 de agosto de 2026
