HELPER: como construímos um corpus de textos psicologicamente carregados e ajustamos o Qwen para análise local de emoções
Estudantes e pesquisadores da HSE University e da VK criaram um corpus de textos em russo psicologicamente carregados com anotação local de emoções e características psicológicas. A ferramenta de anotação HELPER foi desenvolvida e, com base no corpus, os modelos Qwen-3 8B e 14B foram ajustados para as tarefas de extração de fragmentos emocionais e avaliação do estado do autor.
Uma equipe do Laboratório de IA Aplicada da HSE University e da VK (Alexander Sabko, Victoria Belyavskaya, Sergey Pavlukhin) apresentou o projeto HELPER, voltado para a análise do estado emocional do autor de um texto, considerando manifestações emocionais locais e sua dinâmica. Abordagens padrão de análise de sentimento (classificação binária ou multiclasse) não são adequadas para textos psicologicamente carregados, pois as emoções se manifestam de forma fragmentada, e não como um pano de fundo geral. Os conjuntos de dados existentes em russo possuem diferentes esquemas de anotação e não podem ser combinados. A equipe realizou 10 entrevistas em profundidade com psicólogos clínicos e, com base na análise, desenvolveu um esquema de anotação abrangente com quatro componentes: segmentação emocional (14 emoções baseadas em Ekman e OCC), avaliação das respostas do psicólogo segundo quatro critérios, tags temáticas e avaliação final do estado do cliente em cinco escalas. O corpus foi coletado de três fontes: diálogos de aconselhamento do B17.ru, avaliações do Yandex Maps e posts do VKontakte com comentários. Atualmente, o corpus inclui 786 diálogos anotados com 7 emoções (cerca de 9 milhões de rótulos de caracteres) e 156 diálogos com o esquema estendido de 14 emoções, além de avaliações e posts. Para a anotação, foi criado o aplicativo HELPER na stack .NET 10, ASP.NET Core, Blazor e PostgreSQL, com autenticação via Keycloak. O aplicativo suporta priorização depth-first de diálogos, sistema de pontuação para avaliar o trabalho dos anotadores e um detector de usuários suspeitos. Para demonstrar a viabilidade dos dados, a equipe realizou fine-tuning dos modelos Qwen-3 8B e Qwen-3 14B via LoRA em seu corpus (computação no cHARISMa da HSE University). Os diálogos são normalizados antes da entrada (remoção de códigos BB, URLs), mas o estilo de fala é preservado, pois as características discursivas são importantes para a análise. O projeto mostrou que o corpus coletado permite obter um resultado de maior qualidade para tarefas de análise psicolinguística em comparação com abordagens generalizadas.
Fonte: Habr — хаб ML —
original
