HELPER: Cómo construimos un corpus de textos psicológicamente cargados y ajustamos Qwen para el análisis local de emociones
Estudiantes e investigadores de la Universidad HSE y VK han creado un corpus de textos en ruso psicológicamente cargados con anotación local de emociones y características psicológicas. Se desarrolló la herramienta de anotación HELPER y, basándose en el corpus, se ajustaron los modelos Qwen-3 8B y 14B para las tareas de extracción de fragmentos emocionales y evaluación del estado del autor.
Un equipo del taller de IA aplicada de la Universidad Nacional de Investigación Escuela Superior de Economía y VK (Alexander Sabko, Victoria Belyavskaya, Sergei Pavlukhin) presentó el proyecto HELPER, orientado al análisis del estado emocional del autor de un texto teniendo en cuenta manifestaciones emocionales locales y su dinámica. Los enfoques estándar de análisis de sentimiento (clasificación binaria o multiclase) no son adecuados para textos con carga psicológica, ya que las emociones se manifiestan de forma fragmentaria y no como un fondo general. Los conjuntos de datos existentes en ruso tienen diferentes esquemas de etiquetado y no permiten combinarlos. El equipo realizó 10 entrevistas en profundidad con psicólogos en activo y, basándose en el análisis, desarrolló un esquema de etiquetado integral con cuatro componentes: segmentación emocional (14 emociones basadas en Ekman y OCC), evaluación de las respuestas del psicólogo según cuatro criterios, etiquetas temáticas y una evaluación final del estado del cliente en cinco escalas. El corpus se recopiló de tres fuentes: diálogos de consulta de B17.ru, reseñas de Yandex Maps y publicaciones de VKontakte con comentarios. Hasta el momento, el corpus incluye 786 diálogos etiquetados con 7 emociones (aproximadamente 9 millones de etiquetas de caracteres) y 156 diálogos según el esquema ampliado de 14 emociones, además de reseñas y publicaciones. Para el etiquetado se creó la aplicación HELPER con la pila tecnológica .NET 10, ASP.NET Core, Blazor y PostgreSQL, con autenticación mediante Keycloak. La aplicación permite priorización en profundidad de diálogos, un sistema de puntuación para evaluar el trabajo de los etiquetadores y un detector de usuarios sospechosos. Para demostrar la funcionalidad de los datos, el equipo ajustó los modelos Qwen-3 8B y Qwen-3 14B mediante LoRA en su propio corpus (con cómputos en cHARISMa de la Escuela Superior de Economía). Antes de introducirlos, los diálogos se normalizan (se eliminan códigos BB y URL), pero se conserva el estilo del habla, ya que las características lingüísticas son importantes para el análisis. El proyecto demostró que el corpus recopilado permite obtener resultados de mayor calidad para tareas de análisis psicolingüístico en comparación con enfoques generalizados.
Fuente: Habr — хаб ML —
original
