HELPER : comment nous avons construit un corpus de textes psychologiquement chargés et affiné Qwen pour l'analyse locale des émotions
Des étudiants et chercheurs de l'Université HSE et de VK ont créé un corpus de textes en russe psychologiquement chargés avec annotation locale des émotions et caractéristiques psychologiques. L'outil d'annotation HELPER a été développé, et sur la base du corpus, les modèles Qwen-3 8B et 14B ont été affinés pour les tâches d'extraction de fragments émotionnels et d'évaluation de l'état de l'auteur.
Une équipe du laboratoire d'IA appliquée de l'Université nationale de recherche-École supérieure d'économie (HSE) et de VK (Aleksandr Sabko, Viktoria Beliavskaya, Sergueï Pavlukhine) a présenté le projet HELPER, destiné à analyser l'état émotionnel de l'auteur d'un texte en tenant compte des manifestations émotionnelles locales et de leur dynamique. Les approches standards d'analyse de sentiment (classification binaire ou multiclasse) ne conviennent pas aux textes à forte charge psychologique, car les émotions se manifestent de manière fragmentée et non comme un fond général. Les jeux de données russes existants utilisent différents schémas d'annotation et ne permettent pas leur fusion. L'équipe a mené dix entretiens approfondis avec des psychologues en exercice et, sur la base de cette analyse, a élaboré un schéma d'annotation complet en quatre composantes : segmentation émotionnelle (14 émotions basées sur Ekman et le modèle OCC), évaluation des réponses du psychologue selon quatre critères, étiquettes thématiques et évaluation finale de l'état du client selon cinq échelles. Le corpus a été collecté à partir de trois sources : dialogues de conseil sur B17.ru, avis sur Yandex.Maps et publications VKontakte avec commentaires. Actuellement, le corpus comprend 786 dialogues annotés selon 7 émotions (environ 9 millions d'étiquettes de caractères), 156 dialogues selon le schéma étendu de 14 émotions, ainsi que des avis et des publications. Pour l'annotation, une application HELPER a été créée sur la stack .NET 10, ASP.NET Core, Blazor et PostgreSQL avec authentification via Keycloak. L'application prend en charge la priorisation des dialogues en profondeur d'abord, un système de notation du travail des annotateurs et un détecteur d'utilisateurs suspects. Afin de démontrer la validité des données, l'équipe a affiné les modèles Qwen-3 8B et Qwen-3 14B via LoRA sur son corpus (calculs effectués sur cHARISMa du HSE). Les dialogues sont normalisés avant soumission (suppression des codes BB, URL), mais le style de discours est conservé, car les particularités langagières sont importantes pour l'analyse. Le projet a montré que le corpus collecté permet d'obtenir des résultats de meilleure qualité pour les tâches d'analyse psycholinguistique par rapport aux approches généralisées.
Source: Habr — хаб ML —
original
