OnderzoekModellen 🇷🇺 26.07.2026 21:03

HELPER: hoe we een corpus van psychologisch geladen teksten hebben gebouwd en Qwen hebben verfijnd voor lokale emotieanalyse

Studenten en onderzoekers van de HSE University en VK hebben een corpus van psychologisch geladen Russischtalige teksten gecreëerd met lokale annotatie van emoties en psychologische kenmerken. Het HELPER-annotatiehulpmiddel werd ontwikkeld en op basis van het corpus werden Qwen-3 8B en 14B modellen verfijnd voor de taken van het extraheren van emotionele fragmenten en het beoordelen van de toestand van de auteur.
Een team van de workshop voor toegepaste AI van de Hogeschool voor Economie (HSE) en VK (Alexander Sabko, Victoria Belyavskaya, Sergey Pavlukhin) heeft het project HELPER gepresenteerd, gericht op het analyseren van de emotionele toestand van de auteur van een tekst, rekening houdend met lokale emotionele uitingen en hun dynamiek. Standaardbenaderingen van sentimentanalyse (binaire of multi-klasse classificatie) zijn niet geschikt voor psychologisch beladen teksten, omdat emoties fragmentarisch worden getoond en niet als een algemene achtergrond. Bestaande Russischtalige datasets hebben verschillende annotatieschema's en kunnen niet worden gecombineerd. Het team voerde 10 diepte-interviews met praktiserende psychologen en ontwikkelde op basis van de analyse een uitgebreid annotatieschema met vier componenten: emotionele segmentatie (14 emoties op basis van Ekman en OCC), beoordeling van antwoorden van psychologen op vier criteria, thematische tags en een uiteindelijke beoordeling van de toestand van de cliënt op vijf schalen. Het corpus is samengesteld uit drie bronnen: consultatieve dialogen van B17.ru, reviews van Yandex.Maps en VKontakte-berichten met reacties. Op dit moment bevat het corpus 786 dialogen, geannoteerd volgens 7 emoties (ongeveer 9 miljoen symbool-labels), en 156 dialogen volgens het uitgebreide schema van 14 emoties, evenals reviews en berichten. Voor de annotatie is de applicatie HELPER gemaakt op de stack .NET 10, ASP.NET Core, Blazor en PostgreSQL met authenticatie via Keycloak. De applicatie ondersteunt depth-first-prioritering van dialogen, een puntensysteem voor de beoordeling van het werk van annotatoren en een detector van verdachte gebruikers. Om de werking van de data te demonstreren, heeft het team de modellen Qwen-3 8B en Qwen-3 14B via LoRA op hun corpus verder getraind (berekeningen op cHARISMa van HSE). Dialogen worden voor verwerking genormaliseerd (BB-codes, URL's worden verwijderd), maar de stijl van spreken blijft behouden, omdat spraakkenmerken belangrijk zijn voor de analyse. Het project toonde aan dat het verzamelde corpus betere resultaten mogelijk maakt voor psycholinguïstische analyse in vergelijking met algemene benaderingen.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws