TutkimusMallit 🇷🇺 26.07.2026 21:03

HELPER: Miten rakensimme psykologisesti latautuneiden tekstien korpuksen ja hienosäädimme Qwenin paikalliseen tunneanalyysiin

HSE-yliopiston ja VK:n opiskelijat ja tutkijat ovat luoneet korpuksen psykologisesti latautuneista venäjänkielisistä teksteistä, joissa on paikallisia tunnisteita tunteille ja psykologisille ominaisuuksille. HELPER-merkintätyökalu kehitettiin, ja korpuksen perusteella Qwen-3 8B- ja 14B-malleja hienosäädettiin tunnefragmenttien poimimiseen ja kirjoittajan tilan arviointiin.
VK:n ja Korkeakoulun taloustieteen kansallisen tutkimusyliopiston (HSE) soveltavan tekoälyn laboratorion tiimi (Alexander Sabko, Victoria Belyavskaya, Sergei Pavlukhin) esitteli HELPER-projektin, jonka tavoitteena on analysoida tekstin kirjoittajan tunnetilaa paikallisten tunneilmaisujen ja niiden dynamiikan perusteella. Tavanomaiset sentimenttianalyysin menetelmät (binäärinen tai moniluokkainen luokittelu) eivät sovellu psykologisesti latautuneille teksteille, koska tunteet ilmenevät sirpaleisesti eikä yleisenä taustatunnelmana. Olemassa olevilla venäjänkielisillä tietoaineistoilla on erilaisia annotointijärjestelmiä, eikä niitä voida yhdistää. Tiimi toteutti kymmenen syvähaastattelua ammatinharjoittajina toimivien psykologien kanssa ja kehitti analyysin pohjalta kattavan annotointijärjestelmän, joka koostuu neljästä osasta: tunnesegmentointi (14 tunnetta Ekmanin ja OCC-mallin pohjalta), psykologin vastausten arviointi neljän kriteerin mukaan, aihetunnisteet sekä loppuarvio asiakkaan tilasta viidellä asteikolla. Aineisto on kerätty kolmesta lähteestä: neuvontadialogit B17.ru-sivustolta, arvostelut Yandex Maps -palvelusta ja VKontakte-julkaisut kommentteineen. Tällä hetkellä aineisto sisältää 786 dialogia, jotka on annotoitu 7 tunteella (noin 9 miljoonaa merkkitunnistetta), ja 156 dialogia laajennetulla 14 tunteiden järjestelmällä, sekä arvosteluja ja julkaisuja. Annotointia varten on luotu HELPER-sovellus, joka perustuu .NET 10 -pinoon, ASP.NET Coreen, Blazoriin ja PostgreSQL:ään, ja käyttää Keycloak-pohjaista todennusta. Sovellus tukee syvyyssuuntaista dialogien priorisointia, annotoijien pisteytysjärjestelmää ja epäilyttävien käyttäjien tunnistinta. Tietoaineiston toimivuuden osoittamiseksi tiimi hienosääti Qwen-3 8B- ja Qwen-3 14B -malleja LoRA-menetelmällä oman aineistonsa avulla (laskenta suoritettiin HSE:n cHARISMa-järjestelmässä). Dialogit normalisoidaan ennen käsittelyä (poistetaan BB-koodit, URL-osoitteet), mutta puheen tyyli säilytetään, koska puhepiirteet ovat tärkeitä analyysille. Projekti osoitti, että kerätty aineisto mahdollistaa parempien tulosten saavuttamisen psykolingvistisen analyysin tehtävissä verrattuna yleisiin menetelmiin.
Lähde: Habr — хаб ML — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset