HELPER:我们如何构建心理情感文本语料库并微调Qwen用于本地情感分析
来自高等经济大学和VK的学生与研究人员构建了一个带有情感和心理特征局部标注的俄语心理情感文本语料库。他们开发了HELPER标注工具,并基于该语料库对Qwen-3 8B和14B模型进行了微调,用于情感片段提取和作者状态评估任务。
来自高等经济学院(HSE)应用人工智能实验室和VK的团队(亚历山大·萨布科、维多利亚·别利亚夫斯卡娅、谢尔盖·帕夫卢欣)推出了HELPER项目,旨在分析文本作者的情绪状态,考虑局部情绪表现及其动态。标准的情绪分析方法(二元或多类分类)不适用于心理负荷较重的文本,因为情绪是片段式呈现,而非整体氛围。现有的俄语数据集采用不同的标注方案,无法合并。团队对10名执业心理学家进行了深度访谈,基于分析开发了一套包含四个组成部分的综合标注方案:情绪分段(基于Ekman和OCC理论的14种情绪)、心理学家回答的四项标准评估、主题标签以及客户状态的五项量表最终评估。语料来自三个来源:B17.ru上的咨询对话、Yandex.Maps上的评论以及VKontakte上的帖子和评论。目前,语料包含786个对话(按7种情绪标注,约900万个符号标签)和156个按扩展方案(14种情绪)标注的对话,以及评论和帖子。为进行标注,开发了基于.NET 10、ASP.NET Core、Blazor和PostgreSQL的HELPER应用,并通过Keycloak进行身份验证。该应用支持深度优先的对话优先级排序、标注员工作的积分系统以及可疑用户检测器。为了展示数据的可用性,团队通过LoRA在自己的语料上微调了Qwen-3 8B和Qwen-3 14B模型(在高经济学院cHARISMa上计算)。对话在输入前会进行规范化处理(删除BB代码、URL),但保留言语风格,因为言语特征对分析很重要。项目表明,对于心理语言学分析任务,所构建的语料相比通用方法能获得更高质量的结果。
来源: Habr — хаб ML —
原文
