эмоции проявляются фрагментарно, а не общим фоном. Существующие русскоязычные датасеты имеют разные схемы разметки и не позволяют объединить их. Команда провела 10 глубинных интервью с практикующими психологами и на основе анализа разработала комплексную схему разметки из четырёх компонентов: эмоциональная сегментация (14 эмоций на основе Экмана и OCC), оценка ответов психолога по четырём критериям, тематические теги и итоговая оценка состояния клиента по пяти шкалам. Корпус собран с трёх источников: консультативные диалоги с B17.ru, отзывы с Яндекс.Карт и посты ВКонтакте с комментариями. На данный момент корпус включает 786 диалогов, размеченных по 7 эмоциям (около 9 млн символьных меток), и 156 диалогов по расширенной схеме из 14 эмоций, а также отзывы и посты. Для разметки создано приложение HELPER на стеке .NET 10, ASP.NET Core, Blazor и PostgreSQL с аутентификацией через Keycloak. Приложение поддерживает depth-first приоритезацию диалогов, балльную систему оценки работы разметчиков и детектор подозрительных пользователей. Чтобы продемонстрировать работоспособность данных, команда дообучила модели Qwen-3 8B и Qwen-3 14B через LoRA на своём корпусе (вычисления на cHARISMa НИУ ВШЭ). Диалоги перед подачей нормализуются (удаляются BB-коды, URL), но стилистика речи сохраняется, так как речевые особенности важны для анализа. Проект показал, что собранный корпус позволяет получить более качественный результат для задач психолингвистического анализа по сравнению с обобщёнными подходами.