профессиональное поведение, разрешение конфликтов и повседневные задачи. Анализ 25 LLM выявил два типа расхождений: отклонение от человеческого консенсуса при высоком согласии аннотаторов и недостаточное отражение разнообразия мнений при низком консенсусе. Маленькие модели (менее 25 млрд параметров) показали существенно худшее согласование, часто не различая уместное выражение или подавление черт. Большие модели (более 120 млрд параметров) при единогласном консенсусе достигали почти идеального согласования, но при консенсусе ниже 90% их показатели плато достигали 80%. Качественный анализ показал, что модели склонны поощрять эмоциональную открытость в профессиональных ситуациях, где люди рекомендуют сдержанность, а в социальных спорах отдают приоритет гармонии над отстаиванием позиции. Также обнаружена систематическая переоценка уверенности: все 25 моделей не снижали уверенность при низком согласии людей, что нарушает принцип плюрализма распределений. Фреймворк также выявил расхождения между самоотчётами моделей и их реальным поведением: например, модели часто сообщают о низкой импульсивности, но на деле склонны к импульсивным действиям.