основам технического анализа; внедрен расчет доверительных интервалов с помощью бутстрепа для более надежного сравнения моделей; используется стратифицированный бутстреп для агрегации результатов по группам бенчмарков; раздельная оценка дискриминационной способности и насыщения наборов данных (выяснилось, что большинство вопросов FINESSE попадают в промежуточную зону, обладая хорошей диагностической ценностью). Расширен пул моделей: всего протестировано 66 систем, из которых 49 имеют полное покрытие по всем 11 бенчмаркам (8 FINESSE + 3 публичных), а 33 модели включены в основные таблицы. Лучшие результаты показали GPT-5.5 (0,906 по экзаменационным вопросам, 0,876 по торговле и техническому анализу), Claude Opus 4.8 (0,860 по экзаменационным вопросам, 0,856 по торговле и техническому анализу) и другие.