Четыре основных подхода к оценке LLM: множественный выбор, верификаторы, лидерборды и судьи-LLM
Себастьян Рашка (Sebastian Raschka) описывает четыре основных метода оценки больших языковых моделей (LLM): оценка точности ответов на вопросы с множественным выбором (например, MMLU), верификаторы, лидерборды и использование самих LLM в качестве судей. Статья включает пример кода для оценки модели Qwen3 0.6B на бенчмарке MMLU с извлечением предсказанной буквы ответа.
Себастьян Рашка (Sebastian Raschka) в своей статье рассматривает четыре основных подхода к оценке больших языковых моделей (LLM): оценка точности ответов на вопросы с множественным выбором, верификаторы, лидерборды и использование LLM в качестве судей. Первый метод иллюстрируется на примере бенчмарка MMLU (Massive Multitask Language Understanding), который содержит около 16 тысяч вопросов по 57 предметам. Для демонстрации автор загружает предобученную модель Qwen3 0.6B в чистом PyTorch из своей библиотеки reasoning_from_scratch и реализует функцию predict_choice, которая генерирует несколько токенов и извлекает первую букву A, B, C или D, сравнивая её с правильным ответом. На примере вопроса из подмножества high_school_mathematics модель дала неверный ответ (C вместо D). Автор отмечает, что существуют и более продвинутые методы, такие как оценка логарифмической вероятности, которые обсуждаются в других главах.
- Сокращения
- MMLU = Massive Multitask Language Understanding — массовое многозадачное понимание языка
- LLM = Large Language Model — большая языковая модель
Источник: Sebastian Raschka —
оригинал
