ответов. В статье демонстрируется реализация этого метода с использованием модели Qwen3 0.6B и кода на PyTorch: загружается предобученная модель, формируется подсказка с вопросом и вариантами, генерируется ответ, который сравнивается с правильным. Для примера из подмножества high_school_mathematics бенчмарка MMLU модель дала неверный ответ. Отмечается, что на практике также используются методы, основанные на логарифмических вероятностях, а для моделей рассуждений применяются другие подходы. Верификаторы, лидерборды и LLM в роли судьи подробно рассматриваются в книге автора «Build a Reasoning Model (From Scratch)».