АгентыХарнесы 🇺🇸 20.07.2026 05:04

Бенчмаркинг открытых моделей для агентов: как измерять эффективность инструментов

Hugging FaceHugging Face MiniMaxMiniMax
Hugging Face представили инструмент для бенчмаркинга агентов, который оценивает не только конечный результат, но и усилия, затраченные на его достижение. В качестве примера использована библиотека transformers: тестирование проводилось на открытых моделях с разными версиями библиотеки и тремя вариантами окружения (bare, clone, skill). Результаты показывают, что улучшения интерфейса (CLI, Skill) сокращают время выполнения, но могут увеличить потребление токенов на первом запуске.
Hugging Face представили новый подход к бенчмаркингу агентов, основанный на библиотеке transformers. Вместо оценки только финального ответа они измеряют весь процесс: количество шагов, токенов и времени, затраченных агентом. Эксперименты проводились на открытых моделях (включая MiniMax-M2.7) с тремя вариантами доступа к библиотеке: bare (только pip install), clone (полный исходный код) и skill (упакованные документы и примеры). Для крупных моделей оказалось, что версия с CLI и Skill сокращает медианное время, но увеличивает потребление токенов в варианте clone (агенты читают новую документацию). Для малых моделей skill-вариант улучшал точность у крупных, но ухудшал у мелких. Инструмент позволяет сравнивать разные модели и версии библиотеки, а также выявлять узкие места во взаимодействии агента с кодом.
Сокращения
CLI = Command Line Interface — интерфейс командной строки
API = Application Programming Interface — программный интерфейс приложения
Источник: Hugging Face blog — оригинал

Наши прошлые публикации по теме

Есть свежие новости