Бенчмаркинг открытых моделей для агентов: как измерять эффективность инструментов
Hugging Face
MiniMax
Hugging Face представили инструмент для бенчмаркинга агентов, который оценивает не только конечный результат, но и усилия, затраченные на его достижение. В качестве примера использована библиотека transformers: тестирование проводилось на открытых моделях с разными версиями библиотеки и тремя вариантами окружения (bare, clone, skill). Результаты показывают, что улучшения интерфейса (CLI, Skill) сокращают время выполнения, но могут увеличить потребление токенов на первом запуске.
Hugging Face представили новый подход к бенчмаркингу агентов, основанный на библиотеке transformers. Вместо оценки только финального ответа они измеряют весь процесс: количество шагов, токенов и времени, затраченных агентом. Эксперименты проводились на открытых моделях (включая MiniMax-M2.7) с тремя вариантами доступа к библиотеке: bare (только pip install), clone (полный исходный код) и skill (упакованные документы и примеры). Для крупных моделей оказалось, что версия с CLI и Skill сокращает медианное время, но увеличивает потребление токенов в варианте clone (агенты читают новую документацию). Для малых моделей skill-вариант улучшал точность у крупных, но ухудшал у мелких. Инструмент позволяет сравнивать разные модели и версии библиотеки, а также выявлять узкие места во взаимодействии агента с кодом.
- Сокращения
- CLI = Command Line Interface — интерфейс командной строки
- API = Application Programming Interface — программный интерфейс приложения
Источник: Hugging Face blog —
оригинал
