Baidu Wenxin Assistant Task Agent возглавил международный рейтинг ИИ-агентов, обойдя Claude и GPT
Baidu
Anthropic
Alibaba/Qwen
OpenAI
Модель Baidu Wenxin Assistant Task Agent заняла первое место в бенчмарке PinchBench v2 с результатом 94,6%, обойдя Anthropic Claude Opus и OpenAI GPT-5.6-luna. Это первая китайская коммерческая ИИ-система, ставшая лидером рейтинга. Бенчмарк оценивает способность агентов выполнять комплексные задачи в реальных сценариях с нулевым участием человека.
17 июля 2026 года Baidu Wenxin Assistant Task Agent занял первое место в международном рейтинге инженерных ИИ-агентов PinchBench v2, набрав 94,6% в лучшей попытке и 94,4% в среднем. Это первая китайская коммерческая система-агент, получившая первое место в общем зачёте. Среди 59 протестированных моделей Agent опередил Anthropic Claude Opus 4.8-fast (93,5%), Alibaba Tongyi Qianwen Qwen3.7-max (92,5%), Anthropic Claude Opus 4.8 (90,5%) и OpenAI GPT-5.6-luna (88,7%). PinchBench, разработанный Kilo AI при поддержке сообщества OpenClaw, отличается от традиционных бенчмарков тем, что оценивает не знание модели, а способность агента выполнить задачу и предоставить верифицируемый результат. Текущая версия включает 23 реальных рабочих сценария, 147 задач и 617 тестовых прогонов. Оценка проходит по двойному механизму: автоматическая верификация и LLM-оценка без участия человека. Baidu AI Search опубликовал полный код оценки на GitHub. В качестве примеров задач: анализ финансовых данных, исправление уязвимостей Node.js, юридический анализ контрактов. Агент способен автономно выполнять сложные цепочки задач, такие как планирование путешествия или генерация еженедельного дайджеста научных статей. Технология основана на мультиагентном фреймворке Baidu Orion AI Engine и интегрирована в приложение Baidu.
- Сокращения
- LLM = Large Language Model — большая языковая модель
Источник: QbitAI 量子位 —
оригинал
