эталонный тест для агентов в реальных средах Ubuntu, включающий 361 задачу и оценивающий восприятие, долгосрочное планирование, координацию между несколькими программами и системные операции. Ранее на этом эталоне тестировались модели GPT, Gemini и Claude. Прогресс в отрасли вырос с 12,2% в 2024 году до 72,6% в 2025 году и 83,6% в мае 2026 года. Прорыв Shiai до 90,2% позволил преодолеть технические узкие места. Агент отличается высокой эффективностью в задачах межпрограммной координации (93 задачи), обработке изображений в GIMP (92,3% успешности на 26 задачах) и системных операциях (24 задачи без единой ошибки). Команда объясняет успех инженерными решениями, а не доработкой модели. Компания Shiai Intelligent, основанная в 2018 году, разработала мультимодальную систему Harness, которая использует API при их наличии и графический интерфейс в остальных случаях, обученную на данных корпоративного уровня. Компания планирует повысить надёжность до 99,99%, улучшить адаптацию к динамическим средам и внедрить гибридное планирование на граничных и облачных вычислениях для промышленного использования.