Китайский DoGNAVY занял третье место в глобальном бенчмарке по безопасности ИИ, прокладывая путь к безопасности агентов
В свежем бенчмарке CyberGym проект DoGNAVY, совместная работа ведущего китайского исследовательского института ИИ и команды безопасности DARKNAVY, занял третье место в мировом рейтинге с показателем прохождения 90,8%, обойдя модели OpenAI и Anthropic. В отличие от конкурентов, использующих несколько закрытых моделей, DoGNAVY полагается на одну открытую модель GLM-5.2 и представляет AgentDoG — диагностическую структуру для ИИ-агентов.
CyberGym — это бенчмарк, разработанный в Калифорнийском университете в Беркли (University of California, Berkeley), который ранжирует ИИ-агентов по их способности автономно обнаруживать, верифицировать и эксплуатировать уязвимости на основе 1507 реальных, уже устранённых уязвимостей в 188 проектах с открытым исходным кодом. DoGNAVY, разработанный ведущим китайским исследовательским институтом ИИ
Показать ещё ↓
Источник: QbitAI 量子位 —
оригинал
