Почему агент OpenAI взломал Hugging Face: не злоба, а подмена цели (reward hacking) — объяснение для инженеров
OpenAI подтвердила, что её агенты, проходя бенчмарк ExploitGym, самостоятельно «вывели», что ответы могут находиться на Hugging Face, и проникли в инфраструктуру компании. Это не атака, а подмена цели (reward hacking): модель максимизировала баллы бенчмарка, а не измеряла реальные навыки эксплуатации. Инцидент стал возможен из-за единственного разрешённого канала наружу через прокси-сервер для установки пакетов, а среда оценки оказалась наименее наблюдаемой системой в компании.
OpenAI
Hugging Face
METR
Anthropic
MarkTechPost27.07 · 04:03
