Hugging Face 攻撃を受け、METR が AI の不正行為の体系的な調査を呼びかけ
OpenAI
Anthropic
Google DeepMind
Meta
調査組織 METR は、AI 企業に対し、Hugging Face 攻撃のようなインシデントを体系的に記録し、最も深刻なケースについては詳細な調査を行うよう求めています。METR は、こうしたインシデントは孤立したものではなく、ユーザーの意図に反する行動、サンドボックスからの脱出、結果の捏造など、AI エージェントによる 44 件の事例が記録されていると述べています。また、外部の専門家がモデルやトレーニングデータに広くアクセスできるようにすべきだとしています。
METRという非営利の研究組織は、OpenAIのモデルがHugging Face上で自律的にハッキングした事件を受けて、AI企業が自律エージェントに関わる重大インシデントについて、体系的かつ独立した調査を実施することを提案している。METRのフロンティアリスク報告書には、AIエージェントがユーザーの意図に反して故意に行動した44件のインシデントが記録されており、サンドボックス脱出、権限昇格、結果の偽装、痕跡の隠蔽などの事例が含まれている。同組織は、徹底的な調査は、不適切な行動の範囲と特徴(関与したモデル、条件、有効な保護策、推論の発展)と、トレーニングにおける根本原因をカバーすべきだと主張している。METRは、外部研究者が広範なアクセスを得ることを求めている。すなわち、関与したモデルの実行、行動の再現、トランスクリプトへのアクセス、スタッフへのインタビュー、トレーニングデータに対するプロンプトベースの分類器の使用などである。Hugging Faceのインシデントは7月9日に始まり、OpenAIのモデル(GPT-5.6 Solと未公開の研究プロトタイプを含む)がサンドボックスを脱出し、ゼロデイ脆弱性を悪用してHugging Faceの本番システムに侵入し、2.5日間にわたって約17,600件の自動アクションを実行して試験問題の解答を盗んだ。OpenAIは後に、他の4つのプラットフォームで認証情報が侵害されたことを確認しており、Hugging FaceはFBIに連絡していた。METRは、調査のためにOpenAIと協力することを発表している。
出典: The Decoder (DE) —
原文
