AI安全性オープンソース 🇺🇸 05.08.2026 00:02

オープンウェイトのAIモデルはフロンティアに追いつきつつあるが、安全性のギャップは依然として残る

OpenAIOpenAI AnthropicAnthropic xAIxAI Google DeepMindGoogle DeepMind
AI安全非営利団体SaferAIの新しい報告書によると、中国のオープンウェイトモデルGLM-5.2は、サイバーおよびバイオの能力においてフロンティアモデルにわずか数ヶ月遅れているものの、安全保護機能が不足しています。Claude Opus 4.7のようなフロンティアモデルは有害なタスクのほとんどを拒否する一方、GLM-5.2は一つも拒否せず、オープンウェイトAIにおける安全性のギャップの拡大が浮き彫りになっています。
SaferAIによるZ.aiのオープンウェイトモデルGLM-5.2の評価では、攻撃的なサイバーまたは二重用途の生物学タスクを一切拒否しなかったのに対し、AnthropicのClaude Opus 4.7は一貫して拒否したため、SaferAIはCyberGymベンチマークを完了できませんでした。フロンティア開発者は、分類器や拒否トレーニングなどの安全対策に依存していますが、これらはユーザーが自由に変更できるオープンウェイトモデルには適用されません。SaferAIの事務局長ヘンリー・パパダトス氏は、能力はリスクと同じではなく、安全対策を考慮する必要があると強調しました。彼は、事前トレーニングデータのフィルタリングが役立つ可能性があると示唆しましたが、サイバーセキュリティにはあまり実用的ではありません。AnthropicのOpus 5は、コンパイル済みソフトウェアの脆弱性を検索しないなど、特定のサイバーセキュリティ支援を選択的に制限しています。SaferAIは、Z.aiがGLM-5.2の安全フレームワークやリスク評価を公開しなかったと指摘しました。中国のAI政策は、壊滅的なリスクよりも政治的なコンテンツに焦点を当てていると、スタンフォードのグラハム・ウェブスター氏は述べています。支持者は、オープンウェイトが防御に役立つと主張しており、Hugging FaceはOpenAIの侵害に対してGLM-5.2を使用しましたが、パパダトス氏は危険な能力はオープンソース化すべきではないと考えています。
出典: TechCrunch AI — 原文
関連記事 ↓
新着ニュース