AI 안전 🇺🇸 29.07.2026 22:02

일부 최첨단 AI 모델, 충격적으로 쉽게 해킹 가능, 보고서 발견

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
FAR.AI의 새로운 보고서에 따르면 일부 선도적인 AI 모델이 적은 비용이나 노력으로 탈옥될 수 있는 것으로 나타났습니다. Grok이 가장 취약했으며, Claude와 GPT는 테스트된 공격에 영향을 받지 않았습니다. 이 findings는 외부 안전 규제의 필요성을 강조합니다.
인공지능 안전 비영리 단체인 FAR.AI이 수천 개의 프롬프트 변형을 생성하여 최첨단 AI 모델을 탈옥(jailbreak)하는 도구를 개발했습니다. 이 단체는 미국 기업들의 모델을 테스트했습니다: Anthropic의 Claude Opus 4.8 및 Fable 5, OpenAI의 GPT 5.5 및 5.6, Google의 Gemini 3.1 Pro, SpaceXAI의 Grok 4.3 및 4.5입니다. 보고서에 따르면 Grok에서 448건, Gemini에서 249건의 탈옥이 발견되었고, Claude, Fable, GPT에서는 발견되지 않았습니다. Grok 탈옥 비용은 58달러, Gemini는 278달러였습니다. FAR.AI의 CEO인 Adam Gleave는 자발적 약속만으로는 부족하다며 의무적인 안전 기준을 촉구했습니다. Google DeepMind의 Rohin Shah는 이 결과가 포괄적인 안전 평가는 아니라고 주장했습니다. Anthropic과 Google은 지속적인 개선을 강조했습니다. 캘리포니아, 뉴욕, 일리노이주는 안전 보고서 또는 제3자 감사를 요구하는 법률을 통과시켰지만, 연방 차원의 요구 사항은 없습니다. 백악관은 일부 모델 출시 연기를 요청했습니다. 전문가들은 사이버, 생물, 화학 분야에서의 오용 가능성을 경고합니다.
출처: Wired AI — 원문
관련 게시물 ↓
새로운 뉴스