일부 최첨단 AI 모델을 탈옥하는 것이 무섭게 쉬운 것으로 드러나
xAI
새로운 연구에 따르면 많은 최첨단 AI 모델이 간단한 탈옥 기술에 여전히 취약한 것으로 나타났습니다. 연구자들은 ASCII 아트로 프롬프트를 작성하거나 복잡한 인코딩을 사용하는 등의 방법이 안전 장치를 우회할 수 있음을 발견하여 AI 안전에 대한 우려를 제기하고 있습니다.
연구진은 최첨단 AI 모델 일부를 탈옥(jailbreaking)시키는 것이 놀라울 만큼 쉬운 일임을 입증했으며, 이는 모델의 훈련 한계를 이용한 기법을 사용한 결과입니다. 프롬프트를 ASCII 아트로 표현하거나 복잡한 인코딩을 사용하는 것과 같은 간단한 방법이 안전 메커니즘을 우회하여 모델이 유해하거나 금지된 콘텐츠를 생성하도록 만들 수 있습니다. 이 연구는 안전 훈련에 상당한 투자가 이루어졌음에도 불구하고 많은 모델이 이러한 저기술 공격에 여전히 취약하다는 점을 강조합니다. 이러한 취약성은 AI 시스템에서 강력한 정렬(alignment)을 보장하는 데 있어 지속적인 과제를 부각시킵니다.
출처: xAI Grok (GNews) —
원문
