자전거 타는 펠리컨: AI 연구소에 대한 대규모 조사
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
개발자 딜런 카스티요는 AI 모델이 자전거 타는 펠리컨을 그리도록 훈련되었는지 확인하기 위한 연구를 수행했습니다. 그는 7개 모델에서 48개의 프롬프트를 테스트했으며 그러한 훈련의 증거를 찾지 못했습니다.
딜런 카스티요(Dylan Castillo)는 AI 연구소가 의도적으로 모델에 자전거를 타는 펠리컨 이미지를 학습시킨다는 일반적인 가설을 심층 조사했습니다. 그는 8가지 동물 유형과 6가지 탈것 유형을 조합해 48개의 프롬프트를 구성하고, 각 프롬프트를 GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro 등 7개 모델에서 세 번씩 실행했습니다. 평가에는 GPT-5.6 Luna와 Gemini 3.1 Flash-Lite가 사용되었습니다. 연구 결과 자전거를 타는 펠리컨 이미지가 다른 조합보다 더 나아 보인다는 증거는 발견되지 않았습니다. 어떤 연구소도 펠리컨이나 자전거를 개별적으로 묘사하는 데 기대치를 초과하지 않았으며, '펠리컨-자전거' 조합에서는 암기 흔적도 나타나지 않았습니다. GLM-5.2 모델은 이 특정 쌍에 대해 약간 개선된 성능을 보였지만, 그 효과는 통계적으로 유의미하지 않은 것으로 간주되었습니다.
출처: Simon Willison —
원문
