연구미디어 생성 🇷🇺 28.07.2026 08:04

AI 모델 개발자들, 펠리컨 극대화를 하고 있나?

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
한 연구원이 인기 있는 비공식 벤치마크인 자전거를 타는 펠리컨의 SVG 생성 프롬프트를 사용하여 7개의 현대 AI 모델을 테스트했습니다. 결과는 모델들이 이 특정 프롬프트에 최적화되어 있다는 증거가 없음을 보여주며, 벤치마크 극대화에 대한 의혹을 해소합니다.
Simon Willison은 '자전거를 타고 있는 펠리컨의 SVG를 생성하라'는 프롬프트로 주요 LLM 릴리스를 테스트해 왔는데, 이는 잘 알려진 비공식 벤치마크가 되었습니다. AI 연구소들이 인기 있는 벤치마크에 맞춰 모델을 최적화하는 '펠리컨맥싱'에 관여하는지 조사하기 위해, 연구자가 실험을 수행했습니다. 그들은 48개의 프롬프트(동물 8종 × 탈것 6종)를 사용하여 GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro 등 7개 모델에서 1008개의 SVG를 생성했습니다. 각 SVG는 렌더링되었고 LLM 판정자에 의해 평가되었습니다. 분석 결과, 자전거를 타고 있는 펠리컨 이미지가 기대치보다 높은 점수를 받았다는 증거는 발견되지 않았으며, 이는 이 벤치마크에 대한 표적 최적화가 없었음을 시사합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스