研究メディア生成 🇷🇺 28.07.2026 08:04

AIモデル開発者:彼らはペリカンマックス化しているのか?

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
ある研究者が、7つの最新AIモデルを、人気のある非公式ベンチマークである「自転車に乗ったペリカンのSVG生成」を用いてテストしました。その結果、モデルがこの特定のプロンプトに対して最適化されているという証拠はなく、ベンチマーク最大化の疑念に応えるものです。
Simon Willisonは、主要なLLMリリースを「自転車に乗ったペリカンのSVGを生成して」というプロンプトでテストしており、これはよく知られた非公式のベンチマークとなっている。AIラボが「ペリカンマキシング」(人気ベンチマークに合わせてモデルを最適化すること)を行っているかどうかを調査するため、研究者が実験を行った。彼らは、GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Proの7つのモデルで、48のプロンプト(8種類の動物×6種類の乗り物)を使用して1008個のSVGを生成した。各SVGはレンダリングされ、LLM審査員によって評価された。分析の結果、ペリコンが自転車に乗っている画像が期待値よりも高いスコアを得たという証拠は見つからず、このベンチマークに対するターゲットを絞った最適化は行われていないことが示唆された。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース