Pengembang Model AI: Apakah Mereka Pelicanmaxing?
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
Seorang peneliti menguji tujuh model AI modern menggunakan tolok ukur informal yang populer: menghasilkan SVG seekor pelikan di atas sepeda. Hasilnya menunjukkan tidak ada bukti bahwa model dioptimalkan untuk perintah spesifik ini, menjawab kecurigaan tentang maksimalisasi tolok ukur.
Simon Willison telah menguji rilis LLM utama dengan prompt 'Generate an SVG of a pelican on a bicycle', yang menjadi tolok ukur informal yang terkenal. Untuk menyelidiki apakah laboratorium AI melakukan 'pelicanmaxing' (mengoptimalkan model untuk tolok ukur populer), seorang peneliti melakukan eksperimen. Mereka menghasilkan 1008 SVG di tujuh model: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, dan DeepSeek V4 Pro, menggunakan 48 prompt (8 hewan × 6 kendaraan). Setiap SVG dirender dan dievaluasi oleh juri LLM. Analisis menemukan tidak ada bukti bahwa gambar pelikan di atas sepeda mendapat skor lebih tinggi dari yang diharapkan, menunjukkan tidak ada optimasi yang ditargetkan untuk tolok ukur ini.
Sumber: Habr — хаб ИИ —
asli
