KI-Modellentwickler: Betreiben sie Pelikan-Maximierung?
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
Ein Forscher testete sieben moderne KI-Modelle mit einem beliebten informellen Benchmark: Erstellung eines SVG-Bildes eines Pelikans auf einem Fahrrad. Die Ergebnisse zeigen keine Hinweise darauf, dass die Modelle für diese spezifische Aufforderung optimiert sind, und entkräften damit den Verdacht der Benchmark-Maximierung.
Simon Willison hat große LLM-Veröffentlichungen mit der Eingabeaufforderung ‚Generiere ein SVG eines Pelikans auf einem Fahrrad‘ getestet, was zu einem bekannten informellen Benchmark wurde. Um zu untersuchen, ob KI-Labore ‚Pelikanmaxing‘ betreiben (Optimierung von Modellen für beliebte Benchmarks), führte ein Forscher ein Experiment durch. Sie generierten 1008 SVGs über sieben Modelle: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 und DeepSeek V4 Pro, mit 48 Eingabeaufforderungen (8 Tiere × 6 Fahrzeuge). Jedes SVG wurde gerendert und von einem LLM-Juror bewertet. Die Analyse ergab keine Hinweise darauf, dass Pelikan-auf-Fahrrad-Bilder höhere Punktzahlen erzielten als erwartet, was darauf hindeutet, dass keine gezielte Optimierung für diesen Benchmark stattgefunden hat.
Quelle: Habr — хаб ИИ —
Original
