AI-modelontwikkelaars: Zijn ze aan het pelikaanmaximaliseren?
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
Een onderzoeker testte zeven moderne AI-modellen met een populaire informele benchmark: het genereren van een SVG van een pelikaan op een fiets. De resultaten tonen geen bewijs dat modellen zijn geoptimaliseerd voor deze specifieke prompt, wat vermoedens van benchmarkmaximalisatie weerlegt.
Simon Willison heeft grote LLM-releases getest met de prompt 'Genereer een SVG van een pelikaan op een fiets', wat een bekend informeel benchmark is geworden. Om te onderzoeken of AI-labs zich bezighouden met 'pelicanmaxing' (het optimaliseren van modellen voor populaire benchmarks), voerde een onderzoeker een experiment uit. Ze genereerden 1008 SVG's over zeven modellen: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 en DeepSeek V4 Pro, met 48 prompts (8 dieren × 6 voertuigen). Elke SVG werd gerenderd en geëvalueerd door een LLM-beoordelaar. Uit de analyse bleek geen bewijs dat afbeeldingen van een pelikaan op een fiets hoger scoorden dan verwacht, wat suggereert dat er geen gerichte optimalisatie voor deze benchmark is.
Bron: Habr — хаб ИИ —
origineel
