PesquisaGeração de Mídia 🇷🇺 28.07.2026 08:04

Desenvolvedores de Modelos de IA: Estão Eles Otimizando para Pelicanos?

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Um pesquisador testou sete modelos modernos de IA usando um benchmark informal popular: gerar um SVG de um pelicano em uma bicicleta. Os resultados não mostram evidências de que os modelos são otimizados para esse prompt específico, abordando suspeitas de maximização de benchmark.
Simon Willison tem testado os principais lançamentos de LLMs com o prompt 'Gere um SVG de um pelicano em uma bicicleta', que se tornou um benchmark informal bem conhecido. Para investigar se os laboratórios de IA estão se engajando em 'pelicanmaxing' (otimizando modelos para benchmarks populares), um pesquisador conduziu um experimento. Eles geraram 1008 SVGs em sete modelos: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 e DeepSeek V4 Pro, usando 48 prompts (8 animais × 6 veículos). Cada SVG foi renderizado e avaliado por um juiz LLM. A análise não encontrou evidências de que imagens de pelicano em bicicleta obtiveram pontuações maiores do que o esperado, sugerindo que não houve otimização direcionada para esse benchmark.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas