InvestigaciónGeneración de Medios 🇷🇺 28.07.2026 08:04

Desarrolladores de Modelos de IA: ¿Están Optimizando para Pelícanos?

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Un investigador puso a prueba siete modelos modernos de IA utilizando un popular criterio informal: generar un SVG de un pelícano en bicicleta. Los resultados no muestran evidencia de que los modelos estén optimizados para esta indicación específica, lo que aborda las sospechas de maximización de criterios.
Simon Willison ha estado probando los principales lanzamientos de LLM con el prompt 'Genera un SVG de un pelícano en bicicleta', que se convirtió en un conocido benchmark informal. Para investigar si los laboratorios de IA están haciendo 'pelicanmaxing' (optimizando modelos para benchmarks populares), un investigador llevó a cabo un experimento. Generaron 1008 SVG en siete modelos: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 y DeepSeek V4 Pro, usando 48 prompts (8 animales × 6 vehículos). Cada SVG fue renderizado y evaluado por un juez LLM. El análisis no encontró evidencia de que las imágenes de pelícano en bicicleta obtuvieran puntuaciones más altas de lo esperado, lo que sugiere que no hay una optimización dirigida para este benchmark.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas