Les développeurs de modèles d'IA : sont-ils en train de « pelicanmaxer » ?
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
Un chercheur a testé sept modèles d'IA modernes en utilisant un benchmark informel populaire : générer un SVG d'un pélican sur un vélo. Les résultats ne montrent aucune preuve que les modèles sont optimisés pour ce prompt spécifique, répondant ainsi aux soupçons de maximisation de benchmark.
Simon Willison a testé les principales versions de modèles de langage avec le prompt « Générez un SVG d'un pélican sur un vélo », qui est devenu un benchmark informel bien connu. Pour déterminer si les laboratoires d'IA s'adonnent au « pelicanmaxing » (l'optimisation des modèles pour des benchmarks populaires), un chercheur a mené une expérience. Ils ont généré 1008 SVG à travers sept modèles : GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, et DeepSeek V4 Pro, en utilisant 48 prompts (8 animaux × 6 véhicules). Chaque SVG a été rendu et évalué par un juge IA. L'analyse n'a trouvé aucune preuve que les images de pélicans à vélo obtenaient des scores plus élevés que prévu, ce qui suggère qu'il n'y a pas d'optimisation ciblée pour ce benchmark.
Source: Habr — хаб ИИ —
original
