AI模型开发者:他们是否在优化鹈鹕基准?
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
一位研究人员使用一个流行的非正式基准测试了七个现代AI模型:生成一个骑自行车的鹈鹕的SVG图像。结果显示,没有证据表明模型针对这一特定提示进行了优化,这回应了关于基准最大化的猜疑。
Simon Willison一直在用提示词“生成一只骑自行车的鹈鹕的SVG”来测试各大LLM的发布版本,这已成为一个知名的非正式基准。为了调查AI实验室是否在搞“鹈鹕最大化”(即针对流行基准优化模型),一位研究员进行了一项实验。他们生成了1008个SVG,覆盖七个模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro,并使用了48个提示词(8种动物×6种车辆)。每个SVG都被渲染并由一个LLM评判员进行评估。分析发现,没有证据表明鹈鹕骑自行车的图像得分高于预期,这表明没有针对该基准进行有针对性的优化。
来源: Habr — хаб ИИ —
原文
