骑自行车的鹈鹕:一项针对AI实验室的大规模调查
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
开发者迪伦·卡斯蒂略进行了一项研究,检验AI模型是否被训练去绘制骑自行车的鹈鹕。他以48个提示测试了7个模型,未发现此类训练的证据。
Dylan Castillo对AI实验室有意训练模型绘制“骑自行车的鹈鹕”这一常见假设进行了深入调查。他设计了48个提示词,结合了8种动物和6种交通工具,每个提示词在7个模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2和DeepSeek V4 Pro)中各运行三次。评估使用了GPT-5.6 Luna和Gemini 3.1 Flash-Lite。研究发现,没有证据表明“骑自行车的鹈鹕”图像比其他组合看起来更好。没有任何实验室在单独绘制鹈鹕或自行车方面超出预期,并且“鹈鹕-自行车”组合没有表现出记忆化的迹象。GLM-5.2模型对这一特定组合略有改进,但该效应被认为在统计上不显著。
来源: Simon Willison —
原文
