给我看看《指环王》!卡帕西力推新大语言模型基准测试
Anthropic
DeepSeek
Moonshot AI
OpenAI
xAI
Google/DeepMind
ElevenLabs
安德烈·卡帕西宣布,Anthropic 的 Opus 5 正在通过使用 Three.js 从《指环王》开篇生成中土世界进行测试。该基准测试取代了广受欢迎的“骑自行车的鹈鹕”SVG 测试,旨在评估模型在复杂项目规划和持续编码方面的能力。虽然生成的 3D 世界略显粗糙,但揭示了当前大语言模型仍无法真正理解视频或玩自己创建的内容。
安德烈·卡帕西透露,Anthropic 正在使用一种新的基准测试来评估大语言模型:从《指环王》开篇生成中土世界。模型Claude Opus 5在提示词文本和JavaScript库Three.js的引导下,在浏览器中创建了一个交互式3D场景。Opus 5花费了100万令牌、2小时和5500行代码才完成这个演示。最终结果粗糙,让人联想到早期的3D动画,存在漂浮角色和肢体等问题。卡帕西承认,Opus 5无法真正‘进入’它生成的世界;它只能在不同时间点截屏来检查错误,这凸显了当前大语言模型的弱点:它们能编写代码并构建场景,却无法观看视频或玩自己制作的游戏。开发者西蒙·威利森推广的‘鹈鹕骑自行车’SVG测试正在被淘汰,因为模型在这项测试上已经表现出色。新基准旨在测试模型规划复杂项目、连续工作数小时以及迭代数千行代码的能力。社区反应不一:有人称赞这一新方向,也有人质疑其成本以及Three.js是否能真正衡量通用智能。网友们还创建了自己的项目,比如一个AI生成的坎耶·韦斯特演唱会,卡帕西建议集成Seedance等API进行视频渲染,以及ElevenLabs进行音频处理,以提升质量。
来源: QbitAI 量子位 —
原文
