话不多说,直接开始每日瘫坐(doge)!
就在刚刚,大神卡帕西宣布,"我们" Anthropic 已经开始用一种全新的方式,给大模型上强度——
《指环王》。

据卡帕西介绍,这套"指环王基准",正在接替过去风靡一时的"鹈鹕骑自行车" SVG 测试。

具体来说,卡帕西直接把《指环王》的开头丢给 Opus 5,让模型用 Three.js 现场搓出一整个"中土世界"。
至于最终效果嘛,多少有点像上世纪 90 年代末、21 世纪初的国产 3D 动画片:很粗糙,也很抽象。
但客观来说,仔细看上一会儿,如果你又恰好熟悉坐落在新西兰的《指环王》取景地霍比屯,倒也确实能看出那么一丝味道~
不过,就是这么个看起来不太精致的玩意,却实打实地花掉了 Opus 5: 100 万 token,2 个小时以及5500 行代码。
当然,舞台上也并非只有 Claude 一模独自美丽。
最搞笑的,还得是网友新端上来的一碗 DeepSeek V4 Flash 版本。
直接一整个"中国人能飞",画面人物全员漂浮。
面对这些目前肉眼可见的穿帮,卡帕西倒也相当中肯。
他指出,Opus 5 目前还无法真正"进入"自己生成的世界,只能在不同时间点不断截图,再慢慢检查哪里出了问题。
而这恰恰暴露了当前大模型的一块明显短板:
它们已经能写代码、搭场景、生成游戏,却还不能真正看懂视频,也不会亲自玩一遍自己做出来的游戏。
两小时,手搓一个中土
咱们先来看这个"指环王"测试具体是怎么做的。
如果按照卡帕西推文的字面意思,这次输入给 Opus 5 的主要提示词,应该就是《指环王》正文第一章《期待已久的宴会》的开头。

袋底洞的比尔博 · 巴金斯宣布要举办盛大的 111 岁生日宴会,霍比屯立刻议论纷纷……
有兴趣的朋友可以自己试一下。
除此之外,卡帕西还在提示词里指定了 Three.js,也就是一个用代码搭建 3D 场景的 JavaScript 库。
由此,Opus 5 要完成的任务,就是先读懂《指环王》开头的文字,再把它翻译成一个能够在浏览器中实时运行的 3D 世界。

整个过程中,Opus 5 需要用多边形拼出人物、建筑和道具,把它们逐个放进 x、y、z 坐标系,再安排好摄像机、灯光和动画。
人物什么时候移动,镜头往哪里转,灯光如何变化,场景中的物体又该如何互动,全部需要模型用代码定义。
虽然最后的画面称不上精致,而且经常出现穿模、漂浮等问题,比如人物的身体和脑袋分离……但整套场景好歹被真正搭了起来。

需要注意的是,这和视频模型直接生成一帧帧像素并不是一回事。
Three.js 需要先把人物、物体和场景作为三维对象建立起来,再根据代码实时计算它们的位置、角度和运动状态。
所以,我们看到的 Demo 并不是一段普通的 AI 生成视频,而是一个 3D 网页场景运行时的录屏。
不过,卡帕西在评论区也提到,程序化 3D 和视频生成并不是二选一。
有网友提议,可以把这个粗糙的 Three.js 录屏交给 Seedance 充当参考视频,再让视频模型用更高的画质重新渲染一遍。

卡帕西很快表示赞同。
按照他的设想,程序化代码可以负责分镜和控制,先把人物站在哪里、镜头怎么运动、剧情如何推进这些骨架敲定。
接下来再把录屏交给 Video-to-Video 模型,让它补上纹理、光影和细节,把整个中土世界的"卖相"拉满。
至于音频,Opus 5 这次倒没有一起包圆。
卡帕西表示,出于个人对音质的要求,最终使用的是 ElevenLabs。

于是,开头那段有画面、有镜头、还有旁白的《指环王》Demo,就这么横空出世了。
卡帕西也已经将整个项目开源,具体链接可以参考文末。

网友比卡帕西有意思多了
就在卡帕西放出 Demo 后,不少网友也赶来测试了一番。
整体看下来,只能说:
这届网友比卡帕西有想象力多了。
有人用 Claude 启动了一个「Earth Online」项目,目标是靠一群 AI Agent,把整个地球一点点搭出来。
目前,Agent 还没造完整个地球,只搭出了一个低多边形风格的旧金山滨水区。但从现有画面来看,建筑比例、人物尺度和整体风格都保持得相当统一。
这个效果有点像那种乐高世界的动画片。画风不复杂,但人物、场景和动作能在同一个世界里稳定运行。
照这个方向继续走,简单画风的动画和轻量游戏,已经有了点 AI 原生的雏形。
还有网友用 Fable 5 和 GPT-5.6 Sol 搭出了纽约市的 3D 数字模型,并在其中接入实时数据。
模型不仅要把纽约的街道和建筑摆对,还要维持不同区域之间的空间关系。作者也因此提出,这种生成虚拟世界的任务,或许可以成为一种新的空间推理 Benchmark。
更夸张的还在后面。
有网友没买到 Kanye West 的演唱会门票,干脆用 AI 在浏览器里给自己补办了一场。
整个项目依旧由 Three.js 搭建。只有一个 HTML 文件,没有调用任何现成的 3D 模型,舞台、人物和灯光全部由代码生成。
整场演唱会一共准备了 14 首歌,每首歌都有独立的灯光设计和一套专属的球形舞台视觉。
普通用户可以试听片段,连接 Spotify Premium 后,还能播放完整曲目和整场演出。
没抢到票,直接给自己生成一个包场,太亏贼了!
还没完!!!
卡帕西在原帖末尾还畅想,后续可以给这些 3D 世界加入玩法,让玩家以旁观者、NPC 甚至故事角色的身份进入其中。
结果游戏版本还没等卡帕西安排,网友已经做出来了。

这个项目同样使用 Opus 5 和 Three.js,不仅能运行和交互,连音频都配上了。
更多 3D 设计案例也在不断出现。从建筑比例、空间布局到场景风格,Opus 5 已经能在规模不小的项目里维持相对稳定的一致性。
类似实例还有很多,这里就不逐个展示了。
客观来讲,这些作品距离真正成熟的游戏仍有距离。
眼花缭乱的玩法是否有趣、长时间运行是否稳定、玩家会不会真的愿意在里面待上 15 分钟,目前都还没有答案。
但实时 3D 内容和可玩原型的制作门槛,确实被向下推了一大截。
更何况,能有一种新的方法测试模型能力,同时又足够有趣、好玩,岂不美哉?
鹈鹕,骑到头了
那么,为啥突然要让大模型生成《指环王》呢?
这还得从前几年爆火的"鹈鹕骑自行车"测试说起。
这道题最早来自开发者 Simon Willison,要求只有一句话:
生成一张鹈鹕骑自行车的 SVG 图片。

虽然这题目看起来简单,但其实它相当考验模型。
因为 SVG 看起来是一张图片,底层却是一串代码。
模型不仅要知道鹈鹕和自行车分别长什么样,还得把它们拆成线条、圆形和多边形,再用坐标安排好每个部件的位置关系。

更关键的是,鹈鹕和自行车本身就不怎么般配。
自行车的车架、轮胎和踏板必须保持正确的几何结构;鹈鹕则长着大嘴、短腿,以及一副怎么看都不像会蹬车的身材。

两者一组合,模型到底有没有理解空间关系,几乎一眼就能看出来:
轮子歪没歪、脚踩没踩到踏板、鸟到底是在骑车,还是被车架当场肢解。
看看上面这些 24 年年底的 demo 吧~
正因如此,"鹈鹕骑自行车"一度成了民间观察大模型空间理解、物体组合和代码生成能力的经典测试。

但随着模型越来越强,这只鹈鹕也快骑到头了。
看看下面 DeepSeek R1 和 DeepSeek V4 的表现就知道,如今的模型已经能把这道题完成得相当像样。

更重要的是,一张 SVG 只能考察模型的一次性输出。
它测不出模型能不能规划一个复杂项目、连续工作几个小时,并在几千行代码里反复检查和修正自己的错误。
于是,卡帕西把一道"画张图"的小题,换成了"搭个世界"的大工程——
鹈鹕可以下车了,中土世界正式接棒。

卡帕西的鹈鹕
很快,卡帕西准备给"鹈鹕测试"换题的消息,也传到了各大社区。
Hacker News 的高赞评论认为,虽然这些 Demo 的画面质量都很一般,但这恰恰说明,我们需要一个比生成单张图片更难的新测试。
新的基准不该只看模型能不能把图画对,还要考察它能不能理解一个世界。

毕竟,"鹈鹕骑自行车"已经用了太久。
模型不断针对这类任务刷榜,彼此之间的差距越来越难看出来。
相比之下,生成一个完整的 3D 世界,需要模型理解人物和物体之间的空间关系,处理镜头、动作和场景变化,而不是简单调用视频生成模型吐出一段画面。

当然,也有人提出反对意见。
鹈鹕测试足够简洁,成本低,结果也容易比较。
为了测一次模型,消耗那么多 Token 生成整个 3D 世界,多少有点拿算力放烟花的意思。

与此同时,Three.js 本身能不能衡量大模型的综合能力,也遭到了质疑。
有人认为,这类 Demo 最多只能证明 Anthropic 在 Three.js 代码上训练得不错,不能说明模型真的理解了空间和物理世界。
但很快就有网友反驳:
把一段抽象、含义模糊的文学文本转化成 3D 动画,模型需要同时处理空间关系、物理规律、日常物体,以及 3D 变换和计算机图形学中的数学问题。
如果这还只能算"会写 Three.js ",多少有点低估这 5500 行代码了。

还有网友提出了一个更开放的问题:
所谓"空间推理",真的和大模型平时处理文字、代码时的推理不同吗?
一种观点认为,画面能否成立,取决于模型是否理解"前后、内外、远近、遮挡"等空间关系,以及物体在不同视角下的距离、角度和相对大小。

但另一种观点认为,无论模型处理的是"石头旁边",还是"数组里面",做的可能都是同一件事:根据上下文逐个生成 Token,并在这个过程中完成推理。
如果是这样,那么,Opus 5 展示的就不只是一项突然冒出来的"空间能力"。
更可能的情况是,大语言模型原本用于理解文字和代码的通用推理能力,已经开始自然延伸到三维世界。
从画一只鹈鹕,到搭出一个中土世界,题目看起来变了,但背后测试的或许始终是同一个问题:
模型能不能把自己对世界的理解,转化成一套真正能够运行的结构。
而在最后,也许还有一个更加离谱的问题——
如果通用大模型已经能够自己写代码搭建 3D 世界,再调用 Seedance、ElevenLabs 等 API 完成画面和声音,那么用户还有多少必要,亲自打开一个专门的视频生成产品输入 Prompt?
参考链接
[ 1 ] https://karpathy.ai/lotr-movie/
[ 2 ] https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[ 3 ] https://x.com/wizardbrainz/status/2083012159341203708
[ 4 ] https://x.com/aniketjart/status/2083645765097033845
[ 5 ] https://x.com/davidfromkansas/status/2075691129899528254
[ 6 ] https://x.com/MindaugasLT/status/2083488027343470939
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见
淘配网官网提示:文章来自网络,不代表本站观点。