Karpathy入职A厂第一条长推文:用Opus 5把《指环王》第一段变成了3D动画,暴露LLM大缺陷
Andrej Karpathy刚刚做了一个实验,结果让他自己也觉得有点不可思议。
Karpathy入职A厂后第一个长推文,是关于测试模型能力的,AK认为大模型目前的能力非常震撼但还有比较大的缺陷,以Opus 5为例构建3D世界只能靠缓慢截图,原生视觉与玩游戏能力依然极度匮乏!这个结论我想大家都有体会,我测试了DeepSeek v4 flash 0731和Kimi K3 max放在文后了,对比结果显示DeepSeek急需要视觉能力,如果视觉能力加上,那么DeepSeek v4 flash 0731就会变成一个真正的怪兽模型。
Andrej Karpathy刚刚做了一个实验,结果让他自己也觉得有点不可思议。
他把《魔戒》的开头第一段文字扔给Opus 5,给了大约100万token的上下文预算,折合花费约10美元,然后问它能不能用Three.js把这段文字渲染成三维画面。
Opus 5跑了将近两个小时,写出了5500行代码,用程序化的方式把这段故事场景完整呈现出来。
Karpathy说,成品有点粗糙,但挺有意思。让他真正觉得不可思议的是这件事本身的性质:一个语言模型需要在(x,y,z)坐标空间里安置和调度各种多边形资产,还要写出让它们动起来的动画代码,而它居然做到了。
他特别提到这类例子的意义所在。没有人会在正常工作中花时间去写这么定制化的东西,但AI有的是耐心,这件事的成本几乎为零。于是,原本属于"没人会去做"这个类别的事情,现在变成了"为什么不做"。他认为这样的事情可能还有很多。
他进一步展开想象:未来可以按需生成高度定制的世界,玩家可以作为旁观者NPC进入《魔戒》故事,也可以扮演其中某个角色。他把这个想象描述为某种类似"按需生成的侠盗猎车手版X故事"。
当然,这次实验也暴露出一个明显的短板。
Opus 5在生成这些代码之后,没法有效地自己验证成果,因为它既不能高效感知视频,也没办法在生成的场景里直接"玩"。它能做的,是非常缓慢地在不同节点截图查看,结果也确实出了一些问题,留下了不少瑕疵。Karpathy认为,多模态感知能力和直接玩游戏的能力,目前依然是LLM比较明显的欠缺之处。
音频部分是Karpathy自己手动用ElevenLabs完成的,AI可以轻松调用对应的API,但他在声音选择上比较挑剔,所以这块自己来做了。
Karpathy说的这个我也深有体会,我用deepseek v4 flash 0731版本构建模拟火星登陆,同样的提示词:
用HTML和three.js制作一个火星登陆模拟过程,全程要符合物理过程,逼真,发挥你最大的想象力,开始吧
Kimi k3 max 花了1个半小时,DeeSeek V4 flash 0731花了大概20分钟,速度非常快,对于一个284B 参数,激活参数只有13B的模型效果已经非常震撼了,但是deepseek由于没有视觉能力不能一边截图一边测试,最终效果与K3还是有差距的,以下是对比:
不过如果不涉及视觉的话DeeSeek V4 flash 0731干活确实很爽,我爬了Paul Graham所有散文,制作成了eupb中英文对照电子书,全程花费10快钱左右,时间为1个小时左右,用的是Hermes ,消耗token大概1.5亿,有需要的后台可以私信我「Paul」获取电子书。
内容效果:
token消耗:
