Karpathy 最新讨论:我们正在走出那种用简单 prompt(比如"画一个骑自行车的鹈鹕 SVG")来测 LLM 的阶段。他提出的一个泛化思路:给 LLM 一个复杂的、连人类都不愿花时间做的任务,看它能不能凭"无限耐心"完成。
他的实验:给 Opus 5 第一段《指环王》,配 100 万 token 预算(约 $10),要求做一个 three.js 3D 渲染版本。
Opus 5 花了约 2 小时,写出了 5500 行代码,程序化地渲染了整个故事——把各种多边形资产摆到 (x,y,z) 坐标、写代码让它动起来。虽然有点粗糙(janky),但确实跑起来了。
Karpathy 喜欢这个例子的原因:没有任何正常人会花时间写这么定制化的东西,但 LLM 有无穷的耐力和耐心——它把"绝没人会做"变成了"当然可以做,反正几乎免费"。他兴奋于创造超定制世界:比如让玩家作为旁观 NPC 或某个角色,参与进指环王的故事——一种"按需生成的临时 GTA"。
这是今天最新的趋势信号:AI 评测标准正从"简单会做"升级为"复杂长期任务能否自主完成"。LLM 的耐力成了新的核心竞争力。
"生成式世界/游戏"是下一个高潜力方向,但多模态意图-感知仍是硬伤——模型现在"不会玩自己写的游戏"。这对做 AI+游戏/虚拟世界的团队是明确的差距信号。
关注点:多模态原生感知 + 自主审计能力,会是下一轮模型竞争的焦点之一。