Andrej Karpathy(@karpathy)

We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a...

8.5内容质量

TL;DR · AI 摘要

Andrej Karpathy展示Opus 5模型生成复杂Three.js代码的能力,揭示LLM在游戏世界构建中的潜力与局限。

核心要点

  • Opus 5用5500行代码实现《指环王》场景渲染,耗时2小时且预算约$10
  • LLM在生成游戏世界时面临无法感知视频和游戏内审计的弱点
  • 生成高度定制化虚拟世界可能成为LLM的新应用场景

结构提纲

按章节快速跳转。

  1. 讨论传统LLM测试方式已无法满足复杂场景需求

  2. ·Opus 5实验

    给予《指环王》首段和1M token预算,模型生成5500行Three.js代码

  3. 模型能自主定位3D资产坐标并编写动画代码,但存在渲染瑕疵

  4. LLM缺乏视频感知和游戏内审计能力,导致生成内容存在缺陷

  5. 提出构建可定制虚拟世界作为LLM新应用场景的设想

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • LLM生成游戏世界
    • 实验案例
      • Opus 5渲染《指环王》场景
      • 5500行Three.js代码生成
    • 技术挑战
      • 缺乏视频感知能力
      • 游戏内审计困难
    • 未来应用
      • 定制化虚拟世界生成
      • NPC交互场景构建

金句 / Highlights

值得收藏与分享的关键句。

  • Opus 5在2小时内生成5500行Three.js代码,实现《指环王》场景的程序化渲染

    正文第一段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • LLM需要通过截图和坐标计算来模拟游戏感知,导致生成内容存在'jank'瑕疵

    正文第三段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 生成定制化虚拟世界可能成为LLM的新应用方向,类似'按需生成的GTA'体验

    正文第四段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI#LLM#Three.js#游戏开发#Andrej Karpathy
打开原文

Andrej Karpathy 在 X 上的发言:"我们正在进入一个不再需要通过诸如'生成鹈鹕骑自行车的SVG'这样的测试来评估LLM的领域。为了探索模型的泛化能力,我曾好奇如果给Opus 5《指环王》的第一段文字、100万token的预算(约10美元),并要求它生成https://t.co/ybIpXhYSsj的three.js渲染版本,它会如何表现" / X

Andrej Karpathy

@karpathy

我们正在进入一个不再需要通过诸如"生成鹈鹕骑自行车的SVG"这样的测试来评估LLM的领域。为了探索模型的泛化能力,我曾好奇如果给Opus 5《指环王》的第一段文字、100万token的预算(约10美元),并要求它生成three.js渲染版本,它会如何表现。Opus运行了约2小时,编写了5500行代码,以程序化方式渲染了这个故事。虽然实现有些粗糙,但非常有趣。但令人惊讶的是,LLM需要在(x,y,z)坐标中放置和编排各种多边形资源,并编写代码使所有内容动起来,甚至能完成任何事情。我也喜欢这类示例,因为正常人绝不会花时间编写如此定制化的代码,但LLM却拥有无限的耐心和毅力,这使我们从"没人会这么做"转变为"当然可以,这几乎是免费的"。未来可能还有更多类似案例。但我对创造高度定制化的虚拟世界感到兴奋,用户可以进入其中参与《指环王》故事,作为旁观者NPC或故事中的角色等。这就像按需生成的临时GTA世界。最后想指出的是,虚拟世界/游戏领域暴露了LLM的弱点:它们无法轻松审查自己的工作,因为无法高效地原生感知视频或在游戏环境中进行交互。在这里,Opus 5必须非常缓慢且费力地在不同时间点截图,过程中多次出错,导致一些粗糙的渲染。这是多模态交互和游戏生成能力的原始示例,我认为目前仍然存在明显不足。

$

00:00

/$

2026年8月2日 凌晨3:00

460万

观看次数

1.5K

2.1K

28K

12K /