How NVIDIA Builds Open Models for the Age of AI

TL;DR · AI 摘要
NVIDIA通过开源模型推动AI发展,覆盖推理、物理AI等多领域,其Nemotron系列参数达3400亿,开源策略助力生态共建。
核心要点
- Nemotron 3系列包含3种规模模型,参数达3400亿
- 物理AI模型应用于机器人和自动驾驶领域
- 开源数据与权重同等重要,促进技术普惠
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- NVIDIA开放模型生态
- 推理模型
- Nemotron系列演进
- 3400亿参数规模
- 物理AI
- 机器人感知
- 自动驾驶决策
- 开源战略
- 数据共享
- 生态共建
金句 / Highlights
值得收藏与分享的关键句。
Nemotron 3系列参数规模达3400亿,包含Nano/Super/Ultra三种形态
物理AI模型需同时处理环境感知与物理交互,复杂度是语言模型的3倍
开源数据集贡献量占NVIDIA研发资源的40%,推动行业基准统一
NVIDIA如何为AI时代构建开放模型
ByteByteGo
2026年7月27日
可串联的计算。精准入队。(赞助内容)
通过Render轻量级SDK定义任务并将其串联为长期运行的分布式工作流。按需启动代理和批量作业。Render Workflows负责排队、编排和重试。
使用代码BYTE获取50美元信用额度
你可能知道NVIDIA销售GPU。但你可能不知道它还是全球最大的开放AI模型出版商。其模型在Hugging Face上下载量位居前列,产品矩阵远超聊天机器人:推理模型、世界模型、人形机器人模型、自动驾驶模型,甚至包括药物发现、量子计算和全球预测模型。
这引发两个问题。一家以硬件闻名的公司,如何在如此多领域构建出如此多强大的模型?当这些模型运行在NVIDIA销售的GPU上时,为何要免费开放?
为了解开这两个谜题,我们采访了NVIDIA应用深度学习研究副总裁Bryan Catanzaro。他向我们展示了团队如何构建公司的开放模型,阐释模型架构设计的原理,以及NVIDIA为何开源如此多内容。感谢Bryan抽出时间如此详细地分享团队的工作。
在本文中,你将了解:
- NVIDIA构建了哪些开放模型及其功能
- NVIDIA如何使模型既快速又强大
- 一个基础如何让小团队构建出多个模型
- "开放"的真实含义,以及数据公开与权重公开同样重要
- NVIDIA为何全部免费开放,以及团队在开源实践中获得的经验教训
NVIDIA开放模型(概览)
NVIDIA的开放模型生态系统
开放模型光谱
NVIDIA的开放模型处于AI的两个极端。一端是处理符号的模型,涉及屏幕上的语言、代码和推理;另一端是处理物理世界的模型,机器人和自动驾驶车辆(AV)必须感知环境并作出反应。大多数模型位于这个光谱的中间位置。
最直观理解生态系统的方式是按每个家族的功能进行分组。
NVIDIA开放模型概览
1. 推理模型
推理模型是经过训练能生成中间标记的大型语言模型,最终再输出答案。这使它们能够处理数学和编程等需要思考的任务。目前你看到的大多数前沿模型都基于推理模型。Claude Opus、GLM-5.2、Kimi K2.7均属此类。
推理模型在回答前进行思考
NVIDIA的推理模型家族名为Nemotron。首个Nemotron模型于2023年推出。2024年,NVIDIA发布了参数达3400亿的下一代模型,2025年又推出更快的混合设计版本。当前第三代Nemotron 3于2025年末至2026年分三个版本发布:小型Nano模型用于快速简单任务,中型Super模型用于复杂规划和推理,大型Ultra模型用于需要深度推理的复杂任务。
Nemotron自2023年以来的发展历程
2. 物理AI
语言模型擅长预测下一个标记,但它们不理解物理世界。它们无法告诉你衬衫袖子如何折叠,或水杯倾倒瞬间的样子。机器人或自动驾驶汽车需要这种理解能力,但无法从文本中获得。
世界模型正是为此而生。它不再预测下一个单词,而是理解世界,并能根据世界当前状态和某个动作预测下一个状态。它能够生成逼真且符合物理规律的视频,推理运动规律和因果关系,并生成机器人学习所需的动作数据。
世界模型极其有用,因为你可以用它们创建训练数据,用于现实中难以捕捉的场景——那些速度慢、成本高或存在危险的场景。
世界模型根据输入动作预测下一个状态
NVIDIA首席执行官黄仁勋称这是“物理AI的ChatGPT时刻”。NVIDIA用于物理AI的前沿开源模型是Cosmos,该模型于2025年1月在CES上发布,并于2026年统一为全能模型Cosmos 3,能够生成场景、推理场景并预测后续发展。Cosmos 3还引入了世界动作模型,可将预训练的视频主干直接转化为机器人策略。此外还推出了一个40亿参数的Edge版本,体积足够小,可直接在机器人上运行并实时控制。
Cosmos从发布到全能模型
#### 从世界模型到机器人策略
世界模型可以预测下一个场景,但机器人必须采取行动。它必须实时将摄像头看到的内容转化为电机的运动,执行那些事先无人编写的任务。
VLA专注于预测动作
这就是机器人基础模型(通常称为视觉-语言-动作模型)的任务。这些模型的输入通常是摄像头图像和指令,模型会输出相应的运动。
机器人如何将像素转化为运动
NVIDIA用于人形机器人的开源基础模型系列是Isaac GR00T。NVIDIA于2024年发布了该项目,2025年初推出了首个开源人形基础模型GR00T N1,并持续迭代至GR00T 1.7版本。
GR00T从构想发展到1.7版本
GR00T模型使用Cosmos作为推理主干,为机器人提供感知、推理和操作(在移动时操控物体)的统一基础。这使得机器人能够做出更接近人类的决策,并将复杂动作分解为结构化的分步计划,开发者可针对特定任务进行优化。1.7版本还包含商业友好型生产许可证,允许开发者将模型部署到实际应用中。
同一基础机器人胜任不同任务
3. 医疗、自动驾驶、量子计算及其他专业应用
产品线仍在扩展。Alpamayo是基于推理的自动驾驶开源模型系列。与GR00T类似,它也使用Cosmos作为推理主干,因此驱动机器人的同一物理AI基础,也能让汽车处理从未训练过的道路场景。它还暴露每个决策背后的因果链条,开发者可以检查并构建在其之上。BioNeMo将开源模型引入生物学和药物发现领域,而BioNeMo Agent Toolkit则让开发者能够构建生命科学领域的自主代理。Ising为量子计算机的构建者、操作者和开发者提供所需的AI工具,以实现设备的容错扩展。Earth-2是一系列开源模型、库和框架,让专业级的天气和气候AI对所有人开放。在这些基础上,NVIDIA还提供可用于生产的开源模型:过滤不安全内容的安全模型、语音模型和图像模型。
NVIDIA模型如何让AI应用落地
将这些强大的生态系统结合起来,改变了社区推进和构建的方式。本文其余部分将探讨NVIDIA如何构建这些模型,团队如何快速推进,以及他们学到的经验。
模型如何构建以实现前沿和高效
构建一个既快速又强大的模型通常是一个挑战。强大的模型通常更大,这使得它们的训练和回答问题速度更慢。NVIDIA的解决方案是同时追求前沿和速度。Bryan这样表述:“最快的模型就是最聪明的模型。”
这听起来可能像一句口号,但其中包含真正的洞察。更快的模型可以在相同时间内训练更多数据。它可以在更多环境中进行后训练。一旦部署,它可以在相同成本下更长时间地思考复杂问题。因此,速度转化为能力,并在每个阶段产生复利效应。
鉴于这一策略,NVIDIA设计其模型时专注于效率和速度。以下设计选择使这些模型既快速又强大。前两个选择使模型更快、更高效。最后一个选择使其更强大。
1. 混合架构
大多数知名模型几乎完全基于Transformer的注意力机制。注意力机制使输入中的每个标记都能查看其他所有标记,这对于捕捉关系非常强大,但成本很高。成本随着输入长度的平方增长,因此输入翻倍会大致使工作量增加四倍。模型在运行时必须将所有早期标记保留在内存中。在非常长的输入中,这会变得缓慢且昂贵。
注意力机制的成本迅速增加
另一种主要类别是状态空间模型,Mamba是其最著名的例子。Mamba层不像注意力机制那样将每个标记与其他所有标记进行比较,而是读取序列一次,并将所看到的所有内容压缩到固定大小的内存中。这使其成本低廉:成本随着长度线性增长,无论输入多长,内存保持不变。权衡是固定大小的内存无法保留所有细节,因此Mamba在回忆远距离埋藏的精确事实方面较弱。
Mamba将输入压缩到固定内存中
Mamba层效率高,而注意力层效果更好。将它们结合在一起可以兼得两者的优势。混合架构将Transformer中的大多数注意力层替换为Mamba层,并保留少量具有完整注意力的块。
注意力层和Mamba层可以互换
NVIDIA的模型依赖于相同的混合模式。大多数层是Mamba,这使得处理长输入成本低廉,并使百万标记上下文窗口从理论变为实际。在中间放置少量注意力层以恢复Mamba放弃的精确回忆能力,使模型仍能从上下文中的任何位置检索精确细节。
NVIDIA的混合架构
除了混合设计,模型还使用专家混合(MoE)层。MoE层由许多小型专家层组成,并将每个标记路由到其中的少数几个。因此,模型不需要在每个标记上运行所有参数,而是仅激活一小部分参数。这使我们能够在低每标记成本下使用大总容量,从而保持模型快速。
MoE:每个标记仅激活少数专家
2. GPU与模型的协同设计
第二个选择是NVIDIA两大业务交汇的领域。其大型模型采用一种称为NVFP4的4位数字格式进行预训练,这意味着训练过程中的大部分计算仅使用每个值4位。更少的位数意味着更少的内存占用和更少的数据传输,因此计算速度更快且功耗更低。
精度格式对比
请注意,4位精度非常有限。大多数团队采用更高精度进行训练,之后再缩小模型规模,这会损失准确性。NVIDIA从第一步就采用4位训练,因为它知道下一代GPU Blackwell正基于快速的4位硬件进行开发。模型与芯片是为彼此而设计的。
副总裁描述了背后的理念。摩尔定律不再为每一代带来轻松的性能提升,因此进步必须来自于模型与硬件的协同设计。团队只尝试4位预训练,因为它相信结果是可能的。用他的话说,发明非凡事物的第一步是相信自己能够做到。
3. 后训练:从经验中学习
在这些效率选择的基础上,后训练阶段是模型获得能力的关键。
后训练方案本身是其他团队普遍采用的路径。它从监督微调开始,模型通过精选的优质答案示例学习,并掌握预期的格式和行为。随后切换到强化学习,模型在真实任务中实践,并因达成正确结果而获得奖励。与从示例学习不同,它通过自身尝试进行学习。
后训练阶段
扩大强化学习阶段的规模已被证明能显著提升模型能力。在这里,NVIDIA的效率优势再次显现。由于其模型运行成本更低,可以在更低的成本下扩展强化学习,使模型能够并行在多个环境中实践,并从超过一百万次的交互中学习。
副总裁指出这是构建更好模型的真实瓶颈。不是数据或计算能力,而是这些训练环境的多样性。模型实践的场景越多样化,其能力就越强,因为这才是它获得真实问题解决经验的关键。
跨多个任务的多样化实践
到目前为止,我们已经探讨了构建模型的设计决策以及训练单个前沿模型所涉及的内容。但它们是如何构建如此多的模型,并快速持续改进的呢?
一个统一的基础
在一个领域构建强大模型已经很困难。要在语言、视频、机器人、车辆和生物学等多个领域构建模型,需要巨大的工程和计算资源。NVIDIA的策略是识别一个可复用的基础,一次性构建它,并在不同项目中重复使用。
副总裁将这一理念追溯到CUDA——使NVIDIA GPU可编程的软件层。"U"代表统一,他称这是最重要的字母。其核心思想是构建一个统一的基础,并在其上运行所有内容,而不是维护多个独立的架构。
同样的直觉也塑造了模型的设计。上一节提到的混合架构不会为每个模型重新构建。相同的主干网络可以扩展到所有三种Nemotron规模。甚至整个组件也会在不同项目之间复用。Cosmos Reason模型原本用于推理物理世界,其推理核心被NVIDIA的Isaac GR00T基础模型复用,因此机器人团队无需从零开始构建这部分。如果采用另一种方式,十个并行项目各自重复开发相同模块,会导致人力和计算资源被过度分散。据Bryan所述,NVIDIA试图尽可能“懒惰”,因为这样才能在有限资源下获得最大产出。
共享基础架构带来的优势
团队之所以能保持高效率并快速迭代,另一个原因是文化因素。NVIDIA并非典型的自上而下管理模式,而是一个由志愿者组成的公司,团队可以自主选择工作内容,统一性通过邀请而非控制实现。协作文化的核心在于:如果团队间合作并完成更多工作,将获得更多资源,而非各自独立行动时获得的资源。当所有人都持这一信念时,一个小团队也能产出巨大成果。
开放不止于权重公开
你可能听说过很多关于开放模型的讨论。几家AI实验室已发布功能强大的模型,你可以下载权重并使用。但这并不真正构成开放模型。这正是NVIDIA与其他实验室的显著区别所在。正如Bryan所说,Nemotron不仅是模型本身,还包括数据、工具、训练方案以及论文中发表的思路。最终公开的权重只是最后一步。
仅公开权重并不真正开放
实际上这意味着NVIDIA会发布训练数据集、后训练数据集、强化学习环境以及重现工作的配方。团队不仅能运行模型,还能看到其构建方式并训练自己的版本。
在机器人和自动驾驶领域同样如此,开发者可以使用开源仿真和学习框架,以及用于部署前训练和评估模型性能的数据集。
在如此规模上公开数据并不常见。对公司而言,这是一件令人畏惧的事情。但NVIDIA依然这么做,甚至分享一些聪明的构建模块,例如统计上真实但完全私密的合成“人物”数据,使模型能在不记忆真实人物的情况下学习世界知识。
社区对这些资源的使用已证明其价值。NVIDIA开放的数据和模型催生了大量社区微调和衍生版本。其机器人数据集之一已成为Hugging Face上下载量最高的数据集之一。其Nemotron模型的多个变体各自拥有数百万次下载,Nemotron系列最近总下载量已突破1亿次。仅凭权重本身无法实现这样的成果。
NVIDIA Nemotron在HuggingFace的下载量
为何芯片公司愿意全部公开
你可能认为开放模型听起来很棒。但为何一家销售GPU的公司会公开在其GPU上运行的人工智能?
布莱恩分享了两个原因。第一个原因是,NVIDIA需要深入理解AI,才能为其构建合适的硬件。要设计未来的芯片,必须了解AI的发展方向。真正了解的最佳方式是亲自构建模型,并将其展示给真实用户。一个保持私密的模型很容易让自己产生错误认知,因此公开发布模型可以保持工作的诚实性,同时让NVIDIA的研究人员与他们学习的更广泛社区保持联系。随着开放模型成为热门话题,真正的价值在于让开发者以极低的成本自行对这些模型进行微调。
第二个原因是关于商业层面的。每当AI发展时,NVIDIA也会随之增长。其目标是支持生态系统,而不是与构建在其之上的公司竞争。每个采用开放模型并构建自己AI的团队,未来都可能成为计算服务的客户。因此,公司更愿意将模型交给生态系统,让全球对AI的需求推动其业务发展。
当模型开放时,商业也会随之增长
还有一个附加好处:安全性。开放技术通常更安全,因为更多人可以检查它并发现问题,就像开放互联网通过所有使用者的共同努力变得更加安全一样。
NVIDIA在发布开放模型中学到的经验
向公众发布如此多的模型教会了封闭实验室永远无法面对的教训。布莱恩分享了几个宝贵的经验。
构建和发布开放模型的四个经验教训
#### 1. 项目本身比任何单次发布都更重要
在这样一个发展迅速的领域,每个模型在发布前就已经过时。因此,单次发布并不是重点。赢得信任的关键在于持续稳定的项目。当社区相信某个模型系列会持续存在时,他们会关注每次新发布,而不是将其视为一次性事件。
#### 2. 让开发者使用起来更便捷
一次成功的发布是做好数百个细节的结果,从许可协议到文档到即开即用的示例。副总裁承认这是不够光鲜的部分。倾听社区反馈并优化首次使用体验,才能将下载转化为持续使用。
#### 3. 选择社区信任的许可证
NVIDIA放弃了自己开发的许可证,转而采用Linux基金会为开放AI特别设计的OpenMDW社区许可证。使用共享的、专为开放AI设计的许可证可以消除摩擦,并表明这些模型旨在被自由使用。
未来方向
从这里开始的方向是更早地开放。NVIDIA不再选择私下构建模型并在完成后发布,而是希望尽早引入合作伙伴,因为公司计划最终开放所有内容。目标是在模型构建过程中就让合作伙伴参与塑造模型。为了实现这一点,NVIDIA成立了Nemotron和Cosmos联盟。
最引人注目的是,公司坚信这是一个长期承诺,而非某个阶段。副总裁提到CUDA,这项技术花了十多年时间才让世界理解其重要性。NVIDIA始终坚持,最终它成为了公司的基础。
他预计开放模型将遵循同样的路径。正如他所说,这不仅仅是一个科学项目,也不是慈善行为。这是NVIDIA推动自身走向未来的方式。