Gradient Flow

Inside AMD’s AI Bet

8.5内容质量
Inside AMD’s AI Bet

TL;DR · AI 摘要

AMD通过多样化AI基础设施产品和软件策略切入AI市场,但面临性能数据真实性与生态兼容性双重挑战。

核心要点

  • AMD Helios系统采用液冷设计支持大规模云服务,但实际性能仅达峰值的60%-70%
  • ROCm软件栈每6周迭代一次,试图通过自动化工具弥补CUDA生态优势
  • 开放标准架构允许客户自主替换硬件组件,但跨机群协调能力仍待验证

结构提纲

按章节快速跳转。

  1. 揭示AMD在AI领域战略转型的核心逻辑与潜在风险

  2. 解析Helios液冷系统与风冷方案的差异化市场定位

  3. 通过ROCm迭代与AI编码代理实现CUDA生态竞争

  4. 标准化接口设计带来的客户控制权提升与实施挑战

  5. 性能数据真实性与多机协同能力构成主要技术风险

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AMD AI战略
    • 硬件产品
      • Helios液冷系统
      • 风冷服务器方案
    • 软件策略
      • ROCm高频迭代
      • AI编码代理
      • 抽象层封装
    • 风险挑战
      • 性能数据真实性
      • 多机协同缺陷
      • 生态兼容性

金句 / Highlights

值得收藏与分享的关键句。

#AMD#AI芯片#ROCm#云计算#Nvidia
打开原文

Inside AMD’s AI Bet - Gradient Flow

Inside AMD’s AI Bet

Posted by

Ben Lorica

August 3, 2026

July 30, 2026

Posted in

Uncategorized

.meta-info

.post-thumbnail

目录

  • AMD 当前实际销售的产品
  • 软件故事,这才是完整的故事
  • 开源标准的押注
  • 谁在购买,资金实际如何流动
  • 这些仍可能出问题的地方
  • 对于购买 AI 计算资源的你意味着什么

##### AMD 当前实际销售的产品

AMD 最重要的变化不是又推出了一款高性能芯片,而是现在可以为不同客户提供多种形式的 AI 基础设施。其旗舰处理器强调内存性能,有助于系统处理更长的文档和更多并发用户。Helios 将 72 个专用 AI 处理器整合为完整的液冷系统,面向最大的云服务商和 AI 实验室。风冷版本则适配普通服务器,对无法围绕高密度冷却重建数据中心的企业来说更加现实。

让我保持谨慎的两个因素是:所有性能对比都是 AMD 自选工作负载下的内部建模结果,且 AMD 工程师在简报中承认实际吞吐量远低于峰值数据,因此应将这些数字视为上限而非承诺。销售整套系统比销售零部件更具挑战性,因为 AMD 现在需要负责机架组装、冷却、网络和售后支持,任一环节出现问题都会导致整个交付延迟。真正的新变化是 AMD 与 Nvidia 同步出现在采购窗口期,而非晚一年等到预算耗尽。AMD 终于打造出了看起来完整的汽车,但目前还没有人驾驶足够远,还不清楚哪些部件会发出异响。

返回目录

##### 软件故事,这才是完整的故事

硬件只有在客户无需耗费数月专业工程时间就能迁移应用时才有价值。这种迁移成本,比 CUDA 编程系统本身更能保护 Nvidia 的优势。AMD 的策略是从三个方向发起进攻:让更高层次的软件隐藏更多底层芯片细节,利用 AI 编码代理进行工作负载的转换和调优,并每六周更新一次 ROCm 软件栈。AMD 无法在工程师数量上与 Nvidia 匹敌,因此押注自动化技术能缩小差距。

我认为这个押注是可信的,但在最关键的地方仍未经验证。编码代理需要稳定的硬件和严格的测试,这两点在 AMD 内部仍是限制因素。公司在这方面也取得了更多进展:在单台服务器上运行模型的成效,已超过在多台机器上可靠协调运行的水平——而这是最大 AI 服务的运作方式。尝试使用 AMD 的成本正在快速下降,但在生产环境中使用它的风险并未降低那么多。

##### 开源标准的押注

AMD 的下一个论点关乎控制权。Helios 在 AI 处理器、网络交换机和其他组件之间使用行业标准接口。原则上,这使大型客户能够随着时间推移替换系统部件,而非无限期依赖单一供应商的路线图。当下一代产品问世时,临时的速度优势将不复存在。在多个世代中保持谈判主动权的能力,可能更具持久性。

权衡在于开放性会将责任分散到多家公司。AMD依赖合作伙伴提供系统的关键组件,包括让数十个处理器协同工作的高速交换机。这可以加速开发并为客户提供更多选择,但也使故障诊断更加困难。Nvidia的严格控制系统灵活性较低,但一家公司负责大部分性能调优和支持。AMD押注精明的买家会接受今天更多的集成工作,以换取明天更大的自由度。

##### 谁在购买,资金实际如何流动

客户名单改变了我对AMD的看法。OpenAI、Meta、Anthropic、Microsoft和Oracle并非都押注AMD会击败Nvidia。他们购买的是对完全依赖单一公司进行价格、供应和交付的保险。在如此规模下,即使将一小部分支出转移到第二个平台,也能节省真实资金并改善留在Nvidia的所有项目支付条款。

headline承诺看起来简单,实际却更复杂。许多承诺分布在多年内,AMD还通过股票认股权和直接投资来提升采用吸引力。这可能是建立第二生态系统的理性方式,但模糊了获取收入与补贴收入之间的界限。真正的考验不是宣布多少吉瓦特功率,而是实际交付多少设备、客户使用强度如何,以及在计入激励措施后AMD能否实现可接受的利润率。

##### 仍可能出问题的环节

剩余风险主要属于运营层面,这使得它们容易被低估。据报道,Helios机架内包含超过550颗芯片,用于增强其复杂内部布线中的信号。AMD的软件团队还需要持续访问大型测试系统,尤其是现在代码代理生成更改的速度远快于工程师验证的速度。然后公司每年必须重复这一过程,同时争夺稀缺的内存和先进制造产能。下一代产品将增加光互连技术,通过光传输数据,这引入了AMD尚未在此规模上部署的另一项技术。

我还会忽略任何无法转化为实际工作负载的基准测试。供应商比较不同数学格式、功耗设置和基准线的方式,通常在技术上站得住脚,但商业上却无帮助。要问清楚系统在您常规提示长度、响应时间目标、流量模式和功耗限制下的实际表现。AMD通过设计具有竞争力的硬件已通过第一道关卡,但仍需证明其能在严苛的年度周期内完成硬件的构建、测试、交付和替换。

让我最后谈谈对预算影响最大的部分。到2026年,向用户部署模型的计算量将超过训练过程,占到全部AI算力的约60%,这将彻底改变你应该优化的方向。训练过程追求纯粹的数学吞吐量,而部署过程则更看重内存、可预测的响应时间和每条答案的成本——这恰好是AMD设计时针对的指标。另外两个转变同样重要:大型AI设施的限制因素越来越不是芯片采购能力,而是能获得的电力供应。如果你的增长计划假设硬件采购时容量就能到位,那么在相信这个假设之前,务必先与负责电力合同的签署人沟通。同时,智能代理(agent)让普通处理器重新回到账单中,因为一个代理不仅会调用模型,还会运行代码、查询数据库并使用工具,而所有这些操作都发生在常规服务器上,而非昂贵的专用芯片上。

这份清单中最便宜的选项根本不需要任何采购订单。只需合理路由请求即可。AT&T每天处理约450亿个token,通过将简单请求发送给本地小型模型、将复杂请求留给前沿模型,成功将部分AI成本降低了多达90%。AMD内部IT团队的数据显示,这一策略可带来43%的成本节约。你的实际效果完全取决于请求的分布比例和质量标准,虽然这意味着需要运行多个模型并持续评估它们的变化,但你完全可以基于现有硬件在本季度就实现这一方案。至于AMD,我的判断是它将成为一个真正的第二平台,而无需改变行业主导地位。这将表现为选择性股份增长和价格压力,而非趋势逆转。我关注的信号也不是某个基准测试结果或又一个吉瓦级的宣布,而是这些客户是否会回来下第二笔订单。

订阅我们的每周通讯