Latent Space

[AINews] GPT 5.6 price cut by 20%-80%: Cost of GPT 5.4 Intelligence dropped 13x in 4 months due to GPT 5.6 recursive self-optimization

8.5内容质量
[AINews] GPT 5.6 price cut by 20%-80%: Cost of GPT 5.4 Intelligence dropped 13x in 4 months due to GPT 5.6 recursive self-optimization

TL;DR · AI 摘要

GPT 5.6通过递归自我优化使推理成本下降13倍,价格降幅达20%-80%,并引入2.5倍加速模式。

核心要点

  • GPT-5.6 Sol通过自主内核优化降低20%端到端成本
  • 推测解码技术使生成效率提升15%以上
  • GPT-5.6 Luna价格降至$0.20/百万输入token

结构提纲

按章节快速跳转。

  1. 揭示GPT 5.6通过自我优化实现成本指数级下降的行业影响。

  2. 通过自主内核优化和推测解码技术实现20%-15%效率提升。

  3. 针对Codex工作负载的批处理和缓存管理提升硬件利用率。

  4. Rust层优化减少上下文膨胀和重复计算成本。

  5. 通过只读历史记录实现90%缓存命中率。

  6. GPT-5.6 Luna价格下降80%,Sol推出2.5倍加速模式。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • GPT 5.6优化与成本降低
    • 推理加速
      • 自主内核优化(20%成本降低)
      • 推测解码(15%效率提升)
      • KV缓存优化(硬件利用率提升)
    • 代理工具改进
      • Rust层优化(减少重复计算)
      • 提示缓存(90%命中率)
    • 价格调整
      • Luna降价80%
      • Sol 2.5倍加速模式

金句 / Highlights

值得收藏与分享的关键句。

#GPT#AI模型#成本优化#OpenAI
打开原文

[AINews] GPT 5.6价格下调20%-80%:GPT 5.4智能成本4个月内因GPT 5.6递归自我优化下降13倍

AINews:工作日简报

蒸馏就是你所需要的一切!

2026年7月31日

一年前我们的一张重要"英雄图表"(后来被Demis采用)得出了惊人结论:在保持LMSys Elo不变的情况下,GPT4级别智能在18个月内下降了1000倍:

当时尚不清楚这些是"新手收益"——从未优化到优化,从生成到推理,从密集模型到MoE模型,所有低垂果实已被摘取。又过了18个月后,答案似乎是否定的;保持智能水平不变的情况下,成本正持续急剧下降。

昨日,OpenAI公布了GPT 5.6如何优化自身服务的发现:

1. 推理加速

为在相同硬件上服务更多token而不牺牲质量,OpenAI聚焦于多项系统升级:

  • 自我优化:GPT-5.6 Sol被主动用于分析生产流量、调整负载均衡,并自主用OpenAI自有TritonGluon语言重写生产内核。这种自主内核优化使端到端服务成本降低20%。
  • 推测解码:通过设计并运行数百次架构实验(测试规模、结构和功能变化,监控推测者训练过程,出现问题时自主干预,包括硬件故障和训练不稳定性),提升自身草稿模型,使token生成效率提升超过15%。
  • KV缓存:针对不同工作负载(主要是Codex中的Sol)优化批处理、分片和缓存管理,从现有硬件中提取更多推理能力。

2. 代理工具链改进

为简化Codex和ChatGPT Work等工具中复杂的多步骤任务,OpenAI优化了Rust编排层以减少重复计算成本:

  • 避免上下文膨胀:仅在需要时展示工具、技能和插件(延迟发现),默认将工具输出限制在10,000 token以内,防止上下文窗口不必要的扩展。
  • 提示缓存:为避免重复处理相同指令和历史记录,工具链将所有模型可见的历史视为只追加内容。这保留了提示前缀,使系统能够复用先前计算数据并保持高缓存命中率。

今天,他们证明这不仅是理论,宣布对小型模型大幅降价,并在Sol中推出新的2.5倍加速模式(尽管未实现7月暗示的10倍加速Cerebras驱动模式):

Sam Altman

@sama

今日重大降价:*GPT-5.6 Luna降价80%,现为每百万输入token 0.20美元,每百万输出token 1.20美元 *GPT-5.6 Terra降价20%,至2/12美元 *GPT-5.6 Sol在API中获得Fast模式,速度提升2.5倍,价格仅提高2倍,智能水平保持不变

2026年7月30日 下午5:27

·

150万次观看

995条回复

830次转发

13.9K点赞

这是一条优美的帕累托曲线——如果AA的每任务成本能反映真实世界任务,那么OpenAI甚至超越了DeepSeek、GLM和MiniMax等开源模型,以及Gemini Flash-Lite等专门的廉价但优质模型。

很好,但真正令人震惊的是Nicdunz的观察:

GPT-5.4在xhigh模式下得分为51,正好与Luna当前的最大值持平。GPT-5.4的价格为2.50美元/15美元;Luna现在价格为0.20美元/1.20美元。换句话说,大约四个月后,OpenAI以大约十三分之一的令牌价格出售了三月份的完整旗舰智能。

nic

@nicdunz

GPT-5.4在xhigh模式下得分为51,正好与Luna当前的最大值持平。GPT-5.4的价格为2.50美元/15美元;Luna现在价格为0.20美元/1.20美元。换句话说,大约四个月后,OpenAI以大约十三分之一的令牌价格出售了三月份的完整旗舰智能。

5:40 PM · Jul 30, 2026

169K Views

66 Replies

259 Reposts

4.26K Likes

这相当于年化率约为2000倍,相比我们上次观察到的加速幅度显著提升——但你应当对这类数据进行折扣,因为所有公开基准(如AA)都在一定程度上经过训练优化,而Elos模型则更难直接训练。尽管Poolside的Laguna和Thinky的Inkling等领先的中美开源模型提供了完整的控制权和主权,但如果你的唯一目标是获得成本效益高的非微调智能,目前要击败OpenAI仍然非常困难。

2026年7月29日-7月30日AI新闻。我们检查了12个子版块、544个推特账号,未发现更多Discord内容。AINews官网可搜索所有历史文章。提醒一下,AINews现在是Latent Space的一个版块。你可以选择是否接收电子邮件通知!

AI推特回顾

OpenAI价格削减、语义利用与ARC-AGI-3记忆争论

  • OpenAI大幅削减GPT-5.6价格并新增更快的Sol层级:根据@OpenAIDevs,OpenAI将GPT-5.6 Luna价格降低80%,Terra降低20%,同时推出Sol Fast层级,其延迟最高可降低至标准价格的2.5倍,且"智能表现无变化"。对代理工作流的下游影响显著:ChatGPT应用和Codex CLI的自动审查功能正从GPT-5.4迁移至Luna,OpenAI预计成本将降低约10倍。多位观察者(包括@sama、@nicdunz和@kimmonismus)认为这是价格/性能前沿的重要转折点。OpenAI还将此次降价与"模型、推理堆栈和代理工具链"的系统级效率提升挂钩。
  • ARC-AGI-3重申"模型"并非完整系统:最技术性的评估讨论集中在工具链设计、记忆保留和上下文压缩。François Chollet澄清了ARC规则:禁止使用定制化基准工具链,但若报告设置和成本,通用API功能对所有用户开放。@kimmonismus的详细分析显示,在官方半私有ARC设置中Opus 5得分为30.2%,而GPT-5.6 Sol在标准工具链下仅得7.8%。同时指出OpenAI内部使用Responses API保留推理能力+压缩功能,使Sol在公开数据集得分提升至38.3%。@gneubig、@scaling01等观察者强调:长期评估越来越关注完整代理系统——推理保留、截断策略、压缩和工具编排,而不仅是基础权重。

Thinking Machines的Inkling-Small与持续开放权重推进

  • Inkling-Small 将 Inkling 系列能力压缩到更小的活动规模:Thinking Machines 发布了 Inkling-Small,这是一个开源权重、原生多模态 MoE 模型,总参数量为 2760 亿,活跃参数为 120 亿,定位为在约四分之一体积下实现与原版 Inkling 相当的性能。该公司表示,该模型能够联合处理音频、图像和文本,并支持在多模态场景中进行基于 Python 的图像检查,根据后续报告。该发布立即覆盖了整个开源推理栈:vLLM 宣布了当天支持,Modal 强调了单个 B300 部署,LMSYS/SGLang 报告了解码吞吐量数据,Unsloth 发布了本地运行/GGUF 指南。
  • 基准测试表明这是一个异常高效的开源模型,适用于编码和多模态任务:Artificial Analysis 将 Inkling-Small 排在它的智能指数第 40 位——与旗舰版 Inkling 相差不到一个点,在 Humanity’s Last Exam、GPQA Diamond、CritPt 和 SciCode 等任务上表现突出,但在某些代理任务和事实知识方面较弱。社区摘要强调,这个较小的模型在多个编码任务上可以击败或匹配较大的 Inkling,包括 @kimmonismus 和 @mervenoyann 的案例。开源权重、多模态输入、部署栈中 100 万上下文支持以及 120 亿活跃计算的组合,使这成为该批次中最具实际重要性的开源发布之一。

Google 的 Gemini Robotics 2 与具身人工智能的加速

  • Gemini Robotics 2 从桌面操作扩展到全身控制和多机器人协作:Google DeepMind 发布了 Gemini Robotics 2,将其描述为“任何机器人的一个大脑”,演示涵盖全身人形控制、高级灵巧操作和多机器人协作。Google AI 补充说,该系统包括 Gemini Robotics ER 2,这是一个高层具身推理模型,能够观察、规划、与 VLA 模型协作、跟踪进度并在多分钟任务中从失败步骤中恢复。演示强调了非平凡的运动任务,如打结、拧入灯泡、弯腰捡起物体和协作清理车库。
  • 实际应用的故事是异构性和适应性,而不仅仅是更漂亮的演示:技术评论指出,相同的检查点控制了多种硬件类型,而 On-Device 2 据称只需不到 200 个示例即可适应新的双臂机器人,@kimmonismus 总结了这一点。@OfficialLoganK 和 @osanseviero 聚焦于 ER 2 的 API 可用性和具身推理指标,而 NVIDIA Robotics 则借此机会通过 Jetson AGX Thor 推动本地硬件侧的人形/自主系统。与之前的机器人公告相比,这次发布之所以突出,是因为它结合了平台广度、规划、灵巧性和直播 API,而不仅仅是单一的狭窄操作基准。
  • 云代理正从演示阶段转向核心工程工作流程:Cursor提供的运营数据表明,12月时每10个合并的PR中有1个来自云代理,目前这一比例已提升至56%,这得益于为代理分配独立的云计算机并允许其随时间改进环境。同样,@jaredpalmer表示加入Cognition后,他至今仍未配置本地开发用的笔记本电脑,更倾向于使用Slack/Webapp中的Devin进行开发;@dabit3展示了Devin云代理运行macOS并接入Xcode和模拟器,用于构建/测试原生iOS应用。Cognition还新增了GitHub原生堆叠PR支持,这对代理生成的代码变更集具有实用价值。
  • 持久内存正逐步产品化,但其价值证据存在争议:Perplexity推出了Projects,将Spaces进化为通过"Brain"实现共享文件和持久内存的持续工作中心,@AravSrinivas将其定位为支持工作的多用户智能操作系统。在底层内存架构方面,TurboPuffer描述了Mem0将4亿+代理记忆从pgvector迁移至turbopuffer,引用数据显示混合检索p90延迟70ms、召回率@10达97%。但研究信号更为谨慎:@dair_ai指出一篇论文显示,文件系统风格的内存存储在规模扩展时可使检索成本降低一半,但研究中未提升最终答案质量,且在除最强管理代理外的多数代理中存储质量下降。总体而言:内存架构作为产品形态正在成熟,但其对能力提升的因果贡献仍存疑。

Infra, Retrieval, and Tooling: Kernels, Search Transparency, and New Eval Infrastructure

  • 系统优化仍是主要增益来源:SemiAnalysis强调了GPU Mode的AMD内核黑客马拉松,称Readonflow团队将MI355X端到端性能提升了2倍以上。在单个内核层面,@maharshii报告称通过将div.rn.f32替换为rcp.approx,自定义注意力内核性能从torch SDPA的1.5倍提升至2.17倍,这再次证明PTX级检查仍具价值。Astral还开源了针对FlashAttention和DeepSpeed等GPU密集型包预构建轮子的构建流水线,目标是提高可复现性和Python打包便利性。
  • 检索和搜索基础设施正成为透明度问题,而不仅是性能问题:Simon Willison批评OpenAI和Anthropic过度依赖搜索却掩盖了底层搜索索引和合作伙伴关系;他指出Anthropic的子处理器清单揭示了与Brave和TurboPuffer的关联,但产品文档中未明确披露这些信息。在检索模型方面,@antoine_chaffin推出了mDenseOn和mLateOn,这是针对长上下文和代码检索的全开放多语言检索模型,后续指标显示晚期交互模型表现出特别强的泛化能力。

Top tweets (by engagement)

  • OpenAI定价重置:@OpenAI宣布Luna降价80%、Terra降价20%并推出Sol Fast,这是当天最清晰的产品/推理信号。
  • Gemini Robotics 2发布:@GoogleDeepMind和@GoogleAI推出了涵盖全身控制、灵巧度和协作的更通用具身化技术栈。
  • Inkling-Small发布:@thinkymachines推出了具有重大意义的开放多模态MoE模型,激活参数达120亿。
  • 云代理在生产软件工程中的应用:@cursor_ai分享了最具体的采用数据:目前56%的合并PR来自云代理。
  • 对 Hugging Face / OpenAI 事件的独立审查:@METR_Evals 表示已与 OpenAI 和 Redwood Research 达成一致,将对 Hugging Face 事件中观察到的模型行为进行独立审查,审查范围和初步结论将予以公布。

AI Reddit 要闻

/r/LocalLlama + /r/localLLM 要闻

1. Kimi K3 与 Inkling-Small 的本地 MoE 运行测试

立即注册,享受 7 天免费试用

订阅 Latent.Space 以继续阅读本文,并免费访问完整文章归档 7 天。

开始试用

已是付费订阅者?

上一篇

下一篇