Latest open artifacts (#23): Laguna S2.1, Inkling, & Kimi K3 show the utility of open models on the Pareto frontier

TL;DR · AI 摘要
开源模型正成为AI行业核心价值载体,Thinking Machines、腾讯等企业通过开放模型参数和许可协议推动技术普惠。
核心要点
- Thinking Machines的Inkling模型提供975B-A41B参数规模,支持多模态输入输出
- 腾讯Hy3模型采用Apache 2许可证,突破原有自定义许可限制
- Laguna-S-2.1展现快速迭代能力,连续三个月出现在技术报告中
结构提纲
按章节快速跳转。
全球AI实验室正通过开源模型实现价值创造,训练成本下降推动技术扩散
Thinking Machines Inkling模型展现商业级开源模型的性能与应用潜力
Laguna-S-2.1等模型验证了开源社区持续创新的可行性
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 开源模型价值崛起
- 行业趋势
- 训练成本下降
- 商业价值创造
- 核心案例
- Inkling 975B模型
- Hy3 Apache 2许可
- Laguna-S-2.1迭代
金句 / Highlights
值得收藏与分享的关键句。
Thinking Machines通过开放模型微调服务实现年收入超百万美元
Hy3模型成功证明50年数学猜想,验证大模型推理能力突破
Laguna-S-2.1在三个月内完成三次重大版本迭代,展现开发效率
最新开源模型进展 (#23):Laguna S2.1、Inkling 与 Kimi K3 展示开源模型在帕累托前沿的价值
强大模型的训练能力正在快速扩散
Florian Brand
和
Nathan Lambert
2026年8月2日
整合一直是许多敏锐观察者预测的模型训练实验室未来路径之一。这一趋势被标记为不可避免,因为每年训练成本都在呈指数级增长。然而,如果在2024年预测到2026或2027年整合会显著加速,那么现在的情况如何?我们正处于更多公司正在训练强大模型的阶段——尽管整体投入仍高达数亿至数十亿美元——同时越来越多的组织开始公开发布这些模型。
对token的需求极高,且随着模型效率提升和应用场景扩展,需求预计还会继续增长。我们曾认为需要整合的这些实验室正在意识到,构建token机器可能是通向价值的可行路径,而随着时间推移,将有更多公司认识到这一价值来源。
最典型的例子是Thinking Machines——当他们在2025年2月宣布成立公司时,几乎没有人(包括我自己)会将其归类为开源模型公司。如今,他们的开源模型微调服务每年创造数亿美元收入,并且正在发布在美国制造的最佳开源权重模型,领先于NVIDIA早期领导者Nemotron和Arcee的Trilogy。
生态系统另一端则是中国实验室持续稳定的进展,小米等新进入者仍在人工智能经济中积累影响力。长期预测整合趋势的我们,现在似乎更倾向于预测持续采用,并尝试想象开源模型在其中扮演的角色。Kimi K3这样的收入分成许可模式能维持多大市场份额?开源模型又能占据多少市场空间?我们正在进入决定性时代。
这是我们有史以来最密集的开源模型回顾,令人振奋!
我们的精选
- thinkingmachines 的 Inkling:Thinking Machines 首个模型是 975B-A41B 多模态专家混合模型,支持文本、图像和音频作为输入,输出文本。虽然在同类模型中(中国)它并非最强,但作为微调基础模型表现优异,例如通过其商业产品 Tinker。他们还发布了更小的版本(276B-A12B),在同等规模下具有很强竞争力。
- tencent 的 Hy3:腾讯推出的 295B-A21B 专家混合模型。在所有指标上均优于其前身。值得注意的是许可证变更:此前版本(见 Artifacts 21)使用了定制且较为严格的许可证,而此次发布改为 Apache 2 许可证。该模型还成功证明了一个50年前的数学问题(通过专用工具和Sol作为裁判,但后者的重要性尚不明确)。
- Laguna-S-2.1 by poolside : Poolside迅速从无名之辈成长为Artifacts的常客,连续三个月每月都有新作品亮相。S2.1是专为DGX Spark优化的118B-A8B MoE模型的新预训练和后训练版本,这一特性引发了广泛关注。Poolside还采用了OpenMDW许可证,这是一种类似Apache 2.0的开源许可证,但针对AI模型提供了更完善的法律保障。该公司在其博客中也详细披露了所有评估轨迹,这种透明度在开源模型发布中非常罕见。
- DeepSeek-V4-Flash-0731 by deepseek-ai : 在OpenAI将其最小模型价格下调80%的次日,深Seek就更新了V4 Flash模型,其性能在帕累托前沿超越了Luna。目前更大版本的模型尚未更新,其性能表现仍有待观察。在V4系列初始发布中,Flash版本在参数效率方面表现突出,而Pro版本则相对平淡。
- Kimi-K3 by moonshotai : 这是近期规模最大的开源模型发布,我们已通过独立文章和播客节目进行了专题报道。该模型采用非商业许可证,要求推理和微调服务方必须与Moonshot签订商业协议。Kevin Xu和Graham Webster在一篇分析文章中指出,这类许可证可能为未来美国政府针对与中国AI公司有业务往来的实体采取行动提供法律依据:
但如果美国公司需要与Moonshot签订合同才能使用Kimi K3生成的推理token,情况就截然不同了。美国官员和其他政策制定者此前讨论的一些限制中国开源模型使用的政策工具,此时将更明确地适用。
模型
#### 通用模型
- LongCat-2.0 by meituan-longcat : 中国的DoorDash再次推出重磅产品。此次公司发布了参数量达1.6万亿的全新MoE模型。尽管该模型在基准测试之外的综合能力并非同规模中最突出,但其完全基于昇腾910芯片训练,成为首个不依赖华为且不使用玩具级芯片的、完全基于中国加速器训练的非华为模型。其他中国芯片目前主要用于推理(如果有的话)。
- Laguna-XS-2.1 by poolside : Poolside小型(33B-A3B)MoE模型的更新版本。
- Motif-3-Beta by Motif-Technologies : 韩国Motif推出的314B-A13B MoE模型预览版。这是该公司迄今为止最雄心勃勃的模型,规模显著扩大,并引入了GDLA和mHC等架构创新。
- Apertus-v1.5-70B by swiss-ai : 完全开源的Apertus 1.0模型的持续预训练版本,新增了2万亿token训练数据。
- Instella-MoE-16B-A3B-Think by amd : AMD基于Instinct显卡训练的16B-A3B MoE模型。AMD还提供了从基础模型到SFT检查点、MidTrain和DPO的完整训练阶段数据。
付费订阅者专属内容
已经是付费订阅者?
上一篇
下一篇