42章经播客59:29

从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|对谈 Evolvent AI 联创孟繁青

8.5内容质量
从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|对谈 Evolvent AI 联创孟繁青

播客收听

时长 59:29原播客页面

问这期播客

会先在本集摘要、章节、转录和笔记里找答案。

TL;DR · AI 摘要

国内模型竞争焦点转向预训练架构创新,合成数据与RSI技术成新赛道,蒸馏并非决定性因素。

核心要点

  • 国内模型优势源于预训练阶段的架构创新而非蒸馏技术
  • RSIBench-Data成为合成数据领域新标杆产品
  • 模型厂自研数据能力提升降低外采依赖

结构提纲

按章节快速跳转。

  1. 数据重要性在模型竞争中重新凸显,合成数据公司实现商业化突破

  2. 国内模型预训练阶段的架构创新成为核心竞争力

  3. 蒸馏争议

    蒸馏是加速手段而非国内模型变强的决定性因素

  4. ·RSI突破

    RSIBench-Data展示自研数据生成能力的技术突破

  5. 模型对数据需求经历从纯人工到合成数据的范式转变

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 模型竞争新焦点
    • 技术演进
      • 预训练架构创新
      • 合成数据突破
      • RSI技术发展
    • 竞争格局
      • 国内模型优势
      • 蒸馏技术争议
      • 初创公司机会

金句 / Highlights

值得收藏与分享的关键句。

章节

  1. 要点

    国内模型优势源于预训练阶段的架构创新而非蒸馏技术

    国内模型优势源于预训练阶段的架构创新而非蒸馏技术

  2. 要点

    RSIBench-Data成为合成数据领域新标杆产品

    RSIBench-Data成为合成数据领域新标杆产品

  3. 要点

    模型厂自研数据能力提升降低外采依赖

    模型厂自研数据能力提升降低外采依赖

转录

这期还没有可搜索转录。后续抓到带时间戳的内容后会自动补到这里。

#AI模型#合成数据#RSI#预训练#模型竞争

节目笔记

从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|对谈 Evolvent AI 联创孟繁青 - 42章经 | 小宇宙 - 听播客,上小宇宙

活动预告🥳:8 月 22 日,我们会请到繁青做一场线上活动,还会有数十位 model researchers 参与,大家记得翻到 shownotes 末尾查看报名信息!

近几个月,我们找了很多做模型、算法的人交流,聊下来的感受之一是:数据的重要性再次凸显出来。

市场也有很明确的对应反馈,比如一批合成数据公司在很短时间内做出了可观的收入;无论是模型厂还是互联网大厂,都在数据上更为投入。

这期节目,我们请来了较早抓住这波合成数据机会的 Evolvent AI 联合创始人孟繁青。繁青是 01 年出生的 NUS PhD,曾在 Kimi 做过一年多的 Agent 和 RL Infra。

节目里,我们从他在模型厂做 Post-training 与出来创业的不同感受聊起,也相继把有关后训练、数据、RSI/Self-Evolving/AI for AI、国内模型竞争格局,甚至蒸馏这个相对敏感的话题,都比较完整地梳理了一遍,聊出的一个最大非共识,是繁青对国内外模型差异的判断:

原本我们以为,国内更有优势的会是偏工程的 Post-training;但在他看来,国内模型真正有特色的地方,反而是 Pre-training 阶段被资源限制倒逼出来的架构创新。

基于这个认知,我们也得出了一个让人乐观的结论:

很多人会说国模很依赖蒸馏,但繁青认为,蒸馏只是一个加速手段,并不是国内模型变强的决定性因素。就算有一天海外把所有蒸馏通道都封掉,国模依然可以靠预训练的创新能力,构建起自己的竞争力。

最后,Evolvent AI 最近发布了新的研究成果 RSIBench-Data 。如果有朋友想在数据、RSI 方面进行交流,也欢迎联系繁青。

【人类博物馆】

导游: 曲凯,42章经创始人

51 号珍藏: 孟繁青,Evolvent AI 联合创始人;前 Kimi RL 实习生,foucs 在 RL Infra,参与 Kimi K2.5、Kimi Linear 等重要模型发版

【时光机】

Part 1 后训练与模型竞争

  • 01:15 在 Kimi 和出来创业的感受有什么不同?
  • 02:36 为什么 Post-training 背景的人更容易出来创业?有哪些可能性?
  • 04:37 今天的 Bench 和 Eval,与过去相比有什么变化?
  • 07:12 Post-training = 做数据、训模型的门槛在变低?
  • 10:35 同样是做数据,拉开质量差距的是什么?
  • 12:48 国内模型 vs 海外模型,优势其实在 Pre-training?
  • 17:09 国模的竞争格局会怎样发展?最后大家要拼的是什么?

Part 2 RSI

  • 21:50 RSI、Self-Evolving、AI for AI、Auto-Research……该怎么理解这些词?
  • 24:35 如果 RSI 真的能转起来,模型是不是真的就要吃掉一切了?
  • 29:09 假设模型真能自我迭代,创业公司为什么不直接做一个更好的基模?
  • 30:39 要做好 RSI,本质上要解决什么问题?
  • 33:48 RSI 继续发展下去,会引发怎样的变化?

Part 3 数据

  • 35:29 模型对数据的需求经历了哪几波变化?
  • 39:07 模型厂自己也能造数据,为什么还要外采?
  • 40:36 数据的下一波机会可能是什么?
  • 43:00 现在是「算法就是数据,数据就是 Infra,Infra 就是算法」?
  • 46:11 怎么理解合成数据和蒸馏之间的关系?蒸馏技法的区别在哪?

Part 4 展望

  • 48:18 模型现有的技术路线还有多大空间?
  • 49:33 为什么最近 AI4S 火了起来?
  • 51:39 相比于大厂,长期更看好初创模型公司?
  • 53:58 蒸馏对国内模型追赶的意义到底有多大?
  • 56:18 从合成数据到 RSIBench-Data,Evolvent AI 最终想做成什么?

【活动预告🥳】

8 月 22 日,我们会请到我们会请到繁青做一场线上活动,还会有数十位 model researchers 参与,感兴趣的朋友欢迎点击 链接 或扫描下面的二维码,一起来认识&交流!

【 The gang that made this happen】

  • 制作人:陈皮
  • 剪辑:陈皮
  • 片头:Mondo Bongo - Joe Strummer & The Mescaleros
  • 片尾:GeGeGe - 光のサイン