80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

播客收听
问这期播客
会先在本集摘要、章节、转录和笔记里找答案。
TL;DR · AI 摘要
世界模型是AI发展的终局,视频生成技术正从多模态向全模态演进,创业公司需在架构创新和商业化之间找到平衡。
核心要点
- 视频生成模型需从GAN转向Transformer架构以提升上下文理解能力
- DiT架构因压缩损失细节,创业公司探索UiT方案实现跨模态统一空间
- 千卡级训练为创业公司提供窗口期,但架构领先优势仅能维持6个月
结构提纲
按章节快速跳转。
- §引言
访谈揭示世界模型是AI发展的终局形态,视频生成技术正经历关键演进阶段。
从语言模型到多模态、全模态,最终汇聚于世界模型的三阶段发展逻辑。
DiT架构的局限性与UiT方案的创新尝试,揭示创业公司突破路径。
在千卡级训练窗口期通过架构创新和成本优化与大厂竞争。
视觉信号缺乏统计意义,多模态尚未形成统一范式。
金句 / Highlights
值得收藏与分享的关键句。
「像素没有统计意义」揭示视觉信号处理的根本性挑战
UiT架构尝试取消VAE,实现像素、文本与任务条件的统一空间交互
架构领先优势仅能维持6个月,开源是持续创新的考试
世界模型现阶段是具身、3D和视频模型的家族式存在
创业公司需在大厂车辙与成本曲线间寻找平衡点
章节
视频领域的 Anthropic :图片是刀, 视频是过程
视频领域的 Anthropic :图片是刀, 视频是过程
院士里少有的「躬身入局」:全职 20 年的工业界履历
院士里少有的「躬身入局」:全职 20 年的工业界履历
微软 R&D 分离 vs OpenAI 融合:今天模型就是产品
微软 R&D 分离 vs OpenAI 融合:今天模型就是产品
AI 不是足球赛而是篮球比赛:第一节快结束了
AI 不是足球赛而是篮球比赛:第一节快结束了
Sam vs Dario:一号位视角 vs 单点技术执念
Sam vs Dario:一号位视角 vs 单点技术执念
从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构
从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构
转录
视频领域的 Anthropic图片是刀, 视频是过程
院士里少有的「躬身入局」全职 20 年的工业界履历
微软 R&D 分离 vs OpenAI 融合今天模型就是产品
AI 不是足球赛而是篮球比赛第一节快结束了
Sam vs Dario一号位视角 vs 单点技术执念
从 TGANs-C 到 UiT做视频模型,创业公司为什么必须换架构
节目笔记
80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型? - 卫诗婕|漫谈Light the Star | 小宇宙 - 听播客,上小宇宙
从语言大模型,到多模态至全模态模型,再到走向世界模型…
世界正在经历什么?
本期节目我邀请了 加拿大外籍院士、智象未来 Hidream的创始人梅涛 ,还原视频生成模型的技术发展史。
梅涛院士是 全球首篇文生视频论文的作者 ,也是最早探索文生视频的人。
2026 年 5 月 20 日,Google I/O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动 ,不再是几个模型拼接——这与梅涛一直以来的主张不谋而合。
与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding——硅谷正在做减法。
但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。
梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。
我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。 梅涛的模型世界观可以用一句话精炼 ,那就是:
图片是入口,视频是过程,世界模型是终局。 语言、视频、具身,终将汇聚。
这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的AI 趋势进行一场深入的了解。推荐大家收听~
本期嘉宾:梅涛 (加拿大工程院外籍院士、智象未来 HiDream 创始人)
本期 Shownotes:
03:35 视频领域的 Anthropic :图片是刀, 视频是过程
- 学 Anthropic 的三件事: 团队从 OpenAI 出来后极度稳定(智象核心作者从 2017 年起就没走过一个)、坚定做企业服务、通过开源建立自我逼迫的创新节奏
- 视频领域的刀是图片 : 图片是二维/三维信号的入口,今天客户在平台上创作的时间 50%-60% 花在做一张图上
- 多模的成长路径:图片模型 → 视频模型 → 全模态模型 → 世界模型
- 能不能把图片做到全球最好,是视频公司真正的分水岭:Google 的 Veo 3 之所以强,是因为 Google 本身有很好的图片模型
08:25 院士里少有的「躬身入局」:全职 20 年的工业界履历
- 中科大→微软亚研 10 年→京东探索研究院 5 年→2023 年创立智象;从没拿过第二份薪水,始终全职
- 导师张宏江的习惯:看汇报从最后一页往前翻,5 分钟就把半小时的 slides 看完
- 「用 AI 分析理解视频」的任务,跨越 6 年才完成——多模态、全模态、世界模型都是那份实习任务的延长线
- 好的 mentor 给的 assignment 都不是「当下能做出来」的,而是「你的整条职业生涯都要围绕它推进」的
- 反人性才能获得长久的正反馈,负反馈也是正反馈
- 微软亚研院的土壤:这样的 R to D 通道今天几乎绝迹
29:00 微软 R&D 分离 vs OpenAI 融合:今天模型就是产品
- 微软时代:研究员做 paper → 10 个工程师转化成产品 → 100 个工程师做产品化,大半年才能进产品线
- OpenAI 这一代:researcher 和 engineer 完全融合,R&D 之间不再有转化层
- 研究员今天为什么这么贵——因为他们直接是产品线;研究判断本身就是产品判断
- 如果你的研究和工程仍是两个团队,你比大厂慢的不是资源,而是决策速度
31:27 AI 不是足球赛而是篮球比赛:第一节快结束了
- toC 是 toB 的放大器 ——C 端最先感知模型能力的溢出、贡献社区反馈、做 branding
- 中国 AI 创业的三个关键词:全球化、出海、软硬件一体
- AI 的四节比赛 :大模型比拼、 agent(通用+垂直)、终端流量入口/软硬件、第四节待定
- AI 时代, toB 和 toC 的边界越来越模糊:创业公司不必二选一
- 后面的迭代周期会更短:基模半年一次大迭代,Agent 可能三个月一次,终端和交互还会更快
42:15 Sam vs Dario:一号位视角 vs 单点技术执念
- Dario 是理想主义者(读社会学、历史、哲学);Sam 是投资人出身,更现实
- 讲宏大叙事等不到爆发那天就会死
- 中国投资人的三重反射弧——需要沿途下蛋、追共识不追共识外、经历过 toC 时代所以对 toB 天花板有本能的低估—— 这些都改变了中国创业者能选的叙事结构 :你必须在讲远期愿景的同时不断证明近期商业化
- 「长期看 Anthropic 和 OpenAI 的曲线一定会交织」
47:10 从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构
- 做出全球第一篇文生视频论文 TGANs-C (2017):使用 GAN 与卷积神经网络,只能生成约 3—4 秒、48×48 像素的模糊视频,但证明了文本可以反向生成视频
- 视频生成模型经历了 GAN、Diffusion、DiT 几轮架构变化:主干网络从 CNN 换成 Transformer 后,模型才获得更强的上下文和规模化能力
- DiT 需要先把文字、图片和视频压进隐空间,再编码、解码;压缩会损失细节,也让像素级控制变得困难—— 字节等大厂可以在此基础上大力出奇迹,但始终有些事做不到
- 智象在探索的UiT: 尝试取消外部 VAE,让原始像素、文本 Token 和任务条件进入统一空间,直接完成跨模态交互
- 创业公司必须思考如何避开大厂的车辙,如何优化成本曲线,逼近大厂的优势
- 「架构上的领先只能持续六个月」:开源是一场持续创新考试
- 为什么视频模型目前仍然是创业公司玩得起的游戏? 千卡级训练仍给创业公司留有窗口
01:17:15 像素没有统计意义:多模态还在 GPT-2 阶段
- 语言是经过人类数千年压缩的结构化知识,而视觉信号缺少公认的 Token 定义,「像素没有统计意义」
- 文本可以用 next-token prediction 自监督训练,图像和视频通常需要成对的内容与高质量描述,监督成本更高
- 视觉 Scaling Law 会出现,但不一定复刻语言模型的路径 ;数据、算法和算力都还没有形成统一范式
- 目前视觉不负责产生智能,而在于复刻
- 多模态消耗数据的速度仍赶不上人类产生视觉数据的速度
01:27:50 世界模型不是一个模型:三条路还没有交汇
- 杨立昆的 JEPA 路线关注 next state 与世界状态预测;李飞飞更侧重 3D 世界重建;视频生成派则希望从海量真实视频中学习物理规律
- 视频模型的数据更通用、参数体量更大,可以成为世界模型的基础底座,再向具身或交互式任务迁移
- 图片、第三人称视频、第一人称视频和具身真机数据各自覆盖不同分布,单靠真机数据很难获得足够泛化
- 生成与理解目前仍是两套路线,真正的大一统架构尚未出现。
- 世界模型现阶段更像 一组不同目标、数据和训练方式的模型家族 。具身、3D 和视频都只是路径,过早把它们压成一个答案,会遮住真正的架构问题
01:41:16 从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向
- 通用视频模型底座的商业化
- 技术创业选赛道时,「未来足够大」还不够。能否沿途形成收入、数据和产品反馈,决定团队有没有机会等到终局。
- 判断模型是否真正创新,不能只看公开榜单;模型公司会用自己的测试集和极限 Prompt 检查边界能力。
- 好的 Leadership :清晰目标、可执行路径、利他和技术使命感
- 快速不仅指把正确路线跑快,也包括更早承认路线不对
02:08:53 通往世界模型:下一代架构可能已在萌芽
- 从多模态、全模态走向世界模型是通向 AGI 或 ASI 的必经阶段
- 当前的 Transformer 未必足以承载所有模态和交互,下一代架构可能已经在萌芽
- 让博士生和研究员持续筛论文、做小规模试错,再把有潜力的方向放大到产业级训练
- 发现下一代架构靠的不是一次灵感,而是 一套持续感知机制
02:19:34 世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司
- 自动驾驶、视频、3D 和机器人都有各自的世界模型叙事。
- 智象的「具身世界模型」路径:先把图片质量做高,再扩展视频长度、实时性和可交互性,最后延伸到高精度的物理世界任务。
- 「像智象这样的公司,一年都是 100 PB 级年度视频数据」:视频仍是当前最可规模化的物理世界信号
- 图片不是视频模型的过渡版本,而是最低成本的基本功测试——构图、像素控制和角色一致性做不稳,视频越长,错误只会被继续放大。
02:28:49 多模态商业化:智能未涌现,表现力先变现
- 「多模不会一家独大」
- Agent 的价值不只取决于基模,还取决于 Harness、Skills、成本控制和行业 know-how
- 多模态还没有出现语言模型式的智能涌现,却已经出现表现力涌现。商业化可以早于技术终局。
- 「Token 将来价值会越来越薄,因为它成为了一种 commodity。」
02:42:06 船票的本质:模型能力与商业化都要过关
- 一张多模态船票首先要求自研模型和公开可验证的能力;只有应用收入,也可能被下一轮模型升级吃掉。
- 模型层竞争是耐力赛,但资本耐心有限
- 2024—2025 年,一批视频创业公司批量退出牌桌
- 一级与二级市场都在寻找模型排名、对标逻辑和增长数字,但对「新型 toB」的共同要求,是不要回到私有化部署和定制研发。
02:54:55 卖铲子给具身:从世界中学习,再重构世界
- 智象与诺亦腾合作: 具身公司缺少高质量、可规模化的数据
- 把真人遥操和夹爪数据扩增为不同背景、不同手部外观的第一人称视频
- 合成数据是否「真实」并非重点,重点是它能否提升 VLA 或 World Action Model,并用轻量模型量化能力增量。
- 通用世界模型仍缺数据、架构和算力,把触觉、温度、空间、时间、语言与动作放进同一模型,可能需要今天 10—100 倍的计算资源。
- 图片是入口,视频是过程,世界模型是终局
- 「我希望能够从世界中学习,把世界进行重构。」
欢迎前往 视频版 ,对照字幕获得更好的吸收。也欢迎关注公众号「卫诗婕漫谈 Light the Star」,查看访谈文字版整理。
加入听友群、关注「漫谈 Light the Star」的全网账号 👇