刚刚,全球首个“事件级预测”具身智能世界模型来了!
自变量机器人发布全球首个事件级预测具身智能世界模型WALL-WM,将预测单位从时间帧升级为语义事件(如“抓取”“放置”),显著提升跨场景泛化能力与动作鲁棒性。
入选理由:WALL-WM以语义事件(如抓取、抬升)为建模单元,替代传统固定时长动作块,使动作长度可变且更符合物理逻辑
模型
别名:Vision-Language Agent
结合视觉与语言处理的多模态模型。
已跟踪 12 条高相关材料
最近变化
2026-07-25 · 中国机器人硬件优势显著,但软件和数据服务仍待提升
为什么值得关注
VLA 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
刚刚,全球⾸个“事件级预测”具身智能世界模型来了!
量子位 · 9.2 分
自变量机器人发布全球首个事件级预测具身智能世界模型WALL-WM,将预测单位从时间帧升级为语义事件(如“抓取”“放置”),显著提升跨场景泛化能力与动作鲁棒性;其核心采用三层架构(事件指令→事件世界模型→多视角融合)、共享权重双推理模式、视频/动作模型解耦训练,并引入阶梯式思维链...
“VLA和世界模型都不是终局,会有物理世界独有的模型” | 蚂蚁灵波沈宇军@AIGC2026
量子位 · 8.7 分
沈宇军认为VLA和世界模型并非具身智能终局,未来将出现专属于物理世界的模型。机器人数据稀缺,需从传感器输入端构建空间感知能力。
美国具身也没成熟!PI:中国公司何必总当“中国版XX”|RSS 2026
量子位 · 8.5 分
中国机器人硬件领先但软件滞后,RSS 2026会议揭示VLA与世界模型并存,美国具身智能尚未成熟。
已收录 12 条与 VLA 相关的内容,按评分排序。
自变量机器人发布全球首个事件级预测具身智能世界模型WALL-WM,将预测单位从时间帧升级为语义事件(如“抓取”“放置”),显著提升跨场景泛化能力与动作鲁棒性。
入选理由:WALL-WM以语义事件(如抓取、抬升)为建模单元,替代传统固定时长动作块,使动作长度可变且更符合物理逻辑
沈宇军认为VLA和世界模型并非具身智能终局,未来将出现专属于物理世界的模型。机器人数据稀缺,需从传感器输入端构建空间感知能力。
入选理由:机器人行业缺乏物理世界数据,需构建专属物理模型
中国机器人硬件领先但软件滞后,RSS 2026会议揭示VLA与世界模型并存,美国具身智能尚未成熟。
入选理由:中国机器人硬件优势显著,但软件和数据服务仍待提升
世界模型的终局需要因果推理,Aether AI 通过因果世界模型探索新路径。
入选理由:因果世界模型需要在隐空间中同时学习感知、行动和因果。
2026年AI行业进入估值跳涨与价值重估并存的拐点,创业者需关注垂类应用、具身智能及AI硬件等方向。
入选理由:2026年AI行业估值跳涨与价值重估并存,创业者需谨慎选择赛道。
小鹏汽车在CVPR 2026发布物理AI基座模型,通过融合第二代VLA与世界模型实现密集物理预测与稀疏人类意图的协同进化。该架构依托X-World等三大核心技术及全栈自研芯片,将车端推理时延降至80ms,验证了自动驾驶Scaling Law在量产车上的有效性。
入选理由:小鹏第二代VLA与世界模型协同进化,单版训练Token破4万亿,解决稀疏意图监督难题。
全球首个在百TOPS端侧芯片实现实时世界模型的隐式方案 Being-H-Flash 问世:单台机器人月算力成本仅150元,较英伟达 Cosmos 低2%,较 Pi0.5 便宜70%,支持国产与英伟达双平台,显著降低部署与网络延迟风险,推动世界模型走向规模化落地。
入选理由:单台机器人月算力成本降至150元,实现端侧实时世界模型推理。
英伟达 GEAR 实验室推出 DreamDojo 和 DreamZero 世界模型,推动具身智能发展。
入选理由:英伟达 GEAR 实验室发布 DreamDojo 世界模型,支持视频数据训练。
英伟达Jim Fan宣布VLA路线过时,提出新范式WAM,代表作为DreamZero,预计2040年实现机器人自主设计制造,置信度95%。
入选理由:VLA路线过时,新范式WAM登场
自动驾驶终局或为物理AI,L4可能因数据闭环优化比L3更快落地,世界模型已部分上车。
入选理由:物理AI强调硬件与算法深度融合,可能成为自动驾驶终局方案。
NVIDIA科学家Jim Fan在Sequoia AI Ascent会议上提出,机器人技术仅剩3项关键突破,95%确信2040年前将实现通用具身智能的全面工程化落地。
入选理由:机器人技术瓶颈已收敛至感知-推理-执行闭环中的三个具体缺口:长程任务规划、零样本技能迁移、物理世界鲁棒交互。
CHORUS 是一种基于单一 VLA 策略的去中心化多实体协作方法,但文章内容信息密度低,缺乏具体机制和实践细节。
入选理由:CHORUS 采用单一 VLA 策略实现多实体协作。