量子位

机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」

8.5内容质量

TL;DR · AI 摘要

机器人演示阶段受限于缺乏本体认知,爻方智能提出通过世界模型补充物理世界理解能力。

核心要点

  • VLA架构无法预判动作后果,导致机器人演示时需调低速度避免失误
  • 世界模型需补充本体认知,即机器人对自身身体极限的理解
  • 爻方智能将逆运动学作为训练任务,与英伟达的输入信号模式形成对比

结构提纲

按章节快速跳转。

  1. 2026年WAIC展会上机器人仍停留在Demo阶段,核心问题在于大脑技术不成熟

  2. VLA作为即时反应系统无法预判动作后果,存在可执行性鸿沟

  3. 主流世界模型缺乏本体认知,无法理解自身身体极限

  4. 指机器人对自身关节运动范围、力量等物理特性的理解

  5. 将逆运动学作为训练任务,强制模型学习本体认知

  6. 与英伟达将本体状态作为输入信号的方案形成方法论差异

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 本体认知缺失
    • VLA局限
      • 即时反应系统
      • 可执行性鸿沟
    • 世界模型挑战
      • 误差累积
      • 缺乏本体认知
    • 爻方方案
      • 逆运动学训练任务
      • 与英伟达对比

金句 / Highlights

值得收藏与分享的关键句。

#机器人#AI#具身智能#世界模型
打开原文

机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」 – 量子位

扫码关注量子位

<div class="top_search"> <form role="search" method="get" class="search-form" action="https://www.qbitai.com/" id="search"> <label> <input type="search" class="search-field" placeholder="搜索…" value="" name="s"> </label> <button type="submit" class="search-submit"></button> </form> </div>

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

articlead begin

articlead end

机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」

一水

2026-07-23

16:23:49

来源:

量子位

摘要样式

VLA不是终局

逛过WAIC具身智能展区的人,多半有同一个疑问:

都2026年了,机器人干活,怎么还是慢吞吞的?

转头一讨论,大家默认的答案是: 技术不行,快不了 。

但一位刚成立机器人公司的负责人,给出了一个扎心得多的解释:

不是不能快,是怕出错。速度是可以调快的,调快以后出错概率就会增加,给别人演示的时候就会掉链子 。

原来,展台上的慢,是主动调低的安全档。

而不敢调快的根源,正是行业如今热议的「大脑」: 机器人的大脑,还没跨过实用门槛 。

换个环境、换个物体,动作就开始变形,所以很多展示只能停留在Demo层面,在精心布置的场景里小心完成。

说这话的人叫 潘嘉 ,国家科技进步一等奖主要完成人、科大讯飞杰出科学家、具身智能前沿科学带头人。

就在WAIC 2026开幕前,科大讯飞悄悄注册了一家新公司: 安徽爻方智能科技有限公司 ,注册资本3亿元,由潘嘉带队,专攻的正是机器人大脑。

同期,团队联合中国科学技术大学、聆动通用机器人交出了一篇技术报告: iFLYTEK-Embodied-Omni 。

报告很厚,判断却很短:

现在主流的机器人大脑,造法就不对 。

VLA不是终局,世界模型还需补上「本体认知」这一环

总结下来,爻方的思路可以概括成这样两点:

第一,VLA不是终局。这个当下最热的路线,天花板在哪还没人验证过,但理论上的短板,已经摆在了明面上。

第二,接棒VLA的世界模型,也有可以完善的空间,比如「本体认知」这味关键药引子。

要理解这两点,不妨来完整看一下整个行业围绕「大脑」的这场激烈争夺。

为什么大家都在争「大脑」?这背后其实是一个逐渐成型的共识: 具身智能真正的瓶颈,从来不在身体,在大脑 。

原因很简单,交互方式变了。

过去几十年,人机交互停在离身的符号层面。你说话它识别,你打字它应答,始终隔着一块屏幕。

而具身交互要的是另一件事:机器人得用身体走进物理世界。

倒一杯水,它就得知道壶有多重、水会怎么流、洒了怎么办。每一个动作背后,都是对物理规律的理解和推演。

这不是能力的线性延伸,是一次底层跃迁 。

而承担这次跃迁的,只能是大脑。身体的关节、电机、灵巧手,供应链一年比一年成熟;但让身体知道该做什么、会发生什么的那颗大脑,还没造好。

瓶颈在此,战场也自然在此。

至于这颗「大脑」怎么造?行业的分歧,集中在两件事上: 用什么架构,和拿什么数据喂 。

先说架构之争 。

很长一段时间里,VLA都是绝对主流。它直接将视觉和语言映射为动作,见效快、门槛低,所以一时备受追捧。

但VLA的软肋也越来越明显:

它更像一个「即时反应系统」,只管现在怎么做,不管做完之后世界会变成什么样 。

就好比在路上开车,看到红灯它确实知道踩刹车,但它预判不到雨天路滑、这一脚下去车会打滑失控。

只对当下做反应,不对后果做推演——这就是「VLA不是终局」这一判断的根本原因。

△图片由AI生成

正是看到了这一点,世界模型接棒火了起来。其逻辑在于:

先预测未来画面,再从画面推出动作,让机器人也学会「先想后动」 。

英伟达把这条路的招牌「Physical AI」喊成了年度关键词,各家世界模型在榜单上轮番刷榜,行业开始集体从VLA迁向WAM(World Action Model)。

看上去方向是对了,但爻方认为:这里面还藏着两个坑。

第一个坑是误差累积 。

主流世界模型把预测和动作拆成两步串行:先生成未来画面,再从画面反推动作。问题就出在这中间的交接上,视觉预测一旦出错,误差就会直接传导进动作,任务越长,滚得越大。

学界给这个坑起过名字,叫「可执行性鸿沟」:

画面生成得毫无破绽,物理上却根本做不到,机械臂一执行就露馅。

第二个坑更隐蔽,即缺乏本体认知 。借用潘嘉提到的打羽毛球的例子:

好的运动员会预判球的落点和速度,同时他对自己身体的极限能做到什么,也非常清楚。球在这里,我是跳过去扣杀,还是够一下把它救回来。

而现在的世界模型,恰恰缺了后半句。

现在的世界模型,更多还是在关注预测这一点。不管是世界模型还是之前的policy,都没办法通过任务去增加对本体的认识。

预判世界,却不认识自己。画面算得再准,不知道这具身体做不做得到,动作照样落空。

这,就是爻方要补的那味药引子:本体认知 。

有意思的是,英伟达其实也踩过前一个坑。

它早期的打法是标准两段式:Cosmos负责做梦,生成机器人干活的视频,再从画面里反推动作。到了今年2月的DreamZero,也就是新一代GR00T 2的底子,英伟达改了主意,把预测画面和生成动作塞进了同一个模型里联合训练。

换句话说,爻方押的「联合生成」这条路,头部玩家也走到了同一个路口。

但走到路口之后,两家迈的腿不太一样了。

在英伟达的方案里,机器人的本体状态只是喂给模型的一个输入信号;而在爻方这里,认识本体是一道必答的训练任务——告诉它未来几帧要到的位置,让它自己算出每个关节该怎么转。

一个把身体当条件,一个把身体当考题 。

这个差别有多要紧?英伟达自己的技术文档里也写得很直白:靠2D视频做预训练,深度和空间理解会失准,预测看上去没问题,机械臂一伸手,够过头或者没够着。

△图源英伟达官网

画面对了,动作落空。病根,还是不认识自己。潘嘉在采访里也正面聊过这层差异:

以往的模型没办法通过任务去认识本体,爻方干脆把逆运动学做成了任务本身 。

架构上的差异逐渐显现,那数据呢?

机器人数据比语言数据少了几个量级,Scaling Law这张底牌至今没能翻开,真机泛化也就迟迟没有公认解法。

眼下行业能用的数据来源,无非这几种:

面对数据这道坎,爻方又甩出了一个让人意外的说法: 行业当下最主流的叙事,可能是个陷阱 。

当前行业最普遍的做法是:先量产再采集。

先最低限度跑起来,让数据自然回流,带动飞轮转起来,模型就能越来越强 。

特斯拉验证过的路,机器人再走一遍。

但潘嘉对这种做法持保留意见。

在他看来,效果不过关就大规模铺货,用户不会买单,数据飞轮根本转不起来。飞轮的前提是有人愿意用,而不是先把轮子造出来。

量产之前,首先要跨过实用门槛。盲目上线,最后牺牲的就是品牌,第一个吃螃蟹的人,就变成了先烈。

听上去很有道理,不过要解决的问题却很现实:

不靠量产堆数据,泛化从哪来?

细挖爻方的解法

爻方的答案,其实就写在那篇技术报告里: 用更聪明的架构,把有限的数据用到极致 。

具体怎么落地?这里面有几个比较关键的动作。

关键1:大脑,是双核的

传统VLA的短板前面说过了。

对症下药,iFLYTEK-Embodied-Omni在VLM之外,专门引入VGM(视频生成模型),来负责预测未来的视觉状态。

说白了,机器人在动手之前,先在脑子里把动作的后果预演一遍,这种「预见」在长时序任务里尤其关键:

传统VLA往往只能等错误发生后被动补救,而它能在行动前就主动规避风险 。

不过这里有个细节很值得琢磨:为什么偏偏挑视频生成来干预测这活?

眼下行业里能预测未来的技术路线主要有三条,而「视频生成」在不少人眼里恰恰是当中「不够高级」的一条,但爻方偏偏选了它。

对于这点,潘嘉也没藏着掖着:

现在的视频生成也是用自回归大模型结合扩散模型做的,跟我们整套模型的backbone比较契合。

因为和自家架构合得来,所以选了它。至于将来会不会换其他路线,他也没把话说死,等哪条路成熟了同样能为我所用,眼下先挑最跑得通的那条。

务实,是爻方的底色。而它给模型取的名字,藏着同样的讲究。

除了世界模型,我们还有传统的VLA、policy学习,还增加了像逆运动学这样的任务,所以我叫它Embodied-Omni(统一多模态具身基础模型),而不是直接称作WAM 。

一个「Omni」,装下了理解、预测、动作三件事。

而其中的逆运动学任务,正是前面反复说的那味药引子,「本体认知」的落地方式。

需要说明的是,「本体感知」(Proprioception)在机器人学中并非新概念,传统机器人很早就通过关节角度、扭矩等传感器来感知自身状态。

但感知是一回事,认知是另一回事。传感器能告诉模型身体现在在哪,不等于模型懂这具身体能做到什么。此前的技术路线,无论VLA还是主流世界模型,都很少把后者当成训练目标,融进端到端的具身大模型里。

爻方的做法是: 不直接告诉模型手该怎么动,只给它看要到达的终点,逼它自己补全中间每一步,练的就是一副「身体的直觉」 。

预测未来,是学会看世界;逆运动学,是学会看自己。

比主流的世界模型多做一步,这正是爻方的取胜之道。

关键2:大脑和小脑,得实时协同

光有双核还不够,两个脑区怎么配合,同样是门学问。

传统做法是「大脑想完,再交给小脑做」。规划和执行分成两段,信息单向传递,一棒接一棒。

听着顺,但误差累积的坑让人头疼。

iFLYTEK-Embodied-Omni把这套串行改成了「大脑-小脑」协同 :

VLM(理解规划)、VGM(预判建模)、AGM(动作生成)三个模块,通过共享的多模态自注意力机制实时交互。

其中VLM和VGM构成高层大脑,管指令理解、任务规划、进度跟踪和未来预测;

AGM是低层小脑,把规划好的子目标翻译成能落地的动作。

还是拿羽毛球说事。

球飞过来,大脑先判断球速和落点、盘算这一拍怎么接,小脑同时预判自己的身体够不够得着、该用多大力。

两件事不是等一个想完另一个才动,而是几乎同时发生,一气呵成。

大脑和小脑实时对话,动作才能又快又稳。

关键3:以空间推理弥补真机数据不足

架构再巧,也得有数据喂。

既然要让有限的数据发挥最大作用,那挑什么数据、怎么配比,就成了关键一步。

和大多数公司把钱砸在真机数据上不同,爻方的配方,偏偏反着来。

  • 带动作标注的机器人轨迹→26.88%;
  • 无动作的人类操作视频→18.95%;
  • 通用VQA数据→5.06%;
  • 空间推理、感知与任务规划→49.11%。

最扎眼的是最后一档。

将近一半的训练数据,是2D/3D轨迹、2D/3D定位、空间指向、物体指向、任务规划这类「具身大脑数据」。

它们不需要一台真机吭哧吭哧去跑,却能结构化地喂出模型的「空间感」和「规划力」。

空口无凭,模型评测成绩单就是最好的说明。

不过在此之前,还得简单说一下爻方的训练方法。

理解、预测、动作,三个模块要学的东西天差地别,一股脑混着训,模型很容易顾此失彼。

所以爻方分了四步走: 前三步让VLM、VGM、AGM各自开小灶,把专长练扎实;最后一步再联合微调,让三者在同一个框架里彼此对齐、协同起来 。

四步走完,成绩相当能打:

  • LIBERO-Plus零样本基准(七种环境扰动下考泛化):平均成功率89.6%,超过当时最强的VLA和WAM方法;
  • RoboTwin 2.0双臂协同基准:标准与随机环境分别拿下93.68%和93.16%,几乎不受干扰;
  • 长时序任务(连做七步,最考验预测能力):随机环境成绩反而更高,环境越乱,双核大脑越显本事。

不过跑分归跑分,能不能落到真机上,是另一道坎。

好在这条路,讯飞已经用真机蹚过了 。

爻方出底座;科大讯飞控股子公司安徽聆动通用负责工业具身大脑-小脑-本体全链路自主可控,同时兼具本体和硬件。

P.S. 视频中用的还是聆动此前自研的iFlyBot-VLM和iFlyBot-VLA模型~

但这不影响结论:真机已经能落地干活,证明这条路走得通;剩下的,是把大脑换成更强的一颗。

方向已经有了,剩下的是时间问题。

新公司是新的,但这盘棋不是

到这里,很多看似简单的事情,也变得耐人寻味起来。

你以为这是讯飞又成立一家新公司的故事,但背后其实是: 一家公司十几年的积累,等来了一个时代的转向 。

先说这十几年的积累。

讯飞最硬的家底,其实就藏在文章开头那个场景里,机器人动作慢,是因为怕出错、跨不过实用门槛。

而「怎么把一项技术逼过实用门槛」,恰恰是讯飞过去十几年做得最多的一件事 。

早年做语音识别,讯飞面对的客户是汽车厂、家电大厂。这些客户不看Demo,只认真章:车载语音在方言和噪音里能不能不出错,家电听错一次指令,用户可能就再也不打开了。

潘嘉就感慨,正是被客户一年年提着更高的要求打磨,才攒下一身让技术真正落地的工程化本事。

每一年我们做完一个东西,客户都会提出更高的要求。这里面积累了非常多工程化落地的经验,尤其在大模型时代,非常重要。

别的团队还在发愁「Demo怎么变产品」时,这道坎,讯飞已经趟了十几年。

而从语音到机器人,看着是跨界,实则是同一条路往深里走 。

早些年,讯飞给机器人装的是「嘴巴」和「耳朵」,解决它怎么「能听会说」;

2022年的「超脑2030计划」,第一次把目标定在让机器人走进千家万户;

到今天,机器人超脑平台已经对外赋能了400多家企业。

听懂人之后,下一关自然是读懂物理世界。

带队的潘嘉,正是这条路径的缩影。2009年进讯飞研究院,从语音识别做起,拿过CHiME、OpenASR等国际评测冠军,是国家科技进步一等奖的主要完成人。

从语音到多模态再到具身大脑,换的是模态,不变的是那套把AI逼到能用的功夫 。

不过光有积累还不够,还得赶上趟。

AI这几年最大的变化,是从语音、文字这类「离身」的交互,转向让机器人用身体走进物理世界。

说白了,战场从屏幕里挪到了屏幕外。

对讯飞来说,这个转向来得正是时候 。过去积累的AI能力和工程化经验,刚好能用在新战场上。

到这里,整盘棋的分工就清楚了:讯飞出AI底座和产业资源,爻方专攻机器人大脑,聆动通用具有最新升级的统一多模态具身大模型iFLYTEK-Embodied-Omni,并负责工业具身大脑-小脑-本体全链路。

至于这盘棋往哪下,聆动通用CEO季超对行业接下来两三年的判断,说得很直白:

资本会越来越看重收入、订单、客户复购和项目回本周期。具身智能下一阶段不会只比谁讲得更宏大,而是比谁能把机器人真正送进工厂,并让客户持续付费。

新公司是新的,但这盘棋,讯飞其实已经下了很多年。

One More Thing

对了,差点忘了个有意思的事,这家公司为什么叫「爻方」?

潘嘉说,名字想了很久,最后是一位学哲学的朋友起的。

「爻」出自《易经》,是卦象里阴阳变动的最小单元。

阴一半、阳一半,这不就是0和1嘛,堪称中国最早的二进制。

好家伙,一家做AI的公司,名字里居然藏着几千年前的「代码」,有意思。

而「方」,取的是「变中求方」,在纷繁变幻的世界里,稳稳占住一席之地。

阴阳会变,方寸不乱 。

放在具身智能这张还没人摸到底牌的牌桌上,「变中求方」四字,倒像是提前写好的一句注脚。

论文地址: https://arxiv.org/abs/2607.02542

版权声明

版权所有,未经授权不得以任何形式转载及使用,违者必究。

具身大脑

讯飞

作者文章列表

  • 看了20万小时「人类干活实录」,机器人悟了 2026-07-19
  • 人在Meta,休个病假/产假转身被AI裁了?? 2026-07-15
  • 98年哈工大教授创业,要做人形灵巧操作世界模型 2026-07-12
  • 刚刚,一个免费AI Coding选手杀入全球第一梯队 2026-07-14

左侧分享

扫码分享至朋友圈

相关阅读 start

相关阅读

#### 大模型鏖战元年,讯飞星火带动开发者生态增长229%,引领AI开发者生态发展

据科大讯飞公布的数据,自去年5月6日讯飞星火发布以来,讯飞开放平台新增167.6万开发者团队,同比增幅229.1%。可以看出,大模型的到来,推动了新一轮的创新创业,带来平台开发者的迅猛增长。

2024-01-04

#### AI PPT,这次是真不用返工了

实测讯飞智文Vision Agent

2026-05-06

AI PPT

#### 世界模型来了因果技术标杆!具身大脑真要长脑子了

林方舟

2026-07-02

世界模型

因果

#### 英伟达H20不让用?全国产算力推理模型升级,4张华为卡即可部署

有三大技术创新

白交

2025-04-22

华为

推理模型

相关阅读 end

热门文章 start

热门文章

#### 妙啊!无人机直连卫星传Token

2026-07-18

#### 看了20万小时「人类干活实录」,机器人悟了

2026-07-19

#### 不同模型厂同一家Agentic Infra,AGI时代的地基终于浮出水面

2026-07-20

#### WAIC 2026收官|范式大会亮点集锦,见证AI 2.0从技术突破走向产业实践

#### 当AI进入最依赖“人”的行业:一家四线城市康复机构利润增长40%

<form role="search" method="get" class="search-form" action="https://www.qbitai.com/"> <label> <span class="screen-reader-text">搜索:</span> <input type="search" class="search-field" placeholder="搜索…" value="" name="s" /> </label> <button type="submit" class="search-submit"><span class="screen-reader-text">搜索</span></button> </form>

热门文章 end

底部版权

  • 关于量子位
  • 加入我们
  • 寻求报道
  • 商务合作

<a href="/?page_id=183"target="_blank"><i class="weixin_icon"></i></a>

追踪人工智能新趋势,报道科技行业新突破

<p>量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1</p>

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1