MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization
TL;DR · AI 摘要
MoMo框架通过时空动作分词和行为克隆实现机器人操作中的运动模式泛化,提升跨任务适应性。
核心要点
- MoMo在6个真实机器人任务中实现跨模式行为泛化,人类可区分不同运动模式的行为差异
- 框架包含时空动作分词器和行为克隆Transformer,支持连续运动模式条件输入
- 未见过的模式下任务成功率保持在较高水平,证明组合泛化能力
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- MoMo框架
- 核心机制
- 时空动作分词器
- 行为克隆Transformer
- 实验验证
- 6个真实任务测试
- 跨模式泛化能力
- 关键发现
- 运动模式可复用
- 组合泛化能力
金句 / Highlights
值得收藏与分享的关键句。
MoMo框架在六个真实机器人任务中展示了跨模式行为泛化,人类评估者能区分不同运动模式的行为差异
未见过的模式下任务成功率保持在较高水平,证明组合泛化能力
运动模式条件影响关节速度、加速度和末端执行器接近角度,产生可区分的行为特征
MoMo: 通过时空动作标记化实现机器人操作中的运动模式调节 - Apple 机器学习研究
研究领域
人机交互
,
方法与算法
内容类型
论文
发布日期
2026年7月
MoMo: 通过时空动作标记化实现机器人操作中的运动模式调节
作者 Yuhan Hu, Hugues Thomas, Peide Huang, Mouli Sivapurapu, Benoit Landry, Arto Kivila
查看出版物
复制Bibtex
为了在各种场景中有效运行,机器人不仅要准确执行操作任务,还必须根据任务、物体和交互环境调整动作的执行方式。我们探讨这种执行层面的差异是否可以学习为跨任务共享的可复用行为因子。我们提出了MoMo,这是一个包含时空动作标记器和行为克隆变压器的两阶段模仿学习框架,该框架以任务和连续运动模式条件作为输入。在六个真实机器人操作任务中,改变这一条件会产生稳定、动态和中间行为,这些行为人类评估者可以区分,并且在关节速度、加速度和末端执行器接近角度上存在差异。对于仅在一个模式下演示的任务,MoMo能够转移未见过的请求模式,同时基本保持任务成功率。这些结果共同证明了对未见过任务-模式组合的组合泛化能力,并表明运动模式可以跨任务复用,以控制操作技能的执行方式。
相关阅读与更新
人形机器人策略 ~ 人类策略
2025年5月21日 研究领域 计算机视觉 , 研究领域 人机交互
使用多样化数据训练人形机器人的操作策略可以增强其在任务和平台间的鲁棒性和泛化能力。然而,仅从机器人演示中学习需要大量人工操作,需要昂贵的远程操作数据收集,这难以扩展。本文研究了一种更具扩展性的数据来源——以自我为中心的人类演示,作为机器人学习的跨形态训练数据。我们……
阅读更多
用于迁移学习及更广泛应用的高效ConvBN模块
2024年2月12日 研究领域 方法与算法 会议 ICLR
卷积-批量归一化(ConvBN)模块是各种计算机视觉任务及其他领域的重要组成部分。ConvBN模块可以三种模式运行:训练模式、评估模式和部署模式。虽然训练模式对于从零开始训练模型必不可少,评估模式适用于迁移学习及更广泛应用,部署模式则专为模型部署设计。本文重点研究稳定性与效率之间的权衡……
发现机器学习领域的机遇
我们的机器学习研究每天都在取得新突破。
与我们合作