10 月 10 日,星期六

不用机器人,也能给机器人「补课「」: 董豪团队提出 HIL-UMI

怎样知道机器人还需要学什么?一种直接的办法,是让它先做一遍:哪里抓不稳、哪里放不准,人再接管纠正。这样教很有针对性,但每补一批经验,都得让机械臂实际运行。
董豪团队联合启元机器人、北京大学、西安交通大学等提出的 HIL-UMI,把发现薄弱环节的过程放到了人类示范中。人手持夹爪操作,模型同时预测自己的做法,系统比较两者的差异,提示哪些地方需要多教一段。无需机器人实际执行,也能根据当前模型的需要,采集数据并继续训练。

HIL-UMI: Bringing Human-in-the-Loop Post-Training of
Vision-Language-Action Models to Universal Manipulation Interface
Zimu Han*1,4, Yiming Zeng*1,4, Jiyao Zhang*‡1,2,3, Zihao Zhao1, Yuanfei Wang1,2,3, Yixiang Jin5
Shiqi Li5, Shuangben Chen1, Wei Huang1, Ruodai Li5, Hui Shen5 and Hao Dong†1,2,3

论文地址:https://arxiv.org/pdf/2609.20659
项目主页:https://hil-umi.github.io

多教几遍 为什么还是会出错

假设要把桌上的玩具收进抽屉。人演示时,通常能稳稳夹住,再顺利放进去。机器人自己做时,却可能抓偏了一点,把玩具推到了旁边。位置变了,朝向也变了,接下来该怎么夹,已经和示范里的情况不同。

这时候,它缺少的是处理这个新局面的经验。如果继续按原来的动作做,小误差就可能越积越大。再给它看几次顺利完成的操作,未必正好能补上这一课。

如今,一类被称为视觉语言动作模型(VLA)的模型,可以根据摄像头画面和语言指令,生成机器人要执行的动作。用新的操作数据继续改进已有模型,就是后训练。常见做法是监督微调(SFT):人演示怎样完成任务,模型学习其中的动作。

示范帮助机器人学会了基本操作,但人顺利完成任务时经历的情况,和机器人自己动手时遇到的情况,往往不完全一样。后训练需要补充的,正是当前模型还不擅长的那些操作。

比如,模型已经学会打开抽屉,却总把不同颜色的笔放错槽位,下一轮就应该重点教它怎样分辨和放置。如果它夹不稳形状特殊的玩具,就需要多看这类物体该怎么抓。要教什么,应当随着模型已经学会什么而调整。

针对性训练的成本

HG-DAgger 就是这样一种有针对性的后训练方法。它让机器人执行任务,人在需要时接管,演示正确操作,再把这些纠正数据用于训练。机器人哪里做得不好,下一轮就补充哪里的经验。

成本也来自这个过程。采集者要守着机械臂,等待它执行、及时接管,还要复位场景。想让多个人同时采集,通常就得准备多台机器人和相应的场地。

另一种工具提供了更轻便的采集方式。通用操作接口(UMI)是一套手持夹爪设备,人直接拿着它操作,就能记录机器人可用的画面和动作。这样采集不需要机械臂,但仅有记录工具,还不能告诉人:眼前这段示范,是不是模型现在最需要学的?

HIL-UMI 将模型接入了这个采集过程。人正在演示,模型就同步预测动作、提供反馈,帮助决定接下来该重点采什么。HG-DAgger 中根据模型表现补充经验的思路,因此也能用在无需机器人执行的采集上。

人类操作时 就能发现模型的薄弱环节

在 HIL-UMI 的采集现场,人手持夹爪移动物体。摄像头记录画面,系统同时记录夹爪的位置、角度和开合。模型在计算机上运行,接收同样的画面和任务指令,预测接下来一段时间该怎样操作。
实际移动物体的始终是人,模型给出的动作不在机械臂上执行。系统把两者放在一起比较,就能发现人类示范与模型预测在哪些地方出现了分歧。

例如,要夹起一个不规则的玩具,人会先调整夹爪角度,再找到稳妥的夹持位置。模型预测的接近方向或闭合时机,却可能与人明显不同。这种差异能帮助系统找到模型还需要学习的操作。

系统会生成多组动作预测,等对应的人类动作片段完成后,综合比较移动位置、夹爪角度和开合的差异。当差异超过设定门槛,系统就提示操作者从当前状态继续录制,直到当前这一步操作完成。这样补充的可以是一段抓取或放置示范,不必每次都从头录完整个任务。

模型开始参与决定自己需要什么数据。它更新之后,与人类操作的分歧也会改变,下一轮采集的重点随之调整。发现问题、补充示范、继续训练,就可以在人与模型之间反复进行,无需每一轮都让机械臂先尝试。

让模型学会更有效的动作

还要解决一个问题:哪些动作确实让任务向前推进了?以叠方块为例,夹着方块来回移动,和把它对准下方的方块,都有动作发生,对完成任务的帮助却不同。

HIL-UMI 用一个称为“优势估计器”的模型来判断这件事。它查看操作前后的画面,估计这段动作让任务推进了多少。如果人已经有效推进任务,它却给出很低的评价,系统也会补充这类示范,改进它的判断。

动作模型随后结合这些评价和专家示范继续训练,学习更有利于完成任务的做法。执行时,系统也会加入相应提示,引导模型生成能推进任务的动作。这种训练方式称为优势条件行为克隆。

每轮训练会同时使用新示范和历史数据,兼顾新学到的操作与已有技能。更新后的模型再参与下一轮采集,继续提供反馈。

同样多的数据 三轮训练能提高多少

这些在手持设备上采集的经验,最终能让真实机器人做得更好吗?团队以 π0.5 为基础模型,在 Franka 机械臂上测试了四项任务。

整理桌面需要打开抽屉、把笔放进对应颜色的槽位,再收好形状各异的玩具,考验连续完成多个步骤的能力。折毛巾则要应对布料不断变化的形状。叠方块和盖章更强调精度:前者要对齐并放稳,后者要调整好印章姿态,准确落在指定区域内。

实验按机器人完成了多少步骤来评分,称为任务进度分数(TPS),满分 100 分。比如整理桌面,收好了哪些物品、完成了哪些抽屉操作,都会计入得分。

在采集相同帧数数据的条件下,团队比较了持续增加常规示范的 SFT,以及根据模型反馈补充示范的 HIL-UMI。下图记录了三轮采集和训练后的变化。

先看紫色和橙色曲线。二者从相同的平均分 44.3 出发,三轮后,SFT 达到 58.0 分;保留针对性采集、去掉优势机制的 HIL-UMI 达到 88.0 分。这组对比说明,新增数据是否对准模型的薄弱环节,会显著影响后训练的效果。

绿色曲线对应完整方法,从一开始就使用优势条件训练,平均分从 62.3 提升到 94.8。第三轮后,叠方块和盖章均达到 100 分,整理桌面达到 96 分。随着新示范不断补充,四项任务的表现都在逐轮提高。

后训练可以不再围着机械臂开展

省去机械臂反复执行和人工接管,首先改变的是采集速度。团队在整理桌面任务上,将 HIL-UMI 与 HG-DAgger 进行了比较。

HIL-UMI 的数据采集效率达到 HG-DAgger 的 5.63 倍,也就是单位时间内获得的训练数据帧数更多。最终,HIL-UMI 的任务进度分数为 96 分,HG-DAgger 为 91 分,采集更快的同时也取得了更好的任务表现。

HIL-UMI 带来的范式转变,体现在后训练的组织方式上:模型在采集时就参与决定该教什么,而这份反馈可以通过预测获得,不必以机器人实际运行为前提。采集者使用手持设备便能补充模型需要的操作经验,减少了对机械臂设备和运行时间的依赖,也让开展后训练更方便。

团队接下来计划探索分布式后训练,让不同地点的操作者并行采集当前模型需要的示范。每个采集点都不必配一台机械臂,采到的经验可以汇入同一个模型,支持它持续改进。

 

爱范儿 App 下载二维码

爱范儿 App

爱范儿,让未来触手可及

爱范儿
APPSO
董车会
玩物志
爱范儿 公众号二维码

关注明日产品的数字潮牌