清华北理工联合开源 HOST:机器人可通过 29 秒演示视频学习新技能

83次阅读
没有评论

共计 1053 个字符,预计需要花费 3 分钟才能阅读完成。

一句话看点: 具身智能机器人学习新技能 , 正在从“工程师采集数据、反复训练模型”转向“看一段人类演示后自主推理”。自变量机器人联合北京理工大学、清华大学发布并开源 HOST 框架, 核心目标是降低机器人教学门槛。

📌 29 秒视频带来的新尝试

HOST 全称为 Human-to-robot One-Shot Skill AcquisiTion, 强调“人类到机器人”的单样本技能获取。根据公开论文与项目介绍, 机器人观看一段平均约 29 秒的人类演示视频后, 可在不更新模型参数、不重新采集新数据的情况下, 尝试执行训练阶段未见过的桌面操作任务。

研究团队在 50 项任务中测试了这一框架 , 任务包括放水果、堆碗、擦盘子、插笔等。论文披露,HOST 的技能复现成功率达到 62%。相比依赖微调的方案, 其所需数据量和学习时间均明显降低。

🔍 关键变化: 从模仿动作到推理结果

机器人直接学习人类动作并不容易。 人类有手指、手腕和灵活双臂 , 而机器人可能只有单臂、夹爪或不同底盘结构, 动作轨迹很难一一对应。HOST 的思路不是照搬人的动作, 而是观察任务完成后的状态, 再反推机器人自己应该如何行动。

  • 任务阶段判断: 理解演示视频中任务进行到哪一步, 而不是只按时间轴对齐。
  • 视角迁移: 把人类完成动作后的画面转换为机器人可理解的视角与本体条件。
  • 动作反推: 根据目标状态规划机器人动作序列, 重点是达成结果。

💡 无需微调, 减少“学新忘旧”

HOST 的另一项特点是推理阶段不改写模型权重 。也就是说, 新技能更像是通过视频输入临时提供任务目标, 而不是重新训练模型本身。论文数据显示, 微调方案在学习新任务后可能影响旧任务表现, 而 HOST 对已掌握技能的保留更稳定。

其底层采用带视觉预测能力的级联策略模型, 并引入双专家混合架构 。训练过程大致分为两步: 先用机器人同体轨迹建立基础能力, 再通过人类与机器人配对演示学习跨本体迁移。

📊 开源后的行业看点

目前,HOST 的论文、代码和模型权重已经开放 。对具身智能行业来说, 这类项目的意义不只在于单次测试成绩, 也在于探索一条减少遥操作数据依赖的路径。

  • 数据成本: 减少每个新技能都要重新采集大量机器人轨迹的压力。
  • 长尾场景: 家庭、办公等非标准任务有机会通过普通演示视频补充。
  • 社区迭代: 开源有助于更多团队复现、验证并改进方法。
  • 落地限制: 当前测试以桌面操作为主, 复杂动态环境仍需进一步验证。

🚀 总结: 方向明确, 可靠性仍待提升

HOST 展示了机器人技能获取的一种新方向: 不是无限堆数据 , 而是让机器人更有效地理解人类示范。62% 的成功率说明该方法已有可观察进展, 但距离高可靠商业部署仍有差距。

正文完
 0