机器人迎来GPT-3时刻?GEN-1.5看3秒演示就能学会新动作

78次阅读
没有评论

共计 1198 个字符,预计需要花费 3 分钟才能阅读完成。

看点

机器人看 3 秒演示就能学会

重点阅读

机器人的 GPT- 3 时刻真·来了! 卡卡西上身, 看 3 秒就学会新动作

科幻电影中的场景正在成为现实: 机器人只需“看”几秒演示, 就能学会一项全新技能 , 甚至还能举一反三。近日,Generalist AI 发布了新一代机器人基础模型 GEN-1.5, 其展示的能力让不少人惊呼: 机器人的 GPT- 3 时刻真的来了!

📌 事件概览:GEN-1.5 是什么?

GEN-1.5 是 Generalist AI 团队经过 8 个多月连续预训练推出的机器人基础模型 。它主打 One-shot Learning(一次性学习), 通过大规模物理数据预训练, 让机器人仅凭几秒的动作示范, 就能快速掌握新任务。更令人惊叹的是, 整个过程无需梯度更新或微调, 模型甚至能自行“悟”出技能。

🔍 核心能力: 从模仿到举一反三

GEN-1.5 最引人注目的能力是“物理版 Prompt Engineering”。就像给大语言模型一个例子, 它就能理解任务一样,GEN-1.5 将动作演示作为“物理提示”, 直接进入机器人的上下文, 使其理解并执行任务。具体表现包括:

  • 快速学习 : 观看 3 -12 秒演示后, 机器人即可上手执行新任务, 全程无需调整参数。
  • 举一反三 : 例如, 教机器人用刷子清扫, 它随后会用香蕉进行类似动作, 甚至能自主设计双手配合的复杂操作。
  • 技能拼接 : 模型可将两段不同的演示组合成连续任务, 自动补全中间未演示的衔接动作。
  • 跨域迁移 : 在模拟器中学习的技能, 能直接应用于真实世界, 无需额外训练。

💡 技术亮点:0 梯度更新, 能力“涌现”

GEN-1.5 最让研究圈兴奋的是, 其 One-shot 能力并非刻意设计 , 而是在大规模预训练中自然涌现。团队透露, 他们没有为 In-Context Learning 设计特殊架构或目标函数, 而是让模型在连续的真实物理数据中自我学习。随着预训练数据量的增加, 模型逐渐学会了根据“刚刚发生的事”来决策下一步动作, 这已接近 In-Context Learning 的雏形。

“真正让研究圈兴奋的点在于:0 次训练却能做到 59% 的成功率, 这才吓人!”

📊 行业观察: 机器人技术的新范式

GEN-1.5 的发布, 被视为机器人技术从“专用编程”向“通用学习”转变的里程碑 。其“看几秒就会”的能力, 可能大幅降低机器人部署门槛, 未来工厂、家庭等场景的机器人将更加灵活。不过, 目前该模型在 10 种测试任务上的平均成功率仅为 59%(单次演示、无微调), 若提供 5 分钟数据和 10 步梯度更新, 成功率可提升至 83%。团队也承认, 临时学到的技能稳定性尚不及精细微调后的模型, 但这一突破已足够令人期待。

🚀 总结: 未来已来, 但仍有路要走

GEN-1.5 让我们看到了机器人像 GPT- 3 一样, 通过大规模预训练获得“通用学习能力”的可能性 。尽管目前仍有局限, 但其涌现的 One-shot 能力, 为具身智能的发展开辟了新路径。或许不久后, 机器人出厂时最重要的技能, 就是“看着学”。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0