英伟达让机器人自己研究机器人,8台机械臂彻夜烧Token实现99%成功率

85次阅读
没有评论

共计 1388 个字符,预计需要花费 4 分钟才能阅读完成。

进展时间线

英伟达开始搞机器人自己研究机器人那套了 …

英伟达又找到了新的“烧 Token”方式——这次是让机器人自己研究机器人。近日,英伟达 GEAR 实验室与 CMU、伯克利联合推出了具身智能自主研究框架 ENPIRE, 让 AI Agent 像人类研究员一样, 自主完成从读论文到实验部署的完整闭环。

📌 ENPIRE 是什么?

  • 环境模块(Environment): 负责搭建实验环境, 包括安全边界、自动复位和自动评分。
  • 策略改进模块(Policy Improvement):Agent 根据任务目标提出新方案, 可尝试行为克隆、强化学习、启发式规则等多种方法。
  • 部署测试模块(Rollout): 将新策略部署到真实机器人上执行, 记录轨迹、视频和传感器信号。
  • 进化模块(Evolution):8 个 Agent 各自占用一台机器人, 通过 Git 共享代码, 互相吸收有效方案, 淘汰失败路线。

🔍 关键突破: 把物理世界变成可迭代的实验环境

具身智能研究的一大痛点是实验失败后场景混乱,需要人工复位。ENPIRE 的环境模块解决了这一问题——通过自动复位、自动评分和安全控制接口, 将物理世界包装成 Agent 可反复调用的实验环境。例如, 在 GPU 插拔任务中, 机器人需要精确控制力度, 避免损坏针脚; 在扎带穿扎任务中,Agent 甚至自行设计了视觉检测方案, 通过双摄像头确认扎带是否成功穿过。

💡 实验成果:Agent 的研究能力令人惊讶

ENPIRE 在四个高难度灵巧操作任务上进行了验证:Push-T、Pin Insertion、GPU Insertion 和 Zip-tie。最终四个任务均达到 99% 的成功率。以 Pin Insertion 为例,Agent 的研究路径与人类研究员极为相似: 先试行为克隆, 效果一般; 加入在线强化学习数据, 性能提升; 再增加正则化项, 成功率明显跃升; 随后调整 Batch Size, 补偿控制器延迟, 进一步提升稳定性。整个过程完全由 Agent 自主决策, 没有人类指导。

更令人惊讶的是,Agent 会根据任务特点主动改变研究路线 。在 Zip-tie 任务中, 它发现端到端训练效果不佳, 于是自行切换到 VLA 模型(Vision-Language-Action) 进行粗定位, 再调用工具 API 执行精细操作——某种程度上, 这相当于自己做了一次系统架构设计。

📊 物理世界的 Scaling 定律

ENPIRE 展示了物理世界中的 Scaling 效应。 8 个 Agent 分别占用 8 台机器人 , 同时探索不同路线, 使 Pin Insertion 任务达到目标成功率的时间从 1.5 小时缩短到 40 分钟。但 Token 消耗增长更快, 论文专门提出了两个指标来衡量代价: 机器人利用率(机器人实际用于实验的时间比例) 和 Token 利用率(系统每分钟消耗的 Token 数量)。

此外,Agent 之间还出现了经验传承: 在 Pin Insertion 任务中积累的经验被整理成文字总结, 直接塞进 GPU Insertion 任务的 Prompt 里, 后续研究效率明显提升——迁移的既不是模型权重也不是训练数据, 而是一份研究笔记, 与人类实验室的传帮带如出一辙。

🚀 大平行的最后一块拼图

围绕“英伟达开始搞机器人自己研究机器人那套了 …”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

后续仍需结合新增披露持续校准判断。
本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0