李飞飞等署名新论文提出 SimFoundry:用真实视频生成机器人仿真训练场

97次阅读
没有评论

共计 1258 个字符,预计需要花费 4 分钟才能阅读完成。

信息整理

李飞飞署名具身新论文:Sim2Real 烧不起,Real2Sim 量大管饱

一段真实世界视频, 能否变成机器人可训练、可测试的仿真世界? 英伟达 GEAR 联合李飞飞团队、佐治亚理工学院等机构近期发布的 Real-to-Sim 系统 SimFoundry, 正试图把这一流程做成自动化流水线。

根据论文介绍,SimFoundry 并不只是完成三维重建, 而是希望从真实视频出发, 生成可交互、可用于机器人策略评估和训练的仿真环境, 并进一步扩展出更多具有相似功能语义的新场景与新任务。

📌 Real-to-Sim 为什么受到关注

机器人训练长期依赖真实数据, 但真实机器人采集和测试往往成本高、周期长 , 也难以覆盖足够丰富的场景。仿真环境可以低成本生成大量数据, 因此成为具身智能研究中的重要路径。

不过, 传统 Sim-to-Real 方案面临一个现实问题: 高质量仿真场景本身并不好搭建 。几何结构、物理属性、交互方式都需要较多人工配置。Real-to-Sim 的目标, 是把真实世界快速转换为可运行的仿真环境, 从源头降低建模门槛。

🔍 三阶段流程: 先理解, 再生成, 最后扩展

  • 提取阶段: 系统输入普通 RGB 视频后, 利用深度估计恢复三维信息, 并结合视觉语言模型、分割模型识别和分离场景中的物体。
  • 生成阶段: 针对物体生成三维网格, 恢复其位姿, 并为可动部件推导关节结构, 同时补充质量、摩擦、碰撞等物理属性。
  • 增强阶段: 在数字孪生基础上生成“数字表亲”, 通过替换物体、调整布局或设计新任务, 扩展训练数据空间。

💡 不止重建场景, 还要生成任务

SimFoundry 的一个核心看点 , 是它把扩展对象从单一场景扩大到物体、场景和任务三个层面。举例来说, 系统可以在保持物体可抓取、可打开等 affordance 不变的前提下, 更换物体形态; 也可以调整物体位置, 形成新的操作环境; 还可以根据场景中物体的功能, 自动推导新的机器人操作任务。

这意味着, 一段视频不只对应一个仿真副本 , 而可能成为一组训练环境的起点。对于需要大量多样化数据的机器人策略训练而言, 这种自动扩展能力具有实际价值。

📊 实验结果显示仿真评估与真实表现相关

论文在两套机器人平台和 7 类操作任务上进行了验证 , 覆盖 Real-to-Sim 策略评估与 Sim-to-Real 策略训练两个方向。研究结果显示,SimFoundry 中机器人的表现与真实世界表现具有较高一致性, 平均皮尔逊相关系数达到 0.911。

在训练方面, 引入 Object、Scene 和 Task Cousins 后, 相比仅使用数字孪生训练, 真实世界任务成功率分别出现 17%、21% 和 40% 的提升。论文还提到, 仅使用 SimFoundry 自动生成的数据训练策略, 也可以零样本部署到真实机器人, 并在多类操作任务中完成迁移。

🚀 行业观察:Real2Sim 正在补齐机器人数据短板

围绕“李飞飞署名具身新论文:Sim2Real 烧不起,Real2”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0