共计 1191 个字符,预计需要花费 3 分钟才能阅读完成。
具身大模型 R1 时刻:LIBERO 终结者,99.9% 背后的物理推理新范式
机器人执行复杂操作, 关键不只是“手稳”, 还要“想得对”。 近期, 至简动力、北京大学与香港中文大学联合提出的 LaST-R1, 把具身大模型的训练重点从单纯优化动作, 推进到同时优化行动前的隐空间物理推理。
📌 从“照着做”到“先想明白”
过去几年,OpenVLA、π0、π0.5 等模型推动了视觉、语言与动作的对齐, 让机器人能够根据指令完成不少操作。但在真实环境中, 一个常见问题仍然突出: 位置稍有偏移、光照发生变化, 模型就可能表现不稳。
这背后的原因在于, 许多模型更像是在学习“观察到什么就输出什么动作”的映射 。它们能复现演示轨迹, 却未必理解物体之间的空间关系、接触状态和后续变化。
🔍 LaST-R1 做了什么: 把“思考过程”纳入 RL
LaST-R1 全称为 Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning。它面向机器人操作任务, 引入了一套强化学习后训练框架, 让模型在生成动作前, 先产生隐空间推理表示, 用于建模场景结构、物体关系和可能的物理动态。
与语言思维链不同, 隐空间推理并不要求把每个细节写成文字 。对于拉链、旋转、抓取等连续接触过程, 很多力学变化难以用自然语言精确描述, 隐空间表示更适合承载这类高频、细粒度信息。
💡 LAPO: 同时优化“怎么想”和“怎么动”
- 成功轨迹: 不仅强化正确动作, 也强化动作前形成的有效隐空间推理。
- 失败轨迹: 不只修正执行结果, 也反向调整模型内部对物理过程的理解。
- 自适应推理: 简单任务可快速执行, 复杂接触任务则分配更长的隐空间推理长度。
这种机制带来的前后变化很明显: 此前模型更多是在“练手”, 重点是提高动作命中率 ;LaST-R1 则试图让机器人在交互中“修脑”, 让环境反馈塑造行动前的判断方式。
📊 实验表现: 仿真高成功率, 真机泛化更受关注
根据研究团队披露的实验结果,LaST-R1 在 LIBERO benchmark 上, 仅依赖 1 条轨迹进行 warm-up, 随后通过在线强化学习优化, 平均成功率达到 99.9%。在真实机器人任务中, 模型使用 30 条轨迹 warm-up 后, 再经 RL 后训练, 平均成功率由 52.5% 提升至 93.75%。
材料中还提到,LaST-R1 在部分真实任务表现上高于使用 100 条专家轨迹的 π0.5, 差距为 22.5 个百分点。更值得关注的是, 在物体、背景或光照变化时, 它的性能下降较小, 说明模型学习到的可能不只是固定轨迹, 而是更可迁移的空间语义与物理动态理解。
🚀 行业观察: 具身智能训练目标正在变化
LaST-R1 的意义并不只在于刷新某个基准成绩 , 而在于它提供了一个具身大模型后训练的新方向: 强化学习不再只是筛选更高奖励的动作, 还可以参与塑造动作背后的物理推理。