T-Rex框架提出具身智能新思路:让机器人触觉不再被视觉“拖慢”

104次阅读
没有评论

共计 1084 个字符,预计需要花费 3 分钟才能阅读完成。

「 观察视角 」
围绕事件本身、节奏变化与潜在影响展开。

机器人灵巧手的瓶颈, 可能不在“看得不够清”, 而在“摸得不够快”。 近期, 一项围绕 T -Rex 框架的研究引发具身智能圈关注: 研究团队发现, 简单把触觉信号塞进经典模型, 反而可能让任务成功率下降。

📌 反常实验揭示: 触觉不是越多越好

在相关消融实验中, 研究人员尝试在 π0.5 模型中加入触觉输入 。按照直觉, 机器人多了一种感知信息, 精细操作应当更稳定。但实验结果显示, 任务成功率从 17% 降至 6%。

这一结果的关键并不是“触觉无用”, 而是触觉被放进了不合适的处理通道 。视觉通常以较低频率提供场景信息, 适合判断物体位置、形态和上下文; 触觉则发生在接触瞬间, 压力、滑动、形变等变化往往需要更高频率响应。

🔍 T-Rex 的核心: 给触觉单独开一条高速通道

针对这一问题, 李飞飞、Jim Fan、徐丹飞等研究者参与的团队提出 T -Rex, 即触觉反应式灵巧操作框架。它没有继续把所有信息统一压进同一个模型, 而是采用混合 Transformer 专家架构, 让不同感知和控制模块按各自节奏工作。

  • 潜在专家 : 处理视觉和语言信息, 理解场景并提供上下文。
  • 动作专家 : 生成大致动作轨迹, 相当于先画出操作草图。
  • 触觉专家 : 在接触发生后高频介入, 根据指尖反馈修正力度和方向。

💡 数据与训练: 从人类视频到机器人触觉

研究团队还构建了约 100 小时的触觉同步数据集, 覆盖 200 多种日常物品、22 类动作基元以及 7700 多条运动轨迹 。相比只为单一任务采集数据, 这种“动作×物体”的组织方式更强调通用接触经验。

训练流程也分阶段推进: 先利用大量人类第一视角视频学习手部交互先验, 再通过机器人触觉数据完成跨模态对齐 , 最后用少量特定任务示范激活专项能力。这意味着触觉能力不是从零开始学, 而是在已有视觉运动理解上补上“接触反馈”这一层。

📊 12 项精细任务验证: 提升来自“用对触觉”

论文测试了翻书页、转移生鸡蛋、擦盘子、挤牙膏、分纸杯、开锁、填药盒、拧灯泡等 12 项接触密集型任务。 结果显示 ,T-Rex 相较此前较强基线模型取得超过 30% 的平均成功率提升。

更值得注意的是, 消融实验显示: 去掉触觉通道 , 系统表现会明显下滑; 取消异步机制、强行让触觉与视觉同步, 性能同样变差。这说明 T -Rex 的优势不只是“加了传感器”, 而是为触觉设计了独立节奏和处理逻辑。

🚀 行业观察: 具身智能不能只押注“大一统模型”

这项研究给行业的启示相当直接: 视觉、语言、触觉并不一定适合被无差别地统一成同一种输入形式。 对于机器人而言 , 触觉关乎物理接触和即时闭环控制, 它更像是一套高速反应系统, 而不是视觉的附属信息。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0