共计 980 个字符,预计需要花费 3 分钟才能阅读完成。
北大、NTU 等推出世界动作模型 ω -0, 重塑人形机器人的居家作业模式
家庭场景一直被认为是人形机器人落地的终极考验,但也是技术难度最高的挑战 。近日, 南洋理工大学、北京大学、香港科技大学(广州) 和智源研究院联合推出了一款名为 ω - 0 的隐空间预测世界动作模型, 让人形机器人在居家环境中实现全身协同的自主作业, 引发行业广泛关注。
📌 从“先走后做”到“边走边做”
传统的人形机器人操作通常采用“分步走”策略: 先移动到目标位置,站稳后再启动手臂操作。这种模式在简单场景下或许可行, 但面对家庭中的连续任务, 比如擦桌子时需要边移动边保持抹布贴合桌面, 或者拖地时双腿要随手臂动作调整重心, 往往会出现卡顿甚至失去平衡。
ω- 0 模型的核心突破在于摒弃了耗时的“视频到动作”转换,转而构建统一的查询表征。它通过未来视觉特征提供任务进展的宏观指引, 同时动作分支直接生成底层控制器可执行的全身动作指令, 从而实现“边移动边操作”的流畅协同。
🔍 三阶段训练体系与开源数据集
- 第一阶段: 全身动作 VLM 专属预训练, 让模型理解基础的动作语义;
- 第二阶段: 融合视觉、语言、机器人本体数据, 借鉴 V -JEPA 技术, 通过视频查询预判环境变化;
- 第三阶段: 基于真实居家移动操作数据进行微调, 提升场景适配能力。
同时, 团队开源了真实世界家庭人形机器人数据集 ω -HOME,包含 40.3 小时真实环境数据、4827 条任务轨迹和 24 项任务, 每条轨迹都同步采集语言指令、多视角视频、本体状态和全身运动轨迹, 为行业提供了宝贵的训练资源。
💡 实测成绩亮眼, 但仍需理性看待
不过,81.8% 的成功率虽然振奋人心,但距离真正融入家庭、长期自主运行的机器人仍有距离。行业观察人士指出,ω- 0 的意义更多在于验证了一种新思路: 将机器人的全身视为一个整体来规划, 而不是将手臂和腿脚分开控制。当机器人学会在移动中操作、在操作中调整姿态, 才可能从“实验室演示”走向“生活化服务”。
📊 行业影响与未来展望
ω- 0 模型的发布为人形机器人领域注入了新的活力。它不仅展示了全身协同作业的可行性, 还通过开源数据集降低了行业门槛, 推动更多研究团队和企业在真实场景中探索人形机器人的应用。未来, 随着模型能力的持续提升和数据的积累, 人形机器人有望在家庭服务、养老陪护等场景中逐步落地, 真正成为人类生活的助手。