共计 1163 个字符,预计需要花费 3 分钟才能阅读完成。
“世界模型”开始成为具身智能跨越商业化“奇点”的新叙事。
具身智能的商业化进程,正卡在一道物理门槛上。模型能在标准测试里表现不错, 一旦物体位置、摩擦或重量发生变化, 成功率便明显下滑。问题不在于机器人“看不见”, 而在于它并不真正理解物理。
📌 背景:VLA 的短板正在被放大
近期多项研究指向同一结论: 现有视觉 - 语言 - 动作模型在接触丰富任务中,存在精度与力控制两类独立失效模式。它们更像是统计意义上的模仿者, 知道“看到杯子该抓”, 却难以判断杯壁厚度、摩擦力是否足够、注水后重心会不会偏移。
“世界模型”开始被视为具身智能跨越商业化奇点的新叙事方向。
🔍 核心信息: 两项成果同时落地
在第五届全球数字贸易博览会上,杭州美梦空间科技有限公司首次公开并发布两项成果:Physical-WAM 物理 - 世界动作模型 与RoboTwin-Phys 物理漂移评测基准。前者让机器人具备物理预判能力, 后者用来验证它是否真的“懂了物理”。
美梦空间由北京大学信息技术高等研究院高文院士领衔的 AVS 先进视觉系统研究中心孵化。2026 年 8 月, 物理 AI 企业索辰科技完成对其独家种子轮战略投资, 双方在数据、算力与物理 AI 技术上深度协同。
💡 Physical-WAM: 在感知与动作之间插入物理 Token
机器人真实物理交互样本仅维持在百万量级,与文本图像领域数十亿级数据存在数量级落差。Physical-WAM 的解法, 是在感知输入与动作输出之间加入一层“物理 Token”表征, 由 PhysLens、PhysDream、PhysAct 三个模块构成“感知→预测→生成→修正”的闭环。
- PhysLens: 提取摩擦、重量、重心、接触状态等不可直接观测的物理信息。
- PhysDream: 结合环境与候选动作推演未来物理状态, 预测打滑、脱手等风险。
- PhysAct: 将物理属性与未来状态预测引入动作生成, 环境漂移时自动调整策略。
📊 RoboTwin-Phys: 把物理扰动变成可控变量
现有评测多关注任务完成度,而非物理适应度。RoboTwin-Phys 新增 13 类真实世界常见物理扰动因素, 覆盖物体属性、接触属性、阻尼、任务环境与相机配置五大维度, 支持单因素到多因素组合扰动测评, 发布即开源。
🚀 影响与看点: 评测标尺比模型本身更关键
一项能力如果无法被度量,迭代优化就失去锚点。RoboTwin-Phys 提供物理真值、接触力日志与失败时间线, 并采用固定种子配对评估, 减少运气成分。这意味着行业首次可以区分“物理状态识别错了”与“识别对了但动作策略没跟上”。
🧭 总结
从让机器人“懂物理”到验证它是否真的懂了,美梦空间与索辰科技试图补齐物理数据、世界模型与评测标准三块拼图。正如美梦空间 CEO 李明昊所言, 只有让机器人真正读懂物理世界, 具身智能才能从实验室走向真实产业场景。