智源王仲远:世界模型是通往物理AGI之桥,视频生成不等于理解世界

115次阅读
没有评论

共计 1184 个字符,预计需要花费 3 分钟才能阅读完成。

观察视角
围绕事件本身、节奏变化与潜在影响展开。

在 2026 年 6 月举办的第八届智源大会上,智源研究院院长王仲远提出 , 世界模型是连接当前 AI 与物理通用人工智能(AGI) 的关键桥梁。他明确表示, 当前行业普遍将视频生成模型等同于世界模型, 这是一种误读。

📌 世界模型为何是必经之路?

王仲远认为,世界模型是面向真实物理世界的下一代基座模型, 其核心在于让机器人真正“理解”物理世界, 而非仅仅背诵训练轨迹。从“预测下一个 Token”到“预测下一个物理状态”的变革, 是 AI 的一次重大范式跃迁。

  • 感知、理解、推理真实物理世界的时间、空间、物理规律和常识;
  • 涵盖文本、视频、深度、力觉、触觉等全模态数据;
  • 具备主动交互能力, 支撑物理世界的下游应用。

🔍 行业对世界模型的四种误读

  • 以语言为中心: 包括大语言模型、VLM、VLA 等, 将多模态能力映射到语言空间, 但语言无法完整表达物理因果。
  • 以像素为中心: 如 Sora, 预测下一帧 2D 像素, 但常生成违背物理规律的内容,LeCun 也批评其不理解因果。
  • 以三维结构为中心: 如李飞飞团队的 Marble, 生成可交互 3D 环境, 但几何结构不等于物理状态。
  • 以视觉表征为中心: 如 JEPA 系列, 预测视觉嵌入的压缩, 但视觉演化不等于物理规律演化。

王仲远强调,这些模型都未真正触及物理世界的本质, 而智源正在探索第五条路径——潜空间表征, 将全模态数据压缩到统一语义空间, 预测物理状态而非像素或语言。

💡 世界模型的三大卡点

  • 物理理解: 现有模型能生成流畅视频, 却无法预判物理后果, 例如一瓶水掉在地上是否会洒出。
  • 时间一致性 : 长时间序列中, 物体的状态变量(如水的位置、时钟的读数) 必须保持一致, 而非仅画面连贯。
  • 行动驱动: 模型必须将多模态感知、物理规律理解和动作执行打通, 从“看懂”变为“会做”。

📊 数据底座: 视频是基础, 但不够

王仲远以两岁女孩通过视频学习串蓝莓为例,说明视频数据天然携带物理因果信息, 但仅靠视频不足以构建完整的世界模型。真实物理世界的异构感知数据——机器人关节角度、触觉反馈、力矩变化等——同样不可或缺。

智源发布的悟界·Physis-v0.1 采用双层结构: 底层用海量视频建立物理概念模型,上层用真实交互数据精调动作和决策。王仲远认为, 随着具身智能和 AI 硬件大量采集数据, 物理世界基座模型的爆发点正在临近。

🚀 VLA 是过渡, 世界模型是终局

针对 VLA(视觉 - 语言 - 动作)模型,王仲远认为它是当下的有效方案 , 尤其在特定任务场景中(如工厂分拣) 表现良好。但 VLA 存在结构性局限: 模型过大导致响应延迟、泛化性差、无法处理长程规划和复杂物理推理。

🧭 行业观察: 概念混战中的正本清源

围绕“智源王仲远: 世界模型是通往物理 AGI 之桥”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0