共计 1184 个字符,预计需要花费 3 分钟才能阅读完成。
在 2026 年 6 月举办的第八届智源大会上,智源研究院院长王仲远提出 , 世界模型是连接当前 AI 与物理通用人工智能(AGI) 的关键桥梁。他明确表示, 当前行业普遍将视频生成模型等同于世界模型, 这是一种误读。
📌 世界模型为何是必经之路?
王仲远认为,世界模型是面向真实物理世界的下一代基座模型, 其核心在于让机器人真正“理解”物理世界, 而非仅仅背诵训练轨迹。从“预测下一个 Token”到“预测下一个物理状态”的变革, 是 AI 的一次重大范式跃迁。
- 感知、理解、推理真实物理世界的时间、空间、物理规律和常识;
- 涵盖文本、视频、深度、力觉、触觉等全模态数据;
- 具备主动交互能力, 支撑物理世界的下游应用。
🔍 行业对世界模型的四种误读
- 以语言为中心: 包括大语言模型、VLM、VLA 等, 将多模态能力映射到语言空间, 但语言无法完整表达物理因果。
- 以像素为中心: 如 Sora, 预测下一帧 2D 像素, 但常生成违背物理规律的内容,LeCun 也批评其不理解因果。
- 以三维结构为中心: 如李飞飞团队的 Marble, 生成可交互 3D 环境, 但几何结构不等于物理状态。
- 以视觉表征为中心: 如 JEPA 系列, 预测视觉嵌入的压缩, 但视觉演化不等于物理规律演化。
王仲远强调,这些模型都未真正触及物理世界的本质, 而智源正在探索第五条路径——潜空间表征, 将全模态数据压缩到统一语义空间, 预测物理状态而非像素或语言。
💡 世界模型的三大卡点
- 物理理解: 现有模型能生成流畅视频, 却无法预判物理后果, 例如一瓶水掉在地上是否会洒出。
- 时间一致性 : 长时间序列中, 物体的状态变量(如水的位置、时钟的读数) 必须保持一致, 而非仅画面连贯。
- 行动驱动: 模型必须将多模态感知、物理规律理解和动作执行打通, 从“看懂”变为“会做”。
📊 数据底座: 视频是基础, 但不够
王仲远以两岁女孩通过视频学习串蓝莓为例,说明视频数据天然携带物理因果信息, 但仅靠视频不足以构建完整的世界模型。真实物理世界的异构感知数据——机器人关节角度、触觉反馈、力矩变化等——同样不可或缺。
智源发布的悟界·Physis-v0.1 采用双层结构: 底层用海量视频建立物理概念模型,上层用真实交互数据精调动作和决策。王仲远认为, 随着具身智能和 AI 硬件大量采集数据, 物理世界基座模型的爆发点正在临近。
🚀 VLA 是过渡, 世界模型是终局
针对 VLA(视觉 - 语言 - 动作)模型,王仲远认为它是当下的有效方案 , 尤其在特定任务场景中(如工厂分拣) 表现良好。但 VLA 存在结构性局限: 模型过大导致响应延迟、泛化性差、无法处理长程规划和复杂物理推理。
🧭 行业观察: 概念混战中的正本清源
围绕“智源王仲远: 世界模型是通往物理 AGI 之桥”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。