世界模型与VLA之争:智能驾驶下一代架构在争什么

50次阅读
没有评论

共计 1030 个字符,预计需要花费 3 分钟才能阅读完成。

「观察视角」
围绕事件本身、节奏变化与潜在影响展开。

智能驾驶的技术叙事正在换挡。过去一年, 世界模型、VLA、原生多模态频繁出现在发布会和论文中, 但把车企简单分成不同阵营, 反而容易遮蔽真正的问题: 下一代智驾系统究竟要如何理解环境、预演未来, 并把判断转化为可执行动作。

📌 概念边界并没有外界想象得清楚

外界常将华为、蔚来归为世界模型路线,将小鹏、理想归为 VLA 路线。但从公开研究看, 这种分类并不严谨。理想有论文研究世界模型, 小鹏对外强调 VLA, 内部也出现预测式世界模型、生成式世界模型等相关团队。也就是说, 世界模型与 VLA 并非互斥标签, 而是可能在同一套自动驾驶架构中交叉出现。

从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。

🔍 真正分歧是“未来”要被压缩到什么程度

自动驾驶需要提前判断周围车辆、道路结构和自车动作的变化,但模型不一定要生成逼真的未来画面。分歧正在于: 系统应保留多少细节, 才能既理解世界, 又不拖慢车端运行。

  • 小鹏 更强调抽象表达, 将未来状态压缩为较少词元或结构化信息。
  • 小米 关注视频生成器内部表征, 试图减少生成与规划之间的断层。
  • 理想 倾向在隐空间中预测未来, 避免直接生成真实图像带来的高计算成本。
  • 华为相关研究 尝试用离散词元表达未来动力学, 并区分自车与环境变化。

💡 论文交锋背后是工程取舍

几家公司的论文彼此之间已有明显回应: 有人认为生成和规划分开会留下鸿沟,有人批评像素级生成带来冗余算力开销, 也有人担心把世界模型串在策略模型前会增加车端时延。这些争论并不是否定“预测未来”本身, 而是在讨论预测应以何种形式接入规划。

BEV 也是分歧点之一。有方案把 BEV 作为抽象世界的底板, 也有研究认为其几何约束可能限制时空特征交互。哪种方式更适合量产, 仍需要道路表现和长期数据验证。

📊 量产体验还绕不开导航理解

相比架构名称,用户更容易感受到的问题是: 系统会开车, 却可能走错路。公开实验显示, 一些端到端模型即使接入导航信息, 规划结果也未必明显受其影响。原因可能在于模型拿到的只是左转、直行、右转等离散指令, 难以理解提前选道、主辅路切换和复杂路口通行之间的因果关系。

🚀 总结: 竞争将回到可验证能力

世界模型与 VLA 之争,本质不是名词之争, 而是智能驾驶系统如何在有限算力、带宽和时延约束下完成感知、推理与规划的工程竞争。热词会继续变化, 但量产体验、导航理解和闭环验证将决定技术路线的真实价值。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0