共计 1030 个字符,预计需要花费 3 分钟才能阅读完成。
智能驾驶的技术叙事正在换挡。过去一年, 世界模型、VLA、原生多模态频繁出现在发布会和论文中, 但把车企简单分成不同阵营, 反而容易遮蔽真正的问题: 下一代智驾系统究竟要如何理解环境、预演未来, 并把判断转化为可执行动作。
📌 概念边界并没有外界想象得清楚
外界常将华为、蔚来归为世界模型路线,将小鹏、理想归为 VLA 路线。但从公开研究看, 这种分类并不严谨。理想有论文研究世界模型, 小鹏对外强调 VLA, 内部也出现预测式世界模型、生成式世界模型等相关团队。也就是说, 世界模型与 VLA 并非互斥标签, 而是可能在同一套自动驾驶架构中交叉出现。
从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。
🔍 真正分歧是“未来”要被压缩到什么程度
自动驾驶需要提前判断周围车辆、道路结构和自车动作的变化,但模型不一定要生成逼真的未来画面。分歧正在于: 系统应保留多少细节, 才能既理解世界, 又不拖慢车端运行。
- 小鹏 更强调抽象表达, 将未来状态压缩为较少词元或结构化信息。
- 小米 关注视频生成器内部表征, 试图减少生成与规划之间的断层。
- 理想 倾向在隐空间中预测未来, 避免直接生成真实图像带来的高计算成本。
- 华为相关研究 尝试用离散词元表达未来动力学, 并区分自车与环境变化。
💡 论文交锋背后是工程取舍
几家公司的论文彼此之间已有明显回应: 有人认为生成和规划分开会留下鸿沟,有人批评像素级生成带来冗余算力开销, 也有人担心把世界模型串在策略模型前会增加车端时延。这些争论并不是否定“预测未来”本身, 而是在讨论预测应以何种形式接入规划。
BEV 也是分歧点之一。有方案把 BEV 作为抽象世界的底板, 也有研究认为其几何约束可能限制时空特征交互。哪种方式更适合量产, 仍需要道路表现和长期数据验证。
📊 量产体验还绕不开导航理解
相比架构名称,用户更容易感受到的问题是: 系统会开车, 却可能走错路。公开实验显示, 一些端到端模型即使接入导航信息, 规划结果也未必明显受其影响。原因可能在于模型拿到的只是左转、直行、右转等离散指令, 难以理解提前选道、主辅路切换和复杂路口通行之间的因果关系。
🚀 总结: 竞争将回到可验证能力
世界模型与 VLA 之争,本质不是名词之争, 而是智能驾驶系统如何在有限算力、带宽和时延约束下完成感知、推理与规划的工程竞争。热词会继续变化, 但量产体验、导航理解和闭环验证将决定技术路线的真实价值。