共计 1081 个字符,预计需要花费 3 分钟才能阅读完成。
独家对话银河通用张直政: 我们找到了 VLA 和世界模型的融合之路
具身智能的路线之争,正在出现新的融合方案 。 银河通用近期公开的 LDA(Latent Dynamics Action Model)尝试把 VLA 与世界模型放进同一套训练框架中, 让机器人既学习“该怎么做”, 也理解“环境会如何变化”。
📌 LDA 要解决的不是单一路线问题
在当前具身智能讨论中,VLA 通常被视为直接从视觉、语言到动作的策略模型, 世界模型则更强调对环境状态变化的预测。银河通用联合创始人兼大模型负责人张直政的判断是, 两者并非必须对立。
按照他的解释,LDA 的核心是构建一个统一隐空间, 把动作生成和环境演化建模放在一起训练。也就是说, 模型不仅要回答“机器人应该输出什么动作”, 还要评估“这个动作之后世界会怎样变化”。
🔍 四类任务被放进同一训练框架
材料显示,LDA 将前向动力学、逆向动力学、策略学习和视觉预测四类任务统一建模。这样做的目标, 是让模型在同一个表示空间中区分哪些环境变化与动作相关, 哪些变化只是背景扰动。
以网球为例,仅预测球的轨迹并不足够; 如果模型不知道该用怎样的挥拍动作改变球的落点, 就无法完成任务。反过来, 如果只学习动作而不理解来球变化, 也很难产生稳定策略。
- 前向动力学:给定当前状态和动作, 预测下一状态。
- 逆向动力学:根据状态变化反推动作关系。
- 策略学习:面向目标输出机器人动作。
- 视觉预测:理解环境随时间的变化趋势。
💡 低质量、无标注与失败数据也有价值
传统机器人训练往往依赖高质量、成功示范数据,但这类数据采集成本高, 且覆盖场景有限。张直政认为, 失败数据同样关键, 因为模型需要知道不同动作会导致什么后果。
例如打球时,拍子抬得过高和过低都可能接不到球, 但它们代表不同失败类型。只有把这些具有代表性的失败样本纳入训练, 模型才可能形成更强的泛化判断。
在 LDA 的思路中,高质量动作数据更适合用于策略学习, 而有噪声、无动作标注甚至质量较低的数据, 也可以用于学习环境状态转移。这意味着, 行业对昂贵标注数据和成功数据的依赖有望下降。
📊 AstraData 数据金字塔与商业化指向
- 可能降低新机器人本体适配成本;
- 有助于零售、仓储等场景的技能迁移;
- 让多来源具身数据获得更充分利用;
- 开源代码有利于推动外部验证与行业共建。
🚀 行业观察: 具身 GPT 时刻仍取决于落地闭环
围绕“独家对话银河通用张直政: 我们找到了 VLA 和世界模型的融合”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。