共计 1163 个字符,预计需要花费 3 分钟才能阅读完成。
九月的两场产业动作, 把原本停留在学术讨论中的“世界模型”推到了中国科技产业的聚光灯下 。字节跳动基于 Seedance 开发实时空间视频生成模型, 创始人张一鸣亲自跨部门协调模型、算力与硬件资源; 京东则在 JDD 大会上发布 JoyAI-EchoWM 世界模型, 同时宣布规划建设 10 万卡国产 GPU 集群。
📌 世界模型不是“会动的大模型”
很多人把实时空间视频生成等同于“AI 视频的升级版”, 但两者的核心逻辑完全不同 。传统视频生成是“输入指令、输出片段”, 本质是内容生产工具; 而世界模型是“输入行为、输出实时空间”, 本质是交互系统。它的核心能力不是生成画面, 而是理解空间规律、预测物理变化、响应用户动作, 并持续生成连贯的视觉体验。
从技术指标看, 字节跳动正在研发的实时空间视频生成模型 , 目标端到端延迟约 50 毫秒, 生成帧率约每秒 20 帧。人类视觉感知的交互延迟阈值大约在 50 至 100 毫秒,50 毫秒意味着用户几乎感受不到画面与动作的时差。这也是过去几十年 VR 产业始终没能跨过的门槛——云端实时生成的世界模型, 相当于把渲染和计算全部放在服务器端, 终端只负责显示和采集动作, 本质上是把 VR 从“硬件设备”变成了“云服务”。
🔍 字节的“内容闭环”: 从消费端破局
张一鸣亲自协调资源的核心目的, 就是把这四条原本相对独立的业务线拧成一股绳 。这条路径的第一个支点, 是抖音庞大的内容生态和用户规模。字节没有把世界模型定位成 to B 的技术服务, 而是直接指向 C 端消费场景——互动直播、互动短剧、沉浸式游戏。用户不再是坐在屏幕前看视频, 而是走进视频里, 成为场景的一部分。
💡 京东的“产业闭环”: 让 AI 走进物理世界
围绕“世界模型入口战: 字节向左, 京东向右”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。
📊 两条路径, 一场关于入口的长期竞赛
字节有内容和用户, 但缺物理场景 ; 京东有产业和数据, 但缺 C 端入口。两家公司都在沿着自己的长板延伸, 试图用自己最擅长的领域, 定义下一代计算的规则。目前国内的世界模型还处于技术验证和场景落地的早期, 无论是字节的实时空间视频, 还是京东的物理世界仿真, 都还没有真正实现大规模商业化。
🚀 值得关注的几个重点
- 技术路线分化: 字节押注实时空间视频生成, 京东聚焦物理世界仿真, 两种路径对应不同的技术栈和商业逻辑。
- 数据壁垒: 京东的千万小时真实场景数据采集, 是纯互联网公司难以复制的产业护城河。
- 终端卡位:Pico Space Pro 的推迟发布, 暗示字节正在为世界模型适配做硬件层面的准备。
- 商业化节奏: 两条路线都尚未实现大规模商业化, 海外 Google、Meta 等巨头也在加速布局, 技术路线和商业模式都还没有定型。