共计 1221 个字符,预计需要花费 4 分钟才能阅读完成。
当 AI 开始生成“世界”, 影音游内容正在被颠覆。
芯片厂商 AMD 以 82 亿美元全股票交易收购世界模型公司 World Labs。这家由李飞飞参与创办、成立仅两年的团队, 为何值这个价? 答案或许不在它今天的模型能力, 而在 AMD 对下一代算力需求的提前判断。
📌 AMD 到底买下了什么
AMD 在收购公告中的表述颇值得玩味:World Labs 的模型经验 , 将帮助 AMD 更深入理解工作负载如何演变, 进而塑造未来的技术路线图。换言之, 芯片公司买的不是一款产品, 而是对“下一个时代算力长什么样”的判断力。
类似逻辑此前也有先例——2016 年,黄仁勋亲自向 OpenAI 交付第一台 DGX-1; 而到 2025 年 1 月, 英伟达已经发布 Cosmos 世界基础模型平台。
🔍 概念尚未统一, 路线已经分岔
“世界模型”并非新词。1943 年, 心理学家 Kenneth Craik 就提出, 人脑会在内部建立外部世界的“小规模模型”用以预测。2018 年,David Ha 与 Jürgen Schmidhuber 在论文《World Models》中把它引入人工智能, 并给出“观察—预测—行动”的简洁框架。
但直到今天, 它仍缺少公认定义。李飞飞将其按功能拆成三类:
- 渲染器: 输出像素供人眼观看, 文生视频是代表;
- 模拟器: 输出世界状态, 是连接渲染与规划的结构骨架, 却最容易被忽视;
- 规划器: 回答智能体下一步该做什么, 仍处萌芽。
杨立昆则持不同看法。他认为生成视频不等于理解世界 ,“合理的可能情况有无穷多种”, 因此主张世界模型应在抽象空间中工作, 走联合嵌入预测架构(JEPA) 路线。
大语言模型仍是黑暗中的文字匠人: 能言善辩, 却缺乏经验; 知识渊博, 却脱离现实。——李飞飞
💡 巨头之间的取舍
路线分歧背后是资源分配。2025 年 11 月, 杨立昆离开 Meta 并创立 AMI Labs, 延续 JEPA 方向;Meta 则把更多资源压向大语言模型与超级智能。谷歌仍在加注,DeepMind 于 2025 年 8 月发布 Genie 3, 可由单条文本提示生成可交互、可游玩的环境。
📊 内容产业会被怎样改写
World Labs 近期发布的 Atlas, 试图仅凭少量 2D 图像重建真实空间并预测未观测视角, 可用于机器人、娱乐场景生成、房地产与设计。如果文生视频是“生成一个镜头”, 那么 Genie 3 这类尝试更接近“生成一个可以进入的世界”——它支持 24fps 运行并维持数分钟一致性。
据彭博社报道,字节跳动也在基于 Seedance 探索实时空间视频生成, 目标是一个能随用户声音与动作实时变化的虚拟环境, 潜在场景包括直播、短剧和游戏。
- 内容单位可能从“一部片”变成“一个可进入的世界”;
- 互动性与持续运行, 或成为新的产品指标;
- 机器人与内容生产的边界会进一步模糊。
🚀 总结
世界模型距离成熟还有一段距离,商业化路径也未清晰 。但 AMD 的 82 亿美元说明, 巨头愿意为“看清下一轮算力需求”支付溢价。谁能先回答“AI 如何理解物理世界”, 谁就可能握住下一阶段内容与硬件的入口。