Sora关停背后:智象未来CTO谈世界模型的“轮回”终局与创业公司生存之道

114次阅读
没有评论

共计 1449 个字符,预计需要花费 4 分钟才能阅读完成。

编辑导读

对话智象未来 CTO 姚霆: 当 Sora 退场后, 世界模型的终局是 ” 轮回 ”

建议按 ” 变化—原因—影响 ” 的顺序阅读。

近日,OpenAI 宣布将 Sora 的独立服务关停, 视频生成功能并入 ChatGPT 付费体系 , 这一变动在 AI 视频生成领域激起不小波澜。Sora 的退场是否意味着通用视频生成技术的商业化困境? 多模态大模型的未来又将走向何方? 智象未来联合创始人兼 CTO 姚霆在接受采访时给出了他的观察与思考。

📌 Sora 关停: 好技术不等于好生意

在姚霆看来,Sora 的退场并非偶然 , 而是通用视频生成这门“好技术”在商业化面前的必然结局。他分析指出,Sora 的“失败”可以从三个维度理解:

从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。

  • 需求脱节 :Sora 致力于通用视频生成, 但与垂直领域的应用需求相对脱离。OpenAI 本身缺乏视频相关业务生态, 难以将技术能力转化为实际场景。
  • 成本压力 : 当前 AI 服务上线背后都在跑 GPU, 推理成本昂贵。模型架构设计必须优先考虑成本, 否则难以支撑大规模服务。
  • 商业化土壤缺失 : 对比字节跳动的 Seedance 和快手的可灵, 这些公司的视频生成产品能与主营业务形成协同, 而 OpenAI 缺乏这样的业务场景承接技术。

这一差异也折射出国内外视频生成路线的不同: 国外更看重模型架构创新, 国内则倾向于做大而全的平台链路 。姚霆表示, 智象未来作为技术出身的团队, 既追求模型架构创新, 也坚持以垂直领域商业化作为导向。

🔍 世界模型的五个等级: 从静态复刻到“轮回”

世界模型的概念在过去一年经历了剧烈收敛, 成为多数大模型企业讲述的故事 。姚霆将世界模型的发展分为五个等级:

  1. 静态复刻 : 即一幅图, 是最基础的形态。
  2. 视频 : 加入三维和时间域, 形成动态表达。
  3. 交互 : 模型能够与用户进行互动。
  4. 物理规律与因果关系 : 融入真实世界的物理规则和因果逻辑。
  5. 轮回 : 终局是完美的因果关系, 如蝴蝶效应般实现精准推理。

姚霆强调, 世界模型的底座需要基于全模态架构 , 实现文本、图像、视频、3D、动作的统一理解和生成。“如果不跟物理世界打通, 凭什么叫世界模型?”他反问道。最终的形态应是任意输入、任意输出, 用户想怎么输入, 模型就能输出什么。

💡 创业公司的生存策略: 认知、速度与灵活架构

面对快手可灵月收入突破两千万美元、字节跳动生态日活过亿的双寡头格局, 智象未来这样的创业公司如何找到出路? 姚霆分享了三点关键策略:

  • 认知要新 : 需要对行业趋势有充分预判, 不能等大厂做到再复制。同时要坚持做正确但很难的事情, 比如智象的产品经理必须掌握 AI 辅助编程 (vibe-coding)。
  • 速度要快 :AI 产品的稳定版本标准是“用户用两次能成功得到一次想要的结果”。快速上线、收集反馈、持续迭代, 才能形成竞争壁垒。

📊 智象未来的“1+1+3”架构体系

姚霆将这一逻辑比作搜索引擎:“当年做搜索引擎, 下面有众多网页 ; 今天网页变成 skills, 如何在海量技能中寻找、定位、编排, 这是核心问题。”全模态底座的价值在于, 只要建一套索引就能解决所有模态的事情, 无论用户输入什么, 都能给出最终结果。

🚀 行业观察: 技术、商业与生态的平衡

对于创业公司而言, 在大厂环伺下找到差异化路径至关重要 。智象未来选择以全模态底座为核心, 聚焦垂直领域 Agent, 或许代表了中国 AIGC 创业公司在多模态赛道上的一种生存策略。姚霆最后总结道:“AI 时代, 机会是相对平等的。但关键在于能否坚持做正确的事, 并以足够快的速度将其落地。”

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0