共计 1132 个字符,预计需要花费 3 分钟才能阅读完成。
Google I/ O 之后,AI 的参照系变了
AI 的下一个 α 在哪?
📌 从“会写代码”到“能理解世界”
过去一段时间,Coding 被视为 AI 商业化最清晰的落点之一 。企业愿意为代码生成、自动化开发和智能体工具付费, 也让模型厂商看到了 Token 消耗持续增长的确定性。
但 Google 在 I /O 2026 上展示的 Gemini Omni, 指向了另一个更宽的方向: 模型不只处理文本或代码, 而是支持任意模态输入, 并生成文本、图像、音频、视频等多种输出。这意味着 AI 的能力边界, 正在从“工具型助手”扩展到“内容与交互入口”。
🔍 Gemini Omni 强调统一基座能力
根据大会展示,Gemini Omni 并不只是一个视频生成模型。其核心看点在于,Google 试图把理解、生成、编辑和对话控制放进同一套模型架构中, 而不是由多个单点模型拼接完成。
现场演示中, 用户可以通过自然语言修改视频内容 , 例如更换背景、调整镜头角度、添加旁白或音乐。相比以往依赖提示词反复“抽卡”的生成方式, 这类交互更接近指挥一个可协作的创作系统。
💡 多模态为何被重新定价
多模态模型的商业想象力, 来自更高的信息密度与更复杂的生成任务 。文本、图像、视频、音频之间的协同, 不仅能服务创作者, 也可能进入教育、营销、影视、游戏、工业设计等场景。
- 内容生产: 视频、音频与图像生成可直接嵌入创作者工作流。
- 交互方式: 用户通过对话修改复杂内容, 降低专业软件门槛。
- 模型训练: 视觉和视频数据有助于模型理解物理关系、空间结构和因果变化。
- 商业模式: 多模态 API 通常具备更高计算消耗, 也可能带来更高价值密度。
📊 国内厂商的路线分化
在国内市场, 部分大模型公司仍围绕文本、推理、长上下文和 Agent 能力展开竞争 ; 与此同时, 也有厂商选择更完整的多模态路线。材料中提到,Minimax 被多家机构关注, 原因包括文本、图像、视频、音频、音乐等能力布局较完整, 并在视频和语音生成方面已有规模化使用案例。
需要注意的是, 资本市场对厂商估值、收入预测和盈利能力的判断仍属于机构观点 , 并不等同于已经兑现的结果。对行业而言, 更值得观察的是: 全模态能力能否真正降低创作门槛, 并形成稳定、高频、可付费的应用场景。
🚀 行业观察: 下一个增长点仍需验证
Google I/O 2026 释放的信号很明确:AI 竞争正在从单一任务能力 , 转向更综合的感知、生成与交互能力。Coding 已经证明企业愿意为效率买单, 而全模态要证明的, 是用户是否愿意把更多内容生产、信息理解和创意表达交给 AI。
短期看, 模型效果、成本、版权合规和生成内容可控性仍是关键变量; 长期看, 若统一基座全模态模型持续成熟 ,AI 的主战场可能不再局限于聊天框或代码编辑器, 而会进入更广泛的内容、产业和消费场景。