阿里云发布Qwen3.5-Omni,国产全模态大模型实现里程碑式突破

124次阅读
没有评论

共计 1546 个字符,预计需要花费 4 分钟才能阅读完成。

信息整理

阿里云发布 Qwen3.5-Omni, 全模态大战开启

加速 AGI 落地进程

国内大模型赛道再迎重磅新品。 3 月 30 日 , 阿里云通义实验室正式发布旗舰级原生全模态大模型 Qwen3.5-Omni, 这款产品不仅实现了文本、图像、音频、视频的底层语义打通, 更在多项关键能力上对标甚至超越了国际顶尖水平, 为加速 AGI(通用人工智能) 落地进程注入了新的变量。

📌 原生全模态架构, 实现“不降智”突破

与行业内常见的“拼接式”多模态方案不同,Qwen3.5-Omni 采用了原生端到端架构。该模型基于超过 1 亿小时的音视频数据进行预训练, 直接从底层打通了文本、图像、音频、视频的语义逻辑, 从而彻底解决了多模态信息在传递过程中常见的损耗与延迟问题。

官方数据显示,该模型在音频及音视频分析、推理、对话、翻译等 30 多项国际权威基准测试中 , 共取得了 215 项 SOTA(最先进水平) 成绩。其通用音频理解能力已全面超越谷歌的 Gemini-3.1 Pro, 音视频理解能力与之持平, 同时文本和视觉能力也保持了同尺寸单模态模型的水准, 实现了业界长期追求的“全模态不降智”目标。

🔍 核心能力与产品矩阵

在具体能力配置上,Qwen3.5-Omni 系列提供了 Plus、Flash、Light 三种不同尺寸的 Instruct 版本, 以灵活适配从企业级复杂场景到端侧轻量化应用的全场景需求。

  • 处理能力:支持 256k 超长上下文, 可处理超过 10 小时的音频输入与 400 秒的 720P 音视频输入。
  • 多语言支持:原生支持 113 种语种和方言的语音识别, 以及 36 种语种的语音生成。
  • 新增功能:具备语义打断、音色克隆、复杂工具调用等新能力。

一个值得关注的亮点是,模型未经专门训练便自然涌现出“Audio-Visual Vibe Coding”能力, 能够根据音视频指令直接生成可运行的代码, 实现了从“感知理解”到“执行落地”的能力跨越。

同步上线的还有配套的实时 API 服务。该服务基于 WebSocket 协议实现低延迟流式交互, 并内置 VAD 语音活动检测功能, 可自动识别用户语音的起止节点, 为开发者提供了开箱即用的全模态能力接口。

💡 战略落子与市场格局

此次发布是阿里巴巴将 AI 业务升级为集团战略核心、统一“千问”品牌后的首个旗舰级全模态产品,标志着其全栈 AI 布局进入了技术落地与生态扩张的新阶段。

市场数据印证了其战略成效。根据相关报告,2025 年下半年, 中国企业级大模型日均调用量飙升至 37.0 万亿 tokens, 其中阿里云千问的市场占比跃升至 32.1%, 稳居国内企业级大模型市场首位。阿里 AI 相关产品收入已连续 10 个季度实现三位数同比增长。

以 Qwen 系列为核心的 MaaS(模型即服务)业务, 被定位为未来五年云和 AI 营收增长的核心关键。

极具普惠性的定价策略成为其抢占市场的核心抓手之一。模型 API 输入价格每千 Token 仅 0.0016 元, 同时为开发者提供了开通后 180 天内各 100 万 Token 的免费额度, 大幅降低了全模态能力的应用门槛。

从行业格局看,中国大模型市场已从“百模大战”进入头部厂商比拼生态与服务能力的新阶段。阿里云千问与字节豆包、DeepSeek 等共同组成了行业第一梯队, 竞争焦点也从单一的文本对话能力, 全面升级为多模态理解与场景落地能力。

📊 三重价值与行业影响

Qwen3.5-Omni 的突破为中国 AI 产业带来了三重核心价值与市场机会:

🚀 面临的挑战与未来展望

对于阿里云而言,这款模型巩固了其在国内 AI 赛道的头部地位, 也为云计算业务带来了新的增长引擎。对于整个国内 AI 产业, 这次突破打破了国际厂商在全模态领域的技术优势, 为全球竞争赢得了更多话语权。未来, 随着技术持续迭代与场景不断落地, 全模态大模型有望真正融入千行百业, 成为数字经济时代的核心基础设施。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0