共计 1298 个字符,预计需要花费 4 分钟才能阅读完成。
蚂蚁集团百灵开源 Ling-3.0-flash 模型:124B 总参数、5.1B 激活参数
蚂蚁集团百灵大模型迎来一次重要开源更新。 新一代原生混合推理模型 Ling-3.0-flash 已正式开放, 核心卖点集中在 MoE 架构、低激活参数、较低调用成本以及多种部署路径上。
📌 124B 总参数, 主打高效 MoE 架构
根据百灵大模型官方公布的信息,Ling-3.0-flash 采用 MoE 架构, 模型总参数规模为 124B, 但单次推理激活参数为 5.1B。这意味着它并非在每次请求中调用全部参数, 而是通过稀疏激活方式在性能与计算开销之间取得平衡。
此次开源并不只提供单一形态。 官方同步放出了基础版本 , 以及 FP8、FP4、INT4 等不同精度版本, 方便开发者根据硬件条件、成本预算和业务场景进行取舍。
对企业和开发者来说, 这类模型的关键不只在“参数规模”, 更在于能否以可承受的成本接入真实应用。
🔍 三种落地方式覆盖不同使用场景
从官方介绍看,Ling-3.0-flash 的部署路径被划分为三类: 快速 API 接入、单机私有化部署, 以及面向高并发或低时延需求的高性能部署。
- API 调用: 适合希望尽快验证产品、接入 Agent 应用, 但不想自建推理服务的团队。
- 单机私有化: 面向对数据出域较敏感的企业,MXFP4 与 INT4 版本可在单台 NVIDIA DGX Spark 上完成端到端推理。
- 高性能部署: 针对单请求时延敏感的服务, 在指定 GPU 测试配置下, 平均输出速率突破 1100 tokens/s。
这种分层提供方式降低了模型试用门槛, 也让不同规模的团队可以从轻量验证逐步过渡到生产部署。
💡 速度与成本数据成为主要看点
在 Artificial Analysis 榜单中,Ling-3.0-flash 的输出速度达到 353 tokens/s。对于需要进行长文本生成、代码辅助或多轮 Agent 调用的应用来说, 输出速度会直接影响交互体验。
成本方面, 在 AA Intelligence Index 榜单中, 该模型每项任务的加权平均调用成本约为 0.04 美元, 按报道中的汇率折算约为 0.27 元人民币; 加权平均解码时间约为 1.4 分钟。官方信息显示, 它同时进入“智能水平—任务成本”和“智能水平—任务耗时”的优势区域。
需要注意的是, 榜单测试结果通常与测试环境、任务集和调用方式有关 , 实际业务表现仍需结合具体场景验证。
📊 限时优惠与开源生态信号
官方还公布了 Ling Studio 的阶段性优惠安排:2026 年 8 月 7 日 00:00 至 8 月 31 日 24:00,Ling-3.0-flash 享受 2.5 折优惠; 自 9 月 1 日 00:00 起恢复原价。
从行业角度看, 国内大模型厂商正在加快“开源模型 + 云端 API + 私有化版本”的组合打法。一方面, 开源有助于扩大开发者生态; 另一方面,API 与部署服务仍能承接商业化需求。
🚀 总结: 更适合快速验证与成本敏感场景
整体来看,Ling-3.0-flash 的定位并不是单纯追求参数规模, 而是强调推理效率、部署弹性和成本控制。对于希望快速上线 AI 应用、构建 Agent 工作流, 或需要在本地环境处理数据的团队来说, 它提供了一个新的可选方案。