共计 1278 个字符,预计需要花费 4 分钟才能阅读完成。
阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文
建议按 ” 变化—原因—影响 ” 的顺序阅读。
8 月 12 日深夜,阿里云魔搭 ModelScope 社区宣布, 阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重。这是 Qwen-Max 级别模型首次向公众开源, 意味着顶尖大模型的核心能力开始走向开放, 对 AI 开发者和企业用户而言, 无疑是一个重要信号。
📌 模型核心参数:2.4T 总参数, 激活 95B
Qwen3.8-2.4T-A95B 采用混合专家 (MoE) 架构,总参数量高达 2.4 万亿, 但每个 Token 仅激活 95 亿参数, 兼顾了模型容量与推理效率。每个 MoE 层包含 512 个专家, 每个 Token 选择 10 个路由专家, 并额外激活 1 个共享专家, 这种设计在保证性能的同时, 降低了计算成本。
🔍 上下文长度与多步预测能力
该模型原生支持 262,144 Token(约 256K)的上下文窗口 , 并可扩展至 1,010,000 Token(约 1M), 能够处理超长文档、复杂代码库等场景。此外, 模型还经过多步 MTP(Multi-Token Prediction) 训练, 支持推理引擎一次预测多个后续 Token, 提升生成速度和连贯性。
💡 应用场景与评测表现
Qwen3.8 延续了 Qwen3.5 的混合架构,重点强化了编程、办公、科研和长周期 Agent 任务的端到端完成能力。官方公布的评测覆盖编程 Agent、通用 Agent、专业工作和长上下文等方向, 与 Opus 4.8、Fable 5、GPT 5.6 Sol 等主流模型相比, 各项结果互有高低, 在 PaperBench、IFBench 等基准测试中取得了较高成绩。
📊 后训练策略: 三大环节提升 Agent 能力
官方介绍称,Qwen3.8-Max 的办公与 Agent 后训练分为三个关键环节:
- 持续扩展真实环境: 在任务、工作空间、Harness 三个维度上解耦, 环境数量可组合式增长, 而非依赖定制化集成。
- 统一奖励系统: 将基于执行的校验、文本及视觉输出的 rubric 评估、agentic 检查统一在一个奖励系统中, 提供一致可靠的奖励信号。
- 在线数据均衡器: 重构每个 batch, 使任务、难度、工作区与 harness 分布均衡, 降低梯度方差, 支持强化学习稳定扩展。
🚀 行业观察: 开源策略的深远影响
此次开源是阿里在 AI 领域的重要布局。Qwen-Max 级别的模型权重开放, 意味着中小企业和个人开发者也能基于顶尖模型进行微调和部署, 降低 AI 应用的门槛。同时, 这也加剧了开源大模型与闭源模型的竞争, 推动整个行业的技术进步。
值得注意的是, 官方云端版 Qwen3.8-Max 基于该开放权重模型, 并加入了更多生产环境能力, 这显示了阿里在开源与商业化之间的平衡策略。
🧭 总结
Qwen3.8-2.4T-A95B 的开源,不仅展示了阿里在 MoE 架构和长上下文处理上的技术积累, 也为其生态建设注入了新动力。对于开发者而言, 这是一个值得深入研究的模型; 对于行业而言, 这预示着大模型竞争进入新阶段。未来, 我们有望看到更多基于该模型的创新应用涌现。