腾讯混元3正式版发布:搜索能力追平顶级模型,已接入元宝、腾讯文档等产品

143次阅读
没有评论

共计 1226 个字符,预计需要花费 4 分钟才能阅读完成。

Analysis

混元 3 正式版拿了高分, 腾讯全家桶可以放心用了

腾讯混元 3 正式版终于亮相。 从公开评测和产品落地情况看 , 这次升级并非更换底层架构, 而是围绕训练数据、强化学习和真实工具调用体验做了一轮集中补强。

📌 架构延续预览版, 重点放在后训练

混元 3 正式版沿用了此前 preview 版本的基础设计: 总参数量约 295B, 推理时激活约 21B 参数, 并支持 256K 上下文窗口。官方披露的信息显示, 本次正式版没有进行结构层面的重做, 核心变化主要来自两方面: 提升后训练数据质量与多样性 , 以及扩大强化学习阶段的算力投入。

这意味着, 混元 3 正式版更像是一次面向可用性的深度打磨, 而不是单纯追求模型规模扩张。

🔍 搜索与智能体表现成为亮点

在腾讯公布的评测中, 混元 3 正式版覆盖代码、搜索、工作智能体、STEM、推理和上下文学习等多个方向 。其搜索智能体成绩最突出,BrowseComp 得分达到 84.2, 在官方对比表中处于领先位置, 并被称为追平 GPT-5.5。

代码方向上, 混元 3 在 SWE-Bench Verified、SWE-Bench Pro、Terminal-Bench 等测试中取得较高分数, 但与顶级闭源模型仍存在一定差距。STEM 和推理方面,GPQA Diamond 得分 90.4, 也显示出较强的高难度问答能力。

💡 幻觉率下降, 长对话和工具调用更稳

相比 preview 版本, 混元 3 正式版在可靠性指标上提升明显 。官方数据显示, 幻觉率由 12.5% 降至 5.4%, 常识错误率由 25.4% 降至 12.7%, 多轮问题率也从 17.4% 降至 7.9%。长对话理解基准 MRCR 则从 42.9% 提升到 75.1%。

  • 更少幻觉: 生成内容的可靠性有所增强。
  • 更强长上下文: 适合处理长文档、复杂对话和多步骤任务。
  • 工具调用更稳: 无效循环、盲目重试等问题有所减少。
  • 跨框架泛化增强: 在不同编程工具或智能体框架中表现更一致。

📊 腾讯产品开始大规模接入

模型能力最终要看落地。 混元 3 正式版已接入 WorkBuddy/CodeBuddy、元宝、ima、Marvis、QQ 浏览器、腾讯新闻、WeGame、腾讯乐享、搜狗输入法、微信公众号、微信读书、腾讯地图、腾讯文档等业务, 另有近 50 个业务排队接入。

元宝接入后同步上线 Agent 功能, 用户可以通过自然语言提出需求, 由系统交付 PPT、Word、Excel、PDF、HTML 等文件。ima 的知识库问答和 Agent 场景也已接入, 官方称其推理质量和稳定性均有提升。

🚀 开源与定价延续性价比路线

这一路线对开发者和企业用户都有吸引力。一方面, 腾讯希望通过开源和低价扩大生态 ; 另一方面, 混元 3 已深度进入腾讯内部产品矩阵, 后续能否在真实用户规模下持续稳定, 将比榜单成绩更关键。

总体来看, 混元 3 正式版的关键词是“可用性”。 它没有把故事放在参数膨胀上, 而是围绕搜索、办公智能体、长上下文和工具调用补齐短板。对于腾讯来说, 这也是大模型能力真正嵌入“全家桶”的一次重要节点。

以上为阶段性观察。
本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0