Opus 5.2 与 Gemini 4 Pro 未经官宣上线,前沿模型发布流程正在被压缩

4次阅读
没有评论

共计 1265 个字符,预计需要花费 4 分钟才能阅读完成。

Analysis

Opus 5.2 与 Gemini 4 Pro 未经官宣已上线, 前沿模型的发布流程正在被压缩

没有发布会, 也没有官方公告 。过去两周,Anthropic 与谷歌先后把尚未命名的新模型投入真实流量, 硅谷的模型竞赛以一种更安静、也更激进的方式展开。

📌 事件概览: 三家都没有开发布会

9 月 17 日晚,Anthropic 一度切断灰度通道 , 一批原本被路由至新模型的账号归零, 随后通道恢复, 覆盖范围从 Claude Code 扩大到 Chat 和 Cowork。开发者抓取接口请求后发现, 后端模型标识已指向 Opus 5.2, 而前端仍显示 Opus 5。

几乎同一时间, 谷歌的下一代旗舰被发现在第三方盲测平台 Arena 上以旧版本号出现。抽到该模型的用户注意到, 它绘制的鹈鹕带有完整蹬踏动作, 生成 PS5 矢量图需十分钟、输出数千行代码。社区随后判断, 这是内部代号 Argon 的 Gemini 4 Pro

🔍 核心信息: 灰度路由取代正式发布

三家的做法并不相同:

  • Anthropic 采用后端路由, 前端仍显示旧名称, 普通用户无从察觉;
  • 谷歌 在第三方盲测平台沿用旧版本号, 以降低外界关注;
  • OpenAI 在 Astra 发布后未再公开发声, 公开议题转向对手之间的对比。

对厂商而言, 收益相当直接: 模型在尚未正式命名的阶段即可获得真实负载下的表现数据 , 一旦出现问题可以随时回退, 无需承担公开发布失败的风险。灰度路由的算力投入也远低于全量发布——新模型混入旧模型流量, 厂商可以控制被路由的请求比例。

💡 为什么放弃发布会环节

比成本更难处理的是容错。6 月 Fable 5 与 Mythos 5 发布后, 美国商务部下发出口管制指令, 要求暂停向任何外籍人士提供这两个模型。由于无法实时核验用户国籍,Anthropic 将模型对全球用户下线, 直到 7 月 1 日才恢复访问。一次全量发布, 换来一次全量下架。

此后, 团队再做发布, 都会倾向先小范围释放、观察反馈。口碑的影响也更难量化: 用户调用的是 Opus 5, 实际得到的是 5.2, 体验改善明显, 却难以归因。

📊 影响与看点: 基准测试的争议

灰测期间流传较广的一种说法, 是“Fable 5.2 在最高推理档位下碾压 GPT-6 Astra”。这一说法需要分两层看: 它来自开发者的个人对比测试, 且该开发者同时指出代价是更慢、更贵。

另一层背景是,OpenAI 发布 Astra 时主推的 ARC-AGI-3 得分 99.9%, 取自 OpenAI 自行配置的 harness; 换用行业标准 harness 测同一个模型, 得分降至 62.7%, 相差 37 个百分点。

🚀 总结: 三个时间节点值得关注

从 9 月 3 日 GPT-6 Astra 发布, 到 9 月 14 日 Anthropic 接入下一代模型, 再到 9 月 17 日谷歌跟进, 间隔只有十四天。接下来有三个时间节点可供确认:

  • Opus 5.2 最快 9 月底、最晚 10 月底全面开放;
  • Gemini 4 Pro 预计 10 月正式发布;
  • OpenAI 是否会推出新模型, 回应这一次“被灰测超越”。

截至目前,Opus 5.2 与 Gemini 4 Pro 均无模型卡、API 标识和定价信息, 三家公司都尚未正式表态。

以上为阶段性观察。
本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码