领导层洗牌后,Argon能否助谷歌重回前沿?

3次阅读
没有评论

共计 1530 个字符,预计需要花费 4 分钟才能阅读完成。

编辑导读

领导层洗牌后,Argon 能否助谷歌重回前沿?

建议按 ” 变化—原因—影响 ” 的顺序阅读。

谷歌 DeepMind 于 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon, 距离上代旗舰 Gemini 3 亮相已近十个月。对头部实验室而言, 这样的沉默近乎一场豪赌, 而筹码早在两个月前就被重新洗过一遍。

📌 先换人, 再出牌: 一场静悄悄的权力交接

2026 年 8 月 5 日,Alphabet CEO 皮查伊通过内部信宣布架构调整:DeepMind 联合创始人兼 CEO 哈萨比斯卸下日常运营职责, 转任董事长及 Alphabet 首席科学家;CTO 卡武克丘奥卢升任 DeepMind 高级副总裁, 直接向皮查伊汇报; 工作 27 年的首席科学家杰夫·迪恩离职创业。

哈萨比斯从 AlphaGo 到 AlphaFold 几乎等同于 DeepMind 的公众形象,把他从日常管理中解放 , 指向的是 AGI 长期战略; 工程出身的卡武克丘奥卢掌舵运营, 意味着 交付能力被摆到比探索自由度更靠前的位置。多家媒体分析认为, 权力正从伦敦向加州转移,DeepMind 被更深地整合进谷歌产品体系, 代价是自主权削弱。

🔍 Argon 的牌面: 赢在哪里

谷歌称 Argon 在 19 项基准中拿下 13 项领先。DeepSWE v1.1 上取得 77.9%, 高于 Claude Opus 5.5 的 74.2% 与 GPT-6 Astra 的 74.1%; 在 AutomationBench 上以 51.3% 居首。

更关键的是输出 Token 上限从 6.4 万提升到 100 万。输出上限不同于上下文窗口, 决定的是单次推理能生成多长内容, 对大型代码库迁移、深度研究、多步骤企业流程具有结构性意义。谷歌披露,Argon 参与了 Fuchsia Zircon 内核超 80 万行 C /C++ 代码向 Rust 的迁移, 并在 libgav1 项目重写约 3.2 万行 SIMD 代码, 速度达原版 2.7 倍。

  • 推广期定价: 每百万输入 Token 2 美元、每百万输出 Token 10 美元。
  • 缓存输入价格比标准输入低 95%, 单任务成本测算比 GPT-6 Astra 低约四成。

💡 裂缝同样清晰

在 FrontierSWE v2 与 Terminal-Bench Science 0.1 上,GPT-6 Astra 领先 Argon 超过 10 个百分点;Terminal-bench 4.0 上 Claude Opus 5.5 以 66.4% 领先其 57.4%。有评论认为,Argon 缩小了差距, 却未取得明显领先。

彭博社在发布当天报道称,部分谷歌员工质疑其实际编程表现, 前端设计等场景短板明显。Argon 在 DeepSWE v1.1 为 77.9%, 在更接近真实工程复杂度的 FrontierSWE v2 仅 55.0%, 与 GPT-6 Astra 的 65.5% 相差超 10 个百分点。目前 Argon 仅通过 Fairwind 计划向受信任的网络安全防御者开放, 普通开发者仍在等待。

📊 行业观察: 分发优势要用“够好”来兑现

2025 年 11 月 Gemini 3 发布后一度被视为转折点,2026 年 5 月 I / O 大会承诺 6 月发布的 Gemini 3.5 Pro 最终搁置, 有分析师估算该级别模型单次训练开销最高可达 4 亿美元。同期 Anthropic 与 OpenAI 交替领先, 没有一方能保持超过一个季度的优势。

谷歌的独特优势是超十亿用户的产品矩阵,Gemini 应用月活已破 9.5 亿, 但分发只有在模型“够好”时才成立。Argon 没有追求全能冠军, 而是聚焦企业知识工作、软件工程与网络安全, 在 CWE-bench v1 漏洞修复评测中以 68% 并列第一。

🚀 总结: 更像一张入场券

Argon 证明谷歌仍能训练前沿模型,也证明新架构能在较短时间内交出产品。但内部争议、关键基准落后与分阶段开放说明, 它不是“一锤定音”的作品, 而是一张重回牌桌的入场券。真正的考验, 在发布之后。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码