共计 1493 个字符,预计需要花费 4 分钟才能阅读完成。
谷歌推出了个“做题家”:Gemini 4 Argon 屠榜, 但干活差点意思
谷歌新一代旗舰模型终于落地, 但它没叫 Gemini 4 Pro, 而是取名 Gemini 4 Argon。这是谷歌时隔近十个月推出的旗舰, 也是它试图重回第一梯队的一次表态。
📌 旗舰改名, 谷歌先要解决“掉队”问题
2026 年 2 月, 谷歌只推出 Gemini 3.1 Pro 的小幅更新, 原定 6 月发布的 Gemini 3.5 Pro 因多文件代码重构、自主 Agent 执行等任务表现不达标而延期。7 月延期消息传出当天,Alphabet 股价一度下挫 4%。8 月 DeepMind 迎来高层调整, 哈萨比斯转任 Alphabet 首席科学家, 科雷·卡武克丘奥卢接掌 DeepMind。
从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。
空窗期里, 谷歌主要靠 Flash 系列维持存在感, 并启动面向网络安全的 Fairwind 计划。至于 Pro 这块招牌为何被弃用, 谷歌的说法是希望用“元素命名法”区分旗舰与轻量 Flash 系列;Argon 即氩, 化学性质稳定、极少参与反应。
🔍 18 项基准拿下 12 项第一, 短板同样明显
在谷歌公布的 18 项基准测试中 ,Argon 取得 12 项第一、1 项并列第一。长程软件工程测试 DeepSWE v1.1 得分 77.9%, 刷新纪录; 知识工作 Vals Index 为 68.9%;Zapier 业务自动化测试 AutomationBench 为 51.3%; 法律任务 Harvey Legal Agent 拿到 19.6%, 约为 GPT-6 Astra 的四倍。
- 长视频理解 LVBench:91.7%
- 长上下文图检索 GraphWalks:84.2%
- Gray Swan 提示注入测试中攻击成功率仅 0.7%, 为参测模型最低
但它在需要持续操作与执行的场景中落后:FrontierSWE v2 得分 55.0%, 比 Astra 低 10.5 个百分点;Terminal-Bench 4.0 为 57.4%, 不敌 Opus 5.5 的 66.4%。“会做题”和“能干活”之间, 仍有距离。
💡 幻觉率低、定价低, 独立评测尚未跟上
在 AA-Omniscience 测试中,Argon 答错的问题里只有 15% 给出了错误答案, 其余选择承认不知道, 低于 Astra 的 45% 至 51%。价格上, 尝鲜期每百万输入 token 收费 2 美元、输出 10 美元, 缓存命中的输入降至 0.10 美元; 尝鲜期结束后恢复为 4 美元和 20 美元, 与 Opus 5.5 持平。
不过, 目前只有 Fairwind 计划中的网络安全防御人员能够使用它, 其自报成绩也遭遇质疑, 有外媒称部分试用过的谷歌员工认为分数高于实际表现。在 Artificial Analysis 的智能指数中,Argon 得分 53 分, 与 Astra、Claude Fable 5.1 同分, 低于 Opus 5.5。
📊 看点: 谷歌先把它用在内部“干活”
谷歌称 Argon 已在内部投入使用 , 包括帮助量子计算团队把时空开销较已发表基线降低 40%、分析跨数据中心性能数据并释放超过 300 TiB 内存, 以及将 re2、libgav1 和 80 万行的 Fuchsia OS Zircon 内核代码从 C/C++ 迁移到 Rust。
围绕“谷歌推出了个“做题家”:Gemini 4 Argon 屠榜”, 这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看, 核心结论是趋势已较为明确, 但细节仍需结合后续进展持续观察。
🚀 总结
Argon 证明谷歌在知识工作赛道重新具备竞争力 , 也把安全监控和低幻觉率当作卖点。但 Agent 执行能力与真实使用体验, 才是决定用户是否愿意继续买单的关键。