共计 1477 个字符,预计需要花费 4 分钟才能阅读完成。
对 Anthropic 贴脸开大: 智谱 GLM-5.2 凭什么杀入世界编程三强?
六月的 AI 圈迎来了一场戏剧性对决:Anthropic 的 Fable 5 因美国商务部禁令关停 , 而智谱在同一天全量开放 GLM-5.2, 并喊出“前沿智能属于所有人”。这场“贴脸开大”不仅让智谱港股市值突破万亿港元, 更让中国开源模型首次跻身世界编程模型“御三家”。GLM-5.2 凭什么杀入三强? 我们拆解其核心能力。
📌 从“御三家”到“三足鼎立”:GLM-5.2 的代码实力
- 重点: 对 Anthropic 贴脸开大: 智谱 GLM-5.2 凭什么杀入世界编程三强?
- 重点: 当前公开信息主要集中在产品、策略或节奏变化上。
- 重点: 后续仍需关注官方更新、落地范围以及实际反馈。
过去,AI 编程领域的顶级模型被 Claude、OpenAI 和谷歌垄断。 但 GLM-5.2 的出现打破了这一格局 。在汇集全球百万用户盲测的 Code Arena 上,GLM-5.2 以 1595 分排名总榜第二, 仅次于已不可用的 Fable 5, 成为所有当前可用模型中的“现役最强”。Artificial Analysis 智能指数 v4.1 将其评定为 51 分, 直接置于 GPT-5.5 与 Opus 4.8 之间——这是开源模型首次杀入这个区间。
在更考验工程能力的 FrontierSWE 长程编程基准上,GLM-5.2 得分 74.4, 与 Opus 4.8 的 75.1 差距不到 1 个百分点, 同时超越 GPT-5.5 的 72.6。专测 Agent 训练能力的 PostTrainBench 上, 它也位列第二, 仅次于 Opus 4.8。谷歌的 Gemini 因此被挤出“御三家”, 如今是 Claude、OpenAI 和智谱三足鼎立。
🔍 长上下文革命:1M token 让 AI 从“会写代码”到“能做工程”
单次输出能力的差距正在被抹平, 真正拉开档次的是长时间干活的可靠性 。GLM-5.2 这次最大的升级, 是将上下文窗口拉到了 1M token。这意味着你可以把整个项目代码库、技术文档、需求说明一次性喂进去, 模型不仅能吃下, 还能记住。
实际测试中,GLM-5.2 一次性承接了一个完整的全栈应用开发任务: 从开发、联调、测试到打包上线 , 全程自主完成, 最终交付了覆盖网页端、移动端与小程序的完整应用。整个任务处理超过 88 万 tokens, 几乎用满 1M 窗口。而过去这样体量的工程通常需要团队协作数周。短上下文模型在执行后半段时, 最初的需求细节早已被压缩丢弃, 只能输出零散代码片段, 无法整合出可交付产品。长上下文让 AI Coding 从“会写一段代码”进化到“能做一段工程”。
💡 参数更小, 反而更靠谱: 低幻觉率的秘密
例如, 让 DeepSeek V4 Pro 和 GLM-5.2 分别设计一个技术上不可能的任务——在单线程中执行多路复用 I / O 而从不暂停 。DeepSeek 花了 3 分 52 秒生成了一份结构精美但完全错误的代码;GLM-5.2 只用了 12 秒, 直接指出需求不可行。更大的参数和更长的推理时间, 并不必然带来更好的判断力, 反而让模型更不愿意承认自己不知道。
📊 成本优势与定价策略: 物超所值的“完成任务”付费
围绕“对 Anthropic 贴脸开大: 智谱 GLM-5.2 凭什么杀”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。
🚀 行业影响: 开源路线的胜利与挑战
围绕“对 Anthropic 贴脸开大: 智谱 GLM-5.2 凭什么杀”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。