共计 1282 个字符,预计需要花费 4 分钟才能阅读完成。
阿莫迪偷师姚顺雨, 奥特曼偷师梁文锋
当预训练的边际收益逐渐见顶,AI 巨头们不约而同地将目光投向了第二战场 。刚刚亮相的 Claude Opus 5.5 与 GPT-6 Luna, 一个在上下文里寻找智能增量, 一个在缓存中压缩成本, 而这两条路径, 都能在中国团队早前的工程实践中找到清晰的影子。
📌 推理时算力:Opus 5.5 的“思考”必修课
Opus 5.5 最显著的变化 , 是取消了关闭思考模式的选项。官方声明中明确, 所有成绩均基于最大力度的自适应思考。这意味着推理过程不再是可选项, 而是模型能力的一部分。
代价直接体现在 token 消耗上。据 Artificial Analysis 统计,Opus 5.5 在 max 档位下平均每题输出约 11.9 万个 token, 其中 8.4 万用于思考。作为对比,GPT-6 Astra 同档位仅消耗 2.7 万 token。这种“想得越多、答得越好”的逻辑, 正是 test-time compute 路线的典型特征。
这一思路与姚顺雨 2023 年提出的思维树和 ReAct 架构一脉相承。他在《The Second Half》中判断,AI 上半场拼训练方法与模型, 下半场拼使用与评估, 增量正从训练挪向推理与行动。Opus 5.5 相当于把这套理念做了工程化落地。
🔍 缓存复用:GPT-6 Luna 的成本手术
如果说 Opus 5.5 解决的是“怎么想”,GPT-6 Luna 则聚焦“怎么便宜地想”。其输入定价 0.1 美元 / 百万 token, 输出 0.5 美元 / 百万 token, 较上一代直接砍半。若缓存命中, 读取价格低至 0.01 美元 / 百万 token, 比标准输入便宜 90%。
这背后是 prompt caching 与 KV cache 复用技术: 同一段上下文算过一次就存起来, 下次直接读取, 跳过重算。而 DeepSeek 早在 2026 年 8 月就上线了磁盘上下文缓存, 命中价同样砍到未命中的十分之一。V4 Flash 的命中与未命中价差甚至达到 50 倍。
💡 从“穷则思变”到行业通货
- 学术与工程范式 :test-time compute、缓存复用、稀疏注意力等方向, 中国团队更早给出系统性方案。
- 产品化与规模化 : 美国巨头凭借资源与渠道, 将这些思路做成产品推向全球。
- 动力差异 : 算力充裕的一方缺乏抠成本的紧迫感, 而算力吃紧的一方被迫把每一分钱花在刀刃上。
DeepSeek 的 MLA、磁盘缓存、稀疏注意力 , 最初都是资源约束下的“土办法”。当全行业开始拼效率时, 这些方案反而成了最硬的通货。OpenAI 在推测解码上的改进, 也与 DeepSeek V3 的 MTP 思路异曲同工, 只是实现方式从共享主干变为外挂草稿模型。
📊 效率优先时代的竞争逻辑
头部公司面临的共同现实是: 优质数据几乎训练殆尽, 预训练边际收益递减 。增量自然流向推理效率、上下文利用和长上下文成本控制。主战场上的算力优势, 在第二战场反而可能成为路径依赖的包袱。
Opus 5.5 与 GPT-6 Luna 的发布, 与其说是技术路线的巧合, 不如说是行业阶段转换的必然。中国团队在效率工程上的积累, 正在被全球头部玩家以不同方式吸收和再实现。这场静默的取经, 或许才刚刚开始。