共计 1483 个字符,预计需要花费 4 分钟才能阅读完成。
RSI 正在逼近, 三巨头谁也没停。
前几个月,OpenAI 和 Anthropic 轮番推进旗舰模型 , 谷歌的 Pro 线却迟迟没有动静。直到最近, 大模型盲测竞技场 Arena 里突然冒出一个挂着 gemini-3.8-flash 名字的模型, 表现明显异常, 社区迅速将其与尚未发布的 Gemini 4 Pro 联系起来。
📌 一个“冒名”模型引发的猜测
真正的 Gemini 3.8 Flash 已经正式发布 , 开发者对它应有的水平心里有数。但 Arena 里这个同名模型, 在写代码、做 SVG、跑 Agent 等任务上明显又上了一个台阶。几轮实测后, 猜测开始扩散: 这很可能是谷歌藏在标签后面的下一代旗舰。
最早引发传播的实测集中在 SVG 和 3D 场景。 开发者让它用 SVG 画一只侧面的家猫 , 结果与正式版 3.8 Flash 拉开肉眼可见的差距。另有网友测试其生成 Voxel 风格宝塔、空客 H145 直升机 3D 展示页面, 完成度都相当高。
🔍 泄露信息与 benchmark: 夸张但需谨慎
开发者 Qwinah 声称自己“幽灵路由”到了 Gemini 4 Pro 的后端 , 并贴出疑似内部终端截图。据其说法, 模型内部标识出现 G4P-ARGON 和 VIA_3.8_FLASH, 最大输出 256K, 上下文窗口超过 1000 万 token, 还带有跨会话永久记忆、无需 API 联网、后端自动编译运行脚本等能力。
与此同时, 一张 benchmark 对比表开始疯传 。图中数据显示, 该模型在 DeepSWE v1.1 拿到 88.7%,Terminal-Bench 2.1 达到 95.3%,HLE-Verified 冲到 72.1%,OSWorld 2.0 达到 86.8%,GDPval-AA v2 更是被写成 2064 Elo。
💡 RSI 才是更危险的关键词
比 Gemini 4 Pro 传闻更值得注意的 , 是 RSI——递归自我改进。简单说, 就是 AI 开始参与制造更强的 AI, 更强的 AI 又加快下一代模型研发。一旦这个循环跑起来, 被加速的不只是模型能力, 还有模型进化的速度本身。
路透社今年 8 月披露, 谷歌联合创始人 Sergey Brin 一直在推动 Gemini 提速, 并把 RSI 列为重点关注方向。9 月 2 日发布 Gemini 3.8 Flash 时, 谷歌也提到一套长期运行的 Agent 循环正在“递归地评估和改进底层模型”。9 月 14 日, 谷歌等团队发布 Dream-RSI 论文, 专门研究 Agent 如何通过改进探索策略实现递归自我改进。
RSI 这条路不只谷歌在走。Anthropic 公开数据显示 , 截至今年 8 月,Claude 已能主导 26% 的 AI 研发任务, 而今年 2、3 月还不到 1%。智谱创始人唐杰也表示:“我们仍远未达到递归自我改进, 但最小的循环已经出现。”
📊“减速”共识为何落空
就在几天前,Anthropic 的 Dario Amodei 还呼吁前沿 AI 公司携手“减速”, 他列出的第一个警觉条件正是 RSI。奥特曼公开认同放慢节奏, 马斯克表示“Dario 是对的”, 哈萨比斯也称这是正确方向。
但倡议也提到, 单独减速没有意义 。如果 AI 研发继续被 AI 加速, 真正有效的减速需要共同规则: 独立评测者、共同能力门槛、协调放慢机制。然而出于竞争原因, 这些规则并未建立。
- 谷歌: 疑似 Gemini 4 Pro 已在 Arena 匿名测试
- Anthropic: 社区出现 Opus 5.2 灰度痕迹
- OpenAI: 后台出现 gpt-6-sol 模型名, 传闻即将发布
🚀 总结: 风险讲了一遍, 模型没有放缓
这轮“减速倡议”最确定的成果, 不是任何一家真的减了速 , 而是几家最重要的 AI 公司把风险提前公开讲了一遍。模型并没有因此放缓。如果有一天真的出事, 他们至少可以说: 我们早就提醒过了。