共计 1293 个字符,预计需要花费 4 分钟才能阅读完成。
📌 AI 巨头集体踩“刹车”, 但距离真正的 RSI 还很遥远
过去几天,Anthropic 与 OpenAI 先后释放出放缓前沿 AI 能力推进节奏的信号 , 被业内视为硅谷巨头面对安全风险的一次主动降温。资本市场迅速反应, 英伟达一度跌超 3%,AMD、英特尔、美光盘中跌幅约 5%, 费城半导体指数盘中下挫近 6%。当一直踩着 AI 油门的人开始谈刹车, 围绕算力、芯片和数据中心的增长逻辑正面临新的变量。
🔍 RSI: 从科幻概念到工程热词
2026 年,RSI 进一步跨出未来学和安全讨论的范畴 , 成为学术议程、工程实践和创业融资叙事的热词。但跳脱情绪、回归技术,AI 自进化究竟意味着什么? 今天走到了哪一步?
💡 代码不用人敲,RSI 才有了真抓手
从强化学习到 ChatGPT, 再到 DeepSeek R1 和 Anthropic 的 Opus 4.5, 模型能力边界不断刷新。如今基本已经没有什么代码是提示词“敲”不出来的。智能体一旦有了足够强的编程能力, 加上上下文管理逐渐成为原生能力, 就可以在一个任务上持续跑很久, 自行完成读代码、改代码、执行、看结果、再继续下一轮的循环。
📊 今天跑通的, 只是 RSI 的“局部循环”
瞿骜指出, 需要区分两个概念 。今天我们能看到的大多是持续自我改进:AI 在和环境、用户、任务交互中积累经验, 再用这些经验自我更新, 更新的可以是记忆、提示词、工具、技能, 甚至整个 harness。
而严格意义上的 RSI 要更进一步。 它的思想源头可追溯到 I. J. Good 在 1960 年代提出的超智能机器 : 如果一台机器开始参与设计下一代机器, 且下一代又能继续造出更强的下一代, 能力提升就可能进入递归加速过程。
- 持续自我改进 : 从经验中把自己“炼强”, 是 RSI 的起点
- 严格 RSI:AI 参与设计、训练, 甚至亲手构建下一个自己
- 门槛差异 : 把“机器”定义得越完整,RSI 的门槛就越高
🚀 AI 把活干完了,“长本事”才刚刚开始
瞿骜从自身研究路径出发, 指出一个越来越明显的问题:agent 可以在上下文里变得越来越能干 , 但这种提升有上限。任务一旦拉长, 系统还是会慢慢卡住。agent 做了很多事, 积累了很多经验, 但模型本身并没有因此“长本事”。
传统大模型开发经历训练、评估、部署、推理几个阶段。 到了推理阶段 , 模型开始替用户干活, 但同步产生的大量经验通常不会自动回到下一轮学习里。Reef 想解决的, 就是怎么把这条路重新接起来, 让 agent 在真实世界里做过什么、错过什么、被用户纠正过什么, 都有机会变成下一轮学习的材料。
🧭 从 kernel 到 CEO Bench: 什么叫“好”越来越难定义
再复杂一点, 是让 agent 去“经营一家公司”。学术界有一个 benchmark 叫 CEO Bench, 模拟市场环境评估 agent 的经营决策能力。经营这件事会不断留下反馈, 但反馈不再是简单的通过或失败, 需要被识别、被归因, 才能变成下一轮学习的信号。
📌 行业观察: 刹车背后的理性回归
围绕“AI 巨头集体踩“刹车”, 但距离真正的 RSI 还很遥远”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。