共计 1320 个字符,预计需要花费 4 分钟才能阅读完成。
模型还在加速, 世界如何跟上?| 北美 AI 交流手记
15 天,5 座城市,101 位一线从业者 。这是一份来自北美的 AI 交流手记。作者横跨硅谷、洛杉矶、西雅图、波士顿和纽约, 见到的却是同一场技术浪潮里, 不同人正在经历的 不同时间线。
📌 101 人样本: 站在技术曲线最陡处
据手记记述,这 101 位交流对象中,41 位来自 Google、Meta、Nvidia、OpenAI 等新老大厂,17 位来自各 Frontier Lab,42 位是博士,82 位在 35 岁以下, 最年轻的一位只有 21 岁。
他们的位置差异很大: 有人直接向 Sam Altman、Jensen Huang、Satya Nadella、Mark Zuckerberg 汇报或合作, 有人则在一线解决某个零部件、某次运维的具体问题。有人提升模型能力上限, 有人压低每一次推理成本, 也有人还在等一纸并网许可——等待期是 5 年。
- 模型按月进化, 电网按年扩容;
- 组织和人, 则按自己的节奏适应。
🔍“AGI 已来”的体感, 先出现在造 AI 的人身上
行程期间, 各家 Frontier Lab 研究员描述的工作状态变化, 比新闻本身更值得琢磨。
“半年多前, 觉得它还是 research intern 的水平, 现在感觉已经超过我了。”“我的工作主要就是监督和鼓励我的 1 万个 agent。”
一位研究员给出的对比是: 过去一个预训练团队一两百人,现在约二十人就能推进, 一年后也许只需要五个人。人还在流程里, 但重心已从亲手完成每一步, 转向组织整套研究过程。
💡 能力很强, 交付却没有同步跟上
Mert Demirer 等人对超过 50 万名开发者的研究 , 把这种落差量化了出来: 自主编码智能体带来的代码提交活动增幅为 240%, 项目数量增幅 80%, 而实际发布增幅只有 30%。 从提交到发布, 增益一层层变薄。
组织层面的调整也在发生。手记提到, 某大厂已不再用 AI 采用率看板或 token 用量评价员工, 而是回到产出质量、工作速度和所解决问题的复杂度。此前把“用 AI 的量”写进考核, 结果出现大量 bug,review 和修复成本快速上升。硅谷甚至为此造了一个词:Tokenmaxxing。
📊 Scaling 没停, 但关键词变了
一线研究员的乐观依然存在。一位核心模型研究员表示, 训练数据规模已从一两年前的 10T、20T 走到 100T, 参数量在 1T 到 3T 区间, 下一代可能是 10 到 20T,“应该在半年之内”。
但讨论焦点已不再只是数据和参数,而是 RL、environment 和 flywheel。训练材料正从静态内容, 扩展为可执行、可反馈的任务环境——模型不只是“读”, 而是在沙盒里做事、观察、修正。“环境”本身正在成为一种资产。
🚀 数学界的震动, 与难被量化的“承重墙”
但跳出实验室,情绪并不一样。很多行业标准说不清、结果难以判定、无法形成数据闭环。投资人 Sarah Guo 的说法是: 能被测量的就能被训练, 能被训练的迟早会变成商品; 而那些能连接系统、明确责任、保留状态、验收结果的“承重墙”, 可能长期有价值。
🧭 结语
更强的模型,不会自动变成更好的交付, 也不会让物理世界按同样速度迭代。下一阶段的机会, 或许不只在能力曲线最前端, 更在能力、交付与现实之间尚未填平的落差里。