共计 1278 个字符,预计需要花费 4 分钟才能阅读完成。
罗福莉压力有多大? 都给小米模型训练整上直播了
模型训练烧钱并不新鲜, 但把烧钱过程实时挂在网页上供人围观 , 小米这次算是开了先例。北京时间 9 月 15 日晚, 小米两款新模型先后启动训练, 到 17 日下午, 页面上的累计成本已经突破 130 万美元, 而且数字还在往上跳。
把围观地址发出来的, 是小米大模型负责人、前 DeepSeek 研究员罗福莉 。她在 X 上写道“沉寂了近半年”, 并解释这段时间团队一直在研究强化学习究竟能扩展到什么程度。新模型 MiMo-V2.6 还没练完, 训练直播先开了起来。
📌 训练直播里能看到什么
- 重点: 成本动态滚动, 不到两天花掉 130 万美元
- 重点: 当前公开信息主要集中在产品、策略或节奏变化上。
- 重点: 后续仍需关注官方更新、落地范围以及实际反馈。
直播页面结构不复杂,MiMo-V2.6 的 Pro 和 Flash 两款模型各占一栏 。截至 9 月 17 日 15 时 47 分,Pro 训练跑了 45 个多小时, 累计花费约 93 万美元; 晚几个小时开练的 Flash 跑了约 40 个半小时, 花费约 41.6 万美元。Pro 的花费已是 Flash 的两倍多。
进度方面,Pro 完成第 14 步 , 正在进行第 15 步;Flash 完成第 17 步, 正在进行第 18 步。页面还公布了一项名为 DeepSWE v1.1 的软件开发测试通过率:Pro 为 65.78%,Flash 为 60.77%,Pro 领先约 5 个百分点。这些成绩会随阶段性测试更新, 目前只是训练中途的测验结果。
更有意思的是, 网页还兼任故障通报栏 。页面顶部公告显示,Pro 因一个计算节点出现显存问题需要重启;Flash 则在一组数据上遇到基础设施错误, 约 3 小时内未能正确识别, 最后从第 15 步重新启动。
🔍 从匿名测试到公开训练, 策略变了
这不是小米第一次在模型发布节奏上做文章。 今年 3 月 , 一个叫 Hunter Alpha 的匿名模型出现在模型服务平台 OpenRouter 上, 一周后小米才揭晓身份: 这是 MiMo-V2-Pro 的早期测试版。到了这次, 罗福莉干脆提前把训练过程公开, 还预告未来几周会逐步开源相关细节。
直播很快吸引同行关注。Meta 研究员、前 OpenAI 研究员卢卡斯·拜尔看到罗福莉介绍扩大训练规模的三个方向 , 忍不住替她重新“翻译”: 算力、算力, 还是算力。玩笑开完, 他又特意称赞小米竟然连“目前花了多少钱”都公开了。加州大学圣迭戈分校副教授 Yu-Xiang Wang 也说“看得移不开眼”, 还希望团队把训练中遇到的问题记录下来。
💡 钱花在哪: 强化学习与 Agent 训练
今年 4 月,MiMo-V2.5 系列发布并开源 。同月罗福莉在访谈中谈到, 国内团队正在加快探索 Agent 的后训练, 其中一个重点就是扩大强化学习的规模。当时主持人追问有没有初步结果, 她只说“暂时还不是很方便分享”。几个月后, 小米把训练过程放到了网上。
📊 三年 600 亿元之后, 考验才刚开始
围绕“罗福莉压力有多大? 都给小米模型训练整上直播了”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。