阿里、字节、DeepSeek 集体押注超大参数模型,10万亿级竞赛重燃

9次阅读
没有评论

共计 1193 个字符,预计需要花费 3 分钟才能阅读完成。

信息整理

阿里、字节、DeepSeek 豪赌 10 万亿参数模型: 一场停不下来的烧钱游戏

9 月下旬的云栖大会上, 阿里释放了一个明确信号: 大模型的参数规模竞赛并未降温 , 反而被重新推向前台。阿里 CEO 吴泳铭披露, 公司正准备训练参数规模介于 5 万亿至 10 万亿之间的新一代模型。几乎同一时间, 字节跳动与 DeepSeek 也被曝出正在推进超大参数模型, 行业焦点再次回到“越大是否越强”的老问题上。

📌 三家厂商同步加码

阿里 ATH 事业群相关项目负责人刘大一恒在云栖大会现场提到,Scaling 是迈向超级人工智能的关键路径 , 未来 Qwen 系列模型计划将参数规模推向 5 万亿到 10 万亿。与此同时, 有报道称 DeepSeek 正在训练约 2 万亿参数的新模型, 其创始人梁文锋在近期投资者会议上表示下一步可能推进至 8 万亿参数。更早之前, 字节跳动也被曝正在训练最高可达 10 万亿参数的大模型。

作为参照,2025 年引爆行业的 DeepSeek-R1 参数量为 6710 亿 , 不足 10 万亿的十五分之一。国产已发布模型中, 月之暗面的 Kimi K3 总参数为 2.8 万亿, 阿里当前旗舰 Qwen 3.8-Max 约为 2.4 万亿,DeepSeek 现役 V4-Pro 为 1.6 万亿。若以 10 万亿为目标, 各家现役旗舰普遍还需放大约 5 倍。

🔍 参数越大越好吗

支撑“越大越好”的逻辑来自 Scaling Law: 当模型、数据与算力同步放大时 , 模型能力会随之提升。过去几年, 从千亿到万亿的跃升确实伴随着能力肉眼可见的增长。但这一规律并非无限有效。到了万亿级别, 单纯堆参数的边际回报明显递减。如果缺乏等量高质量语料与算力配套, 能力并不会同倍提升。

此外, 参数大也不等于好用。 模型越大 , 推理越慢, 用户等待时间拉长; 推理成本也随之上升, 最终会转嫁到定价上。因此, 参数规模决定的其实是能力上限, 而上限决定排位——这正是厂商们明知成本高企仍要冲刺的原因。

💡 三笔账单: 算力、推理与数据

  • 基础设施:10 万亿参数预训练需要数万张高端 GPU 连续运行数月, 电费、运维与芯片采购均是天文数字。
  • 推理成本: 模型部署后, 每次调用都消耗算力, 用户规模越大, 推理侧开销越持久。
  • 数据成本: 高质量、精细清洗和标注的数据比裸算力更稀缺, 扩大模型必须同步扩大数据。

📊 Flash 与大参数共存

围绕“阿里、字节、DeepSeek 豪赌 10 万亿参数模型: 一场停”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

🚀 总结

从千亿到万亿, 再到如今瞄准 10 万亿 , 国产大模型厂商正用真金白银争夺下一代模型的入场券。参数规模决定能力上限, 但能否把上限转化为可用、可负担的智能, 取决于算力效率、数据质量与成本控制的综合平衡。10 万亿目前仍是规划中的数字, 等模型真正落地时, 牌桌或许已经洗过一轮, 而那时它很可能不再是终点, 而是新的起跑线。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码