共计 1204 个字符,预计需要花费 4 分钟才能阅读完成。
DeepSeek 掀桌后, 大模型厂商应该关注什么?
大模型竞争正在从“谁的模型更大”转向“谁能更快、更便宜地验证新想法”。 在 DeepSeek 新模型引发行业关注后, 训练框架与底层基础设施的重要性被进一步放大。近期, 百度智能云百舸团队开源的 LoongForge, 正是这一变化中的一个典型样本。
📌 变化: 多模态让传统训练框架压力陡增
过去的大模型训练主要围绕文本展开, 工程体系相对成熟 , 也长期依赖英伟达 GPU 生态。但进入多模态阶段后, 模型结构和数据形态都变得更复杂: 视觉编码器、语言模型、投影层等模块参数规模差异明显, 图片、视频、文本样本的计算量也可能相差数百倍甚至更多。
这意味着, 传统框架中“一套并行策略打天下”的方式越来越难适配新需求 。小模块可能被过度分配资源, 大模块又可能成为训练瓶颈; 长视频样本占用的计算时间过长, 也会让其他 GPU 处于等待状态。
🔍 原因:AI Infra 正成为模型迭代速度的底座
行业内越来越多观点认为, 大模型竞争不只取决于创意本身 , 更取决于创意能否被快速验证。训练框架的价值, 正在于把模型切分、通信优化、显存管理和容错等复杂工程问题标准化, 让研发团队把更多精力放在模型设计上。
材料显示,LoongForge 被定位为全模态训练框架, 覆盖 LLM、VLM、VLA 以及 Diffusion 等场景。它试图解决的核心问题, 并不是单点性能优化, 而是让复杂模型在大规模集群上更稳定、更高效地训练。
💡 核心信息:LoongForge 重点补齐三类短板
- 模块解耦: 针对视觉编码器和语言模型等不同模块, 分别配置更合适的并行方案, 避免资源分配“一刀切”。
- 自动负载均衡: 根据样本计算量动态分配任务, 让长视频、图片等不同数据类型在集群中更均衡地运行。
- 异构硬件接入: 通过 XPU_Plugin 等机制屏蔽底层硬件差异, 降低在 GPU 与国产芯片之间迁移训练代码的成本。
此外, 材料还提到 LoongForge 对 MoE 通信、稀疏注意力、KV 布局和算子融合等方向做了优化, 并通过配置化方式缩短新模型接入周期。不过, 这些能力最终能否在更多团队和真实业务中稳定复现, 仍需要社区反馈和后续迭代来验证。
📊 影响: 开源框架背后是生态位争夺
LoongForge 采用 Apache 2.0 协议开源, 意味着开发者和企业在商用、修改和二次开发上拥有较高自由度。对百度智能云而言, 这不仅是技术展示, 也可能是吸引开发者围绕其云服务和昆仑芯等硬件生态展开适配的入口。
如果训练框架能够降低异构算力使用门槛, 国产 AI 芯片在大模型训练中的落地阻力也会随之下降 。换句话说, 框架层的开放, 可能成为硬件生态扩展的重要前置条件。
🚀 总结: 模型之争正在深入基础设施层
围绕“DeepSeek 掀桌后, 大模型厂商应该关注什么?”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。