共计 1276 个字符,预计需要花费 4 分钟才能阅读完成。
北大与 DeepSeek 联合开源 DSpark: 破解 AI 大模型高并发推理瓶颈, 速度提升 60% 至 85%
IT 之家 6 月 27 日消息, 今日,DeepSeek 联合北京大学正式发布 DSpark 推理加速框架, 旨在解决大语言模型在高并发生产环境中的 …
近日,DeepSeek 联合北京大学正式推出 DSpark 推理加速框架,旨在解决大语言模型在高并发场景下的推理效率问题。该框架已部署于 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro 的预览版服务中, 在同等吞吐量下, 单用户生成速度提升了 60% 至 85%。相关论文和代码已在 GitHub 上开源。
📌 大模型推理的瓶颈与推测解码
大语言模型生成文本时采用自回归方式,每生成一个 token 都需要一次完整的前向传播, 导致推理延迟随输出长度线性增长。推测解码技术提供了一种解决方案: 用轻量级小模型快速生成多个候选 token, 再由大模型并行验证。但实际加速效果受限于候选生成质量和验证阶段的计算资源占用。
从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。
当前主流方案分为两类: 自回归式草稿模型 (如 Eagle3) 串行生成候选,接受率高但延迟随长度增长 ; 并行式草稿模型(如 DFlash) 一次性生成所有候选, 延迟低但长候选块接受率迅速下降, 造成计算浪费。
🔍 DSpark 的两大创新机制
DSpark 围绕上述瓶颈提出了两项互补机制:
- 半自回归候选生成: 采用并行主干网络一次性产出所有候选位置的隐藏状态, 随后由轻量级顺序模块逐 token 注入前缀依赖。顺序模块提供马尔可夫头和 RNN 头两种实现, 实验表明两层 Transformer 深度的 DSpark 即可在各项指标上超过五层 DFlash。
- 置信度调度验证: 模型在每个候选位置输出置信度分数, 预测该 token 被接受的概率。硬件感知前缀调度器将验证长度选择建模为全局吞吐量最大化问题, 动态决定每个请求的验证前缀长度, 优先将计算资源分配给高置信度 token。
💡 性能表现与工程优化
在离线基准测试中,以 Qwen3-4B 为目标模型,DSpark 相比 Eagle3 平均接受长度提升约 30.9%, 相比 DFlash 提升约 16.3%。在线生产环境实测中, 在 V4-Flash 引擎上, 当 SLA 为 80 token/ s 时, 聚合吞吐量提升 51%; 当 SLA 收紧至 120 token/ s 时, 吞吐量提升高达 661%。在 V4-Pro 引擎上,35 token/ s 的 SLA 下吞吐量提升 52%,50 token/ s 下提升 406%。
工程实现方面,团队采用了异步调度器以隐藏调度延迟, 并通过解耦物理执行与逻辑序列跟踪来支持动态变长验证前缀, 避免标准解码内核的利用率下降。
📊 开源与行业影响
目前,DeepSeek 已在 GitHub 的 DeepSpec 项目中开源了 DSpark、DFlash 和 Eagle3 三种草稿模型的训练代码、评估脚本及模型检查点。DSpark 的发布为高并发 AI 推理场景提供了高效解决方案, 尤其适合需要低延迟响应的对话系统、代码生成等应用。