共计 1672 个字符,预计需要花费 5 分钟才能阅读完成。
每秒每 GPU 处理 8064 个词元: 英伟达刷新 DeepSeek-R1 推理速度纪录
建议按 ” 变化—原因—影响 ” 的顺序阅读。
AI 硬件性能竞赛再掀高潮。近日,在被誉为“AI 界最严苛大考”的 MLPerf v6.0 推理基准测试中, 英伟达交出了一份令人瞩目的成绩单, 不仅全面领先竞争对手, 更在关键的大语言模型推理速度上刷新纪录。
📌 MLPerf v6.0: 更贴近真实应用场景的 AI 测试
MLPerf 基准测试是衡量 AI 系统性能的重要标尺,其 v6.0 版本于 2026 年 4 月发布, 相比此前的 v5.1 版本进行了重大升级。新版测试不再局限于传统模型, 而是引入了多个前沿的生成式 AI 模型, 并重点考察了推理交互性和大规模多节点系统性能, 更贴近当前工业界的实际应用需求。
从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。
v6.0 版本引入了六大关键模型基准, 覆盖了从语言理解到视觉生成的全方位 AI 能力:
- GPT-OSS-120B: 大型开源语言模型, 专注于数学、科学推理和代码编写能力测试
- DeepSeek-R1 交互模式: 新增交互式场景, 对首字响应时间和每词元速率要求更高, 模拟真实聊天机器人体验
- Qwen3-VL-235B: 首个多模态视觉语言模型基准, 测试多模态数据处理能力
- WAN-2.2(文生视频): 首个文生视频基准测试, 采用 SingleStream 模式更准确衡量延迟
- DLRMv3: 第三代推荐系统基准, 基于 Transformer 架构, 计算强度显著提升
- YOLOv11 Large: 针对边缘计算场景的目标检测基准
🔍 英伟达的全面性能碾压
根据官方公布的测试结果,英伟达凭借其最新的 Blackwell Ultra 架构(GB300 NVL72), 在 MLPerf v6.0 中实现了全方位的性能领先。不仅所有测试项目均位列第一, 其推理训练“Wins”数量更是领先最接近竞争对手 9 倍之多, 展现了在 AI 硬件领域的绝对优势。
其中, 最引人注目的是在 DeepSeek-R1 模型上的表现。在服务器端测试中 , 英伟达实现了 每秒每 GPU 处理 8064 个词元 的惊人速度, 相比 v5.1 版本的 2907 词元 / 秒, 性能提升高达2.77 倍。即使在离线测试场景下,DeepSeek-R1 的处理速度也从 5842 词元 / 秒提升至 9821 词元 / 秒, 增幅达 1.68 倍。
💡 关键性能数据一览
除了 DeepSeek-R1 的突出表现外, 英伟达在其他主流模型上也实现了显著性能提升:
- Llama 3.1 405B 服务器测试: 从 170 词元 / 秒提升至 259 词元 / 秒, 性能提升 1.52 倍
- Llama 3.1 405B 离线测试: 从 224 词元 / 秒提升至 271 词元 / 秒, 性能提升 1.21 倍
这些数据不仅体现了 Blackwell Ultra 架构的强大计算能力, 也反映了英伟达在优化大语言模型推理效率方面的深厚技术积累。
📊 行业影响与未来展望
MLPerf v6.0 测试结果的公布, 对 AI 行业具有多重意义:
首先, 测试基准向交互式、多模态场景的演进,反映了 AI 应用正从单纯的批量处理向实时交互、多模态理解方向发展。英伟达在 DeepSeek-R1 交互模式等新测试项目中的优异表现, 表明其硬件平台已经为下一代 AI 应用做好了准备。
其次, 文生视频、视觉语言模型等新基准的引入,预示着 AI 计算正从传统的语言模型向更复杂的多模态生成任务扩展。英伟达在这些领域的领先优势, 可能进一步巩固其在 AI 训练和推理市场的主导地位。
最后, 性能的大幅提升意味着实际应用成本的降低。更高的推理效率可以直接转化为更快的响应速度、更低的能耗和更经济的运营成本, 这对于大规模部署 AI 服务的云厂商和企业用户来说尤为重要。
🚀 值得关注的几个重点
总体来看,英伟达在 MLPerf v6.0 中的表现再次证明了其在 AI 硬件领域的领导地位。随着 AI 模型不断向更大规模、更多模态、更强交互性发展, 硬件性能的持续提升将成为推动整个行业前进的关键动力。对于开发者、研究机构和企业用户而言, 选择能够提供卓越推理性能的硬件平台, 将在未来的 AI 应用竞争中占据重要优势。