英伟达公布 AVO 研究:AI 连跑 7 天,自主优化出超越专家的 GPU 内核

137次阅读
没有评论

共计 1342 个字符,预计需要花费 4 分钟才能阅读完成。

观察视角
围绕事件本身、节奏变化与潜在影响展开。

让 AI 不只是“写代码”,而是自己提出方案、修错、测试、再迭代, 英伟达最新公开的 AVO 研究, 正把软件优化这件事推向更自动化的阶段。按照论文披露,AVO 在 Blackwell B200 GPU 上连续运行 7 天后, 拿出了性能超过人类专家方案的注意力计算内核。

📌 AVO 是什么: 把“变异”从随机试错变成智能体决策

这项研究全名为 AVO(Agentic Variation Operators)。它的关键点, 不是单纯让大模型生成几段候选代码, 而是让智能体直接参与整个进化过程: 查看历史版本、结合领域知识、分析运行反馈, 再决定下一步如何修改。

换句话说,传统进化算法更像“盲改代码”, 而 AVO 试图让 AI 像工程师一样, 在理解上下文和目标的前提下持续优化。研究团队将这种能力用于 GPU 底层内核调优, 这是一个高度依赖经验、通常需要专家长期打磨的领域。

🔍 为什么这件事重要:GPU 优化一直是“硬骨头”

论文选取的目标并不简单,而是大模型核心组件之一的 Attention 注意力机制。这一部分直接关系到训练和推理效率, 也是英伟达 cuDNN、以及 FlashAttention 系列持续竞争的焦点。

过去, 这类优化往往依赖少数资深工程师手工调整,包括内存访问、寄存器分配、warp 调度和流水线时序等细节。硬件一变、模型一变, 很多工作又得重来。

如果研究结果能在更多场景中复现,意味着部分底层性能调优工作, 未来可能从“专家手工活”转向“智能体持续搜索”。

💡 已披露成绩:7 天搜索后, 部分结果超过现有标杆

根据论文与相关公开表述,AVO 在 B200 上运行 7 天后, 针对多头注意力 (MHA) 内核取得了较突出的结果:

  • 相较 cuDNN, 部分测试配置下性能最高提升约 3.5%;
  • 相较 FlashAttention-4, 最高快约 10.5%;
  • 迁移到 GQA 时, 在已有成果基础上继续优化约 30 分钟, 可获得约 7% 至 9% 提升。

从描述来看,AVO 找到的并非表层改动, 而是深入到 GPU 微架构相关层面。这也是外界格外关注这篇论文的原因之一:AI 不再只是生成上层代码, 而开始触碰过去高度依赖资深专家经验的优化空间。

📊 对行业意味着什么:AI 开始参与“优化 AI”

这项研究最值得关注的,不只是单次跑分, 而是它展示了一种新的研发路径:AI 可以被用来自动化优化本身。

  • 对大模型训练而言, 注意力内核效率提升, 理论上有助于缩短训练时间;
  • 对硬件利用率而言, 同样算力可能承载更大模型或更高吞吐;
  • 对工程团队而言, 可把部分重复、漫长的手工调优交给自动化系统。

当然, 目前公开信息仍主要来自论文和研究人员表述,外界更关心的是: 这些结果能否在更多工作负载、不同框架和更广泛硬件环境中稳定复现。如果后续验证充分,AVO 代表的方向很可能会扩展到编译器、芯片设计乃至更多系统级优化任务。

🚀 总结: 从辅助编程, 走向自主探索

AVO 释放出的信号很明确:AI 正从“按提示写代码”, 走向“围绕目标长期搜索并自我修正”。这与传统 Copilot 式工具不同, 它更接近一个持续工作的自动优化系统。

就现阶段看,英伟达这项研究至少证明了一件事——在高性能计算的某些关键环节,AI 已经开始展现出挑战顶尖人工调优的潜力。至于它是否会进一步改变软件和芯片优化流程, 还要等待更多公开实验和产业落地结果来回答。

正文完
 0