NVIDIA CUDA内核融合提升AI工作负载中的GPU效率
realtime news Jul 10, 2026 17:31
NVIDIA的CUDA内核融合技术减少了内存流量和内核启动开销,将AI和HPC任务的速度提高了最多3倍。对于MoE和LLM训练至关重要。
NVIDIA(纳斯达克代码:NVDA)通过最新的CUDA内核融合技术改进加倍提升GPU效率。这项技术优化了内存使用并最小化了内核启动开销。通过将多个操作合并到单个内核,NVIDIA声称在某些工作负载上(如专家混合模型(MoE)和大型语言模型(LLM)训练)可以实现多达3倍的加速。
内核融合通过解决GPU计算中的长期瓶颈实现了这一点:中间数据传输导致的高内存带宽消耗。在典型的GPU工作负载中,中间结果通常在不同内核启动之间通过全局内存传输,从而产生显著的延迟。融合通过将中间数据保存在寄存器或共享内存中来消除这一问题,从而极大减少全局内存流量并提升整体性能。
关键性能提升
NVIDIA最近的基准测试突出了内核融合的影响。例如,操作sum(abs(x))的一个简单实现需要两个内核和3GB的内存流量,完成时间为3.51毫秒。而手动融合的内核将内存流量减少到1GB,完成时间仅为1.18毫秒——提高了3倍。有效内存带宽接近RTX 4090的理论峰值的90%,展示了硬件的高效利用。
这些优化对于AI和高性能计算(HPC)工作负载至关重要。NVIDIA于2026年5月发布的CUDA Toolkit 13.3引入了新的抽象概念,例如CUDA Tile编程,这进一步简化了编写融合内核的过程,并针对Tensor Cores等硬件特性进行优化。NVIDIA的MLPerf Training 6.0结果还指出,内核融合是Blackwell GPU吞吐量提升1.3倍的关键因素之一。
融合选项:手动、编译器或显式API
开发人员有多种方法可以利用内核融合:
- 手动融合:编写自定义CUDA内核提供了最大控制和最佳性能,但需要大量专业知识和维护工作。
- 编译器融合:像PyTorch的
torch.compile这样的工具可以从高级代码自动生成融合内核,使用方便但可预测性较差。 - 显式API:NVIDIA的
cuda.computeAPI允许开发人员直接在Python中组合变换和归约操作,同时提供控制性和简易性。这种方法利用了像CUB这样的久经考验的库来实现优化性能。
每种方法都有其权衡。手动融合提供了最佳性能,但劳动强度大。编译器融合方便但可能由于输入数据或编译器版本的不同而产生不一致的结果。显式API在结果的确定性和开发工作负担之间提供了平衡。
重要意义
随着AI模型规模和复杂性的增加,内核融合变得越来越重要。像MoE路由、深度学习算子融合(例如GEMM + 激活)以及仿真工作负载等任务对带宽的依赖性很高。通过减少内存流量和内核启动延迟,融合确保这些工作负载能够充分利用现代GPU,例如NVIDIA的Hopper和Blackwell架构。
对于投资者来说,NVIDIA在GPU优化方面的领导地位进一步巩固了其在AI硬件领域的主导地位。截至2026年7月10日,NVIDIA的股票收盘价为209.62美元,市值为5.11万亿美元。在CUDA技术的持续进步下,其在AI和HPC市场的地位可能进一步加强,而对高效硬件和软件解决方案的需求仍在不断增长。
对这些进步感兴趣的开发者可以查看CUDA Toolkit 13.3和cuda.compute API的详细文档。对于高要求的AI工作负载而言,内核融合不仅是一种优化手段,更是一种必要条件。
Image source: Shutterstock