NVIDIA CUDA 13.3 引入硬件加速加密功能

realtime news Jul 15, 2026 18:21

CUDA 13.3 在 NVIDIA GPU 上引入无进位乘法运算,使 Ampere 及更新硬件的加密性能提高至多 18 倍。

NVIDIA CUDA 13.3 引入硬件加速加密功能

NVIDIA 随着 CUDA 13.3 的发布引入了硬件加速的无进位乘法运算,这一新功能旨在提升 Ampere 及更新 GPU 的加密性能。这项期待已久的功能允许开发者利用 clmad 指令,这是一种并行线程执行(PTX)功能,用于执行高速二进制扩展域乘法运算。以前,开发者必须依赖较慢的软件方法,例如位片电路,来实现类似的功能。

无进位乘法是现代加密技术的核心操作,支持诸如 AES-GCM 加密(用于 TLS 和 VPN)的 GHASH 协议以及先进的零知识(ZK)证明系统等协议。NVIDIA 的基准测试显示,这种硬件支持的变革性效果。在 NVIDIA B200 GPU 上,GHASH 吞吐量达到了惊人的 ~6.3 TB/s——比以往方法提升了近 19 倍——而 ZK 证明系统的性能提升高达 13 倍。

自 2010 年 Intel 在 x86 CPU 中引入 PCLMULQDQ 指令以来,无进位乘法的硬件支持已成为标准。NVIDIA 将类似功能引入其 GPU 的举措与加密密集型工作负载(如数据中心加密和区块链应用)日益增长的计算需求保持一致。

为什么这很重要

诸如 AES-GCM 等加密操作对于保护互联网通信和存储系统至关重要,而 ZK 证明正成为保护隐私的区块链协议的支柱。硬件中的无进位乘法显著减少了计算开销,使这些技术更具可扩展性和成本效益。例如,AES-GCM 中的 GHASH 操作——以前的瓶颈——现在可以以接近 DRAM 带宽限制的速度处理数据。

此外,clmad 的加入扩大了可以在 NVIDIA GPU 上高效运行的加密工作负载范围。这些包括 Reed–Solomon 和 BCH 等纠错码、后量子加密方案,甚至量子稳定码。这使基于 Ampere 的 GPU 成为从电信到区块链开发等行业的多功能选择。

性能基准

CUDA 13.3 的无进位乘法在 NVIDIA 的测试中表现非常明显:

  • GHASH 吞吐量:在 B200 GPU 上达到 ~6.3 TB/s,比之前的位片方法提升近 19 倍。
  • 零知识证明:在总和检查协议性能上提升高达 13 倍,这对于扩展区块链和隐私应用至关重要。
  • 实际应用:在 NVIDIA GeForce RTX 5090 上,峰值 GHASH 吞吐量达 ~1,300 GB/s,即使在消费级 GPU 上也表现出高性能。

行业背景

随着加密工作负载的需求日益增长,硬件加速正成为竞争优势的决定因素。Intel 和 AMD 早已在 x86 处理器中支持无进位乘法,Intel 最近还重申了其在即将推出的 Nova Lake CPU 中支持加密友好扩展的承诺。NVIDIA 将类似功能引入 GPU 是一个合乎逻辑的下一步,特别是在 GPU 越来越多地处理图形以外的工作负载(如人工智能和区块链计算)时。

CUDA 13.3 的推出使 NVIDIA 在与 AMD 等竞争对手的竞争中处于更强的地位,后者也在增强其 GPU 计算能力。对于已经使用 NVIDIA 硬件的开发者和企业来说,此更新为优化加密管道提供了一个显著的机会,而无需额外的硬件投资。

展望未来

随着 CUDA 13.3 现已可供下载,开发者可以立即开始将 clmad 集成到他们的加密工作负载中。这对于依赖高吞吐量加密、ZK 证明和纠错码的行业来说意义重大。随着加密需求的持续增长,NVIDIA 的硬件加速可能会重新定义安全计算的成本和性能动态。

优化加密性能的竞赛远未结束。随着 Intel 等竞争对手继续在这一领域推动创新,高性能、安全计算硬件的市场只会愈加激烈。

Image source: Shutterstock