Nvidia NVSHMEM 提升 GROMACS 分子动力学 GPU 扩展性能
realtime news Jul 09, 2026 18:15
Nvidia 的 NVSHMEM 实现了 GPU 发起的通信,通过消除分子动力学模拟中的 CPU 瓶颈,提升了 GROMACS 的扩展能力。
在 2026 年 7 月 9 日发布的新指南中,Nvidia 展示了其 GPU 本地通信库 NVSHMEM 如何重塑分子动力学 (MD) 模拟。通过让 GPU 直接管理数据传输,NVSHMEM 消除了历史上限制 GROMACS 等工作负载扩展性的 CPU 协调瓶颈。此变革为研究蛋白质折叠和药物研发等领域的原子行为的研究人员带来了显著的性能提升。
传统的 MD 模拟依赖于消息传递接口 (MPI),其以 CPU 为中心,在现代 GPU 集群上实现亚毫秒时间步时难以跟上节奏。瓶颈在 GROMACS 的“光晕交换”算法中尤为明显——这一边界数据共享算法在峰值迭代速率下消耗了超过 50% 的 CPU 墙钟时间。Nvidia 的 NVSHMEM 通过允许 GPU 内核直接发起数据传输,完全绕过了 CPU,并实现计算与通信的重叠,从而解决了这一问题。
通过 GPU 驱动的通信实现性能提升
使用 NVSHMEM,GROMACS 在 Nvidia DGX H100 系统上与支持 GPU 的 MPI 相比性能提高了多达 1.5 倍,特别是在对延迟敏感的小型系统上。例如,一个 45,000 个原子的系统在四个 GPU 上运行时,模拟速度提高了 46%,从使用 MPI 时的 1,126 ns/天提升至 1,649 ns/天。
在使用 Nvidia NVLink 互连的多节点设置中,性能提升达到 2 倍,而基于标准 InfiniBand 的集群可看到高达 1.3 倍的改进。这些收益源于诸如内核融合(减少同步事件数量)和互连感知传输(基于可用硬件能力优化数据移动)等创新。
对高性能计算的更广泛影响
GPU 发起的通信不仅限于分子动力学。“光晕交换”模式也出现在计算流体力学、天体物理学和晶格量子色动力学等领域,使这种方法在高性能计算 (HPC) 中得到了广泛应用。2026 年 5 月关于 GPU 发起的通信与协调 (GICC) 的研究报告显示,在 AMD MI250X 系统上也观察到了类似的减少通信开销的好处,进一步突显了整个行业向 GPU 本地执行模型的转变。
在 2025 年的 SC 大会上,Nvidia 强调了这一趋势,推出了新的基于 Blackwell 的系统和 Quantum-X 网络,旨在优化 GPU 间的通信。GROMACS 2026 的发布将 NVSHMEM 集成为默认功能,标志着这些技术的主流采用。
展望未来
虽然 NVSHMEM 的 GPU 驱动方法在延迟绑定任务中占据主导地位,但传统的 MPI 在计算密集型、低节点数场景中仍略有优势(1–3%)。然而,对于需要强扩展的大规模模拟,GPU 发起的通信正逐渐成为标准。未来的发展可能包括通过 OpenSHMEM 等标准化库和 Kokkos 等分布式抽象更广泛地采用这些技术。
对于研究人员来说,Nvidia 的指南提供了在现有工作流中实施 GPU 本地通信的实际策略。运行 GROMACS 模拟的用户可以在 Nvidia 的高性能硬件上立即体验到可扩展性和效率的提升。随着 HPC 系统的发展,GPU 发起的通信将重新定义计算科学,在各学科中实现更大规模和更详细的模拟。
Image source: Shutterstock