NVIDIA 推出非均匀张量并行技术用于大规模 LLM 训练

realtime news Jul 06, 2026 22:29

NVIDIA 的非均匀张量并行技术(Nonuniform Tensor Parallelism,NTP)能够在数千个 GPU 上实现大规模 LLM 的高效训练,减少停机时间并优化有效工作量(Goodput)。

NVIDIA 推出非均匀张量并行技术用于大规模 LLM 训练

在大规模训练大型语言模型(LLM)时,特别是需要在数千个 GPU 上长时间运行的任务,存在显著的挑战。NVIDIA 最新研究的非均匀张量并行技术(Nonuniform Tensor Parallelism,简称 NTP)旨在通过提高容错能力和优化有效工作量(Goodput,即在训练过程中完成的有助于收敛的有效工作)来解决这些问题。

这一概念在最近的博客文章中详细阐述,提出了一种可自适应的框架,通过动态调整张量并行(TP)的配置并重新分配工作负载,最大限度地减少硬件中断带来的影响。即使在 GPU 组中某些设备发生故障时,NTP 也能确保训练任务的持续进行。

为什么非均匀张量并行很重要

张量并行是现代 LLM 训练的基础,它通过将大型 Transformer 层拆分到多个 GPU 来处理单个设备内存无法容纳的模型。然而,TP 组中 GPU 之间的相互依赖意味着一个硬件故障就可能导致训练速度减慢甚至中断。随着模型扩展到数千个通过高速连接(如 NVIDIA NVLink)互联的 GPU,这一问题变得更加严重。NVIDIA NVLink 每个域最多支持 72 个 GPU,带宽高达 1,800 GB/s。

NTP 通过实现实时调整来应对这些漏洞。如果 TP 组中的某个 GPU 出现故障,系统会减少该组的并行度,例如从 8 个 GPU 减少到 7 个,并将工作负载重新分配到剩余设备上。这样可以避免单个故障导致整个训练过程中断。

NTP 的关键创新

动态并行调整: NTP 会在硬件中断时自动重新配置 TP 组。剩余的 GPU 接管更多的工作负载,确保受影响的副本仍然能为训练管道做出贡献。

功率提升: 为弥补因并行度降低造成的性能损失,NTP 允许对活跃 GPU 动态提升功率。这可以暂时提高时钟频率和计算吞吐量,使受影响的域能够跟上完全运行的副本。

高效重分片: NTP 通过将张量重分片与其他计算(如反向计算和参数同步)重叠,最大限度地减少开销。这确保了适应过程本身不会成为瓶颈,在某些情况下将开销控制在 1% 以下。

对大规模 AI 训练的意义

NTP 的创新与 AI 基础设施的总体趋势相吻合,即在大规模 LLM 训练中采用混合并行策略(结合张量并行、数据并行和流水线并行)。最近的研究(例如 2025 年 10 月的关于张量并行和流水线并行协同的研究)强调了减少通信开销和提高容错能力。NVIDIA 的贡献建立在这一工作基础之上,为管理大规模 GPU 集群中的硬件变异性提供了一种可靠的方法。

随着数据中心架构的演进,从 8 个 GPU 的扩展域扩展到 72 个甚至更多,最大化每个设备的正常运行时间至关重要。NTP 的实时适应能力确保了即使在非理想条件下,集群仍能完成有意义的工作,从而保持训练效率并降低与停机相关的成本。

未来展望

NTP 目前是一项实验性功能,相关研究正在探索其向混合专家模型(Mixture-of-Experts,MoE)模型的非均匀专家并行(Nonuniform Expert Parallelism,NEP)扩展。这一框架已经集成到 NVIDIA Megatron Core 的开发分支中,容错功能可通过NVIDIA Resiliency Extension获得。

随着 AI 模型规模和复杂性的不断增长,像 NTP 这样的解决方案将在确保 LLM 训练基础设施的可扩展性和可靠性方面发挥重要作用。对于在 LLM 领域不断突破可能性的开发者和研究人员而言,这代表了在应对大规模训练挑战方面的重要进步。

Image source: Shutterstock