NVIDIA GPU在GB200 NVL72上将Presto查询延迟缩短至8倍

realtime news Jul 08, 2026 16:52

NVIDIA GPU通过利用GB200 NVL72加速Presto SQL查询速度提升至8倍,用于高吞吐量分析的性能。与IBM Storage Scale的集成提高了I/O性能。

NVIDIA GPU在GB200 NVL72上将Presto查询延迟缩短至8倍

NVIDIA已证明,GPU加速的Presto相比传统的CPU集群能提供多达8倍的查询性能提升。基于NVIDIA GB200 NVL72系统的基准测试,这项创新突出展示了GPU在大规模数据分析中的变革潜力,特别适用于需要在从TB到PB级数据集上扩展工作负载的企业。

Presto是一种开源的分布式SQL引擎,被广泛用于对海量数据集的交互式查询。通过整合NVIDIA的GPU技术,该平台显著降低了延迟。在针对单节点NVIDIA DGX B200系统的测试中,使用GPU运行的Presto相比CPU集群提供了2.5倍到8.2倍的运行时加速,这取决于数据规模和部署的GPU数量。例如,使用单个B200 GPU的情况下,Presto查询比八节点的Intel Xeon CPU集群快2.5倍。当使用八个活跃的GPU时,对于1TB数据集,性能提高至8.2倍。

当扩展到多节点部署的NVIDIA GB200 NVL72集群时,性能提升更加显著。该系统由18个节点组成,配备Grace CPU、B200 GPU和高速NVLink连接,并与IBM Storage Scale无缝配合以实现数据移动。通过使用GPU Direct Storage (GDS),数据完全绕过CPU,从而减少开销并加速查询执行。对于30TB数据集,NVL72集群上的优化配置通过I/O和通信改进(包括更大的批处理大小和微调UcxExchange参数)实现了64%的查询运行时间加速。

GPU加速:企业分析的变革者

像Presto这样的GPU加速SQL引擎正迅速在从金融到零售等依赖于交互式分析和AI驱动洞察的行业中被采用,这些行业的关键需求是最大程度地减少查询延迟。IBM和NVIDIA在GTC 2026上宣布的合作对推动这一技术的发展起到了关键作用。基于IBM watsonx.data平台的早期生产测试报告显示,与仅依赖CPU的设置相比,查询性能提高多达25倍,同时成本减少了80%。对于企业来说,这些改进意味着更快的决策和更低的基础设施成本。

NVIDIA GPU加速Presto实现的一大亮点是其使用了NVIDIA cuDF库和NVLink 5.0连接。这些技术实现了高带宽、低延迟的GPU到GPU通信,使处理大规模数据集更加高效。此外,GDS优化确保了从存储到GPU内存的数据路径避免了不必要的CPU参与,进一步提升了吞吐量。

真实基准测试和实际用例

基于TPC-H分析查询的基准测试展示了GPU加速Presto的可扩展性和效率。对于3TB的数据集,单节点DGX B200在启用3个GPU的情况下,比10节点的Intel Xeon CPU集群快3.6倍。在高端配置中,利用同一节点的全部8个GPU,性能加速至7.8倍。这些结果突显了GPU加速在数据湖平台中常见的计算密集型工作负载(如连接、聚合和扫描)中的适用性。

除了性能提升,与IBM Storage Scale的集成还为企业用户带来了实际价值。该文件系统能够以高I/O吞吐量处理PB级数据,与Presto的需求高度契合。在测试中,从传统POSIX读取切换到启用GDS的读取后,查询运行时间减少了近50%,这归功于从存储到GPU内存的直接数据传输。

GPU加速分析的未来是什么?

分析的未来正日益以GPU为驱动。NVIDIA和IBM正在积极改进Presto的GPU利用率,计划优化查询工作节点和协调器之间的通信。这些改进旨在消除瓶颈,进一步减少查询延迟。NVIDIA还鼓励开发者通过其在IBM watsonx.data平台上的技术预览测试GPU加速的Presto。

对于已经投资于数据湖平台架构的企业,GPU加速提供了一条通往高性价比高性能分析的清晰路径。通过利用NVIDIA GB200 NVL72、IBM Storage Scale和GDS等技术,企业能够实现前所未有的查询速度,从而获得更快的洞察力和竞争优势。

Image source: Shutterstock