AMD 在 MI300X GPU 上测试“拓扑幽灵协议”

realtime news Jul 09, 2026 20:15

AMD 在 MI300X GPU 上评估用于 LLM 推理的实验性拓扑幽灵协议,目标是高并发工作负载和内存优化。

AMD 在 MI300X GPU 上测试“拓扑幽灵协议”

AMD 已经公布了对所谓的拓扑幽灵协议(TGP)的评估,这是一种实验性架构,旨在提升高并发场景下长上下文大型语言模型(LLM)推理的性能。据 2026 年 7 月 8 日发布的一篇技术文章称,TGP 在 AMD 的高容量 Instinct MI300X GPU 上进行了测试,重点通过 KV 缓存回收和基于分段的状态管理提高内存效率。

TGP 设计的核心是一种分段内存驻留模型,该模型可以减轻推理过程中活动内存不受控制的增长。与其将完整的推理状态保存在内存中,TGP 将工作负载分为多个段,并在这些段之间回收键值缓存。这种方法虽然引入了额外的计算开销,但在极端压力下增强了系统的弹性,特别是在涉及多用户和大型模型时。

实验结果突出了这些权衡。在使用 Qwen 72B-Instruct 模型进行的压力测试中,TGP 在 256 个并发用户各生成 250 个输出 token 的情况下,达到了每秒 431 个 token 的速率,并实现了 100% 的成功率。相比之下,在相同条件下,标准的 vLLM 框架速率下降到每秒 42.7 个 token,成功率仅为 12%。虽然 TGP 并非在所有情况下都更快,但当内存和并发限制被推到极限时,它表现出了更强的稳定性。

AMD 选择 Instinct MI300X GPU 进行这些测试,是因为其 192 GB 的 HBM3 内存和 5.3 TB/s 的带宽非常适合承载多个模型并管理高内存负载。实验设置包括一个 24B 主模型、一个 3B 辅助模型和一个 72B 量化备用模型,以及运行时缓冲区和 TGP 分段过程产生的内存开销。这些配置突出了 MI300X 在支持复杂多用户工作负载中的关键作用。

尽管结果令人鼓舞,AMD 承认 TGP 仍处于实验阶段。该架构尚未针对生产环境进行优化,其性能可能因模型配置和工作负载的不同而有所变化。然而,压力测试表明它有潜力重新定义 AI 推理中的性能阈值。

值得注意的是,目前除了 AMD 外,还没有经过同行评审的文献或经过验证的来源在 LLM 推理的背景下引用“拓扑幽灵协议”。“TGP”一词更常与量子计算中的传输验证框架“拓扑间隙协议”相关联。这引发了关于 AMD 的 TGP 是否代表一种尚未被广泛认可的推测性或专有方法的疑问。

虽然 TGP 的更广泛市场影响尚不明确,但这些实验突显了 AMD 在高并发 AI 工作负载领域的创新努力。如果进一步优化,TGP 可能会吸引那些需要管理复杂 LLM 部署的企业,尤其是在内存限制威胁到系统稳定性的情况下。

Image source: Shutterstock