99.9% 稳定运行时间对 AI 推理的真正意义
realtime news Jul 16, 2026 23:00
解析 AI 推理中的 99.9% 稳定运行时间:它的实现方式、故障领域,以及在承诺之前应该向供应商提出的关键问题。
对于AI推理系统——其中 API 提供实时预测——99.9% 的稳定运行时间不仅仅是一个数字;它是定义可靠性期望的基准。然而,有多少供应商能够通过能应对现实世界故障的架构来兑现这一承诺?Together AI 的最新博客深入探讨了实现这三个“九”的工程挑战,以及企业在选择供应商之前应仔细审视的内容。
99.9% 稳定运行时间的 SLA 意味着每月停机时间少于 43 分钟,这一临界值对依赖 AI 模型进行实时操作的企业至关重要。当这些系统出现故障时,连锁反应可能会瘫痪整个工作流程——例如刚在 2026 年 7 月 15 日一天前报告的 ChatGPT 部分故障。这些事件凸显了即使是领先的平台也可能非常脆弱。
为什么实现 99.9% 比听起来更难
与传统服务相比,AI 推理系统面临独特的故障模式。作为高性能 AI 工作负载的核心,GPU 的故障方式与 CPU 不同。Together AI 指出了常见问题,包括可能悄然破坏内存的 ECC 错误、驱动程序崩溃以及热节流——这些都可能导致模型输出下降或服务完全中断。
除了硬件问题,网络和软件故障也可能加剧中断。例如,网络交换机故障可能在导致完全不可用之前降低性能。存储中断会阻止访问模型权重,可能级联为更广泛的容量问题。Together AI 强调,这些故障很少孤立发生,从而使恢复工作更加复杂。
每个“九”需要不同的工程实现
构建更高的稳定运行时间——99%、99.9% 或 99.99%——不仅仅是扩大努力规模,而是解决根本不同的问题:
- 99%: 应对节点级故障,通过检测并替换退化硬件以防止影响请求。这要求在可观察性和容量管理之间实现精细平衡,因为高负载下的 GPU 往往掩盖微妙问题。
- 99.9%: 对整个数据中心(DC)故障的弹性。这一层需要跨多个设施进行主动流量路由,而不仅仅是冷备用,并且每个设施都需要有足够的容量来处理完全故障转移。Together AI 强调,依赖于第三方超大规模供应商的提供商通常无法直接控制这些故障领域。
- 99.99%: 区域冗余。供应商必须部署在多个区域,具备可用区(AZ)故障转移和预留容量以吸收整个区域的故障。没有预留的空闲容量,恢复时间会被拖延。
向供应商提问的关键问题
Together AI 提供了一份检查清单,用于评估推理提供商,敦促客户深挖 SLA 标题之外的内容。关键问题包括:
- 供应商是拥有自己的基础设施,还是从超大规模供应商处租赁?如果是外包的,电力、冷却或网络层故障能多快解决?
- 故障转移路径是通过实时流量测试的,还是仅在定期演练期间测试的?现实的恢复时间目标(RTO)是多少?
- 稳定运行时间是如何被衡量的——是在负载均衡器上,还是在成功完成推理时?通过重试掩盖的部分退化可能会扭曲指标。
近期的故障,例如今年早些时候 Verizon 在美国范围内的网络大规模中断,或 ChatGPT 的高错误率,凸显了提前提出这些问题的重要性。那些无法向您详细说明其架构或在紧急情况下依赖第三方队列的供应商,可能存在潜在风险。
为什么这很重要
推理稳定运行时间不仅仅是一个技术指标——它是企业在大规模部署 AI 时的关键业务因素。模糊的 SLA 定义可能会在承诺与实际交付之间留出漏洞,而性能下降往往被排除在停机计算之外。Together AI 以透明的方式测量推理完成时的稳定运行时间,并区分可用性和吞吐量保证,这为行业设定了高标准。
对于评估供应商的企业来说,结论很明确:深入了解数字背后的架构。随着 AI 在各行业中成为核心运营的一部分,确保您的系统能够在下一次故障中存活可能决定您的未来成败。
Image source: Shutterstock