Kimi-K3 在 AMD Instinct GPU 上扩展至 2.8T 参数

realtime news Jul 27, 2026 16:30

Kimi-K3,一个拥有 2.8T 参数的 AI 模型,已部署在 AMD Instinct MI355X GPU 上,并提供 Day 0 高级推理能力支持。

Kimi-K3 在 AMD Instinct GPU 上扩展至 2.8T 参数

Moonshot AI 的 Kimi-K3,这是一款拥有 2.8 万亿参数的大型语言模型,根据 2026 年 7 月 27 日发布的技术更新,已在 AMD 高性能的 Instinct MI355X GPU 上实现了 Day 0 验证部署。该模型于 7 月 16 日开放 API 访问,利用 AMD 的张量并行 (TP8) 架构,可在八 GPU 配置上高效运行单实例操作。这标志着生成式 AI 模型在复杂推理任务中的规模化迈出了重要一步。

MI355X GPU 基于 AMD 的 CDNA 4 架构,每块 GPU 提供 288 GiB 的 HBM3E 内存和 8 TB/s 的峰值内存带宽,非常适合 Kimi-K3 的计算需求。部署测试显示,每块 GPU 处理约 205 GiB 的模型权重和运行时状态,并保留 82 GiB 的内存余量用于未建模的开销,例如通信缓冲区和内核工作空间。该模型能够处理多达 100 万个上下文位置的标记,使其在长文本推理和文档分析任务中处于领先地位。

Kimi-K3 的关键创新

Kimi-K3 引入了多项架构创新,包括 Kimi Delta Attention (KDA)、门控多头潜在注意力 (MLA) 和稳定潜在 MoE。这些创新减少了内存开销,并提高了长上下文推理的效率。该模型每个标记激活 896 个专家中的 16 个,确保了可扩展性而不牺牲精度。虽然该模型具有内置的视觉能力的多模态设计,但当前部署专注于仅文本任务。

在 AMD 的 TP8 框架下,Kimi-K3 的权重分布在八个 GPU 上,采用先进的分片技术。例如,密集层和专家矩阵使用行和列并行分区,而注意力权重被分片到多个 GPU 上,以充分利用 MI355X 的 10.1 PFLOPS 低精度计算性能。

市场和战略背景

Kimi-K3 的部署正值 AI 行业的关键时刻。该模型预计将在 7 月 27 日发布开放权重,这引发了与 OpenAI 的 GPT-4 和 Google 的 Gemini 的比较,但它通过原生多模态功能和前所未有的 100 万标记上下文窗口脱颖而出。API 定价为每百万输入标记 3 美元和每百万输出标记 15 美元,使其在软件工程、研究和知识管理等企业应用中具有竞争力。

此时正值 AI 领域的地缘政治紧张局势。Nvidia CEO 黄仁勋于 7 月 23 日称赞了中国的 AI 创新,包括 Kimi-K3。同时,7 月 21 日的报道显示,特朗普政府正在探讨对中国 AI 模型的禁令,这可能会给 Kimi-K3 的全球采用带来复杂性。

有趣的是,一个基于 Solana 的名为 "KIMI3" 的迷因代币浮出水面,截至 2026 年 7 月 17 日声称市值为 66K 美元。然而,该代币与 Moonshot AI 或 Kimi-K3 项目无关。

接下来是什么?

虽然当前的部署专注于单实例验证,但未来的性能优化计划包括微调内核效率、通信策略以及对 100 万标记上下文的支持。Moonshot AI 还计划将 Kimi-K3 的用例扩展到多模态任务,利用其视觉处理能力。

对于 AMD 来说,Kimi-K3 在其 MI355X GPU 上的成功验证突显了其在高性能 AI 硬件市场中的竞争优势,直接挑战 Nvidia 的主导地位。此次合作强调了支持下一代 AI 工作负载所需的专用基础设施的日益增长的需求。

Image source: Shutterstock