最新更新
7/17/2026 9:51:00 AM

LMCache以CacheBlend实现14倍加速

LMCache以CacheBlend实现14倍加速

据@_avichawla称,LMCache多进程与CacheBlend使TTFT快14倍、解码快4倍,成本降至一成。

原文链接

详细分析

研究人员开发了开源项目LMCache,通过解决KV缓存重用限制,为大型语言模型实现了14倍更快的首token时间和90%更低的推理成本。

关键要点

  • 提供商对缓存输入token提供高达90%的折扣,因为命中可完全跳过预填充计算,在稳定提示上可实现60%至85%的命中率。
  • 传统仅前缀缓存无法处理多文档查询不同顺序或多轮对话等常见模式,导致90%的缓存块未被使用。
  • LMCache采用分离架构和CacheBlend选择性重计算,支持vLLM SGLang和TensorRT LLM集成实现非前缀重用。

KV缓存优化的深入分析

标准KV缓存具有位置依赖性,每个token仅编码对先前上下文的注意力,因此必须字节级前缀匹配才能命中。阿里巴巴生产数据表明仅10%的块贡献77%的命中,大部分存储闲置。LMCache将缓存管理移至独立进程,仅通过共享GPU内存交换块ID,而到CPU磁盘和远程存储的传输并行运行避免干扰推理。

CacheBlend实现灵活重用

CacheBlend仅重计算边界注意力token,允许文档任意顺序或组合,在H200硬件上运行Qwen3 235B并发50用户时提供2至4倍多文档处理加速,实现报道的14倍TTFT和4倍解码提升。

商业影响与机会

企业通过降低token成本和提高吞吐量获得即时变现机会,支持实时知识库查询等新服务而无需按比例扩展GPU。资源争用实施挑战通过多进程设计解决降低运营开销。竞争格局有利于早期集成LMCache的采用者,推理引擎主要参与者已支持插件。监管合规通过高效资源使用改善符合能效要求,伦理最佳实践强调透明缓存政策以维持生成质量。

未来展望

行业将转向分离式缓存架构标准化非前缀重用,使每份文档成为可重用资产。预测显示广泛采用将进一步压缩推理经济加速各行业AI部署,通过选择性重计算技术维持质量。

常见问题

LMCache与标准KV缓存有何不同?

LMCache引入分离管理和CacheBlend实现非前缀重用,克服传统系统中浪费大部分缓存块的位置依赖问题。

CacheBlend如何在跳过重计算时保持质量?

它选择性重计算仅跨文档边界的注意力token,在多文档基准上验证准确性并实现2至4倍加速。

哪些推理引擎支持LMCache集成?

它直接插入vLLM SGLang和TensorRT LLM,无需引擎修改即可广泛部署。

高缓存命中率可实现什么成本节省?

提供商折扣高达90%,LMCache提升有效命中率在Qwen3 235B等生产工作负载上交付14倍更快TTFT。

Avi Chawla

@_avichawla

Daily tutorials and insights on DS, ML, LLMs, and RAGs • Co-founder