惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
News and Events Feed by Topic
爱范儿
爱范儿
Apple Machine Learning Research
Apple Machine Learning Research
博客园 - 叶小钗
Last Week in AI
Last Week in AI
博客园 - 三生石上(FineUI控件)
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
月光博客
月光博客
大猫的无限游戏
大猫的无限游戏
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
博客园 - Franky
人人都是产品经理
人人都是产品经理
The Cloudflare Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 司徒正美
罗磊的独立博客
博客园 - 聂微东
T
Troy Hunt's Blog
美团技术团队
IT之家
IT之家
A
Arctic Wolf
腾讯CDC
雷峰网
雷峰网
SecWiki News
SecWiki News
博客园_首页
L
LINUX DO - 最新话题
Cloudbric
Cloudbric
量子位
N
News and Events Feed by Topic
小众软件
小众软件
C
CXSECURITY Database RSS Feed - CXSecurity.com
Cyberwarzone
Cyberwarzone
J
Java Code Geeks
V
V2EX
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
Latest news
Latest news
Webroot Blog
Webroot Blog
F
Fortinet All Blogs
P
Privacy International News Feed
NISL@THU
NISL@THU
Google Online Security Blog
Google Online Security Blog
WordPress大学
WordPress大学
PCI Perspectives
PCI Perspectives
GbyAI
GbyAI
宝玉的分享
宝玉的分享
阮一峰的网络日志
阮一峰的网络日志
S
Secure Thoughts
Simon Willison's Weblog
Simon Willison's Weblog
P
Palo Alto Networks Blog
V
Visual Studio Blog

BlogFinder

日常漫步 Vol.24 之漫步前山河 - 雅余 周报 #1-聊聊本周的收获 - Edwin's Blog 我的OpenCode必装插件与Skill Write Something 掌中之物未必在掌握之中 · CRIVU PiliNara,一个更顺手的 PiliPlus 分支 「NekoEcho」:做一个必有回响的猫娘主题博客 2026-05 书影音总结 简化博客主题 - 安迪 我第一次发布 npm 包 拾花小记#45:中考前的二三事 – 小改学习志 黛西花园5月游 #18 枇杷又熟了的五月月报 一些奇奇怪怪的需求?word仿方正书版的几个小操作 - Xiobb's Blog 0419 御温泉之旅 修复了一些bug,网站基本上趋于稳定了 - 新锐博客 又回到四十年前 如何定义成功 迷鹿屋2026已重新上线 科技冰火两重天+一周回顾 ${title} 热度退了,我反而用得更深了-咕咚同学 我到底该不该换个域名? 随身WIFI折腾记 - 安迪 博客撰写体验提升——hexo pro插件 为什么不用相机把屏幕上的接关密码拍下来? 国清寺与天台山 – Ouroboros ★★★★☆《挽救计划》——久违的经济上行感 - Davidの3号基地 删除右键“打开方式”里多余选项 第三周刊_No.53|一切都会被支付两次 安卓APP通话记录与录音上传踩坑记录 - 子舒的博客 天量下跌 inBox 笔记 2.3.8,把工具栏交给了你-咕咚同学 我把小龙虾搬到了微信-咕咚同学 安好 - 响石潭 Compound Engineering Plugin:让每个工程单元都比上一个更容易 MOSS-TTS Family:开源高质量语音与声音生成模型家族深度解析 Crawl4AI:专为 LLM 设计的开源 Web 爬虫与数据抓取工具 Build Your Own X:从零实现你最喜欢的技术——程序员进阶的终极资源清单 Anthropic Skills:用文件夹教 Claude 专业技能的开源框架 1年的去月球(下) - 梅之夏 欢迎回来。 简单讲讲 ASN.1 与 OID DTV - 直播聚合客户端 5.22-5.27 – 不兴江 还没去过鸭川 – 不兴江 张晶晶同学三刷林志颖 关于我 – 不兴江 爱与嫉妒 – 不兴江 港股被持续做空 备案码花了四百块-咕咚同学 一句话生成封面:我给公众号做了4种风格的AI封面生成技能 「官」方認證 再谈费曼学习法 2026-05-28T00:34:11+08:00 2026-05-28T00:28:45+08:00 离谱的英语学习指南:基于AI的英语进阶系统方法论 iii:零集成架构的后端统一运行时 Claude Code Harness:让 Claude Code 工作有迹可循的工程化框架 Heretic:全自动移除大语言模型审查机制的开源工具 MarkItDown:微软开源的万能文档转 Markdown 利器 Harness:让 Claude Code 秒变多智能体协作工厂 这段时间尽折腾AI Agent了,确实极大地提高了效率 近期动态:两个新站点正式上线啦 误判解除!zhouayuan.com 腾讯安全申诉成功 - 周阿源|玩具设计・插画日常・生活随笔 Ralph:让 AI 编码工具自主循环跑完所有 PRD 任务的量产神器 全都违法 – 个人工作记录 关于zhouayuan.com被误判 “含违规信息” 的说明与申诉记录 - 周阿源|玩具设计・插画日常・生活随笔 小米 MiMo v2.5 Pro 白嫖 最大的人间清醒,兜里有钱,但是不花。 夜晚靓歌(12):于文文现场solo - 王志勇的Blog 今日插画:风扬起的倔强 - 周阿源|玩具设计・插画日常・生活随笔 回门习俗 独立网卡 - 忘记了回忆 500亿入股人工智能企业 从命令行到桌面智能体-咕咚同学 第一性原理读书笔记 行者微评论223-加班の守株待兔-博客|政治与时事-风雨行者 ZOZO开源物理接触求解器:GPU加速的可扩展仿真引擎 OpenStock:开源股票市场交易平台技术深度解析 MoneyPrinterTurbo:基于AI的全自动短视频生成工具深度解析 Claude-Mem:为 Claude Code 构建的持久化记忆压缩系统 Twenty:可代码化定制的企业级开源 CRM 平台技术深度解析 2026-05-26T22:59:17+08:00 企业级开源大模型部署平台 GPUStack 实战教程 1年的去月球(上) - 梅之夏 Sevalla - 静态网站托管服务 不用翻墙、不用注册、不用月费,普通人也能用上 Claude Code 装修灯具要注意⚠️ 黄梅天先锋 - 游子微博 公安备案顺利办结,站点备案全部完成 - 周阿源|玩具设计・插画日常・生活随笔 第三次兑换天猫超市卡了宗宗酱-三维狐少儿编程 Don't think, feel. - Rolen's Blog 人这一辈子,到底图个什么 博客迁移 - Edwin's Blog 情感赛道写作模板 再现本轮行情的典型特征 裁员与平常心-咕咚同学 别让“偷懒”,成为隐私泄露的破绽 片刻 - Jdeal | Life is like a Design.
LMCache:LLM 推理的 KV Cache 管理层,让 GPU 显存压力骤降
Cheman · 2026-06-13 · via BlogFinder

今天在 GitHub Trending 上看到一个很有意思的项目:LMCache,一个 KV Cache 管理中间层,能够把 GPU 显存里的中间结果持久化出来复用,显著降低 TTFT(首 Token 延迟)和提升吞吐,特别适合长上下文和多轮 Agentic 场景。

一、项目概述

LMCache 定位为 LLM 推理的服务层基础设施,核心思路是把 KV Cache 从"推理引擎的临时状态"转化为"可持久化存储、可跨引擎复用、可观测、可变换的 AI 原生知识"。

项目主要特点:

  • 引擎无关:以独立 Daemon 进程运行,即使推理引擎崩溃,KV Cache 也不会丢失(无 Fate-sharing)
  • 多级持久化卸载:支持 GPU → CPU RAM → 本地 SSD → 远程后端(Redis/Valkey/S3/Mooncake 等)的分层存储
  • 生产级可观测性:内置请求级/Token 级 Prefix Cache 命中率、生命周期、性能诊断等指标
  • 跨引擎集成:已与 vLLM、NVIDIA Dynamo、SGLang、TGI 等主流推理框架深度集成
  • PD 分离:支持 Prefill-Decode 分离架构,通过 NVLink/RDMA/TCP 传输 KV Cache
  • 硬件广泛支持:CUDA、ROCm(AMD MI300X)、Intel SYCL、MUSA 多硬件后端

二、技术原理

2.1 架构设计

LMCache 采用 Daemon + Plugin 架构:

┌─────────────────────────────────────────────────────────┐
│                    LLM Serving Engine                   │
│         (vLLM / Dynamo / SGLang / TGI / ...)            │
└──────────────────────┬──────────────────────────────────┘
                       │  LMCache Connector
┌──────────────────────▼──────────────────────────────────┐
│                 LMCache Daemon                          │
│  ┌─────────────┐  ┌──────────────┐  ┌───────────────┐ │
│  │ Storage Mgr │  │  KV Transforms│  │ Observability │ │
│  └──────┬──────┘  └──────┬───────┘  └───────┬───────┘ │
│         │                │                   │          │
│  ┌──────▼────────────────▼───────────────────▼───────┐ │
│  │           Storage Backend Interface               │ │
│  │  (CPU RAM / SSD / Redis / Mooncake / S3 / ...)   │ │
│  └────────────────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────┘

核心源码在 lmcache/v1/ 目录下,包含存储管理、连接器、Serde(序列化/反序列化)等核心模块。

2.2 持久化 KV Cache 的关键技术

Tiered Storage:KV Cache 从 GPU 显存卸载到分层存储(CPU RAM → SSD → Remote),通过 LRU/TTL 策略管理各层容量。

Non-prefix KV Reuse:基于 CacheBlend 论文(EuroSys 2025),不仅复用前缀,还能在 Prompt 任意位置复用 KV Cache,对不能命中的 Token 用 CacheBlend 选择性重计算来保证生成质量。

Serde Interface:统一的序列化/反序列化接口,支持自定义压缩、Token Dropping 等变换策略:

# Serde 接口示意(基于 README 中描述的 pluggable interface)
class KVSerde:
    def serialize(self, kv_cache) -> bytes:
        ...

    def deserialize(self, data: bytes) -> kv_cache:
        ...

2.3 多硬件后端编译

LMCache 的 GPU 扩展通过 PyTorch C++ Extension 编译,支持多种后端:

# setup.py 核心逻辑(简化)
ext_modules = []

if not NO_NATIVE_EXT:
    # 纯 C++ 通用扩展
    ext_modules.extend(_common_cpp_extensions())

    # GPU 后端(互斥,只能选一)
    if BUILD_WITH_SYCL:
        ext_modules.extend(sycl_extension())    # Intel XPU
    elif BUILD_WITH_HIP:
        ext_modules.extend(rocm_extension())    # AMD ROCm
    elif BUILD_WITH_MUSA:
        ext_modules.extend(musa_extension())    # 摩尔线程
    else:
        ext_modules.extend(cuda_extension())    # NVIDIA CUDA

CUDA 架构支持范围非常广:7.5 (T4) → 12.0 (RTX 50),确保各类 GPU 均能受益。

三、安装与快速开始

环境要求

  • Python >= 3.10, < 3.14
  • PyTorch 2.11.0
  • CUDA 12.9+ 或 ROCm / SYCL / MUSA 环境

最简安装

从源码编译(启用全部 GPU 扩展):

git clone https://github.com/LMCache/LMCache.git
cd LMCache
pip install -e . --no-build-isolation

快速上手

安装完成后,有三个命令行工具可用:

# 启动 LMCache Server(管理 KV Cache 的 Daemon 进程)
lmcache_server

# 启动 LMCache Controller(API 服务)
lmcache_controller

# CLI 工具
lmcache --help

配合 vLLM 使用示例:

pip install lmcache vllm
# vLLM 会自动通过 connector 与 LMCache Daemon 通信

更多配置和部署方案请参考 官方文档

四、生态与合作伙伴

LMCache 已深度融入 LLM 推理生态,是 PyTorch Foundation 官方项目:

  • 🔥 NVIDIA Dynamo:官方集成,加速 LLM 推理
  • 🔥 vLLM v1:多模态 KV Cache 加速(GPT-4o、Llama 等)
  • 🔥 AMD MI300X:Agentic Workload 基准测试,性能显著提升
  • CoreWeave + Cohere:生产级部署案例
  • Redis:KV Cache + Redis 组合,降低推理成本
  • Mooncake / InfiniStore:高性能 KV 传输后端
  • S3 兼容对象存储:低成本海量 KV Cache 存储

2026 年 GTC 也有相关展示,已成为分布式推理领域的基础设施层。

五、总结

LMCache 填补了 LLM 推理中 KV Cache 无法复用 的关键空白——它通过标准化的 Daemon + 插件架构,将 KV Cache 管理从推理引擎中解耦出来,既保证了稳定性(引擎崩溃不影响 Cache),又实现了跨请求、跨会话、跨引擎的复用。结合 CacheBlend 等学术研究成果,在长上下文 RAG 和多轮 Agentic 场景中有着明显的性能优势。

如果你正在做 LLM 推理优化,或需要处理长上下文场景,LMCache 是一个值得深入了解的项目。

项目地址:https://github.com/LMCache/LMCache 官方文档:https://docs.lmcache.ai/ 博客(含深度技术文章):https://blog.lmcache.ai/