惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
S
Schneier on Security
C
Cyber Attacks, Cyber Crime and Cyber Security
N
News and Events Feed by Topic
TaoSecurity Blog
TaoSecurity Blog
T
Threat Research - Cisco Blogs
博客园 - 三生石上(FineUI控件)
大猫的无限游戏
大猫的无限游戏
The Last Watchdog
The Last Watchdog
Latest news
Latest news
AI
AI
Webroot Blog
Webroot Blog
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
The Hacker News
The Hacker News
Google DeepMind News
Google DeepMind News
S
Securelist
IT之家
IT之家
雷峰网
雷峰网
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
P
Proofpoint News Feed
Last Week in AI
Last Week in AI
博客园 - Franky
美团技术团队
Cyberwarzone
Cyberwarzone
C
CERT Recently Published Vulnerability Notes
Security Archives - TechRepublic
Security Archives - TechRepublic
Security Latest
Security Latest
T
Tailwind CSS Blog
S
Security Affairs
S
Security @ Cisco Blogs
H
Heimdal Security Blog
腾讯CDC
N
News | PayPal Newsroom
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
博客园 - 司徒正美
博客园_首页
Jina AI
Jina AI
M
MIT News - Artificial intelligence
Hacker News - Newest:
Hacker News - Newest: "LLM"
B
Blog
F
Full Disclosure
www.infosecurity-magazine.com
www.infosecurity-magazine.com
T
The Blog of Author Tim Ferriss
Schneier on Security
Schneier on Security
N
News and Events Feed by Topic
NISL@THU
NISL@THU
C
Cisco Blogs
T
Troy Hunt's Blog
O
OpenAI News
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More

暗无天日

读:AI Agent 安全日志——从可见性与隐私的两难说起 - 暗无天日 读:AI Agent 生产化——一份从原型到上线的速查清单 - 暗无天日 AI写作的语言指纹——如何让文字不那么像机器 - 暗无天日 读:50 条 Claude Code 技巧——一个工程经理的六个月使用心得 读:AI 辅助开发为什么让 E2E 测试更有价值 - 暗无天日 读:在Emacs中使用Claude Code(Spacemacs适配版) - 暗无天日 Claude Code 背后的工程哲学——读 Agent Harness Engineering 读:Agent Harness Engineering——AI 智能体不只是模型,还有套件 - 暗无天日 browser-harness:让 AI 直接接管你的浏览器 - 暗无天日 读:Security-First CI/CD —— DevSecOps 自动化实践指南 TIL: 数字小键盘的小数点陷阱与行内算术求值 - 暗无天日 读:Immutability 不是万能药,它是一种权衡 - 暗无天日 Conducty:给 Claude Code 加上项目记忆和并行执行能力 - 暗无天日 读 — GitHub Trending 里的 Claude Code 技能包 TIL: Emacs 中那些跟鼠标配合的冷门快捷键 - 暗无天日 读:Anvil——把 Emacs 变成 AI 的工具服务器 读:Emacs 代码折叠终极指南 - 暗无天日 读:Clojure 搭车客指南 - 暗无天日 git推送失败后恢复仓库损坏的完整记录 - 暗无天日 多智能体系统的两个有效模式——以及对 Claude Code 用户的启示 - 暗无天日 用 Org Babel 写 Literate 博文:扩展执行 + 定制导出 proced:Emacs 内置的进程查看器 - 暗无天日 从 proced 定制中学到的 Elisp 模式 读:让 Emacs proced 在 macOS 上显示 CPU 和内存 异步编程的函数着色税 - 暗无天日 链式调用的代价:JavaScript 和 Clojure 的共同教训 - 暗无天日 hyperfine:命令行基准测试工具 - 暗无天日 管道中的变量去哪了?——子 shell 作用域陷阱 - 暗无天日 开源包装器的信任陷阱:四个危险信号 - 暗无天日 程序员愿意为 AI 写文档,却不愿为同事写 - 暗无天日 mktemp: Shell 脚本中临时文件的安全陷阱与最佳实践 - 暗无天日 WSL9x —— 在 Windows 9x 里跑 Linux 内核 6.19 用 ox.el 做你想做的事 —— org-export 高级编程指南 读:Hot-wiring the Lisp Machine —— 用纯 Elisp 构建零依赖的 Org 静态站点生成器 Elisp 性能优化的六个实战教训 - 暗无天日 fcitx5 下 Emacs 无法切换输入法的排查 - 暗无天日 ERT 测试交互命令的三种方式 - 暗无天日 SEM Assistant: 当 Elisp 守护进程遇上 LLM 用 dmsg 给 Elisp 加上结构化调试日志 用 org-habit 追踪非每日习惯 - 暗无天日 Clojure X-Men:当编程语言特性变成超能力 - 暗无天日 TIL: 用 diff-hl 在 fringe 中显示 git 变更 读:llm-test —— 用 LLM agent 驱动 Emacs 测试 TIL: AI 时代的橡皮鸭调试 - 暗无天日 fcitx 启动后键盘输入卡顿的排查 - 暗无天日 TIL: 早期网页的图片热区导航 - 暗无天日 读 Seeing the Whole System 用 Emacs 自动生成每周链接推荐 - 暗无天日 读:ASCII control characters in my terminal 读 What to learn - 暗无天日 Lisp 的括号之痛——一个愚人节玩笑揭开的老伤疤 - 暗无天日 一本书该"线性读"还是"并行读" - 暗无天日 读 How to Monetize a Blog:一篇伪装成变现指南的讽刺文 Python Mock 第三方依赖的四种策略 - 暗无天日 Emacs Lisp 热重载实用指南 - 暗无天日 Prot 的 Emacs 配置哲学 - 暗无天日 TIL: 从直播对谈中学到的三个 Emacs 技巧 - 暗无天日 TIL: 自动使用项目虚拟环境的 Python - 暗无天日 TIL: 让 Help buffer 自动获得焦点 一条命令让本地开发用上 HTTPS —— slim 工具介绍 用 fsck 检查和修复 Linux 文件系统 排查Linux进程"卡死"实战:从strace到gdb全流程 - 暗无天日 PostgreSQL 索引:从基础到你可能不知道的高级用法 - 暗无天日 用 .pdbrc 自定义 Python 调试器 ANSI 转义码的标准化现状 - 暗无天日 终端程序的潜规则 - 暗无天日 PARA Org-mode 测试配置 - 暗无天日 AI越强越辣鸡?控制论说这是必然的 - 暗无天日 AI 越强越需要你盯着——反馈循环实操指南 - 暗无天日 你的AI代理正在偷你的密钥——四种你没想到的泄露通道 - 暗无天日 LLM 在 DevOps 中的三种角色 - 暗无天日 写作风格的反建议 - 暗无天日 反驳本质复杂性——Dan Luu 论为什么《没有银弹》错了 - 暗无天日 文件充满了危险——Dan Luu 谈文件系统的可靠性陷阱 - 暗无天日 AI 时代的 PARA 方法:用 Org-mode 和 AI 打造个人知识管理系统 Linux 数据去重学习笔记 - 暗无天日 创建跨平台 ZIP 文件的隐藏陷阱:Extra Field - 暗无天日 X11 Forwarding 排障指南 - 暗无天日 IP欺骗端口扫描:当别人冒充你去扫描别人 - 暗无天日 Linux 输入栈全景解析:从硬件按键到屏幕响应 - 暗无天日 Unix 系统中那些被埋没的配置开关——以 FontConfig 为例 - 暗无天日 在Linux上限制儿童使用电脑 - 暗无天日 GIF不仅仅是一种图片格式——用GIF流做些奇怪的事 - 暗无天日 Leiningen 学习笔记:Clojure 项目构建与管理从入门到实战配置 - 暗无天日 Google SRE Book 读书笔记 - 暗无天日 yes 管道 head 发生了什么 - 暗无天日 为什么 nohup 在 crontab 中不起作用 Bash中的Indirection与Nameref - 暗无天日 Linux PAM 简介 - 暗无天日 从Linux ISO文件启动计算机 - 暗无天日 用 Bash 打造一个Screen Locker 用GitHub Actions自动构建EGO博客 - 暗无天日 blocking I/O 的作用 - 暗无天日 mobileog 手机端同步提示Error:2 No such file 的解决方法 回收 WSL2 VHDX 文件占用空间 使用 org-mode columnview 生成任务列表 - 暗无天日 Emacs 作为 MPD 客户端 - 暗无天日 移动文件路径却不破坏org file link的方法 - 暗无天日 如何合理的导出help link 成HTML - 暗无天日 笑话理解之Biology - 暗无天日
读 — Prompt Caching 省钱指南
2026-04-29 · via 暗无天日

jdon.com 转载了一篇关于 LLM prompt caching(提示词缓存)的深度解析,以 Claude Code 为实际案例。prompt caching 不是什么新功能,而是 LLM 推理的基础设施特性,理解它的运作方式能帮你显著降低 API 调用成本。本文解读其中的核心机制和实践规则。

重复计算:LLM 最贵的隐性开支

每次 AI 代理执行一步操作,都会把整个对话历史重新发给大模型。这段历史里有系统指令、工具定义,还有三个回合前就处理过的项目背景。所有这些内容在每个回合都被重新读取、重新计算、重新收费。

这笔账算起来很惊人:一个 2 万 token 的系统提示词,跑 50 个回合,就是 100 万 token 的重复计算,按全价收费,但没产生任何新价值。prompt caching 就是来解决这个问题。

静态前缀与动态后缀:缓存的关键分界

要用好缓存,先要搞清楚请求里哪些东西会变、哪些不变。每个代理请求都包含两部分:

  • 静态前缀 :系统指令、工具定义、项目背景、行为规则。这些在各回合之间完全不变。
  • 动态后缀 :用户消息、助手回复、工具输出。这些随每个回合不断增长。

缓存之所以可行,就是因为静态前缀不变。推理服务器把静态前缀的计算结果存下来,后续请求如果带着相同的前缀,直接从内存读取,跳过整个计算过程。

这个分界线是理解后续所有规则的基础。缓存只对不变的部分有效,所以你的架构设计必须确保前缀稳定。

KV 缓存:把计算结果存下来

稍微深入一点技术细节。Transformer 处理输入时分两个阶段: 预填阶段 * (prefill) 处理整个输入,做大量矩阵运算,计算密集所以贵; * 解码阶段 (decode) 逐个生成 token,主要读取历史状态,内存密集但计算量小。

在预填阶段,模型为每个 token 计算一对"键"(key)和"值"(value)向量。这些向量一旦算完就不会变。如果没有缓存,每个请求都丢弃这些向量重新算;有缓存的话,它们被持久化在推理服务器上,通过 token 序列的哈希值索引。新请求带着相同前缀到来,哈希匹配,向量从内存加载,预填计算直接跳过。

从计费角度看:缓存读取的价格是基础输入价格的十分之一(0.1 倍),缓存写入要付 1.25 倍的溢价(因为要存储计算结果)。这套定价意味着缓存只有在命中率够高时才划算。

哈希敏感性:顺序换了就是缓存未命中

prompt caching 最反直觉的一点: 顺序敏感 。基础设施对整个 token 序列做哈希计算。序列中任何变化,哪怕只是两个元素的顺序互换,哈希值就变了,整个前缀按全价重新计算。

原文给了几个生产环境中破坏缓存的真实案例:

  • 系统提示词里注入了时间戳,导致每个请求的哈希值都不同
  • JSON 序列化器对工具定义的键排序不一致,不同请求之间顺序变了
  • 代理工具在会话中途更新了参数,2 万 token 的缓存全部作废

这解释了为什么 Claude Code 在工程上如此小心翼翼。

三条铁律

基于这些教训,原文总结了三条规则:

  1. 会话期间不要修改工具定义 。工具定义是缓存前缀的一部分,添加或删除任何一个工具都会让下游所有内容失效。
  2. 不要在会话中途切换模型 。缓存是模型特定的,中途换模型意味着从头重建整个缓存。
  3. 不要为了更新状态而改变前缀 。Claude Code 的做法是:需要提醒 AI 某件事时,不编辑系统提示词,而是把提醒作为一条新消息追加到用户消息中,前缀保持原样。

这三条规则的共同逻辑是:缓存前缀是"只写一次、反复读取"的资源。任何修改都会导致重新计算,而重新计算的价格是缓存读取的十几倍。

Claude Code 的 92% 命中率

Claude Code 是 prompt caching 的最佳实践案例。它的整个架构围绕一个目标:让缓存保持"热"状态(即始终命中)。

原文描述了一个 30 分钟编码会话的成本账本:

  • 第 0 分钟:加载系统提示词、工具定义和 CLAUDE.md,超过 2 万 token。这是整个会话中最贵的时刻,但只需付一次。
  • 第 1 到 5 分钟:用户开始给指令,Claude Code 派出子代理浏览代码库。2 万 token 的静态前缀从缓存读取,每百万 token 0.3 美元而非 3 美元。
  • 第 6 到 25 分钟:计划子代理收到的是摘要而非原始输出(避免膨胀动态后缀),每个回合都从缓存读取前缀,命中率攀升到 90% 以上。每次访问重置缓存的存活时间,保持缓存温热。
  • 第 28 分钟:会话结束。总处理量约 200 万 token,其中 184 万是缓存读取。按 Sonnet 4.5 费率,无缓存要 6 美元,有缓存只要 1.15 美元,省了 81%。

监控你的缓存效率

要验证缓存是否正常工作,看每个 API 响应中的三个字段:

  • cache_creation_input_tokens :写入缓存的 token 数
  • cache_read_input_tokens :从缓存读取的 token 数
  • input_tokens :未经过缓存处理的 token 数

缓存效率公式: cache_read_input_tokens 除以 cache_read_input_tokenscache_creation_input_tokens 。像跟踪系统可用性一样跟踪这个指标。

总结:缓存不是开关而是架构纪律

prompt caching 不是一个可以随意开关的功能。它需要你围绕它来设计架构:静态内容放顶部、动态内容放底部、前缀在会话中保持不变、动态后缀尽量精简。

Claude Code 展示了这种纪律在大规模下的效果:92% 命中率,81% 成本节省。如果你在构建基于 LLM 的系统却没有围绕 prompt caching 来设计,那你就是在把大部分利润空间白白扔掉。