惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 司徒正美
大猫的无限游戏
大猫的无限游戏
腾讯CDC
J
Java Code Geeks
博客园 - 【当耐特】
Microsoft Azure Blog
Microsoft Azure Blog
V
Visual Studio Blog
人人都是产品经理
人人都是产品经理
博客园 - Franky
博客园 - 聂微东
阮一峰的网络日志
阮一峰的网络日志
美团技术团队
云风的 BLOG
云风的 BLOG
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
U
Unit 42
雷峰网
雷峰网
B
Blog RSS Feed
博客园_首页
量子位
F
Fortinet All Blogs
罗磊的独立博客
H
Hackread – Cybersecurity News, Data Breaches, AI and More
酷 壳 – CoolShell
酷 壳 – CoolShell
C
Check Point Blog

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解
GPT 省钱,不是别用最新模型,而是别浪费缓存
AlfredZhao · 2026-06-23 · via 博客园_首页

2026-06-23 17:53  AlfredZhao  阅读(0)  评论()    收藏  举报

很多人一提到“省钱”,第一反应就是别用最新模型。但从一条真实的开发账单看,影响成本的关键,未必只是模型新不新,而是这次请求里有没有把缓存价值吃满。

01 | 先看这笔账到底花在哪

这次小功能开发的 Token 使用为:total=212,930,其中标准输入 189,287,命中缓存 4,328,576,输出 23,643,输出里还包含 3,112 的 reasoning Token。

按给定单价计算,GPT-5.5 的价格正好是 GPT-5.4 的 2 倍:

计费项 GPT-5.4 GPT-5.5
标准输入 $2.50 / 1M $5.00 / 1M
命中缓存输入 $0.25 / 1M $0.50 / 1M
输出 $15.00 / 1M $30.00 / 1M

代入这次请求的数据后:

① GPT-5.4 的开销

标准输入约 $0.473,命中缓存约 $1.082,输出约 $0.355,总计约 $1.91

② GPT-5.5 的开销

标准输入约 $0.946,命中缓存约 $2.164,输出约 $0.709,总计约 $3.82

只看结果,GPT-5.5 确实更贵,而且是明显更贵。

02 | 真正决定你省不省钱的,是缓存命中

这组账单里最关键的数字,不是 21.2 万总 Token,而是 432 万命中缓存

因为缓存输入按给定价格只需要标准输入的一小部分成本,这次长上下文请求才没有把账单直接拉爆。原始结论也很明确:这类“长上下文/密集开发”的请求里,缓存就是最核心的省钱点。

换句话说,问题不是“要不要用最新模型”,而是:

  • 你有没有持续复用上下文
  • 你有没有让高频对话命中缓存
  • 你是不是把一次开发会话切得过碎

03 | 省钱思路其实很简单

如果是像 Codex 这类连续开发场景,短时间内持续互动,更容易反复命中缓存,因此整体成本会明显更低。

相反,如果中断很久再重新打开,让上下文重新读取,那么第一次“冷启动”就更可能按标准输入计费。这时,贵的不只是模型版本,而是你失去了之前已经建立起来的缓存优势。

所以,笔者更倾向于把结论说得更准确一点:

想省钱,不是简单地别用最新模型,而是尽量把密集开发会话一气呵成,让缓存真正发挥作用。

关注我,和AI一起成长~