惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
U
Unit 42
GbyAI
GbyAI
M
MIT News - Artificial intelligence
美团技术团队
罗磊的独立博客
雷峰网
雷峰网
量子位
博客园 - 【当耐特】
Last Week in AI
Last Week in AI
D
Docker
小众软件
小众软件
S
SegmentFault 最新的问题
Blog — PlanetScale
Blog — PlanetScale
阮一峰的网络日志
阮一峰的网络日志
宝玉的分享
宝玉的分享
T
Tailwind CSS Blog
WordPress大学
WordPress大学
V
V2EX
博客园_首页
腾讯CDC
The Cloudflare Blog
A
About on SuperTechFans
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC

博客园 - AlfredZhao

理解Oracle Property Graph:以账户转账示例完成图特性最小测试 APEX 无法分配 SH 用户?一个存储过程轻松解决 SH 中文化样例数据使用手册 Oracle 排除非业务表:一份能直接抄的“全量过滤”SQL 进程都杀了,为什么 `netstat` 还能看到端口? MAC 空间告急?Codex 的 156GB 缓存垃圾,这样清! 人工清理问题数据:先查准,再删除 TK(Trusted Knowledge)为何而生? 使用快捷键快速切换 Mac 外接显示器模式 客户环境 Nginx 配置:流式报表与超时排查要点 Security Central:数据库安全的统一控制与运营平台 Palantir 眼中的一次“订单可能延期”,如何成为实时决策的起点? 从一条订单消息到 Bronze、Silver、Gold:我的第一次 Kafka + Lakehouse 实验 UUID v4 与 v7:同样是唯一 ID,为什么数据库表现可能完全不同? 用 crontab 给 LLM 使用量装上“监控眼” DeepSeek 与 GPT API 价格调整:该关注什么? 查看 Oracle 数据库中的定时任务执行情况 Codex 专用用户登录后自动进入默认项目目录 Mac 小技巧:用方向键优雅处理超长网址 Oracle GDD 与 Raft:别把共识机制和数据主权混为一谈 在 Oracle APEX 中用 BGE_BASE 生成向量:从模型导入到历史数据更新 行业人+AI:真正有价值的四个关键要素 知识库文件解析失败:一次由 Domain Index 引发的定位记录 Unicode 码位数、UTF-8 字节数、中英文差异和 Oracle 长度别再混淆了 Skill 的使用:从路径到能力边界 切换 Embedding 模型时,千万别忽略历史向量维度 kbot 适配 GPT-5.6:一次参数兼容性排查 Git 打 Tag 上传 GitHub 遇到 SSH 超时,如何处理? SQL JOIN 写法:把多表关联条件写清楚 VS Code 一键美化 JSON:不用安装插件
GPT 省钱,不是别用最新模型,而是别浪费缓存
AlfredZhao · 2026-06-23 · via 博客园 - AlfredZhao

2026-06-23 17:53  AlfredZhao  阅读(0)  评论()    收藏  举报

很多人一提到“省钱”,第一反应就是别用最新模型。但从一条真实的开发账单看,影响成本的关键,未必只是模型新不新,而是这次请求里有没有把缓存价值吃满。

01 | 先看这笔账到底花在哪

这次小功能开发的 Token 使用为:total=212,930,其中标准输入 189,287,命中缓存 4,328,576,输出 23,643,输出里还包含 3,112 的 reasoning Token。

按给定单价计算,GPT-5.5 的价格正好是 GPT-5.4 的 2 倍:

计费项 GPT-5.4 GPT-5.5
标准输入 $2.50 / 1M $5.00 / 1M
命中缓存输入 $0.25 / 1M $0.50 / 1M
输出 $15.00 / 1M $30.00 / 1M

代入这次请求的数据后:

① GPT-5.4 的开销

标准输入约 $0.473,命中缓存约 $1.082,输出约 $0.355,总计约 $1.91

② GPT-5.5 的开销

标准输入约 $0.946,命中缓存约 $2.164,输出约 $0.709,总计约 $3.82

只看结果,GPT-5.5 确实更贵,而且是明显更贵。

02 | 真正决定你省不省钱的,是缓存命中

这组账单里最关键的数字,不是 21.2 万总 Token,而是 432 万命中缓存

因为缓存输入按给定价格只需要标准输入的一小部分成本,这次长上下文请求才没有把账单直接拉爆。原始结论也很明确:这类“长上下文/密集开发”的请求里,缓存就是最核心的省钱点。

换句话说,问题不是“要不要用最新模型”,而是:

  • 你有没有持续复用上下文
  • 你有没有让高频对话命中缓存
  • 你是不是把一次开发会话切得过碎

03 | 省钱思路其实很简单

如果是像 Codex 这类连续开发场景,短时间内持续互动,更容易反复命中缓存,因此整体成本会明显更低。

相反,如果中断很久再重新打开,让上下文重新读取,那么第一次“冷启动”就更可能按标准输入计费。这时,贵的不只是模型版本,而是你失去了之前已经建立起来的缓存优势。

所以,笔者更倾向于把结论说得更准确一点:

想省钱,不是简单地别用最新模型,而是尽量把密集开发会话一气呵成,让缓存真正发挥作用。

关注我,和AI一起成长~