惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
Y
Y Combinator Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Hugging Face - Blog
Hugging Face - Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
The Cloudflare Blog
L
LangChain Blog
美团技术团队
N
Netflix TechBlog - Medium
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
B
Blog
博客园 - 司徒正美
爱范儿
爱范儿
D
DataBreaches.Net
月光博客
月光博客
U
Unit 42
B
Blog RSS Feed
Engineering at Meta
Engineering at Meta
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
MongoDB | Blog
MongoDB | Blog
腾讯CDC

程序员

V2EX 看到讨论"跨域"的帖子,那个她好像回来了 codex 今天真的是不稳定呀。 火山方舟 Coding Plan 慎买 刚问了大家 openclaw 和 hermes 在什么机器上面玩,求推荐一个机器 GPT-image-2 生成 AI 图片防伪有感 codex pro 5 小时限制已经严重缩水 逆天 Antigravity 动态 JSON 序列化对强类型语言很难吗? 自建了 GPT Coding Plan,遇到了定价问题,请教大家 大家都是在什么设备上玩 openclaw 以及 hermes 的呀? 软考还有一个月就考试了,你们学习了吗? 大伙用 AI 会考虑在 user scope 的 CLAUDE.md/AGENTS.md 里交代 AI 说中文吗 我发现程序员这个群体很大部分其实挺抠的 最近使用 cc 总会莫名其妙的返工, codex 不会 目前体验最好的远程 vibe 工具 想知道大佬们抓包遇到 ssl pinning 都是咋优雅的 解决的? 工业软件的大佬们是怎么 vibe coding 的 最近 chrome 是不是有 bug 啊,一搜索就卡住 分布式异步系统在 vibe coding 下的困境 PHP Native AOT 编译器,支持将 PHP 代码编译为可执行文件,运算性能提高 150 倍 没想到 2026 年,还要浪费大量时间在跨域问题上 DeepSeek V4 这周会出吗? 中转站正式试营 欢迎试用 不掺不假 小米 mimo 升级 v2.5,并且重置了额度 Jenkins, SCM 轮询完全不工作是啥问题啊 赛博斗蛐蛐, AI 模型的简单对比(白嫖版) 使用中转站要擦亮眼睛!不说别的,倍率计算 充值好乱。 买了火山的 Coding Plan 测试得出计费模式 给我的 AI 生成了简历和状态卡, 大家帮忙看下 Ta 能找到啥样的
深度 Vibe Coding 2 个月 用了三百多亿 Token 一些统计数据和...
Had · 2026-06-25 · via 程序员

一个月前发了贴( Codex 使用量分析): https://v2ex.com/t/1213114

目前这个 Infra 项目也 public release 了, https://wdl.dev/

项目在一开始是 CC 为主的,当时还是 Opus 4.6 ,后来 GPT 5.5 来了,就主要由 Codex 主程了,最大的一个 session (也就是我所谓的 Main Coder ),目前累积的 input 已经有 10B (一百亿)了。

Codex 2026-04-13 to 2026-06-24 统计如下:

指标 数值
Total tokens 17,997,228,583
Input 17,852,969,037
Cached input 17,097,716,224
Output 37,707,353
Reasoning output 11,175,876
非缓存 Input 755,252,813
Net 792,960,166
缓存命中率 95.77%
调用次数 116,485
会话数 296
日均 Total 246,537,377.85

事实上从第二周开始 Codex 就开始接手了,Claude Code 主要是 Review (当然也有在 Codex 烧完,我又不想继续充钱时,它接手),但是即便是 Review ,Claude 也消耗了非常多的 Token ,以下是统计数据,Claude Code 从 5 月 4 日开始不再有一个月滚动存储,而是完整存储,所以项目虽然是 413 就开始最小 demo ,但是我最早本地统计只有 417 的,拼接一下是这样

按“2026-04-17 to 2026-05-03 用旧报表,2026-05-04 to 2026-06-24 用当前日志”的混合口径,Claude Code 统计如下:

指标 数值
范围 2026-04-17 to 2026-06-24
Total tokens 12,708,166,023
Input 4,820,408
写缓存 351,000,106
读缓存 12,317,263,840
Output 35,081,669
总输入 12,673,084,354
Net 390,902,183
缓存命中率 97.19%
调用次数 51,750
会话数 约 220-230

也就是 token 总消耗量大概在,三百多亿,粗算如果都走 API ,成本大概是 25K USD 左右,但是现在仅需 Codex 的多次 reset (当然也有我有时候充值点 Credit ,总数不多),再加上 200 刀的 ChatGPT 和 100 刀的 Claude Code (话说 100 刀 Fable 做 Code Review 根本做不下来,只能再补差 200 刀,结果 Fable 用了几天没了),就能搞定了,这样看订阅真是大善人?

最后大概发散几个体验吧,我属于古法 Vibe Coding 派的,skill 除了自己的一个 Refactor Guard 以外,其他一概不用,所以以下体验可能存在优化空间

  1. Opus 的 1M 上下文,从体感上和 GPT 的 258K 没有太大区别,GPT 的 Compact 是真能记得住,Opus 你但凡 Compact 了一回来就像个傻子一样
  2. 大概也就是我古法 Vibe Coding ,所以体感上 Opus 4.7 和 4.8 是质量不怎么样,的确没有 5.5 好,因为我一个 Main Coder+4 个 Reviewer(2CC +2Codex),所以需要模型能力势均力敌的,4.7 和 4.8 有时候就是找不到 P1 错误,不核心的大家都能找到;有时候要用 CC 来写的时候,GPT 又能从 CC 写的代码中找到一堆错误,这种体感就不得不会让我对 Opus 的评价再下降一些
  3. 说到 Fable 5 ,说实话,体感上可以和 GPT 5.5 掰掰手腕了,但是太贵,CC 的对抗式 Code Review ,Fable 5 刚发布那会儿我 100 刀的来看一个新的 Feature ,5 小时限额用完都没有跑出来结果,消耗实在是太大了,后来补差升级,结果自然是好的,真能找出来问题
  4. 再说回 Opus 4.6 ,因为我后期什么 CLI 都用了,例如 Google 的 gemini ,后来换了 Google 的 agy ,然后我还有很早期的 Amazon Q Developer 也就是现在的 kiro-cli ,当然也试了 OpenCode+DS4 ,还有腾讯的 Code Buddy ,结论是 kiro-cli 的 Opus 4.6 真的还是能打的,不比 4.7/4.8 弱,Google 的 gemini 质量算差的,有时候感觉是夸夸学院毕业,OpenCode+DS4 质量也还行,但是只能用来 Review ,写代码写不下来,Code Buddy 完全不行,差挺多的
  5. 如何对抗降智,我没有很明显感知到 GPT5.5 降智,我算是银弹攻势吧,4 个 Review 不够就六个,堆起来然后多轮 review ,总能解决问题
  6. 我也让 AI 总结了,我花了一半多的时间进行重构/找逻辑漏洞/找 BUG/降复杂度,我觉得是值得的,我们都不喜欢又臭又长的代码,不过其中消耗的心力和时间是实打实的
  7. 工程判断能力,大概是 AI 最缺的一部分,这就是人类的用处了,知道什么时候选择什么,做到什么程度,要收敛,不然 AI 就会无休止的死磕,并且有些场景用人类经验可以直接给到最优解,但是 AI 总是再边缘打转,这个问题出现过很多次了,对于应用来说可能还行,对于稍稍严肃点的项目来说,就需要更多的人类判断
  8. 要有 tracking 文档,例如复杂度变高,新增一个 feature 后,一般会用干净的 session ,每个大模型取两个,生成四组 findings ,然后再做合并成一个大的 tracking 文档,再由 Main Coder 进行处理,同时由既定的 4 个 Reviewer 再对修改做 Reviewer ,是很古法,但是也算是很有效
  9. Codex Cloud 有个 Security ,能发现一些问题,但是不能全信,同时 GitHub Copilot AI 也能发现点问题,但是那个可信就更弱点,Codex Cloud 几天前的更早一些时间是有一次可以 4x 出 Review 的,但是现在把这个同时启动 1/2/3/4 个的这个功能下线了,有点可惜
  10. Claude Code 的 Cloud 功能上比 Codex 完备点,但是只能手动多启动多个 session ,也是挺好用的 Review
  11. Claude Code 很喜欢写注释,Commit Message 也非常长,而且很喜欢提交; Codex 的干净注释是和我胃口的,Codex 的自动批准算是比 Claude Code 好用一些,也真能挡住一些操作。

大概就这些碎碎念了,欢迎交流。