惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

罗磊的独立博客
小众软件
小众软件
The Cloudflare Blog
博客园 - 【当耐特】
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
酷 壳 – CoolShell
酷 壳 – CoolShell
WordPress大学
WordPress大学
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
V
Visual Studio Blog
量子位
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
美团技术团队
S
SegmentFault 最新的问题
宝玉的分享
宝玉的分享
博客园 - 叶小钗
月光博客
月光博客
Apple Machine Learning Research
Apple Machine Learning Research
T
Tailwind CSS Blog
博客园 - 聂微东
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
J
Java Code Geeks
Y
Y Combinator Blog
D
Docker
Microsoft Azure Blog
Microsoft Azure Blog

博客园 - 张善友

纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 AI 编程时代,.NET 的机会在哪里? Vibe Coding 月提交量 29 亿次之后:GitHub 的危机、Azure 迁移,以及 .NET 的机会 从 PostgreSQL 到 Kubernetes:开源的护城河,从来不写在代码里 人工智能最先替代的,是人工智能学院自己 企业架构的六种场景:从"四大流派"到数字原生与 AI 原生 TensorSharp 最新进展研究报告:从 DeepSeek V4 Flash 到 GLM-5.2,以及等待中的 GLM-5.3 Google 官方下场安利:Go 是 AI 时代的"理想语言"?其实 C# 更有资格坐这个位置 当"入门第一课"的作者开始 Vibe Coding:廖雪峰 2026 上半年 AI 编程实践深度探索 两种 Harness 哲学:从 DeepSeek Harness 的"过度抽象"争议,看 OpenClaw.NET 的另一种答案 JVMGuard 来了,.NET 开发者别慌:你的 dotnet-monitor 早就准备好了 .NET 11 Preview 7 发布:一大波硬核更新来袭,离正式版又近了一步! Agent 系统的不确定性治理:当软件工程遭遇"梯度下降" WorkBuddy 专家团的下一步:用 MetaSkill 把「提示词约定」升级为「运行时硬约束」 改变世界的17个方程,如何重塑 GoodCrew 的架构哲学 修 Bug 的手艺与架构的艺术:从熵增到熵减 "从"前锋"到"中场":为什么 Agent 基础设施的建设者必须是系统思考者" 纯 C# 追平 llama.cpp?.NET 本地推理三国杀 MCP 第五版 × OpenClaw.NET:从协议升级到生态编排 把 284B 的 DeepSeek V4 Flash 装进纯 .NET:TensorSharp 用一天改写了 .NET 推理栈的位置 从DDD到Ontology:当数字员工不再认"限界上下文"这堵墙 从 Harness 引擎到 MetaSkill DAG 的确定性架构 25家巨头联名的那封公开信,为什么数字员工架构师应该逐字读一遍 AI + C# NativeAOT:破解应用开发的"最后一公里" 本体:AI落地的"企业翻译官" C# MCP SDK 2.0 即将发布:去会话化、去握手、去运维噩梦 数字员工的成本账:OpenClaw.NET 如何用工程化实现"成功任务的单位经济学"(下) AI 成本战的隐性成本与降本五层:从"成功率悖论"到"系统复杂度"(中) MCP + A2A 融合:协议层已就绪,信任层才是硬仗
从 Token 价格战到成功任务单位经济学:AI 成本战的真正主线...
张善友 · 2026-07-22 · via 博客园 - 张善友

核心观点:AI 行业过去最喜欢讲的是"能力",今天越来越必须讲的是"结果"。"有用智能每人民币"(Useful Intelligence per RMB)正在重新定义企业采购、产品设计与工程优化的底层逻辑。成本战的真正主线,不是 token 价格战,而是成功任务的单位经济学


一、Token 便宜,不等于 AI 便宜

过去两年,AI 行业最热闹的竞争几乎都围绕同一个问题:谁更强、谁更便宜、谁更快、谁更容易被大规模使用。任何新技术进入市场时,最先被比较的往往都是最表面的指标——价格、速度、参数、门槛。AI 也不例外。

模型刚开始从实验室走向现实世界时,行业最先关心的就是 token 单价、API 费用、上下文长度、模型大小,以及谁能在相同预算下跑得更远。这个逻辑在 AI 早期非常有效,因为那时候最重要的事情是"让更多人用起来",降低 token 价格确实能快速推动试用、测试和扩散。

但 token 有一个根本问题:它只解释了"模型层"的成本,却解释不了"任务层"的成本。

这就是今天很多 AI 应用看起来"很便宜"、实际却"不便宜"的原因。你看到的 API 账单可能很小,但在账单之外,还有大量没有算进去的东西:

  • 重试成本:任务反复失败后的重新调用
  • 修正成本:模型输出不稳定带来的人工干预
  • 等待成本:工作流中因为 AI 介入增加的延迟
  • 集成成本:系统对接、维护与持续优化
  • 摩擦成本:组织协同中因 AI 插入而额外增加的管理开销

一个模型单次调用再便宜,如果总是答偏、总要追问、总要人来收尾,它的真实成本就不会低。相反,一个单次费用略高的模型,如果一次就能把事情做对,少返工、少重试、少人工干预,最后反而更划算。

这就是"token 价格便宜"和"AI 真的便宜"之间最关键的区别:前者是输入成本,后者是结果成本。前者是账面数字,后者是业务现实。


二、OpenAI 为什么把"有用智能每人民币"提到台前

OpenAI 提出 "Useful Intelligence per RMB"(有用智能每人民币),最值得重视的地方,是它把 AI 的评价单位从"使用量"改成了"交付量"。

这实际上是整个行业逻辑的重写。过去衡量 AI 产品,常常会问:多少人用、多少次调用、多少活跃用户、多少模型分数、多少席位开通。这些指标只能说明"有人在使用",却不能说明"事情有没有做成"。

而"有用智能每人民币"更接近现实,它要求回答几个更难的问题:

  1. 这个系统到底完成了多少有用工作?
  2. 每个成功任务的完整成本是多少?
  3. 结果是否稳定、可靠、可复用?
  4. 规模放大之后,单位成本有没有真正下降?

OpenAI 为什么要强调这个框架?因为它直接对应一个越来越明显的行业现实:AI 不再只是一个展示能力的技术对象,而是一个必须被算账的生产力系统。 企业真正关心的,从来不是模型"看起来聪不聪明",而是它能不能在真实工作里少花时间、少花人工、少花返工成本。

新的评价标准必须从"模型层"下沉到"任务层"——因为模型层的指标只能说明能力上限,而任务层的指标才说明真实价值。


三、真正贵的,是流程,不是价格

今天很多企业在谈 AI 成本时,仍然会本能地把目光聚焦在 token 价格上。但真正的成本,往往根本不在那个地方——它在流程里。

一个 AI 任务真正落地,通常不是一次调用,而是一整条链路:理解需求 → 补充上下文 → 调用模型 → 检查输出 → 修正结果 → 重新确认 → 交付下一环节。每一个环节都在消耗成本。尤其是当 AI 被嵌入团队协作、跨部门流程和高频工作流之后,成本的复杂度会迅速上升。

这时候,一个单次很便宜的模型,很可能反而变贵。因为它虽然让模型调用费更低,却让重试次数更多、人工介入更多、等待时间更长、工作中断更多。便宜的 token,在这种场景下并不等于便宜的结果。

这也是为什么企业经常会出现一种错觉:看账单时觉得 AI 很便宜,真正上线后却发现"怎么越用越贵"。并不是模型突然涨价了,而是你开始为自己之前没有意识到的东西买单了:

  • 团队要为结果再做一轮审核
  • 工程师要为模型输出再做一次修补
  • 运营要为 AI 生成的内容再做一遍筛选
  • 业务负责人要为流程中的异常再做额外沟通

这些成本在模型平台的价格表上看不到,但它们都属于成功任务的总成本

所以真正的问题从来不是"每百万 token 多少钱",而是"完成一次真正可用的任务,到底花了多少钱"。这才是单位经济学的核心。


下篇预告:为什么高成功率不一定更便宜?企业为什么总算不清 AI 的账?AI 降本的真正抓手在哪里?敬请关注中篇《AI 成本战的隐性成本与降本五层》。