惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Apple Machine Learning Research
Apple Machine Learning Research
博客园 - 三生石上(FineUI控件)
雷峰网
雷峰网
WordPress大学
WordPress大学
S
SegmentFault 最新的问题
博客园 - 叶小钗
The Cloudflare Blog
T
Tailwind CSS Blog
Hugging Face - Blog
Hugging Face - Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
月光博客
月光博客
小众软件
小众软件
罗磊的独立博客
酷 壳 – CoolShell
酷 壳 – CoolShell
大猫的无限游戏
大猫的无限游戏
阮一峰的网络日志
阮一峰的网络日志
V
V2EX
美团技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 聂微东
量子位
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
宝玉的分享
宝玉的分享

博客园 - 张善友

纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 AI 编程时代,.NET 的机会在哪里? Vibe Coding 月提交量 29 亿次之后:GitHub 的危机、Azure 迁移,以及 .NET 的机会 从 PostgreSQL 到 Kubernetes:开源的护城河,从来不写在代码里 人工智能最先替代的,是人工智能学院自己 企业架构的六种场景:从"四大流派"到数字原生与 AI 原生 TensorSharp 最新进展研究报告:从 DeepSeek V4 Flash 到 GLM-5.2,以及等待中的 GLM-5.3 Google 官方下场安利:Go 是 AI 时代的"理想语言"?其实 C# 更有资格坐这个位置 当"入门第一课"的作者开始 Vibe Coding:廖雪峰 2026 上半年 AI 编程实践深度探索 两种 Harness 哲学:从 DeepSeek Harness 的"过度抽象"争议,看 OpenClaw.NET 的另一种答案 JVMGuard 来了,.NET 开发者别慌:你的 dotnet-monitor 早就准备好了 .NET 11 Preview 7 发布:一大波硬核更新来袭,离正式版又近了一步! Agent 系统的不确定性治理:当软件工程遭遇"梯度下降" WorkBuddy 专家团的下一步:用 MetaSkill 把「提示词约定」升级为「运行时硬约束」 改变世界的17个方程,如何重塑 GoodCrew 的架构哲学 修 Bug 的手艺与架构的艺术:从熵增到熵减 "从"前锋"到"中场":为什么 Agent 基础设施的建设者必须是系统思考者" 纯 C# 追平 llama.cpp?.NET 本地推理三国杀 MCP 第五版 × OpenClaw.NET:从协议升级到生态编排 把 284B 的 DeepSeek V4 Flash 装进纯 .NET:TensorSharp 用一天改写了 .NET 推理栈的位置 从DDD到Ontology:当数字员工不再认"限界上下文"这堵墙 从 Harness 引擎到 MetaSkill DAG 的确定性架构 25家巨头联名的那封公开信,为什么数字员工架构师应该逐字读一遍 AI + C# NativeAOT:破解应用开发的"最后一公里" 本体:AI落地的"企业翻译官" C# MCP SDK 2.0 即将发布:去会话化、去握手、去运维噩梦 数字员工的成本账:OpenClaw.NET 如何用工程化实现"成功任务的单位经济学"(下) 从 Token 价格战到成功任务单位经济学:AI 成本战的真正主线(上) MCP + A2A 融合:协议层已就绪,信任层才是硬仗
AI 成本战的隐性成本与降本五层:从"成功率悖论"到"系统复杂...
张善友 · 2026-07-22 · via 博客园 - 张善友

image

核心观点:最反直觉的是,成功率更高不一定更便宜。AI 降本的真正抓手不是换更便宜的模型,而是压降系统复杂度。企业总算不清账,是因为只看见了模型账单,却看不见组织账单。


一、为什么高成功率不一定更便宜

最反直觉的一点:成功率更高,不一定意味着成本更低。

很多人本能地觉得,成功率高就说明效率高,效率高就说明更省钱。但在 AI 里,这个等式并不总成立。尤其是在 Agent、编码助手、复杂工作流这些场景中,成功率提升往往伴随着:

  • 更长的推理链条
  • 更高的上下文消耗
  • 更多工具调用
  • 更频繁的验证
  • 更复杂的动作路径

也就是说,一个真正能把事情做成的系统,往往不是最轻量的系统,而是最"重"的系统

这就是为什么有些失败的 AI 看起来很便宜——因为它很快就停了;有些成功的 AI 反而很贵——因为它真的一路做到最后。前者没有完成任务,后者才完成了任务。可如果只看 token,前者显得更省,后者显得更贵。于是,成本判断就会失真。

这也是"成功任务的单位经济学"比"token 价格"更有解释力的原因。因为它把"成功"这个结果变量"成本"这个投入变量放在一起看,避免了只看输入、不看输出的错觉。

  • 一个任务成功了,但要花很高的成本,未必值得大规模复制
  • 一个任务失败率很高,但单次很便宜,也没有商业意义
  • 真正值得投资的,是那些能稳定成功、且每次成功的总成本持续下降的系统

二、企业为什么总算不清账

如果说个人用户更容易被"感觉有帮助"误导,那么企业更容易被"看上去在提效"误导。

AI 项目在企业里最常见的问题,并不是模型不够强,而是组织没有把它的真实成本算清。很多企业立项时,只看得到模型费用,却看不到整套落地的隐性成本:

显性成本 隐性成本
模型 API 费用 数据清洗与接入
云服务费用 权限与安全合规
算力租赁 监控、日志与可观测性
人工复核与异常处理
流程同步与跨部门沟通
部署、维护、更新与持续优化

企业买的从来不是一个"回答问题的模型",而是一整套"把任务做成的系统"。系统一旦进入生产,成本就不再是单点账单,而是组织账单

更麻烦的是,企业常常只看局部提效,不看整体流程:

  • 一个环节快了,不代表整条链路快了
  • 一个岗位省时了,不代表整条组织省钱了
  • 一个工具让某个人少写几分钟,不代表最后的业务结果真的改善了

很多 AI 项目失败,不是因为效果不好,而是因为它们只是把旧流程上了一层新工具,没有真正改变任务结构。

今天讨论 AI,越来越不能只停留在"模型能力"上,而要看"工作流设计"。因为工作流没变,AI 再强也只是替旧流程做局部加速;只有工作流真的被重构,AI 才可能把成本结构一起改写。


三、AI 降本,真正降的是系统复杂度

很多人谈 AI 降本时,最先想到的是换更便宜的模型。这个思路太浅了。因为真正的大头,往往不是模型单价,而是系统复杂度

第一层:缓存(Cache)

很多 AI 请求都有重复成分,尤其在企业内部工作流中,大量提示词、工具说明、背景信息、知识片段都会反复出现。如果这些东西每次都重新发送给模型,token 消耗会非常快地累积起来。缓存的意义,就是把这些重复成本挡在外面。每个应用实际上都应该尽可能地建立自己的一套缓存体系。

第二层:模型路由(Model Routing)

不是所有任务都值得上最强模型。简单问题完全可以交给便宜模型,复杂任务再交给更强模型。把模型分层,才能把成本分层。否则所有任务都用同一个标准去跑,AI 的成本就一定高。

第三层:上下文压缩(Context Compression)

很多系统之所以贵,不是因为模型太贵,而是因为上下文太长。一个对话越长、一个任务链越复杂,输入 token 就越容易爆炸。通过摘要、压缩、信息筛选、历史治理,可以让输入更精准,也让成本更可控。

第四层:语义工具选择(Semantic Tool Selection)

很多 Agent 工作流看似强大,但每次都把所有工具定义、函数说明、能力列表塞给模型,这会极大增加 token 消耗。更好的办法,是先筛选,再调用,只把当前任务需要的信息送进去。

第五层:流程重构(Workflow Redesign)

这是最重要的。因为真正的降本,不是把同样的流程做得更便宜,而是把流程本身改得更合理。哪些环节该让模型做,哪些环节该让规则系统做,哪些环节该让检索做,哪些环节该让人做,哪些环节根本不该交给 AI。只有重新定义任务边界,AI 的成本优化才会真正成立。

所以,今天很多 AI 降本,表面上看是在压 token,本质上是在压复杂度。


上篇回顾Token 便宜不等于 AI 便宜,OpenAI 提出的"有用智能每人民币"把评价从"使用量"转向"交付量"。真正贵的不是价格,而是流程。

下篇预告:OpenClaw.NET 如何用 Harness 引擎、MetaSkill DAG 和 TokenHub 实现"成功任务的单位经济学"?数字员工与传统 SaaS 的成本结构有何本质不同?敬请关注下篇《数字员工的成本账:OpenClaw.NET 的工程化实践》。