惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Recorded Future
Recorded Future
Stack Overflow Blog
Stack Overflow Blog
Cisco Talos Blog
Cisco Talos Blog
Jina AI
Jina AI
S
Schneier on Security
Engineering at Meta
Engineering at Meta
M
MIT News - Artificial intelligence
腾讯CDC
NISL@THU
NISL@THU
Hacker News: Ask HN
Hacker News: Ask HN
Google DeepMind News
Google DeepMind News
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
D
Darknet – Hacking Tools, Hacker News & Cyber Security
S
Secure Thoughts
Recent Announcements
Recent Announcements
博客园_首页
GbyAI
GbyAI
IT之家
IT之家
Security Archives - TechRepublic
Security Archives - TechRepublic
V2EX - 技术
V2EX - 技术
美团技术团队
PCI Perspectives
PCI Perspectives
Blog — PlanetScale
Blog — PlanetScale
W
WeLiveSecurity
Application and Cybersecurity Blog
Application and Cybersecurity Blog
P
Privacy International News Feed
Know Your Adversary
Know Your Adversary
人人都是产品经理
人人都是产品经理
C
Cisco Blogs
V
Visual Studio Blog
Martin Fowler
Martin Fowler
博客园 - 叶小钗
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
H
Help Net Security
Google DeepMind News
Google DeepMind News
Y
Y Combinator Blog
T
Troy Hunt's Blog
Hugging Face - Blog
Hugging Face - Blog
S
Securelist
宝玉的分享
宝玉的分享
N
News | PayPal Newsroom
云风的 BLOG
云风的 BLOG
Security Latest
Security Latest
Project Zero
Project Zero
I
InfoQ
G
GRAHAM CLULEY
博客园 - 司徒正美
C
Check Point Blog
O
OpenAI News
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
a16z 合伙人:大模型吃掉通用任务,创业公司吃掉垂直行业
硅星人 · 2026-06-07 · via 人人都是产品经理

当 OpenAI 和 Anthropic 等巨头在通用 AI 领域高歌猛进时,创业公司如何在细分市场构建护城河?a16z 合伙人 Joe Schmidt 提出四道防线:行业隐性知识的数据飞轮、跨厂商模型调度的灵活性、任务分级路由的成本优势,以及吸收监管复杂性的治理能力。本文深度剖析 AI 应用层创业的生存法则与战略机遇。

最近半年,几乎每一个 AI 创业者都会有一个疑问:OpenAI 和 Anthropic 会不会把我们全吃掉?模型越来越强,Codex 和 Claude Code 越来越像操作系统,那应用层还有得做吗?

硅谷顶级风投 a16z 的合伙人 Joe Schmidt 专门写了一篇文章回应这个问题。他的核心判断是:大模型公司的主攻方向(代码生成、写作、图像创作等通用任务)确实是创业公司的禁区,但在这条“黄砖路”之外,还有大量复杂、垂直的问题实验室根本够不到,真正的机会在那些需要让 AI 输出可信、合规、能在具体行业里运转的地方。

创业公司可以靠四道护城河守住阵地:行业隐性知识积累成的数据飞轮、跨厂商跨模型选最优解的灵活性、按任务难度分级路由的成本优势、以及帮客户吸收监管复杂性的治理能力。他用一句话概括这场博弈:模型可以替换,但深耕行业的工作系统不行。

以下为编译。

01 每个人都在问:AI 应用层还有得做吗?

我最近被创始人和求职者反复问同一个问题:AI 应用层还有没有空间?还是说 OpenAI 和 Anthropic 会吃掉一切?

这问题背后有一种特殊的 AI 焦虑症。一些人已经认定,唯一能避免沦为永久底层的位置,要么在大模型实验室里,要么在机器人、硬科技这类“实验室碰不到”的前沿地带。如果每一款软件都注定被吃掉,要么被 Codex 或 Claude 直接吸收掉工作流,要么被下一代模型直接变成多余,那就赶紧跑吧。

听着,我几乎比谁都更 AI 原教旨主义,而且我认为他们只说对了一半。实验室确实会吞掉一大片应用层。但“应用层”不是一个同质化的机会池。正确的思考框架是:你站在黄砖路上,还是奥兹国的其他地方?

02 大模型公司吃通用任务,创业公司吃垂直行业

“黄砖路”是我们对大模型公司主攻方向的简称,它们在这条路上投入了极其巨大的资源。代码生成、写作、图像创作这类问题之所以天然属于实验室,是因为这些问题随着模型原始能力的提升会直接变好:每一块钱的预训练和后训练支出,都会直接改善产品体验。

如果你在创业,黄砖路是最明显的方向,也是最危险的方向。拿一个高性能模型,接上几个现成的连接器(Google Drive、Slack、Salesforce、Notion、GitHub),再在上面搭一层代理编排,看起来像变魔术一样简单。

问题是,这就是实验室在做的事情。他们当然拥有模型本身,这意味着更好的利润率、更强的控制力,以及对下游所有参与者的定价权。但更重要的是,他们也拥有决定产品架构的权利,产品为哪些问题而设计、用什么方式来解决。他们到目前为止一直在刻意选择“模型加工具调用”的模式,而这恰好是黄砖路上那些水平化、低步数任务所需要的。

退一步说,就算有创业公司能在产品上跑赢 Codex 或 Claude Code,实验室手里还握着巨大的分发渠道和 AI 领域最强的品牌光环。如果你是一家 AI 应用公司,用同样的连接器、同样的模式、没有底层子代理或深度配置、也没有自己的分发能力,那你大概率走在一条通往“哪里都不是”的路上。

但对创业公司来说,这不是全盘悲观的局面。黄砖路之外有巨大的机会,创业公司可以在那里真正拥有客户、解决复杂问题。

这些公司构建的是代理式体验,模型被编织进一张由工具、自动化、集成构成的复杂网络里。这使得它们天然是垂直化的。它们可以做多步、多角色协作的工作,拥有针对特定角色和垂直场景的子代理,而这些都是 Anthropic 和 OpenAI 用水平化平台无法触及的:跨系统收集上下文,然后在不同阶段由多个人审批流转。这些场景往往涉及一个或多个遗留系统,倾向于需要确定性的结果,模糊是不可接受的,而且最终常常绑在某个有价值的业务成果上。

实验室很清楚这些问题的价值:他们之所以在搭建自己的外包配置团队,以及为什么会出现一整个面向大客户的强化学习产业,原因就在这里。

对此最常见的反驳是:历史上押注“模型不会变好”从来都是糟糕的赌注。它们大概会一直变强,最终吃掉这些应用层公司的市场。

实验室当然会继续进步,但我认为奥兹国其余地区的公司有几道护城河可以守住。

第一,数据和学习的飞轮。 很多知识不在任何训练集里,不成文的行业惯例、没有文档记录的标准、只存在于从业者头脑里的隐性知识。这些全都不在公开网页上。再多训练算力也替代不了真正嵌入这些知识所在的业务流。这里有两个叠加的飞轮:跨客户飞轮,当你看到同一种问题的更多变体时涌现的模式;以及单个客户内部飞轮,具体决策背后的原因、未说出口的例外、公司自己不成文的经验法则,这些只有在与系统的真实交互中才会浮现。

即使客户数据不能在客户之间直接使用,应用公司依然可以利用跨客户问题类型的模式识别,来指导未来问题的架构设计。一个让代理跑过一百次法律红线审查、一千次保险核保周期、一万次销售开发代表任务的公司,已经把问题的“形状”内化了,这种积累是下一个新进入者用一套全新代理从头开始无法复制的。

第二,管理模型的变化与复杂性。 实验室已经在做内部路由了,不同请求调不同模型类别、底层用集成。但他们做不到跨厂商路由,不能用竞争对手的模型来评估某个子任务,也不能为一个极窄的环节专门用开源微调。奥兹国公司可以在整个模型市场中为每一个子任务选最优模型,而不是只能用母公司发货的那一个。他们还做了没人想做的工作:每次新模型发布时重新跑评估、针对客户边缘场景重新校准提示词、在不炸掉生产环境的前提下完成部署。实验室不会替客户做这些;他们把下一个模型卖给你,让你自己迁移。奥兹国公司帮客户吸收掉迁移成本。客户得到的是整个市场最优智能的组合,以及每次升级时无感的连续性。

第三,成本优化。 每个查询都跑 Opus 4.7 是通往负毛利的最快路径。最好的奥兹国公司在不同级别的模型之间做路由,最难的任务用前沿模型,大部分用中端模型,在已经取得足够积累的环节用更小的定制或微调模型。有些公司现在更进一步,在这些基础上做自己的后训练,针对客户关心的极窄工作流做优化,服务成本只是前沿 API 调用价格的零头。实验室定的是智能的底价:花 X 元能买到的最低智能。奥兹国公司卖的是反过来的东西:为工作流实际所需的智能水平,找到最低的美元成本。这只有在你精确知道每个子任务需要什么水平时才可能,而实验室在结构上不可能了解所有垂直行业。

第四,治理。 成为客户在某个垂直行业使用 AI 的“控制平面”,这件事本身就有相当大的价值,权限、审计、代理被允许做什么、代理实际做了什么,全部汇聚于一处。这个控制平面由具体场景的护栏构成,而不同行业、不同岗位需要的护栏完全不同。因为奥兹国公司拥有端到端的工具、工作流和数据,他们能在水平工具难以企及的地方提供确定性结果。他们也是替最终客户吸收监管复杂性的实体:法律行业的 FRCP 和律师规则、医疗领域的 HIPAA、金融领域的 SEC 和 FINRA、各州保险法规等等。一个水平化玩家如果不变成一百个不同的垂直行业公司,就不可能真正承接这些责任。CIO 们想要的是一个能在合同里白纸黑字写明“我会为提供的代理承担合规责任”的合作伙伴。

所有这些都指向同一件事:专注。可以是一个垂直行业(保险、法律、会计),也可以是一个做深做透的功能(销售、客服、财务)。无论哪种,都需要一支团队全身心扎进一组客户里,它的工作流、它的边缘场景、它的监管规则。实验室不是为这个设计的。他们必须同时覆盖所有人,这是他们铺出黄砖路的方式。同样的取舍也让他们进不了奥兹国的其余地区,你可以同时无处不在,也可以在一件事上做到极致。二者不能兼得。

03 销售的例子:复杂业务需要什么

怎么在实践中思考这件事?11x 的 CEO Prabhav Jain 给出了一些来自一线的建议。

从客户真正关心的结果出发。 对 11x 来说,就是帮客户产生更多销售管道。从这个问题出发,追问就变得极其具体:我们希望端到端拥有哪些真正驱动管道的活动?把每个活动分解成任务,哪些是代理式的、哪些不是,哪些需要深度的领域洞察、哪些不需要。实验室当然也会发布工作流,但当流程有很多步骤、输入很脏、状态很难解析、存在各种现实世界约束时,单靠更好的模型是做不到的。这部分工作回到传统软件工程,而实验室在一个专注的应用公司面前没有任何优势。

举个例子,11x 处理的任务包括:基于自定义信号做线索挖掘、线索数据补充、深度账户研究、从 CRM 中抓取上下文、针对不同渠道的消息生成、线索质量判断代理、邮件送达系统。这些不是一次性就能完成的任务,需要深度工程。

奥兹国比喻中最关键的一个洞察是:在任何一个真实工作流里,大约有一半非代理式任务,实验室在这些任务上没有任何优势,他们写模型层下面的确定性软件,并不比你强。另一半代理式任务,仍然需要你针对真正想要的结果去调、去训练、去约束模型。领域知识往往不在通用训练数据里。这些能力是从垂直或功能的土壤里长出来的,在流程的关键时刻被喂给模型。当 11x 的代理在电话上评估一个 inbound 线索时,它需要被训练去理解“什么是针对这个特定行业、这个特定人群的好销售对话”。这是应用公司才能做的工作,而且会不断积累。

更重要的是,业务在演进,这些技能会不断过时,你的能力就是持续演进这些工作流和上下文,这本身就变成了竞争优势。11x 的规模化邮件外拓产品刚起步时,“AI 味”的邮件刚开始进入人们的视野。到今天,人们对哪些是 AI 写的、哪些是人类写的已经有了敏锐的判断力,而这个判断标准每隔几个月就在变。代理必须不断根据市场动态调整,而护城河正是在这里被建出来的。事实上,尽管存在这种变化,11x 的正面回复率在过去几个月上升了 4 倍,已经为客户创造了数亿美元的管道。

在复杂度高的问题上工作。 复杂问题才是真正释放商业价值的地方,否则你只会发现自己搭了一层薄薄的壳。拆解任何一个足够复杂的商业问题,混乱会迅速浮现。举个听起来很简单的 GTM 场景的例子:如果一家公司已经是你的客户,你就不应该再联系这家公司里的任何联系人。但这事一点都不简单。也许 CRM 里关联的是这家公司的一个域名。那些有几十个子公司的集团怎么办?如果 CRM 记录里留的是母公司域名怎么办?如果一个 Salesforce 里过时的匹配字段,把一封冷销售邮件发给了一位现有客户的 CRO?真实世界的数据是脏的,人类尚且搞不定,模型也不会自动跨过这道坎。从混乱中提取秩序,需要的是为问题具体形态而设计的专用代理,而不是一个对着 CRM 指指点点的通用副驾驶。事实上,根据 11x 的数据,他们已经发现自己的数据质量和新鲜度远高于客户,所以他们默认以自己的数据为准。

护栏不只用来防止坏事发生。这是客户付钱给你的原因。 护栏被严重低估了。即使在同一个产品内部,每一个场景都需要自己的护栏。一个受到严格监管的金融服务客户,和一家中等规模的 SaaS 客户,要求的保障完全不同,这些差异一直渗透到代理怎么写、能联系谁、能触碰哪些数据、电话里能说什么、以及每个决策怎么被记录。一套“放之四海皆准”的系统在这种差异面前会崩溃。护栏必须按场景构建、按客户配置、持续审计,而这项工作完全属于应用公司。这就是 11x 有前置部署工程师和技术部署策略师的原因,他们需要为每一个客户的需求做定制。举个例子,他们曾与一家 F1000 企业合作,通过语音向他们的大量中小企业客户做授权外呼。最初几次迭代接听率很低,他们必须快速迭代,学会怎么让这个特定人群在前 10 秒内产生互动。中小企业主的行为和大企业买家、普通消费者完全不同。现在他们一天为这个客户创造的销售机会,比他们整个销售团队针对这个细分市场一个月做的还多。

04 保险的例子:智能不在模型里,在工作流里

保险是另一个切面,同一个结论。FurtherAI 的 CEO Aman Gour 是这样理解这件事的:

当他们开始在真实保险运营中部署 AI 时,反复听到一种假设:模型是智能的载体,工作流只是围绕它的脚手架。随着合作了越来越多的保险公司,他们越来越确信这个假设是反的。

在保险业,很多智能本身就存在在工作流里。两家保险公司可能走同一条路径处理一份投保申请:接件、审核、报价、承保。但路径只是最容易的部分。真正区分两家公司的是路径内部的全部细节:哪些风险需要上报、哪些损失信号值得关注、两条规则冲突时哪一条优先级更高、什么情况下必须有人签字、哪些外部数据会被调取、最终决策怎么归档。这些逻辑不在一个干净的规则引擎里,而是散落在 SOP、经理审核记录、核保理念、公司特定的风险偏好和多年的操作经验中。其中很大一部分根本没有被写下来,模型无法直接读取。

这就是为什么 FurtherAI 不相信一个每次都从零推理的纯代理,也不相信一个现实一乱就崩溃的硬编码工作流。他们在构建的是代理式工作流,工作流给你可重复性、可审计性和成本控制,代理处理不确定性并在主线走不通时恢复路径,人类留在循环里处理那些需要承担责任的判断。

在第一天,这能自动化人工操作。但假以时日,每一次上报变成信号,每一次例外是一次反馈,每一次人类修正展示了操作手册哪里不完整。慢慢地,工作流不再是脚本,而是变成了保险公司的运营记忆。实验室很难触达到这个层面。他们会持续发布更好的模型和更好的通用代理,他们也理应如此。但他们不会坐在一家保险公司的生产流程里足够久,去理解为什么某一个账户被上报、某一个风险被拒保、某一位核保人推翻风险偏好指引而且他推翻得对。这种理解,只能来自把工作流跑在生产中数千次。你第一天交付的工作流不是护城河。生产使用所产生的反馈循环,随着时间积累,才是。

05 三个测试判断你的方向,两条路都有赢家

工具与步数测试。 完成这项工作需要多少步?你需要构建的工具复杂到什么程度?对比一下:水平化 AI 搜 Google Drive,一步,操作一个工具,结果错了用户可以重搜;和一份针对律所三年先例的多步法律红线审查,几十步、跨多个工具、输出必须通过合伙人审核且最终可能在法庭上被辩论。两者看起来都像“代理在做工作”,但只有后者需要一个专注团队花几年才能构建的那种深度软件。

系统测试。 你在构建的是客户用来完成工作的“系统”,还是叠加在客户已有系统之上的“工具”?系统拥有端到端的工作流,数据采集、治理、完成事项的记录,是客户描述实际工作如何发生时指向的东西。工具只是在客户已经在运行的工作流上加一层智能。做工具能产生真实收入,而且实验室可以拿走,因为客户并不依赖你作为编排层。高客单价通常是系统的信号,因为系统替代真正的人力岗位并据此定价,但这不是保证。问自己一个问题:如果实验室发布了一款据称与你直接竞争的产品,客户还需要你的产品吗?如果答案是“是”,你在构建系统。如果“否”,你只是工具,即使你的客单价很高。

对冲基金/P&L 测试。 实验室的表现用 benchmark 来评判,奥兹国其余地区的表现用客户的 P&L 来评判。你的客户不关心你的模型在 SWE-Bench 或 MMLU 上拿了多少分,他们只关心你的代理有没有搞定那笔交易、有没有把合同条款审对、有没有签下正确的保单。如果他们死死盯着业务流的结果,而不是一个通用的能力评分,你就在奥兹国其余地区。如果他们买的是通用能力,你卖的东西他们买一张 Claude 或 Codex 的席位就能得到。最好的代理公司需要像对冲基金一样运作,用客户 P&L 衡量的 alpha 来取胜,而不是用 benchmark 分数。

我们会在黄砖路上和路之外同时看到巨大的赢家。

模型公司会继续赢,因为他们拥有模型,也拥有他们设计的水平工具的分发能力。奥兹国其余地区的公司如果能拥有“工作系统”,公司实际执行工作的界面,以及从工作中产生并沉淀下来的数据,就能赢。这些公司拥有数据采集、工作流行动系统和治理层。随着某个垂直领域内更复杂的工作流不断成熟,它们会汇聚成一个客户最终依赖的核心体验。当新一代模型从既有大公司和新兴玩家中不断发布,这些公司就成了整合一切、把智能交付给客户的中间层。模型在底层可以替换,但工作系统不行。

下一代企业软件,会在黄砖路之外被建出来。

本文由人人都是产品经理作者【硅星人】,微信公众号:【硅星人Pro】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。