一、服务裹着能力:FDE 与"模型能力—业务"的落差
- agent 产品不像飞书、企业微信那样买回来就能用,模型能力与业务之间存在 gap,填 gap 的是 FDE:服务裹着能力,而不是能力裹着服务。
- 不可能人人达到同一水平,只能让最好的 5% 提供一键自动化。案例:以"抢外卖券"这类高频需求每天自动抢券,用场景教育用户并让其复制场景——场景落地后就像一句咒语,一句话就能拿到结果,本质是最佳实践的封装。
- 填落差三条路:跑最快的 5% 做出系统优化供他人使用;培训(不可能人人,但多比没有好);FDE——培训来不及、自己的人还没长出来时带着产品与服务进场趟出最佳实践。零一万物(马杰):放弃通用大模型转 to B 垂类、对标 Palantir,先内部培训(转化率约 75%)再入驻 FDE;FDE 多有股权、不背销售指标,唯一成功指标是"把自己抽离掉"。
二、国内大厂与海外的差别,以及低成本用户漏斗
- 国内大厂认为砸钱推广就能解决;海外是"做软件的人同时输出怎么用",边做边教。国内自己也不知道怎么用,还在比功能大小、说不清功能对各行业的作用。
- 像 Workbody 这类产品,通过任务以低成本、出卖一点时间换取尝试资格,免费层充足,用户从小白成长,量大后总会出现超级用户;但真正生产力与流程优化还未到,往深水区走服务仍必须进去。
三、速度不匹配:技术、组织与制度
- 技术两三个月一个新东西,组织无法随之调整,制度、利益分配、商业结构更落后,像层层齿轮转速不匹配;填平这道速度差需要服务。
- 反直觉:见效快的不是内容、影视等"先进行业",Palantir 等反而都挑传统行业;传统行业更容易出效果、甲方更容易付费。
- 例:Cola skill 网站从想到做花了两个月;走上正规交付与支付渠道后,资质、公司、法人盖章都得自己跑,所以会有服务公司去接这些环节,代理不会消失。coding 之所以快,是它不依赖分发、付费与政府关系;AI 进入办公领域后阻力明显变大。
四、从内容转产品:Claude Code 与 skill 带来的自动化
- 转产品不是能力问题,而是以前 AI 做不到:Claude Code 及后续 Codex 等发展后,资产与工作流沉淀为 skill。
- skill 的变现困境:2C 收不了费是悖论——用 skill 耗 token,收费就无法让人试用,且 skill 架构开源不保密。与 agent 合作则相反:只给 API 用户会迷茫,直接推最优质的 skill,用户会把能力与结果归功到 agent 产品本身,所以应笼络优质创作者、把 skill 内化进产品。
- 用 skill 很难:一个 skill 就是一套没有界面的软件,每个人也不需要那么多,关键是想清楚自己需要什么;skill 更像模板,用到实际工作中得自己定制——"个人的 FDE 化"。
五、流程、入库与旧基建:摩擦无法 scaling,SaaS 又为什么"必死"
- 新东西在 2B 大公司没有对应流程与章程,SOP 也建不了,只能频繁沟通;去年 8 月某大厂采购 ListHub 开始入库,到上个月才入完。本可 scaling 的许可变成无法 scaling 的事。台湾企业采购同样要入库。
- 判断:SaaS 必死、软件必死——SaaS 本身是服务而非软件,AI 用 token 提供服务;手机 App 会越来越少。新的 gap 是会 web coding 的人越来越多,但做出来的东西别人没法用、也没地方发——一切仍依赖互联网 1.0 的基建,发内容可以、发产品不行。
- GitHub 这类托管机制撑不住了:AI 写代码一次几万行、每次改三五十个文件,人审不过来,需要基于"AI 提交修改"的新托管平台,这类 Infra 会重做一遍。
六、这半年被打脸的认知:coding 停滞、小模型降本与顶尖模型发布变慢
- 年初以为 coding 会一路高歌猛进,实际从去年 8 月至今没有明显大进步(部分与某些模型不可用有关),甚至更困难;最大的变化是小模型进步快(DVC Flash 等)、降本很多,很多人用得起较好的 coding 模型。
- 先进模型则令人失望:顶尖模型发布显著变慢,Fable 疯狂降智;国内一直"沉默"不讨论,美国则意识形态割裂、冲突非常具体。
七、以谁为中心:"agent 加 X"与"X 加 agent"
- 命题本质是以谁为中心。agent+X:所有功能装进 agent,对话始终在 agent 中发生——发消息、生成文档都不必打开软件。X+agent:原有 X 里开一个对话框,逻辑是 agent 住进原来的 X。
- 有历史资产的公司一定选第二条(微信小微是 X+agent,飞书走的是 agent+X),两条路一左一右、最终在山顶相见;倾向判断:手机里一个 agent 可调很多 App,App 变少而 agent 功能变多,agent+X 可能后劲更足。
- 但 X+agent 受限:X 动不了所以一定别扭;旧产品靠免费加广告/社交 cover 成本,而现在每个 token 都是成本、cover 不住;叠加旧组织结构、参差的 agent 能力与旧基建,达不到专门做 agent 的体验水平。
八、手机思想实验、dashboard,与 A 与 A 之间那张新网
- 思想实验:三五年后模型与 harness 都足够好,为什么还要解锁手机去点 App?一块屏直接说话就能发消息、加日历——这正是 agent+X 的极致形态:一块屏、一个对话界面,去调各种 client、skill 与能力并分发干活。
- 但人的记忆力不足以支撑:订了票会忘。人永远需要那个目录界面,它变成一个仓库,所以大 dashboard 是必要的:所有 chat 中的事、待办、遗留未完成的工作都要在 dashboard 呈现,不是沿用原来的 UI,而是建立一个动态的、随时变化的 UI。
- 新网问题:微信不倒靠关系链,若未来每人都有 agent,除人对人之外还有 A 与 A,会出现 HAH、HAAH 一类新对话路径。例如我对"我的 A"说"提醒橘子明天下午我们要聊某事",我的 A 去找他的 A book 时间、发邀约。
- 阻力:现在 A 还太少、没做到每人一个;Cola 让两个 Cola 聊天的试验用户学不会——"我的两个 agent 在聊天"太抽象。人也终究更喜欢人味。
九、语言、水印争议与 Jarvis 式设想:现在还只是"更好的锤子"
- 语言不是随机组合,每个字的排列背后都有心理模型。Claude 加水印引发强烈反感:官方称水印不改变输出质量、还写示例演示,示例中加水印前后文案却完全不同、"每个字都不对",在严肃场景(如法律合同)换个词意思就全变。
- 期待的画面是电影里的 Jarvis:一个 AI 助理就在身边,知道你的健康数据、每天聊天的上下文,理解你与他人的关系、你的认知模型与世界观。现在还没到——当下它更像一个更好的锤子:以前拉一根网线成了互联网公司,现在拉一个 AI 进来就要成为 AI 公司;但这次真的出现智能了。
十、两个割裂的形态:agent 群聊没人用,内容消费却先跑起来
- 群聊心智难学:想引入另一个人就得拉群,而群聊在中国之外都不流行;跟我的 Cola 聊天时 @ 一下季刚的 Cola 就很难学。人要学会一样东西必须有 trigger、前面得放个胡萝卜:要么大幅提高工作质量与效率,要么带来消费上的愉悦感。
- 割裂:我们关注 agent 的工作效率与生产;大量普通用户并不需要用 AI 工作,他们对 AI 的最大想象也不是 AI 玩具或 AI 视频。而内容消费的渗透比正经 AI 应用快得多:AI 短剧渗透已超过 8 个百分点,以前有内容追求的人不看短剧,现在越来越多有要求的人在看;刷到短剧会看完一集,剧情像小学生写的,但钩子一级勾一级,是生理性的。
- 门槛降到 0 后人人都有想法,但讲故事仍需人来讲,AI 只是"给一颗种子长出一棵树"。技术带来的好处是:以前只能在脑中想一想的事现在真能做出来、交付出去;更多人需要的是消费与内容生产(短剧、漫剧、游戏),很多擅长讲故事的人过去只是没被看见。
十一、割裂的行业与三个世界:效率、娱乐,以及 AI for Science 的滞后爆发
- 三个叠加的世界:原子世界、互联网比特世界、token 世界。token 世界(模型能力、harness、agent)与互联网世界结合(生短剧、写小说、提效);另一条轴是 AI 世界与原子世界结合(救灾无人机等)。
- 行业割裂:搞消费的和搞效率的几乎互不讨论,彼此默认另一个世界的人不存在。"你只能看见你能看见的"——数据显示没人用 Claude,但上下文里就有一个在用的。
- AI for Science 案例:某家最近做癌症研究,请了一位美国做临床药物研发的博士,他认为临床实验巨慢而药物研发巨快。判断基点是:21、22 年基因编辑与蛋白质设计技术被发现后大量人投入,大量药物的临床试验将陆续做完并批量上市,未来三五年可能有很多疾病被治愈或延缓;近期中国实验猴涨价且不够用,正说明 AI 实验室已多到"抢猴"的程度。
十二、A2A 社交的两个假设、C 端 agent 新形态与上下文获取
- A2A 社交的前提是 agent 拥有你所有上下文、能找到全世界最符合你的 soulmate。它依赖两个假设:① agent 拿到你全部上下文、足够懂你——这块越来越好;② agent 去全世界寻找、跟别的 agent 对话帮你找人——这张网还没成型(Cola 能看到我,但看不到全世界其他人的 agent)。另一层认知是:真实关系是各自先有爱好、认识后互相知道,而不是先比对爱好再匹配。
- Gorog Bot 是激进形态:界面上什么都没有,你不断创建 agent,每个 agent 就是一个任务,界面就是一个聊天——回到最初 GPT 的单一聊天,但背后基建完全不同:分配永久性虚拟机记忆、连接能连接的所有服务,任务需要时自动弹出按钮、一键授权。要点是极简的连接与上下文获取加持久的云端服务(每人一台虚拟机)。
- 上下文怎么拿:走 MCP,本机笔记在本地时读、再同步到云端;不主动扫你电脑,而是在当前任务下授权同步某个文件夹,而非全量同步——矛盾在于:需要时把本机 100 个文件中的 3 个上传云端,还是让本地 agent 住进你电脑。
- 海内外差异:海外大部分产品已完成 agent 线上化且都有 MCP,国内一点开只有飞书能连;让 GPT 每周定时用 Apple Watch 健康数据甚至体检报告与病例做分析,医生不可能看完你所有上下文,AI 可以。过去一年对个人与企业影响最大的两项是语音输入法(语音转文字自动换行、自动序号,说的时候想到哪说到哪)与翻译(现在默认给你翻,语言的隔阂好像真的不存在了)。
十三、从看病说起:AI 的两项能力与上下文的清洗
- 医生不仅读不到你全部上下文,还会忽略你说的很多话。案例:一位用户慢性病 10 年、看过至少 10 个医生,没人听完他讲;他把十来年的感受讲给 Cola,Cola 推理出可能的病症并推荐用药,他拿结果找医生确认,医生说还真是、之前没有医生给过这个选项,服药后病治好。讲述者本人的脑雾乏力被 AI 判为缺铁性贫血也是同类例子。
- 提炼:AI 起码有两项能力——上下文的阅读能力(医生只有 10 到 20 分钟,AI 记得你一年来的日常)与很强的推理能力;充足上下文加专业领域推理,就能拿到好结果。核心是上下文获取。
- 有了正反馈后容易疯狂积累上下文(每天看的、读的、聊的都自动清洗入库),随之而来的是信息茧房:上下文太多后,即便明确 prompt 告诉他怎么做,他仍会把你拉回以前的平均值。所以"上下文是一辆要维护的车,而不是一个增值的房子":不能指望产品替你整理,越多越必须自己处理。两条原则:顶层设计好什么时候不该读、什么时候才需要读,不要一上来就读全部;丢进去前先加工——不相关的旧描述会被摘过来、改变推理结构,所以每次进入前说明本次背景与对话记录,让它提炼出边界和约束。
- 项目化管理:每个完整项目单独管理、做完就翻篇,项目信息与个人认知分层抽取。agent 越多上下文越不够用,这正是坚持迭代自己 agent 的原因(可以用任何 agent,觉得好就加进来,即"六经注我")。人际关系与情感不弄,项目、工作、认知会弄。
十四、闭环与信息茧房,以及模型价格的两条曲线
- 每个人都跟自己的 agent 形成一个闭环,各转各的都很开心。两层觉察:应该形成自己的闭环、不要照抄别人;同时要意识到自己在环中、别被困住。破茧的方法是:把做的东西发到网上,以及去进入长视频、读书,找 AI 之外的信息源自己消费。
- 模型价格:半年前与做出海的朋友打赌最先进模型会变贵还是变便宜,各押 100 元;DeepSeek 出来后疯狂降价、谁都跑得起,押"贵"的输了;最近 DeepSeek 涨价 12 倍,大家又用不起。从业者应当最关心价格——涨 10 倍直接影响整个商业模式;判断是价格差不多"就这样了",Luna 已能满足 90% 人的需求、有些地方已免费,而顶尖模型(Fable、下一代的 Astra)依然很贵,开始分化:顶尖模型永远最新最强、价格持平甚至略涨,主流模型价格像指数下降;很多人为基准上五分十分的差距要付 50 到 100 倍价格,真用起来又觉得非常值。
- Harness 与底座模型像汽车底盘与引擎:以为 harness 可以随便插到任何模型上,实际"这个 harness 就该配这个底盘"表现最好,因为它们是联合训练的。一直在 Cloud 世界的人没看过 GPT、DeepSeek,其实它们写作更"逼真";GPT 到现在也不说人话,Claude 用到 OFZ5 更惨,Humanizer 也救不了 Fable。
- 红皇后效应与缓存:若 harness 与模型解耦、切换 API 是任意的,模型厂商就只能拼命奔跑才能停在原地——用户切换零成本,昨天 3000 万用户今天可能归零。DeepSeek 降价时缓存极其低廉,在 Cola 里缓存率 96、在 harness 里经常 100%;缓存 90% 与 95% 是两个重要节点,成本可能差两倍,因为无缓存价格是有缓存的十倍到一百倍。核心问题是缓存可能降低输出质量,Cloud Code 现在的拉跨就可能是为降成本让模型与缓存过于极端所致。
十五、缓存、成本与产品:产品就是自己带一套 FDE
- Cola 主打的功能点都在大模型本身的线上——凡是要它做东西、做项目,都落在大模型的能力线上。取景框很重要:不告诉 AI 自己长期希望往哪走,它就是一个无状态的东西;一旦有 role model、有方向,模型能替你管很多事。
- 这可能是 harness 该做的事:让用户进来后找到一个目标,像多邻国——你说要学英语但不知道怎么学,它说你进来玩游戏打卡就行,先把人带起来。harness 要给用户一个目标、一条路径与方法。
- 结论:只给用户模型没有用,那只是工具,中间还有 gap,需要 FDE。什么是产品?产品就是自己带一套 FDE。 往后每个产品的细分会越来越不一样:每个模型想做的事、它的 onboarding 与 FDE 彼此关联,会越来越分化。
文章由 englife.space & manus.im 转写与梳理










