惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 叶小钗
Microsoft Azure Blog
Microsoft Azure Blog
Stack Overflow Blog
Stack Overflow Blog
Jina AI
Jina AI
Vercel News
Vercel News
H
Help Net Security
Martin Fowler
Martin Fowler
美团技术团队
云风的 BLOG
云风的 BLOG
Y
Y Combinator Blog
阮一峰的网络日志
阮一峰的网络日志
MyScale Blog
MyScale Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 三生石上(FineUI控件)
博客园 - 司徒正美
人人都是产品经理
人人都是产品经理
Engineering at Meta
Engineering at Meta
G
Google Developers Blog
Blog — PlanetScale
Blog — PlanetScale
MongoDB | Blog
MongoDB | Blog
宝玉的分享
宝玉的分享
小众软件
小众软件
T
Tailwind CSS Blog
WordPress大学
WordPress大学

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
GLM-5.0 不是“又一个更强模型”,而是中国大模型竞争范式的拐点
邓的AI手记 · 2026-02-18 · via 人人都是产品经理

大模型行业正经历从参数竞赛到可交付智能的关键转折。GLM-5的推出不仅标志着开源模型的重大突破,更将竞争焦点从单纯的代码生成转向了完整的工程交付能力。本文将深度剖析行业面临的三大迁移趋势、当前卡脖子的交付难题,以及未来3-5年Agentic Engineering将如何重构企业生产力体系。

一、行业背景:从“参数竞赛”换挡到“可交付智能”

过去两年,我最直观的感受是:大模型行业的重心不止一次挪位,尤其有三次迁移非常清晰。

1)从通用对话到垂直落地:企业越来越不为“会聊天”买单,而是为“能把任务做完”付费。

2)从单轮能力到长程任务:写一段代码、改一句文案的边际价值在下降;能跨文件、跨工具、跨阶段推进,把事情从头到尾跑完的价值在上升。

3)从闭源垄断到开源追赶:尤其在国内市场,在外部限制与成本约束下,“可控、可部署、可定制”的本地方案越来越像默认选项。路透社也提到智谱发布 GLM-5(开源)并强调编程与长程 Agent 能力,同时还提到其训练使用了华为昇腾等国产芯片,这背后对应的是供应链与算力自主的战略语境。

所以在我看来,GLM-5 的意义不在“指标又涨了多少”,而在于它把大模型的主战场从“写代码”更明确地推向了“写工程/交付工程(Agentic Engineering)”。官方文档甚至直接把它定位为“面向 Agentic Engineering 打造”。

二、当前问题:行业卡在“能用”与“可交付”之间

如果把企业对大模型的期待拆成三层:可用(能答)—可控(能按规则答)—可交付(能完成任务并验收),那目前最卡的其实是第三层。

1)“会写”不等于“能跑”

很多模型在 demo 里看起来很强,但一进真实工程就露馅:依赖版本对不上、项目结构不一致、测试缺失、边界条件漏掉……最后还是工程师来补齐“让 AI 产物可运行、可验收”的那一大段脏活累活。

2)长程任务的“目标漂移”

Agent 一旦跨多步,常见问题是越做越偏:计划与执行脱节、记忆混乱、工具调用不稳定、局部最优把整体带沟里。GLM-5 把“长程 Agent 任务”当作核心卖点,本质上就是瞄准这类痛点。

3)成本结构开始反噬规模应用

当应用从试点走向日常高频调用,推理成本和工程效率就不再是“优化项”,而是硬约束。与此同时商业化压力也在上升:路透社报道智谱因需求增长上调 GLM 编程订阅价格(至少 30%),这说明开发者侧的付费意愿与供给成本之间,正在重新做账。

三、核心矛盾:开源“逼近顶级闭源” vs 真实交付的系统性门槛

我对 GLM-5 的核心判断是:它代表了一条“更强的基座 + 更工程化的后训练 + 更低部署成本”去打穿交付门槛的路线。但真正决定胜负的矛盾,往往不在“模型会不会”,而在“系统能不能把模型能力稳定兑现”。

这件事可以拆成两股对冲力量:

能力侧在加速:GLM-5 在官方信息中强调参数规模、数据规模、异步强化学习框架(“Slime”)与稀疏注意力(集成 DeepSeek Sparse Attention)来提升长上下文效率与部署成本;并给出 200K 上下文窗口、128K 最大输出等工程向指标。

兑现侧的摩擦更真实:企业落地时,真正决定成败的是评测体系、工具链、权限/审计、知识库与数据治理、回滚机制、可观测性(为什么错、错在哪里),以及“人类接管”的流程设计。

一句话:模型能力在逼近,但交付链条并不会自动补齐。GLM-5 讲“面向 Agentic Engineering”,其实是在把竞争从“比聪明”推到“比系统工程”。

四、趋势判断:未来两年,大模型竞争会从“模型战”变成“交付战”

结合 GLM-5 这类发布,我更愿意把接下来两年的变化概括成三条趋势。

趋势1:模型将被重新定价,价值从“回答”迁移到“执行”

当开源模型在 coding/agent 评测上不断刷新上限(GLM-5 在 SWE-bench-Verified、Terminal Bench 2.0 等指标上宣称取得开源最高分,并在 BrowseComp、MCP-Atlas、τ²-Bench 等 Agent 评测上强调开源第一),市场会逐渐把“能答对”当作门槛,而不是溢价来源。

真正能卖出溢价的,会变成:更稳定的工具调用、更少的幻觉、更强的长程规划与自检、更可控的输出结构。

趋势2:评测会从“静态题库”走向“真实工作流基准”

传统 benchmark 只能代表能力的某个切片,而 Agentic 工程需要端到端的指标:完成率、回滚率、人工介入次数、平均修复轮次、单位交付成本。GLM-5 把“复杂系统工程、长程任务执行”推到前台,本质上是在押注:下一代评测标准会更贴近真实工作流。

趋势3:国内市场会更强调“可部署、可控与供应链确定性”

路透社提到 GLM-5 使用国产芯片训练,这不只是技术叙事,也是商业叙事:对政企与强监管行业来说,“可控可管可审计”往往比“全球最强”更重要。

五、未来3–5年推演:GLM-5 这类路线会把行业带到哪里?

下面这段我更想谈“产业演化”:不盯单点指标涨幅,而看竞争格局与产品形态怎么变。

1)第1阶段(未来12个月):Agentic Coding 先成为开发者侧的默认工作方式

开发者场景需求最清晰、ROI 最直接。GLM-5 明确强化编程与工程交付,并提供长上下文与工具调用能力支持(Function Call、结构化输出、上下文缓存等)。

但这阶段的胜负手不只是模型本身,更在:IDE/CLI 集成、仓库级理解、测试生成与自动修复,以及和企业代码规范/权限体系的融合。

2)第2阶段(1–3年):企业“业务 Agent”从试点走向规模化,同时经历一次“幻觉治理”与“责任归属”重构

当 Agent 真正接触业务系统(工单、CRM、财务、采购),幻觉不再是体验问题,而是风险问题。企业会更强硬地要求:

可追溯:每一步引用了什么数据、调用了什么工具

可审计:权限最小化、数据不出域

可回滚:错误动作可撤销

这会倒逼平台层(而不只是单一模型)形成护城河:观测、治理、沙箱、审批流、红队测试。

3)第3阶段(3–5年):基座模型趋于“半商品化”,差异化上移到“行业工作流 + 数据飞轮 + 组织适配”

如果开源模型持续逼近顶级闭源,企业最终会把基座当作可替换件。届时真正拉开差距的,是三件事:

行业知识的结构化沉淀(知识库、图谱、流程与规则)

真实任务数据闭环(哪些任务失败、失败模式是什么、如何再训练/再对齐)

组织层面的“人机分工”制度化(谁批准、谁复核、出错谁负责)

从这个视角看,GLM-5 的战略价值并不是“它有多像某个顶级闭源模型”,而是它把国内厂商的竞争拉进一个更现实的战场:谁能把 Agent 变成可交付的生产力系统。这也解释了为什么媒体报道会把它与“复杂系统工程”和“长程 Agent”强绑定,并强调其逼近闭源顶尖体验。

结语:我对 GLM-5 的独立观点

GLM-5 最值得关注的,不是“开源又追平了谁”,而是它把行业叙事从“聊天更像人”推进到“交付更像团队”。当模型把“写工程”作为主目标时,行业会被迫承认一个事实:未来的大模型竞争,本质是系统工程竞争。模型只是发动机,真正决定体验与价值的是整套传动系统、刹车系统与仪表盘。

如果你正在做大模型产品或企业落地,我建议把评估重点从“单次回答效果”迁移到三类指标:

1)端到端交付率(完成任务并可验收)

2)人工介入成本(需要多少次接管)

3)失败可控性(错了能否定位、回滚、复盘)

谁能在这三项上建立长期优势,谁就更可能在未来 3–5 年的“交付战”里胜出。