惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Cisco Talos Blog
Cisco Talos Blog
量子位
小众软件
小众软件
Microsoft Azure Blog
Microsoft Azure Blog
V
Visual Studio Blog
I
InfoQ
Jina AI
Jina AI
The Cloudflare Blog
Recorded Future
Recorded Future
Recent Announcements
Recent Announcements
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
G
Google Developers Blog
Stack Overflow Blog
Stack Overflow Blog
阮一峰的网络日志
阮一峰的网络日志
Microsoft Security Blog
Microsoft Security Blog
美团技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Martin Fowler
Martin Fowler
T
Tailwind CSS Blog
博客园 - Franky
酷 壳 – CoolShell
酷 壳 – CoolShell
F
Fortinet All Blogs
WordPress大学
WordPress大学
P
Proofpoint News Feed
D
DataBreaches.Net
爱范儿
爱范儿
雷峰网
雷峰网
D
Docker
B
Blog
Engineering at Meta
Engineering at Meta
腾讯CDC
N
Netflix TechBlog - Medium
C
Check Point Blog
博客园 - 【当耐特】
Apple Machine Learning Research
Apple Machine Learning Research
T
Tenable Blog
GbyAI
GbyAI
Security Archives - TechRepublic
Security Archives - TechRepublic
博客园 - 三生石上(FineUI控件)
T
The Blog of Author Tim Ferriss
博客园 - 聂微东
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
SecWiki News
SecWiki News
S
Security @ Cisco Blogs
S
Security Affairs
V
V2EX
Application and Cybersecurity Blog
Application and Cybersecurity Blog
云风的 BLOG
云风的 BLOG
C
CERT Recently Published Vulnerability Notes
Y
Y Combinator Blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
26年AI产品经理为什么必须掌握Harness Engineering?
林航旗 · 2026-03-24 · via 人人都是产品经理

Vibe Coding被热捧为AI PM的未来技能,但其本质仍是依赖冗长Prompt的脆弱模式,难以应对工业级挑战。OpenAI的Harness Engineering系统揭示了关键突破:通过约束环境、自动化验证和反馈闭环,将AI从'玩具'升级为可靠工具。本文深度解析这一工程思维如何重构人机协作范式,以及产品经理如何从质检员转型为系统架构师。

整个行业都在鼓吹“Vibe Coding”是2026年AI PM的必备技能。但我发现,这种模式本质上和用AI写文章毫无二致——只不过产出物从“文字”变成了“代码”,模型依然无法精准理解背后的真实意图。

在这种直觉驱动下,依靠堆砌巨长的Prompt并不断对话,确实能迅速“聊”出一个惊艳的Demo。然而,Vibe Coding扛不住真实的工业级环境。在随后的迭代中,缺乏硬约束的系统必然崩塌:每次叠加新功能,Agent就会破坏旧逻辑;执行长线任务时,极易陷入失忆与死循环。最终,过度迷信Vibe Coding的项目,无一例外变成了一座无法维护的屎山。

问题出在哪里?

OpenAI的Codex团队在2026年用一组数据给出了答案:3名工程师,耗时5个月,交付了一个拥有100万行代码的完整软件产品,整个过程0行人工手写代码。

他们复盘这个极端实验时指出,实现这一跨越的核心不在于使用了多强大的底座模型,而在于他们构建了一套被称为Harness Engineering(驾驭工程)的系统。

对于AI产品经理而言,理解并掌握Harness Engineering,是将AI应用从“玩具”推向“工业级产品”的必经之路。

一、什么是Harness Engineering?

Harness原意是马具(缰绳、马鞍等)。在工程领域,它指代一套控制与测试环境。

如果把大模型比作引擎,Harness就是方向盘和刹车。引擎的马力越大,对方向盘和刹车的要求就越高。一台没有刹车的跑车,马力越强,车毁人亡的速度就越快。

在Agent开发中,Harness Engineering指的是为AI Agent搭建一个包含明确约束、可用工具链、自动验证标准和反馈闭环的独立运行环境。 它的核心目的是让Agent在你不在场的情况下,依然能自主、可靠地把任务做对。

这听起来像是在“给AI配置一台电脑”,但更准确的比喻是“为AI搭建一条带有自动化质检探头的流水线”。

二、 协作范式的演进:Prompt vs Context vs Harness

理解 Harness Engineering 的前提,是看清人机协作范式如何从“语言交互”转向“系统工程”。

Prompt Engineering(提示词工程):单向的指令下达

模式: “你是资深行业分析师,请帮我写一份竞品分析,要求分三点……”

本质: 一次性的条件概率生成。AI是一个没有记忆、没有手脚的被动执行者。你每次都需要重新交代背景,输出结果完全依赖指令的精细度。

局限: 任务链一长,AI必然失忆。人需要全程守着,不断下发新指令。

Context Engineering(上下文工程):静态的信息供给

模式: 接入RAG库、定义系统级文档(Skill手册)。“基于这份100页的内部数据表和行业报告,分析竞品。”

本质: 为AI构建信息环境。AI有了背景知识,产出质量和稳定性大幅提升。

局限: 知识库解决的是“AI怎么写”的问题,但解决不了“AI怎么知道自己写对了”的问题。你给了它操作手册,但它遵不遵守全靠自觉。产出物依然需要人类逐行Review。

Harness Engineering(驾驭工程):动态的系统闭环

模式: 为Agent设定运行沙箱、配置调用接口,并植入校验脚本。Agent提交结果后,系统自动运行验证规则,失败则直接把报错信息(包含修改建议)退回给Agent重做,直到通过才提交给人类。

本质: 从“优化输入”转向“约束边界与自动化验收”。

核心区别: Context Engineering决定了Agent能看到什么,而Harness Engineering决定了系统能预防什么、测量什么、修复什么

三、 核心机制:面向 ROI 的“推理三明治”

Harness 在工程实操中通过“推理三明治”结构对冲质量波动。但在 2026 年的工业环境下,这套结构不再是盲目的全量堆叠,而是基于 TokenROI(推理投资回报率) 的精准博弈:

顶层:高推理规划(The Top Bun) 调用高推理模型(如 DeepSeek-R1 或 o1)负责将模糊需求拆解为带有硬性约束的执行蓝图。这一层产出的不是代码或文字,而是 “确定性验收矩阵(Acceptance Matrix)”,明确定义了下一步执行必须触发的工具链和逻辑断点。

中层:低推理执行(The Meat) 由低推理模型(如 GPT-4o-mini 或 8B 级端侧模型)承接原子任务。在 Harness 预设的 Lint 工具、结构化测试脚本约束下,利用其低延迟和低成本优势,进行大规模的内容填充或代码构建。

底层:选择性高推理质检(The Bottom Bun) 这是实现工业级交付的关键。为了平衡成本与延迟,系统并非对所有产出进行高推理 Review,而是通过 Harness 中的 “逻辑探针” 识别高风险变更(如涉及权限控制、金融计算或核心接口调用)。

  • L1/L2 脚本校验: 80% 的格式与语法错误由确定性代码直接拦截。
  • L3 高推理质检: 仅当脚本校验发现逻辑矛盾,或命中高风险断点时,才唤醒高推理模型作为“质检员”进行语义对撞。

通过这种“按需唤醒”的夹心结构,Harness 系统利用高推理模型的逻辑冗余,去填补低推理模型在长线任务中的幻觉黑洞。这意味着:即使执行层偶尔“掉链子”,自动化反馈闭环也会将其在系统内修正,确保最终交付给人类的是具备“确定性”的成品。

四、 Harness 系统的五大核心模块

一个完整的Harness系统包含哪些部分?结合行业前沿实践,以下是构建Harness环境必须具备的核心模块:

1. 按需索引

大模型的上下文窗口虽然越来越大,但塞入的信息越多,关键约束被稀释的概率就越高(即“注意力丢失”)。 Harness系统通过提供“目录地图”解决这个问题。在根目录放置一个简短的索引文件(如AGENTS.md),仅列出“架构说明在A”、“设计规范在B”、“API接口在C”。Agent根据当前任务,按需调取对应的子文档。这种渐进式披露机制,保证了Agent工作台的清爽和信息的高信噪比。

2. 代码拦截

过去我们习惯在Prompt里写“请务必遵守XX规范”。但在Harness中,凡是能用代码写死的规则,绝对不用Prompt去建议。 通过引入Lint工具、结构化测试脚本等确定性工具来限制Agent的行为。例如,设定“A模块不能跨层级调用C模块”,一旦Agent生成的逻辑违规,脚本直接拦截并报错。这种机械化的硬约束,极大地压缩了Agent自由发挥导致的犯错空间。

3. 三层自动质检

这是Harness引擎的心脏。Agent写完方案或代码,系统自动触发三层验证:

  • L1 硬性规则: 格式对不对?字数是否超标?(脚本直接判断)
  • L2 执行测试: 逻辑能不能跑通?耗时是否超时?(在隔离沙箱中实际运行一遍)
  • L3 软性标准: 方案的业务推演是否合理?(调用另一个高推理强度的Agent进行同行评审) 关键点在于,这三层验证产生的“报错信息”是写给Agent看的,并且自带修复指令。 Agent收到报错后自主修改、再次提交,形成循环。在这个闭环里,人类完全不需要参与。

4. 数据探针

不要让Agent变成“闭门造车的盲人”。Harness系统会给Agent接上“眼睛”和“探针”。 给它开放UI自动化测试工具的控制权,让它能自己打开页面看渲染效果;给它开放日志系统的查询权限,让它能自己查报错链路;给它提供吞吐量、延迟等指标接口,让它能根据客观数据验证自己的产出。感知通道越丰富,Agent的闭环能力越强。

5. 垃圾回收

Agent 的高效执行伴随一个致命副作用:它会以指数级速度复制并放大系统中已有的“坏模式(Bad Patterns)”。人类原本需要数月堆积的技术债,Agent 只需数小时就能让其蔓延至整个项目。

Harness 系统通过部署后台治理 Agent(类似于 Java 的 GC 机制)来对抗这种熵增,但其核心不再是盲目的自动删改,而是闭环的“探测-验证-提议”机制:

  • 风险探测: 后台 Agent 定期扫描知识库、Prompt 模板和产出逻辑。利用高推理模型识别过期文档、违背“黄金原则”的冗余逻辑或正在蔓延的代码异味(Code Smell)。
  • 影子系统验证(Shadow Verification): 这是防止系统崩溃的关键防线。治理 Agent 在发现坏模式后,不会直接修改生产环境,而是在隔离的影子沙箱中运行清理方案,并与原版本的输出结果进行像素级的比对测试。
  • 确定性回滚预案: 只有当清理后的逻辑在影子系统中通过了 100% 的回归测试,且性能指标(延迟、Token 消耗)不降反升时,系统才会生成一份带有详细差异对比(Diff)的 Merge Request

通过这种“自动探测、模拟验证、人工复核”的半自动治理模式,Harness 能够在不引入系统性风险的前提下,持续进行微小的逻辑修复,从根源上拦截 Agent 带来的技术债爆炸。

五、 对AI产品经理的终极启示

理解了Harness Engineering,就会明白为什么自己vibe coding的AI产品只能停留在玩具阶段,而OpenAI的Codex团队能够用极少的人力支撑庞大的复杂系统。

对于AI产品经理而言,这意味着彻底告别依赖模型直觉的“Vibe Coding”模式::

从流水线上的一个质检员、安全员,AI每做完一步都要上去核对、修改指令(in the loop)。 变成了设计这条流水线的系统架构师。

未来,PM的核心产出将不再仅仅是一份PRD或一段精妙的System Prompt,而是这套环境的业务规则定义。你需要去定义什么是合格的输出、用什么数据指标来验证这个输出、发生特定错误时应该触发什么工具供Agent排查。

你的工作越前置、你设计的Harness约束越严谨,Agent在后台能连续自主工作的时间就越长,你的生产力天花板就越高。

不要试图用更好的Prompt去控制一匹脱缰的野马,去给它建一个拥有清晰赛道、护栏和自动测速仪的马场。这就是2026年,AI产品经理必须建立的系统工程思维。

本文由 @林航旗 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议