惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Threatpost
S
Schneier on Security
P
Palo Alto Networks Blog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
S
Securelist
T
Threat Research - Cisco Blogs
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
V
Vulnerabilities – Threatpost
AI
AI
C
CERT Recently Published Vulnerability Notes
C
Cyber Attacks, Cyber Crime and Cyber Security
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Know Your Adversary
Know Your Adversary
AWS News Blog
AWS News Blog
TaoSecurity Blog
TaoSecurity Blog
O
OpenAI News
Cyberwarzone
Cyberwarzone
G
GRAHAM CLULEY
SecWiki News
SecWiki News
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Simon Willison's Weblog
Simon Willison's Weblog
I
Intezer
C
CXSECURITY Database RSS Feed - CXSecurity.com
C
Cisco Blogs
K
Kaspersky official blog
Spread Privacy
Spread Privacy
S
Security @ Cisco Blogs
Hacker News - Newest:
Hacker News - Newest: "LLM"
IT之家
IT之家
有赞技术团队
有赞技术团队
B
Blog
T
Tailwind CSS Blog
PCI Perspectives
PCI Perspectives
P
Privacy & Cybersecurity Law Blog
Last Week in AI
Last Week in AI
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Webroot Blog
Webroot Blog
博客园 - 叶小钗
Cisco Talos Blog
Cisco Talos Blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
H
Hacker News: Front Page
The Cloudflare Blog
C
Cybersecurity and Infrastructure Security Agency CISA
美团技术团队
V
V2EX
腾讯CDC
S
SegmentFault 最新的问题
Security Archives - TechRepublic
Security Archives - TechRepublic

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
Prompt Engineering指南:AI产品经理工作实操手册
陈惑仔Harry · 2026-01-21 · via 人人都是产品经理

Prompt Engineering已成为AI产品经理的核心竞争力,但如何系统化地构建生产级Prompt却鲜有深度方法论。本文揭秘从Benchmark制定到评测集构建的全流程实战技巧,教你用LLM-as-a-Judge技术打造高效Prompt迭代闭环,让AI真正成为你的‘阅卷人’。

Intro

作为一个AI产品经理,为AI Feature做Prompt Engineering可能占到工作时间的70%以上。

今天整理出来我自己在工作中搭建并使用的撰写Prompt的Pipeline。希望能给AI产品经理同行们一些启发,也希望给想入行的小伙伴一些日常实操、应对面试的建议。

总体来讲,生产用Prompt撰写分为三部分:

  1. 为任务制定Benchmark
  2. 写出第一版生产用Prompt
  3. 循环迭代

在开始前,请大家先建立一个概念:生产用Prompt不可能是一次写好的,需要不断的根据评测得分迭代,获得最好的效果和稳定性。

打个比方,你是一所高中的数学教学组组长。想提高学生的数学考试成绩。你需要先出卷子让学生们考试,知道他们的得分和欠缺点、才有可能去针对性教学。

那考试得分的真实性、稳定性就很重要了。相信大家都学过大数定理和中心极限定理,我们需要大批量的【评测样本】(可能是成百上千条)。所以是不可能我们人肉去一个个看评测集、然后给每个评测样本打分的。

你,数学组组长,作为出卷人,不可能去批全校的卷子。你需要把得分标准教给其他数学老师,让他们去当阅卷人帮你批卷子。

在工作中,AI产品经理就是出卷人,AI则作为阅卷人。

这种方法也就是大家常说的【机评】。学名叫做LLM-as-a-Judge(LaaJ)。经典论文:https://arxiv.org/html/2306.05685v4。

现在,请大家假设自己是OpenAI的产品经理,想从零做一个关于AI给出减脂建议的feature。让我们一起开始撰写Prompt的旅程吧。

为任务制定Benchmark

针对任务制定【评测标准】

拿到这个任务,我们就开始扮演出卷人的角色了。想衡量一个AI给出的减脂建议好不好,可能有哪些标准呢?

感觉有很多衡量指标:有用性、易操作性、情绪价值…

没错!对于一个任务的产出,一定是有多个维度可以评判,而我们需要做的第一步就是确定这些维度、以及他们的权重。这些维度和权重的确认就是一个产品经理Taste的重要体现了。

在这个任务中,我认为上面三个维度已经足够衡量AI的输出。而我觉得他们的重要程度是递减的。

所以我的评测公式是:总得分=70%有用性得分+20%易操作性得分+10%情绪价值得分。

示例:有用性得分=5,易操作性得分=3,情绪价值得分=2,总得分=70%*5+20%*3+10%*2=4.3

这三个维度就像三道大题。对于阅卷人来说,给出这个总得分公式是不够的,需要告诉他们每道大题分别怎么打分。在真实工作中,一般每个维度我们会给出1到5五个分数,每个分数会给一个得分的规则,在这里为了简化起见,我们就给三个分数,就是1分、2分、3分。

以有用性得分为例。得3分的标准,可能是给出的建议在学术上被验证完全有效。2分的标准,学术上验证对大部分人有效。1分的标准,对所有人或大部分人都无效。

对于易操作性和情绪价值,另外两个维度也要按照相似的方式给出不同得分的标准。

示例:

我们刚刚构建的得分计算公式和各个维度的打分规则,合在一起就是这个AI feature的【评测标准】,这也是所有AI feature的起点

构建【评测集】,给【小批量评测样本】人肉打分

我们刚刚给出了一些阅卷标准,现在我们开始出卷。比如说我们现在先出100道跟如何减脂相关的题目。形成 raw_questions.csv。大部分的题目是为了给学生作答的,也就是说让之后 AI 用我们的 生产用prompt 去产出。

但是我们需要先挑出来一小部分题目,比如10~20道,我们给这些题目先写上我们认为的可能遇到的一些不同类型的答案。然后按照我们刚刚的评测标准,去给出这些题目的各个维度的得分以及总得分。作为阅卷样例。记录在 human_labels.csv。而这些阅卷样例将在第5步用到。

一步完成后,你拥有两份文件:

  • raw_questions.csv(待模型生成答案)
  • human_labels.csv(人肉基准)

针对评测标准写【评测用Prompt】

有了阅卷标准之后,我们要把它教给阅卷人。对于AI来说,就是用Prompt告诉他我们刚刚的阅卷规则。

关于怎么写好一个Prompt,有一些小tips:

  • 每个章节使用xml标签:如<task>根据我的评测标准给输入的文本打分</task>。因为模型在训练过程中见过很多XML,所以这种格式更易于被LLM理解
  • 给few-shot:给一些例子教 AI 学会如何打分。这里要注意,这些例子尽可能覆盖在真实生产场景中会遇到的例子,不要只给一两个高分或低分的例子
  • 让 AI 先分解问题,然后逐步解决

示例:

usefulness_prompt

<role> assistant </role>

<task> 对于<input>中的减脂建议,根据<criteria>评估其“有用性”,给出 1‑3 分并说明理由。 </task>

<criteria>

1分:对所有人或大部分人都无效

2分:学术上验证对大部分人有效

3分:给出的建议在学术上被验证完全有效

</criteria>

<input> {question} </input>

<output>

”’json { “score”:”你要填的得分”, “reason”:”你要填的得分理由” }

</output>

operability_prompt(同上,只改任务描述)

emotion_prompt(同上,只改任务描述)

这里有一个小tips是,直觉上大部分人会只用一个 prompt 让AI给出多个维度的打分。

但由于LLM的上下文注意力机制,我建议是有多少个维度就构建多少个Prompt。比如说这里是3个维度,那就构建3个 prompt。之后对于每一条评测样本都call 3次 API 获得3个维度的得分,最后再用程序进行加权平均。

用【评测用Prompt】跑小批量评测集

这一步是为了衡量阅卷人有没有学会我们的阅卷标准。也即用我们的评测用 prompt ,去跑第2步挑出来的那一小部分题目,让模型输出他认为的每个样本各个维度的得分以及总得分。

这里有一个小技巧,为了避免模型输出的随机性,我一般会在参数中把 temperature 设为0(这样模型输出会稳定)。

根据模型打分结果调整【评测用Prompt】,直至和人肉打分对齐

获得了模型,也即阅卷人人的打分之后,我们可以把模型的打分跟我们自己在第2步中的打分进行对比,看看模型在哪些维度会进行高估,哪些维度会进行低估。

然后针对这些问题,我们对第3步的评测用 prompt 进行修改,然后重复第4步、第5步,直到模型输出的打分和我们自己的人肉打分完全一致,或误差小于阈值(如0.2)

这时候你就有了一个完全理解你心意的阅卷人,能代替你去做重复的判卷子工作了。

第一版生产用Prompt

写第一版【生产用Prompt】

有了阅卷人之后,我们现在要教学生如何答题了!

关于写【生产用prompt】,我建议的大方向是采用段落式的写作方法。

示例:

<role> 你是一位减脂专家。 </role>

<task> 你会收到用户关于如何减脂的提问,结合你的专业知识和用户的实际情况,给出建议。 </task>

< guideline> 不要上来就给用户的建议。要先了解ta的基础信息、身体情况、减脂目标等。 然后推荐合适的生活方式,以及训练规划。 尽量不提供药物建议除非你觉得必要。

</guideline>

<examples>

{ “examples”: [ { “user_input”: “我最近想减脂,但不知道从哪里开始,你能给我一个计划吗?”, “assistant_output”: { “advice 1”: { “advice”: “为了给你做个可执行的减脂计划,我需要先了解你的身高、体重、年龄、性别、日常活动量、目前饮食情况、作息、训练基础以及你具体想达到的目标(比如减多少斤、多久完成)。请先告诉我这些信息。”, “reason”: “在不了解你的基础信息前,任何训练/饮食建议都是不精确甚至不安全的。基础信息能决定你的热量缺口设置、训练强度、营养分配方式,避免减脂过程损伤肌肉或影响身体机能。” } } }, { “user_input”: “我173cm 72kg 28岁 男 每天久坐、没时间做饭、作息正常,想两个月瘦到68kg。”, “assistant_output”: { “advice 1”: { “advice”: “你的目标是 2 个月减 4kg,属温和可实现范围。为了制定合适的计划,我还需要知道你的:1)目前每周能安排多少训练时间;2)是否有力量训练经验;3)是否有膝盖、腰椎、肩颈等伤病史;4)外卖/食堂/家里做饭这三种哪种更容易坚持。”, “reason”: “训练安排必须建立在你可执行的时间和身体状态之上,否则无法坚持或可能加重旧伤。同时饮食策略必须贴合你日常饮食来源,才能真正落地。” } } } ] }

</examples>

<format_requirement> 按下列格式输出,前后不要加任何多余解释

”’json { “advice 1”: { “advice”:”advice details”, “reason”:”reason details” } … } </format_requirement>

段落式的写法有好处,一个是协作角度,对自己和同事来看简洁清晰;一个是在之后的修改步骤里边,可以针对性地对每一个段落进行微调,而不改变其他段落,进行类似于控制变量的实验,这样甚至能知道模型在这个任务方面对于每个段落的提示词,它的反馈是什么样的。

这里有一个误区,是提示词越长越好,并不是这样的。更长的提示词对模型来讲一般意味着在一个更确定的向量空间内进行回复,但是会少很多的发散性,甚至是智能感。因此我建议先从一个比较简单的框架开始。先看模型在使用这个简单 prompt的情况下,对于该任务的能力如何,和自己的Benchmark的差距有多大,再去看如何调整Prompt来达到最佳效果。

Claude官方有对于Prompt Engineering的一套完整方法的介绍,我觉得感兴趣的同学可以点击链接详细阅读

https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/overview

Claude Console也有一个Prompt的生成器,值得尝试:

https://platform.claude.com/dashboard

也可以使用字节的Prompt Pilot,我觉得能给人一些灵感。

https://promptpilot.volcengine.com/home

还有一个更简单的方式,就是把你写的一个很简单的 prompt 喂给Gemini,或者 Claude,或者 GPT,让他们按照现在 prompt 的最佳实践给你进行修改。注意,不要让他们直接上手改 prompt,而是让他们给出具体的修改思路和要改哪些点,等你 approve 之后再去改,这样避免在他的 chatbox 框内去 review 很长的 prompt,效率更高。

使用【生产用Prompt】产出【大批量评测样本】

终于到了这一步!让考生(也就是AI)去用我们写好的生产用prompt答卷。

把我们之前构建好的评测集里面还没有答案的题目,一个一个喂给 AI,让 AI 逐个作答,并把它们的答案保存下来。

这里我自己比较习惯的方式是,把整个评测集先保存成一个 csv,然后用模型每次来读取评测集里的题目的时候,相当于使用Python Pandas摘选出某个 csv 中某行某列的一个值,然后把值填入到 prompt 里边。模型处理输出之后。把关于这行样本的输出再回填到该行的另外一列。

用【评测Prompt】跑【大批量评测样本】

可能很多人觉得说这一步也没啥说的,就是用评测 prompt 让阅卷人给我们跑出来的评测样本打分。但其实还是有一些关键的小技巧:

  • 一个是模型的设置,temperature 要设为0来保证打分的稳定性;设置随机种子来确保可复现(若涉及抽样);设置max_tokens以防截断
  • 另外为了确保打分是波动比较低的、是稳定的,在生产中对于每一个样本会跑3~5次评测prompt。如果得分波动率超过了一个设定的阈值,那我们会去掉离群值后、将分数进行平均,来获得最终的该样本得分。这个过程其实是需要一些代码来实现的。建议大家通过跟 Claude Code 聊天来聊清楚自己的一个需求,这个任务对于 Claude Code 来说没有任何难度。
  • 我自己工作中是在 DeepEval 这个开源库的基础上进行的修改。https://github.com/confident-ai/deepeval

根据模型打分结果A/B Testing改【生产用Prompt】

好!现在我们作为数学教学组长终于获得了学生的答案及准确的分数!我们知道了学生在各个维度的掌握情况如何,以及我们应该去针对性地提高哪些维度。

但在进一步进行教学修改 prompt 之前,我们要先检查一下这个判卷的过程中有没有一些错误或者纰漏:

  • 特别首先筛选出各个维度的低分的 case,看这些 case 在程序运行中有没有LLM输出中断的情况
  • 对于特别高分和特别低分的 case,在这个评测样本上有没有一些规律?这样可以看出是不是对于某些类型的题,我们的 prompt 表现不够好。这样我们能知道是考虑做 edge case 的修改,还是做 general case 的修改

在确定没有其他问题之后,我们可以进入到A/B testing 改 prompt 阶段。

这里的方法我自己总结下来,就是自然实验中的【控制变量法】。如果同时修改多个段落,很难确定某个维度的得分提升是来自于哪个修改。而一段一段地修改,才能知道每个段落对于最终模型的输出有怎样的影响。

在挑选从哪个段落开始改起方面,我建议大家抓住主要矛盾,先改对于模型来讲你觉得影响最大的 prompt 段落。如果该段落的改进达到瓶颈之后,提升不太大了,再去从其他的小段落开始改起。

A/B Testing迭代

在改好了新的 prompt 之后,我们可以循环步骤7到步骤9,直到结果满意。

有一些值得注意的小tips:

  • Prompt engineering 不是万能的,如果在进行了各种调优,尝试模型在该任务中的得分都没有一个明显的提升的话,可能要从头想一下这个任务对模型来讲是否practical
  • 反过来讲,如果只是经过了一两次简单的尝试,就能够把模型的得分从比较低提升到比较高,则要想想给出的得分标准是否太简单
  • 模型的选择、参数,对于整个Prompt Engineering的结果有巨大影响。所以每一次换新的模型或者调参数,都需要将整个测评过程重跑一遍,以确保没有引入新的问题

最后,最重要的是 ,AI 不是人,产品经理依旧要对最后的结果负责。因此就算评测达到了很高的分数,还是建议产品经理自己去随机抽样不同分得分的 case ,来看看是不是都能满足交付给用户的标准。

总结

以上所讲的是我在日常工作中从0到1撰写一条生产用prompt的方法。

概括下来就是:

1️⃣ 设定评测标准

2️⃣ 构建评测集

3️⃣ 编写评测 Prompt

4️⃣ 评测对齐

5️⃣ 生产 Prompt

6️⃣ A/B 迭代

Prompt Engineering是一门科学。虽然文中用的是单 prompt的案例,但是对于一个 prompt chain,一个 workflow,甚至是一个agent feature,其实都可以应用这个方法论的原则和步骤来进行调优。

希望能给从业者一些启发,给正在找工作的面试小伙伴一些更深入了解 AI 的方法。

如果大家有什么问题,欢迎评论区评论 ~

AI向善:)

本文由 @陈惑仔Harry 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议