惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
Netflix TechBlog - Medium
J
Java Code Geeks
爱范儿
爱范儿
雷峰网
雷峰网
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园 - 三生石上(FineUI控件)
H
Hackread – Cybersecurity News, Data Breaches, AI and More
B
Blog RSS Feed
Google DeepMind News
Google DeepMind News
Jina AI
Jina AI
The GitHub Blog
The GitHub Blog
I
InfoQ
月光博客
月光博客
博客园 - 聂微东
博客园 - Franky
The Cloudflare Blog
阮一峰的网络日志
阮一峰的网络日志
博客园_首页
G
Google Developers Blog
Blog — PlanetScale
Blog — PlanetScale
L
LangChain Blog
罗磊的独立博客
Apple Machine Learning Research
Apple Machine Learning Research

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
AI 产品经理最该花精力的事情
产品经理伯庸 · 2025-12-08 · via 人人都是产品经理

AI 产品经理的日常,不在 PRD 里,也不在原型图上,而在一场场“没有标准答案”的效果评估中。从 60 分到 100 分的跃迁,靠的不是炫技,而是用系统性评估把 AI 的“模糊正确”变成“可靠好用”。这是一份关于如何科学“考 AI”的实战指南。

很多刚转行或者想转行做 AI 产品经理的朋友,经常问我同一个问题:做 AI 产品,是不是每天都在研究怎么写出惊艳的 PRD,或者是跟 UI 抠原型的交互细节?

其实真不是。

对于 AI 产品经理来说,花时间最多的事情,往往既不是写 PRD,也不是画原型,而是一件听起来特别枯燥、但又特别要命的事儿,AI 产品效果评估。

咱们得承认,现在调个接口把 AI 产品搭建起来,太容易了。大模型能力摆在那,只要路子对,做到 60 分是分分钟的事。 但是,想让 AI 产品从「能用」变成「好用」,是 60 分到 100 分的区别。这中间差的这 40 分,你没法靠画原型画出来,全得靠你在泥坑里打滚,不断地对产品进行效果评估和调优。

为什么说这事儿最耗费精力?

评估这事儿,听着简单,不就是看看 AI 答得对不对吗? 嗯,还真没那么简单。

首先,因为没有标准答案。

以前做传统软件,按钮点击跳转正不正常,那是 0 和 1 的事,非黑即白。 但 AI 不一样。特别是在文案生成、陪伴聊天这种主观性特别强的场景里,什么是好的回答? 一句文案,你觉得「太罗嗦」,开发觉得「挺详细」,老板觉得「没情感」。 如果不花大把时间去定义评估标准,大家就只能在会上吵架,谁嗓门大谁有理。

其次,最可怕的是:按下葫芦浮起瓢。

咱们肯定都遇到过这种崩溃瞬间:你为了修某个 Bad Case(坏案例),专门去调了 Prompt 或者改了知识库。结果一上线,那个 Bad Case 是修好了,但原本那几个回答得特别完美的 Case,突然就开始胡说八道了。 所以,那种头痛医头的零敲碎打根本行不通,必须得做系统性的评估。

那这块硬骨头,到底该怎么啃?

评估不易,但想做出一款拿得出手的产品,这又是必须要过的坎。结合这段时间的踩坑经验,我觉得大概可以分三步走:

第一,建立评估数据集

你得建立一个高质量的评估数据集。 这活儿全是脏活累活。你不能弄几个数据糊弄事儿。你的数据覆盖度得够。

简单的送分题要有;

复杂的逻辑推理题要有;

甚至用户没事找事的超纲题也得有。

评估集的数据量如果不厚实,你的评估结果就是自欺欺人。

第二,确定评估方式

用机器打分: 比如让 GPT-5 去给你的小模型打分。这招快,成本相对低,适合快速迭代看趋势。

人工评分: 这是最准的,但也最贵、最慢。

你得在成本和效果之间找个平衡。如果是上线前的关键版本,那我建议还得是人工来看一眼心里才踏实。

第三,归因分析

分数跑出来了,比如准确率只有 75%,然后呢? 评估的终点不是那个分数,而是归因。 我们要通过分析那些 Bad Case,把脉把出来:

这是召回的问题?

还是重排序的问题?

还是大模型生成的问题?

只有把原因定位到这么细的颗粒度,开发兄弟们才知道该怎么修。

其实说白了,评估就是给 AI 模型的一场模拟考试。

如果你不做系统性的评估,每次仅用少量数据测试效果,就是在赌博。 你没法发现真正的问题在哪,更别提解决问题的优先级了。

本文由人人都是产品经理作者【产品经理伯庸】,微信公众号:【AI文如刀】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。