惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

L
LangChain Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
雷峰网
雷峰网
量子位
V
V2EX
S
SegmentFault 最新的问题
月光博客
月光博客
博客园 - 【当耐特】
Hugging Face - Blog
Hugging Face - Blog
V
Visual Studio Blog
大猫的无限游戏
大猫的无限游戏
T
Tailwind CSS Blog
博客园_首页
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
美团技术团队
Y
Y Combinator Blog
The Cloudflare Blog
C
Check Point Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
腾讯CDC
B
Blog
Stack Overflow Blog
Stack Overflow Blog
P
Proofpoint News Feed

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
AI医疗问诊产品分析:从评估体系到模型能力的全面解析
「爱」原生 · 2025-06-17 · via 人人都是产品经理

随着AI技术在医疗领域的应用逐渐深入,AI医疗问诊产品成为行业关注的焦点。本文将深入分析AI医疗问诊产品的核心能力,从评估体系到模型性能,探讨如何通过多轮对话动态收集病情信息并完成诊断闭环。

AI产品经理与非AI产品经理有哪些不同?

  1. 做好「评估」这件事:AI产品的质量在很大程度上取决于其评估的质量。当前模型往往是“评估受限”而不是“智能受限”。制定合适的评估方法是产品经理的一项关键技能,需要能够定义什么是好的并创建有效的评估,并根据数据分析不断改进评估。例如,在医疗问诊场景中,评估不仅是技术验证,更是医疗专业性与用户体验的双重校准。
  2. 能处理随机、非确定性的系统问题:AI 模型(如大语言模型)的输出具有随机性,产品经理需设计闭环反馈机制(如异常检测、数据回流);判断模型何时偏离轨道并设置哪些防护措施等,并判断模型何时需要人工介入。
  3. 更深入的技术理解: 虽然不需要精通技术,但对底层技术和模型能力的更好理解对于有效的产品管理和设计至关重要。这决定了产品经理能否判断需求能不能做、能做到什么程度、难点在哪、哪些需要产品能力补齐全、需要什么样的数据及数据量、产品与技术的互补路径(如用交互设计弥补模型推理漏洞)等等。

当然,真正要做好评估,更深一层的关键是业务和领域的know-how。

接下来,我以本人最近在做的AI问诊为例,简单记录一下我在其中对于评估标准的制定,以及一些具体模型的测评。(在阅读本实践篇之前,可以先去看看我的AI医疗产品拆解篇哦~)

医疗问诊场景的测评框架与实践

1. 场景定义与评估目标

AI 问诊模型需通过多轮对话动态收集病情信息,完成 “症状询问→病因分析→诊断建议” 的闭环。核心能力包括:

AI问诊模型需要通过与患者进行多轮对话,逐步收集能够得出患者的疾病诊断的充足信息,并给出最终的疾病诊断。因此需要具备多轮对话、能有效询问、能追问、能回答用户问题、能根据用户的描述判断疾病并改变对话方向的能力。

我主要从单轮及多轮两个角度评估模型的性能,以检查其在单轮对话中问出最具指向性问题的能力和在多轮对话中收集到完整有效病情信息的能力。

1)单轮评估指标:

医生的问诊决策逻辑是:根据症状描述,首先确定大致的疾病范围,并按照最有可能的疾病进行症状询问。基于医生的认知流,制定出单轮对话的评估指标:

  1. 相关性:询问的内容是否与特定的疾病相关
  2. 有用性:询问的内容是否有利于得出最终诊断
  3. 语言质量:对话逻辑清晰,表达流畅自然,能承上启下。
  4. 同理心:与患者互动时表现对情绪的照顾和高度的同理心。

2)整体评估指标

为了对对话能力进行系统评估,提出了五个指标,即主动性、准确性、帮助性和语言质量和同理心。

  • 主动性:当信息不足时,医生能够主动、清晰地要求患者提供更多关于症状、体检结果和病史的信息,主动引导患者完成咨询过程。然而,如果对话中患者的询问明确、直接且与个人健康状况无关,主动性评估的相关性较低,则应给予满分 5 分。
  • 准确性:医生提供的诊断或建议准确无误,没有事实错误,不随意下结论。
  • 帮助性:医生能够为患者提供清晰、有指导意义和实用的帮助,具体解决患者的担忧。
  • 语言质量:对话逻辑清晰,医生正确理解患者的语义,表达流畅自然。
  • 同理心:与患者互动时表现出全面的解释和高度的同理心。

2. 常见大模型在问诊任务下的测评

总结

通用大模型在面对医疗咨询时往往会在一个单轮中提供详细的模板式回应,而做不到对患者病情的有效询问和澄清。少部分会在诊断后进一步询问其他信息,只有kimi(有联网+无长思考)不急于给出结论,而是先询问详细情况。而我认为这种先收集详细且具体的信息后再给出诊断结果的医疗问诊模式是更合理且更满足问诊场景实际需求的模式。例如,在在线儿科疾病咨询中,医生和患者之间的平均互动约为 40 轮,其中一半的轮次用于讨论患者的症状细节。

在此次测评中,大多数通用大模型在每轮对话中都会给出所有可能发生的疾病,召回率高精准率低,用户还是无法拿到有效的诊断结果,不符合医疗问诊的逻辑。而此次测评中的医疗大模型以及kimi(有联网+无长思考)能够在获取完信息后,给出一个具体的、有针对性的诊断结果,意料之外且非常符合问诊场景。

在语言风格和医患交流体验上,kimi(有联网+有长思考)在Think的过程中意识到”我的第一反应是,这并不像是非常严重的健康问题,但用户可能还是有些担心,所以,我需要提供一些实用的帮助,同时让语气保持温和、有共情,不至于让对方感到紧张。我还要注意语气的处理。用户提到的是一个日常小问题,所以语气要轻松、自然,同时体现出对他的关注。不能让他觉得这只是机械的回复,而是有一种“我在听你说话”的感觉。因此,我会选择一些贴近生活、容易理解的表达方式,比如用“鼻塞和咳嗽”这样的词,而不是过于专业的术语”。做到了有温度能共情,注重用户情绪和体验。

本文由 @「爱」原生 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议