





























随着AI技术在医疗领域的应用逐渐深入,AI医疗问诊产品成为行业关注的焦点。本文将深入分析AI医疗问诊产品的核心能力,从评估体系到模型性能,探讨如何通过多轮对话动态收集病情信息并完成诊断闭环。

当然,真正要做好评估,更深一层的关键是业务和领域的know-how。
接下来,我以本人最近在做的AI问诊为例,简单记录一下我在其中对于评估标准的制定,以及一些具体模型的测评。(在阅读本实践篇之前,可以先去看看我的AI医疗产品拆解篇哦~)
AI 问诊模型需通过多轮对话动态收集病情信息,完成 “症状询问→病因分析→诊断建议” 的闭环。核心能力包括:
AI问诊模型需要通过与患者进行多轮对话,逐步收集能够得出患者的疾病诊断的充足信息,并给出最终的疾病诊断。因此需要具备多轮对话、能有效询问、能追问、能回答用户问题、能根据用户的描述判断疾病并改变对话方向的能力。
我主要从单轮及多轮两个角度评估模型的性能,以检查其在单轮对话中问出最具指向性问题的能力和在多轮对话中收集到完整有效病情信息的能力。
1)单轮评估指标:
医生的问诊决策逻辑是:根据症状描述,首先确定大致的疾病范围,并按照最有可能的疾病进行症状询问。基于医生的认知流,制定出单轮对话的评估指标:
2)整体评估指标
为了对对话能力进行系统评估,提出了五个指标,即主动性、准确性、帮助性和语言质量和同理心。












通用大模型在面对医疗咨询时往往会在一个单轮中提供详细的模板式回应,而做不到对患者病情的有效询问和澄清。少部分会在诊断后进一步询问其他信息,只有kimi(有联网+无长思考)不急于给出结论,而是先询问详细情况。而我认为这种先收集详细且具体的信息后再给出诊断结果的医疗问诊模式是更合理且更满足问诊场景实际需求的模式。例如,在在线儿科疾病咨询中,医生和患者之间的平均互动约为 40 轮,其中一半的轮次用于讨论患者的症状细节。
在此次测评中,大多数通用大模型在每轮对话中都会给出所有可能发生的疾病,召回率高精准率低,用户还是无法拿到有效的诊断结果,不符合医疗问诊的逻辑。而此次测评中的医疗大模型以及kimi(有联网+无长思考)能够在获取完信息后,给出一个具体的、有针对性的诊断结果,意料之外且非常符合问诊场景。
在语言风格和医患交流体验上,kimi(有联网+有长思考)在Think的过程中意识到”我的第一反应是,这并不像是非常严重的健康问题,但用户可能还是有些担心,所以,我需要提供一些实用的帮助,同时让语气保持温和、有共情,不至于让对方感到紧张。我还要注意语气的处理。用户提到的是一个日常小问题,所以语气要轻松、自然,同时体现出对他的关注。不能让他觉得这只是机械的回复,而是有一种“我在听你说话”的感觉。因此,我会选择一些贴近生活、容易理解的表达方式,比如用“鼻塞和咳嗽”这样的词,而不是过于专业的术语”。做到了有温度能共情,注重用户情绪和体验。
本文由 @「爱」原生 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。