惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

有赞技术团队
有赞技术团队
Martin Fowler
Martin Fowler
N
Netflix TechBlog - Medium
WordPress大学
WordPress大学
罗磊的独立博客
H
Help Net Security
MongoDB | Blog
MongoDB | Blog
A
About on SuperTechFans
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
Docker
云风的 BLOG
云风的 BLOG
Microsoft Security Blog
Microsoft Security Blog
Blog — PlanetScale
Blog — PlanetScale
P
Proofpoint News Feed
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
I
InfoQ
J
Java Code Geeks
博客园 - 聂微东
大猫的无限游戏
大猫的无限游戏
Engineering at Meta
Engineering at Meta
美团技术团队
小众软件
小众软件
Stack Overflow Blog
Stack Overflow Blog
C
Check Point Blog

Java for You

语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u 一个浏览器看见飞机船舶与卫星,空间智能的门槛变了 - Java for You - java4u 编码Agent搬出编辑器后,本地优先工作台在解决什么 - Java for You - java4u AI写代码开始像带团队:Qwen Code补上工作流控制台 - Java for You - java4u AI会聊天却不会改3D模型?从Pascal 1.0看懂MCP工具调用 - Java for You - java4u 智能体上线最难的不是提示词:Agents API开始托管运行时 - Java for You - java4u AI任务一多就堵车:问题可能不在模型速度 - Java for You - java4u AI能写无人机控制代码后,安全边界不能只守提示词 - Java for You - java4u AI代码扫描能批量开了,但它还不能替你挡住合并 - Java for You - java4u 机器人动作误差降近九成,真正该先看数据切分 - Java for You - java4u 图片一多首字就慢?用EPD拆开多模态推理三段路 - Java for You - java4u 蛋白预测快2.9倍,科学AI最难的是让整条流水线不空转 - Java for You - java4u NVIDIA把供应链专家经验训练进模型,关键不是换一个更大模型 - Java for You - java4u 人人都能问公司数据之后,数据分析师反而更重要了 - Java for You - java4u 语音AI开始边听边说,改变的不只是响应速度 - Java for You - java4u Agent到底比一次大模型调用多了什么?小白从这张流程图看懂 - Java for You - java4u ChatGPT服务10亿周用户后,最难扩展的可能不是模型 - Java for You - java4u AI编码助手的日志也会泄密:先划清明文边界 - Java for You - java4u
让AI审科学公式,它最适合当比较员而非裁判 - Java for You -...
蜗牛 · 2026-09-14 · via Java for You

极简办公桌

“让大模型解释模型”听起来像用一个黑箱审另一个黑箱。9月10日的一项临床评估却给出更细的答案:大模型在比较多个候选公式时可能有用,但对单个项作生理和数学解释时会说得流畅却不可靠。对科研和医疗团队,正确用法不是把验证外包给AI,而是让它先整理分歧,再由专家签字。

研究到底做了什么

论文原文关注符号回归:系统从数据中寻找显式数学表达式,用身高、体重等变量预测体脂率。显式公式看似比神经网络透明,但“看得见”不等于“解释正确”,复杂项可能违背生理常识。

研究者选取四个符号表达式,让三种大模型分别运行三次,分析可解释性和医学合理性,再由三名临床医生评价输出。论文报告,相较于孤立解释公式中的每个项,模型对多个候选进行比较与排序时获得更积极的临床评价;同时,输出仍包含生理和数学上值得质疑的解释。

样本很小:只有四个表达式、三名临床医生和有限重复。它是一项案例研究,不足以证明大模型普遍具备医学审计能力,更不能推出诊断安全性。

为什么比较比绝对解释更稳

让模型回答“这一项为什么影响体脂”时,它容易为相关性编出因果故事;让它比较A、B两个公式时,任务可以锚定在可见特征:变量是否合理、单位是否一致、复杂度谁更高、极端输入下谁更失真。前者要求生成正确科学机制,后者更像按规则做候选筛查。

mermaid diagram

这个流程把大模型放在“发现问题”而非“宣告正确”的位置。硬规则先检查量纲、定义域、除零和极值;大模型负责把复杂表达式翻成可审查的问题;专家结合领域知识和数据决定是否接受。

一个具体场景

假设两个体脂公式在验证集误差相近。公式A使用少量常见变量,极端身高下输出仍合理;公式B包含高次交互项,平均误差略低,却在老年样本上波动。大模型可以列出比较表,提醒专家检查B的稳定性与生理依据。但它不能仅凭变量名称断言某个交互项“代表代谢机制”,因为训练文本中的常见说法并不是当前数据的因果证据。

对职业分工的影响

这类工具不会让临床专家变得多余,反而提高了审查设计的重要性。专家的工作从逐字写初稿,转向定义检查标准、识别编造机制、决定何时追加实验。数据科学家则要保存提示、模型版本、每次输出和医生意见,避免只留下经过挑选的“最好答案”。

我的判断是,大模型最适合做低成本的第二视角:快速发现公式命名、单位和边界上的疑点,帮助专家把时间集中在争议最大的部分。它不适合充当独立验证者,因为语言合理性与科学有效性是两套标准。

立即可执行的审计方法

  1. 先用确定性程序检查单位、范围、单调性和异常值,再调用大模型。
  2. 一次给出多个候选,要求按固定准则比较,不问开放式“它为何正确”。
  3. 同一任务至少重复三次,把不一致处直接标红给专家。
  4. 要求每条解释对应数据证据或文献;找不到就标记“待验证”。
  5. 最终结论由具名领域专家签署,并保留被否决的模型建议。

该方法适合研究早期的候选筛查、解释初稿与风险清单;不适合临床诊断、治疗建议、监管证明或缺少专家复核的自动决策。论文没有进行真实临床部署,本文也没有复现其模型运行。

证据要按层级保存

一次合格审计不该只保存最后那段顺口的解释。最底层是原始数据、变量定义和公式;第二层是可重复的程序检查;第三层才是模型输出;最上层是专家结论与签名。上层可以引用下层,却不能反过来用“专家觉得模型说得像”替代数据证据。

当三个模型或三次运行意见不一致时,不要多数表决后把分歧删掉。分歧本身就是风险信号:可能是提示含糊、公式接近边界,也可能是模型在补故事。最有价值的输出往往不是“B更好”,而是“B在年龄变量上的解释三次不一致,请检查量纲与样本分布”。

如果结果最终会影响真实患者,还要在部署前增加外部数据验证、亚组分析和漂移监测。语言模型的审计记录只能成为证据链的一段,不能替代这些环节。

在你的专业领域里,你愿意让AI负责筛选候选,还是连最终签字也交给它?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。