





























这篇研究把 Lenz(一个事实核查平台)上近 180 天内收集到的 1,000 条近期真实用户 claim 拿来让五个 frontier LLM 分类:GPT-5.4、Claude Opus 4.7、Gemini 3 Pro、Gemini 3 Pro+Search 和 Sonar Pro(Perplexity 的检索型模型)。作者故意用 True / Mostly True / Misleading / False 四个标签,并要求只输出标签、不写解释,也不提供 Abstain。论文测的是模型之间的 label agreement 和 Krippendorff's α(ordinal),不是谁更接近 truth,因此 67% 指的是“至少有一个模型和多数派不同意”而不是“67% 都错了”。评论区还补充说,其中两种模型带 search,三种是纯 parametric,作者也计划后续做人类标注来对照。
评论最集中地质疑的是 rubric 本身:模型被强制从 True / Mostly True / Misleading / False 里选一个,而且最初没有 Abstain,也不允许解释。很多人指出这会把“我不知道”硬压成一个猜测,尤其是对边界模糊、需要上下文的 claim。还有人认为 middle buckets 的定义本来就不清楚,'mostly true' 和 'misleading' 很大程度上只是口味不同的标签。于是这项研究更像是在测 prompt 和标签解释权,而不是单纯测模型懂不懂事实。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8]
另一个高频批评是样本本身就很多不适合闭卷判断。评论里反复举到未来事件、刚发生的新闻、预测性语句和需要实时检索的数据,例如 2026 的军事事件、2027 的能源投产、以及带有“among the most / commonly”的模糊表述。三种没有 search 的模型在这种设定下只能靠猜,而两种带 search 的模型也仍然会分歧。于是很多人认为,这更像是在测试知识截止点和检索能力,而不是纯粹的 fact-check 能力。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]
不少人认为 67% 这个 headline 太抓眼球,但统计口径并不等于“事实层面分歧”。True vs Mostly True、Misleading vs False 这类相邻桶被当作 disagreement,会把轻微的校准差异也算进去。作者自己补充说,更值得看的可能是 34% 的 substantive disagreement,以及 21% 至少有一个模型判 True、另一个判 False 的极化分歧。评论还多次提到需要 human baseline、重复采样和 inter-annotator agreement,否则很难判断这 67% 到底偏高还是正常。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10]
围绕标签语义本身也有一大串争论。有人认为 'misleading' 应该表示“字面上有事实,但会诱导错误推断”,因此它可以和 true 或 false 交叉;也有人坚持一个明显错误的句子就该直接归 False。像 almonds、Ruskin Bond 出生地、以及 “Extraterrestrial life exists somewhere in the universe” 这类例子,都被拿来说明是否需要 unknown / uncertain 类别,以及历史语境如何改变答案。这个分歧说明四个标签不是自然语言里的硬边界,而是带有解释空间的分类框。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10]
也有人把这类研究解读为:LLM 不该被当成独立 oracle。更实用的做法是把 disagreement 当作 escalation 信号,配合 search、rationale、multi-step reasoning 或 human review。有人提到自己在生产里就是靠“两个便宜模型意见不合就升级处理”,所以 67% 的分歧反而证明这个路由机制有用。另一派则更直接,认为 LLM fact-check 本身就不适合离线闭卷做,最多只能当辅助工具。
[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]
Krippendorff's α(ordinal): 衡量有序类别一致性的统计量,越接近 1 代表一致性越高。
Abstain: 允许模型在不确定时弃权/不回答的选项。
AVeriTeC: 一个 fact-checking 相关的 benchmark/corpus,常拿来和人类标注一致性比较。
knowledge cutoff: 模型训练知识的截止时间;之后发生的事通常不在参数记忆里。
retrieval-augmented search: 先检索网页或外部资料,再据此回答的方式。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。