惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
美团技术团队
Recent Announcements
Recent Announcements
B
Blog
GbyAI
GbyAI
雷峰网
雷峰网
博客园_首页
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
T
Tailwind CSS Blog
M
MIT News - Artificial intelligence
V
V2EX
人人都是产品经理
人人都是产品经理
爱范儿
爱范儿
L
LangChain Blog
Microsoft Security Blog
Microsoft Security Blog
宝玉的分享
宝玉的分享
A
About on SuperTechFans
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
U
Unit 42
Hugging Face - Blog
Hugging Face - Blog
F
Fortinet All Blogs
N
Netflix TechBlog - Medium
Last Week in AI
Last Week in AI
aimingoo的专栏
aimingoo的专栏

News Hacker | 极客洞察

Rockstar GTA 6 团队组工会:薪酬透明、灵活工时、反 crunch Framework 12 值不值:可维修 Linux 机对上 Apple Silicon 低价 MacBook 古罗马公寓:日常、城市规划与沉浸式体验 AI时代的专家价值:验证、经验与大学角色 Chad Whitacre 退 tech 转离线:Home Depot、印刷杂志、东正教社区 本地 Git remote:共享、隔离与 GitHub 误解 AI只该做琐事,别替代人情与创作 AISlop:检测 AI 生成代码坏味道的多语言 CLI 英国低价值采购系统:每月零申报的官僚负担 郁金香狂热:泡沫神话与理性争议 用 LLM 写代码,也要让人比模型更累 AI会重演前端“失去的十年”吗? AI 编程提产却压缩思考,工程质量与协作承压 Cloudflare 多 agent AI 代码评审引发成本与流程争议 500K AI电影“戛纳首映”被质疑只是公关噱头 8×H200跑2B模型到3k tok/s,“标准GPU”标题引争议 防水夹克演化:材料回潮、帽兜变迁与AI争议 意大利人与荷兰人教学时共享手势本能 Claude Code 隐藏配置考古:文档滞后、版本易碎与自动执行争议 大众汽车用 client assertion 阻断 Home Assistant 接入 Zot 支持 Claude Opus 4.8,评论聚焦 Claude Code 计费与 harness 神秘 Hy3 LLM 在 OpenRouter 霸榜:便宜、刷量与隐私争议 佛州 Blue Origin New Glenn 静态点火爆炸,堪比 N1 联网汽车监控升级:数据售卖、监管失灵与断网自保 Blue Origin New Glenn静态点火爆炸,发射台损毁恐延一年 住宅建造为何难规模化:地段、法规、偏好与收入 十种基础云:观云分类、光学现象与云计算误会 据称被 Shopify 收购后,Garnix 关停并开源 Bot Company疑借Airbnb私测家务机器人,致房屋受损 Coalton:Common Lisp 上的静态类型 Lisp,讨论集中在上手与类型建模
五个 frontier LLM 对 1k 真实 fact-check claim 67% 分歧,N...
2026-05-28 · via News Hacker | 极客洞察

🎯 讨论背景

这篇研究把 Lenz(一个事实核查平台)上近 180 天内收集到的 1,000 条近期真实用户 claim 拿来让五个 frontier LLM 分类:GPT-5.4、Claude Opus 4.7、Gemini 3 Pro、Gemini 3 Pro+Search 和 Sonar Pro(Perplexity 的检索型模型)。作者故意用 True / Mostly True / Misleading / False 四个标签,并要求只输出标签、不写解释,也不提供 Abstain。论文测的是模型之间的 label agreement 和 Krippendorff's α(ordinal),不是谁更接近 truth,因此 67% 指的是“至少有一个模型和多数派不同意”而不是“67% 都错了”。评论区还补充说,其中两种模型带 search,三种是纯 parametric,作者也计划后续做人类标注来对照。

📌 讨论焦点

强制四选一的 rubric 本身就很模糊

评论最集中地质疑的是 rubric 本身:模型被强制从 True / Mostly True / Misleading / False 里选一个,而且最初没有 Abstain,也不允许解释。很多人指出这会把“我不知道”硬压成一个猜测,尤其是对边界模糊、需要上下文的 claim。还有人认为 middle buckets 的定义本来就不清楚,'mostly true' 和 'misleading' 很大程度上只是口味不同的标签。于是这项研究更像是在测 prompt 和标签解释权,而不是单纯测模型懂不懂事实。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8]

样本里很多是时间敏感、预测性或需要搜索的 claim

另一个高频批评是样本本身就很多不适合闭卷判断。评论里反复举到未来事件、刚发生的新闻、预测性语句和需要实时检索的数据,例如 2026 的军事事件、2027 的能源投产、以及带有“among the most / commonly”的模糊表述。三种没有 search 的模型在这种设定下只能靠猜,而两种带 search 的模型也仍然会分歧。于是很多人认为,这更像是在测试知识截止点和检索能力,而不是纯粹的 fact-check 能力。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]

67% 这个 headline 夸大了分歧强度

不少人认为 67% 这个 headline 太抓眼球,但统计口径并不等于“事实层面分歧”。True vs Mostly True、Misleading vs False 这类相邻桶被当作 disagreement,会把轻微的校准差异也算进去。作者自己补充说,更值得看的可能是 34% 的 substantive disagreement,以及 21% 至少有一个模型判 True、另一个判 False 的极化分歧。评论还多次提到需要 human baseline、重复采样和 inter-annotator agreement,否则很难判断这 67% 到底偏高还是正常。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10]

'misleading'、'false'、'true' 的语义边界本来就不稳

围绕标签语义本身也有一大串争论。有人认为 'misleading' 应该表示“字面上有事实,但会诱导错误推断”,因此它可以和 true 或 false 交叉;也有人坚持一个明显错误的句子就该直接归 False。像 almonds、Ruskin Bond 出生地、以及 “Extraterrestrial life exists somewhere in the universe” 这类例子,都被拿来说明是否需要 unknown / uncertain 类别,以及历史语境如何改变答案。这个分歧说明四个标签不是自然语言里的硬边界,而是带有解释空间的分类框。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10]

更实用的结论是:让 LLM 做分流,不要当独立 oracle

也有人把这类研究解读为:LLM 不该被当成独立 oracle。更实用的做法是把 disagreement 当作 escalation 信号,配合 search、rationale、multi-step reasoning 或 human review。有人提到自己在生产里就是靠“两个便宜模型意见不合就升级处理”,所以 67% 的分歧反而证明这个路由机制有用。另一派则更直接,认为 LLM fact-check 本身就不适合离线闭卷做,最多只能当辅助工具。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]

📚 术语解释

Krippendorff's α(ordinal): 衡量有序类别一致性的统计量,越接近 1 代表一致性越高。

Abstain: 允许模型在不确定时弃权/不回答的选项。

AVeriTeC: 一个 fact-checking 相关的 benchmark/corpus,常拿来和人类标注一致性比较。

knowledge cutoff: 模型训练知识的截止时间;之后发生的事通常不在参数记忆里。

retrieval-augmented search: 先检索网页或外部资料,再据此回答的方式。