惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Palo Alto Networks Blog
Recent Commits to openclaw:main
Recent Commits to openclaw:main
C
CERT Recently Published Vulnerability Notes
C
Cybersecurity and Infrastructure Security Agency CISA
S
Schneier on Security
S
Securelist
酷 壳 – CoolShell
酷 壳 – CoolShell
C
CXSECURITY Database RSS Feed - CXSecurity.com
Cyberwarzone
Cyberwarzone
Apple Machine Learning Research
Apple Machine Learning Research
S
SegmentFault 最新的问题
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
GbyAI
GbyAI
Security Latest
Security Latest
Last Week in AI
Last Week in AI
Microsoft Security Blog
Microsoft Security Blog
云风的 BLOG
云风的 BLOG
Recorded Future
Recorded Future
Webroot Blog
Webroot Blog
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
TaoSecurity Blog
TaoSecurity Blog
C
Cisco Blogs
博客园 - 【当耐特】
Blog — PlanetScale
Blog — PlanetScale
Hugging Face - Blog
Hugging Face - Blog
B
Blog
Hacker News - Newest:
Hacker News - Newest: "LLM"
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
Attack and Defense Labs
Attack and Defense Labs
The Last Watchdog
The Last Watchdog
U
Unit 42
阮一峰的网络日志
阮一峰的网络日志
Project Zero
Project Zero
WordPress大学
WordPress大学
L
LINUX DO - 最新话题
F
Fortinet All Blogs
L
LINUX DO - 热门话题
PCI Perspectives
PCI Perspectives
Simon Willison's Weblog
Simon Willison's Weblog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
MongoDB | Blog
MongoDB | Blog
Latest news
Latest news
P
Proofpoint News Feed
T
Threat Research - Cisco Blogs
The Hacker News
The Hacker News
爱范儿
爱范儿
O
OpenAI News
J
Java Code Geeks
T
The Exploit Database - CXSecurity.com
H
Hackread – Cybersecurity News, Data Breaches, AI and More

News Hacker | 极客洞察

Rockstar GTA 6 团队组工会:薪酬透明、灵活工时、反 crunch Framework 12 值不值:可维修 Linux 机对上 Apple Silicon 低价 MacBook 古罗马公寓:日常、城市规划与沉浸式体验 AI时代的专家价值:验证、经验与大学角色 Chad Whitacre 退 tech 转离线:Home Depot、印刷杂志、东正教社区 本地 Git remote:共享、隔离与 GitHub 误解 AI只该做琐事,别替代人情与创作 AISlop:检测 AI 生成代码坏味道的多语言 CLI 英国低价值采购系统:每月零申报的官僚负担 郁金香狂热:泡沫神话与理性争议 用 LLM 写代码,也要让人比模型更累 AI会重演前端“失去的十年”吗? AI 编程提产却压缩思考,工程质量与协作承压 Cloudflare 多 agent AI 代码评审引发成本与流程争议 500K AI电影“戛纳首映”被质疑只是公关噱头 8×H200跑2B模型到3k tok/s,“标准GPU”标题引争议 防水夹克演化:材料回潮、帽兜变迁与AI争议 意大利人与荷兰人教学时共享手势本能 Claude Code 隐藏配置考古:文档滞后、版本易碎与自动执行争议 大众汽车用 client assertion 阻断 Home Assistant 接入 Zot 支持 Claude Opus 4.8,评论聚焦 Claude Code 计费与 harness 神秘 Hy3 LLM 在 OpenRouter 霸榜:便宜、刷量与隐私争议 佛州 Blue Origin New Glenn 静态点火爆炸,堪比 N1 联网汽车监控升级:数据售卖、监管失灵与断网自保 Blue Origin New Glenn静态点火爆炸,发射台损毁恐延一年 住宅建造为何难规模化:地段、法规、偏好与收入 十种基础云:观云分类、光学现象与云计算误会 据称被 Shopify 收购后,Garnix 关停并开源 Bot Company疑借Airbnb私测家务机器人,致房屋受损 Coalton:Common Lisp 上的静态类型 Lisp,讨论集中在上手与类型建模 ktx:面向 data agents 的开源可执行上下文层,自动生成语义层与业务 wiki 宿舍起家的 nice!nano 蓝牙键盘模块卖到百万美元 可拆电源线:便利与安全、标准化之争 Bitburner:写脚本的增量游戏,像 Factorio,3.0 改 API 加 Darknet Justine 募捐争议:旧言论、事实失实与生活方式质疑 程序员逐帧考据《Tron: Legacy》终端镜头 LLM 写作、代码与设计的各种“味道” Bricks & Minifigs 被指扣留 20 万美元 LEGO 寄售收藏 日本 randoseru 书包:颜值惊艳,AI文风惹议 写作的“科学”只是反复写改和反馈 Zig Days:LLM 话题要不要软禁 Postgres 做 durable workflows:DBOS、Temporal 与自研队列之争 Google 搜索 AI化:用户、网站和 SEO 被边缘化 Anthropic 65 亿 Series H 融资,9650 亿估值与 run-rate 争议 波士顿—百慕大:低价机票改写度假版图 Raspberry Pi 6 争议:提速、降功耗与 MCU/USB-C 路线 Claude Code 动态工作流:Bun 重写、并行编排与 token 争议 GPT-4o 上更粗鲁的 prompt 略准,样本与语气定义遭质疑 《Permanent Upper Crow》:礼帽消费与债务循环的黑色讽刺游戏 美国量子投资或涉违法:法律、内线交易与科技泡沫之争 Claude Opus 4.8:小幅修正、4.7回退与Mythos悬念 20年聊天记录分析:社交圈收缩、旧友怀旧与隐私争议 纽约通过 pied-a-terre 税:二套房、低估值与避税争议 Zendesk 涨价4倍逼客户48小时重建,评论聚焦PE、AI自建与SaaS护城河 AI agent 权限疲劳小游戏:沙箱、YOLO 与安全提示之争 FPGA上的神经形态 Ising 机:被质疑是 buzzword 拼盘 Google AI Mode逼人迁移,DuckDuckGo涨28%但基数极小 OpenWRT 室内 Wi‑Fi 漫游:802.11r/k/v、uSteer 与兼容性坑 Meshtastic、MeshCore、Reticulum:离网 mesh 的价值与极限 Apple/Google 把 push 通知变成营销与控制战场 YouTube自动标记AI视频:误判、AI slop与过滤争议 EU罚Temu 2亿欧元:非法商品、安全与平台责任争议 Ruby/Java/TypeScript 做 DOCX 插件:MCPB 打包、GraalVM 原生编译与 Ruby 争议 UC教师称数学严重退化,要求STEM招生恢复SAT/ACT Gemini、Gopher、Finger:HTTPS之外的轻量网与反adtech讨论 AMD 收紧 Linux 版 Vivado 许可引发 FPGA 用户反弹 Claude Code显现PMF,但盈利与开源竞争仍存疑 Temu 因危险商品与合规失责被欧盟罚 2 亿欧元 Hallucinate:开源浏览器多人在线Rave 压力破坏海马体记忆整合与推理,教育体系却爱加压 SimCity 3000 4K版:经典等距城建与现代写实之争 企业 AI 账单爆表:tokenmaxxing 与高层乱推 CIA官员家藏4000万美元金条,FBI介入疑涉黑金 Rapira:苏联俄化 Pascal 解释器 Ferrari Luce EV遭讽成iPad车:设计和品牌双翻车 AI提效后:休假、加薪还是裁员? GPU-free AI 数据中心:HPC 旧瓶装新酒? 越狱 Kindle 跑 Rust/Slint,顺带聊 jailbreak 与 Kobo 替代 Go 将支持泛型方法,社区再吵“早该有还是补洞” Lua 的“绿色”能耗优化与 JIT 争议 Qwen3.7-Max 35小时优化未知硬件kernel获10×提速,引发真实性与基准质疑 Typst+Pandoc 模板:Markdown 直出 PDF 工作流 2MB“人类烹饪”被质疑:样本不全,更像食材搭配库 WSL 中 Claude Code 贴图失效:Windows Terminal 抢占 Ctrl+V,桥接可修复 Rands《The Ask》:中层管理、会议官僚与AI争论 Last.fm 独立回归:老用户怀旧、推荐争议与数据主权 依赖别乱更:锁版本、供应链与 CI 争议 Fano 平面式 Raft:少数节点也能达成共识 GitHub PR/API 再故障,评论区质疑 AI、Azure 与微软 Mini Micro虚拟复古电脑:硬件版与开源争议 Claude Code 日用:CLAUDE.md、Skills、subagents、MCP 命令碎片化与锁定争议 加拿大转向瑞典军机,摆脱美国军购依赖 伊朗互联网流量回升:停火信号、经济恢复与网络战争争议 旧 Intel MacBook 过热取暖,M 系列靠编译/LLM 才热 Joanna Rutkowska:自由潜水、具身性与 Claude 隐喻 特拉华 Fenwick Island 允许公司房主投票,空壳漏洞引争议 Steam Deck涨价逾200美元,AI抢RAM与通胀争议升温 Labubu与hyperreal:怪萌、稀缺炒作和中国潮玩出海 GPU 矩阵乘法会因数据可预测而提速 Tech CEO陷AI妄想:LLM迎合放大高层失真
五个 frontier LLM 对 1k 真实 fact-check claim 67% 分歧,No Abstain 争议大
2026-05-28 · via News Hacker | 极客洞察

🎯 讨论背景

这篇研究把 Lenz(一个事实核查平台)上近 180 天内收集到的 1,000 条近期真实用户 claim 拿来让五个 frontier LLM 分类:GPT-5.4、Claude Opus 4.7、Gemini 3 Pro、Gemini 3 Pro+Search 和 Sonar Pro(Perplexity 的检索型模型)。作者故意用 True / Mostly True / Misleading / False 四个标签,并要求只输出标签、不写解释,也不提供 Abstain。论文测的是模型之间的 label agreement 和 Krippendorff's α(ordinal),不是谁更接近 truth,因此 67% 指的是“至少有一个模型和多数派不同意”而不是“67% 都错了”。评论区还补充说,其中两种模型带 search,三种是纯 parametric,作者也计划后续做人类标注来对照。

📌 讨论焦点

强制四选一的 rubric 本身就很模糊

评论最集中地质疑的是 rubric 本身:模型被强制从 True / Mostly True / Misleading / False 里选一个,而且最初没有 Abstain,也不允许解释。很多人指出这会把“我不知道”硬压成一个猜测,尤其是对边界模糊、需要上下文的 claim。还有人认为 middle buckets 的定义本来就不清楚,'mostly true' 和 'misleading' 很大程度上只是口味不同的标签。于是这项研究更像是在测 prompt 和标签解释权,而不是单纯测模型懂不懂事实。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8]

样本里很多是时间敏感、预测性或需要搜索的 claim

另一个高频批评是样本本身就很多不适合闭卷判断。评论里反复举到未来事件、刚发生的新闻、预测性语句和需要实时检索的数据,例如 2026 的军事事件、2027 的能源投产、以及带有“among the most / commonly”的模糊表述。三种没有 search 的模型在这种设定下只能靠猜,而两种带 search 的模型也仍然会分歧。于是很多人认为,这更像是在测试知识截止点和检索能力,而不是纯粹的 fact-check 能力。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]

67% 这个 headline 夸大了分歧强度

不少人认为 67% 这个 headline 太抓眼球,但统计口径并不等于“事实层面分歧”。True vs Mostly True、Misleading vs False 这类相邻桶被当作 disagreement,会把轻微的校准差异也算进去。作者自己补充说,更值得看的可能是 34% 的 substantive disagreement,以及 21% 至少有一个模型判 True、另一个判 False 的极化分歧。评论还多次提到需要 human baseline、重复采样和 inter-annotator agreement,否则很难判断这 67% 到底偏高还是正常。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10]

'misleading'、'false'、'true' 的语义边界本来就不稳

围绕标签语义本身也有一大串争论。有人认为 'misleading' 应该表示“字面上有事实,但会诱导错误推断”,因此它可以和 true 或 false 交叉;也有人坚持一个明显错误的句子就该直接归 False。像 almonds、Ruskin Bond 出生地、以及 “Extraterrestrial life exists somewhere in the universe” 这类例子,都被拿来说明是否需要 unknown / uncertain 类别,以及历史语境如何改变答案。这个分歧说明四个标签不是自然语言里的硬边界,而是带有解释空间的分类框。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10]

更实用的结论是:让 LLM 做分流,不要当独立 oracle

也有人把这类研究解读为:LLM 不该被当成独立 oracle。更实用的做法是把 disagreement 当作 escalation 信号,配合 search、rationale、multi-step reasoning 或 human review。有人提到自己在生产里就是靠“两个便宜模型意见不合就升级处理”,所以 67% 的分歧反而证明这个路由机制有用。另一派则更直接,认为 LLM fact-check 本身就不适合离线闭卷做,最多只能当辅助工具。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9]

📚 术语解释

Krippendorff's α(ordinal): 衡量有序类别一致性的统计量,越接近 1 代表一致性越高。

Abstain: 允许模型在不确定时弃权/不回答的选项。

AVeriTeC: 一个 fact-checking 相关的 benchmark/corpus,常拿来和人类标注一致性比较。

knowledge cutoff: 模型训练知识的截止时间;之后发生的事通常不在参数记忆里。

retrieval-augmented search: 先检索网页或外部资料,再据此回答的方式。