惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
V2EX
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
人人都是产品经理
人人都是产品经理
博客园 - 三生石上(FineUI控件)
aimingoo的专栏
aimingoo的专栏
U
Unit 42
GbyAI
GbyAI
H
Help Net Security
A
Arctic Wolf
SecWiki News
SecWiki News
K
Kaspersky official blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
Blog — PlanetScale
Blog — PlanetScale
B
Blog
Spread Privacy
Spread Privacy
L
Lohrmann on Cybersecurity
C
Check Point Blog
O
OpenAI News
Microsoft Security Blog
Microsoft Security Blog
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
大猫的无限游戏
大猫的无限游戏
Google DeepMind News
Google DeepMind News
Webroot Blog
Webroot Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
P
Palo Alto Networks Blog
A
About on SuperTechFans
S
SegmentFault 最新的问题
Recent Announcements
Recent Announcements
S
Schneier on Security
Martin Fowler
Martin Fowler
WordPress大学
WordPress大学
Jina AI
Jina AI
The Hacker News
The Hacker News
V2EX - 技术
V2EX - 技术
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
腾讯CDC
罗磊的独立博客
G
GRAHAM CLULEY
L
LINUX DO - 热门话题
雷峰网
雷峰网
博客园 - 【当耐特】
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Google Online Security Blog
Google Online Security Blog
美团技术团队
M
MIT News - Artificial intelligence
Engineering at Meta
Engineering at Meta
Hacker News: Ask HN
Hacker News: Ask HN
S
Security Affairs
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
月光博客
月光博客

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
OpenAI的新论文,为什么被业内嘲讽是营销?
知危 · 2025-09-13 · via 人人都是产品经理

OpenAI 新论文把“幻觉”甩锅给评测机制:考卷只认“猜对”,不认“不敢说”,逼得模型瞎蒙。业内却集体翻白眼——观点不新鲜、实验太初级,被批像给 GPT-5 低幻觉性能打软广。当学术变成营销话术,真正该回答的问题是:我们到底想要一个“不确定就闭嘴”的保守答案机,还是敢想敢错的智能体?

近期,OpenAI 发布了一篇新论文《 Why Language Models Hallucinate 》,指出当前大模型幻觉的主要来源,引发了广泛关注。

他们给出了一个简洁却颠覆性的解释:大模型之所以出现幻觉,并非由于模型架构的失灵,而是当前技术社区的训练与评测机制倾向于奖励猜测,并且惩罚承认不确定的行为,迫使模型在高度不确定时,也倾向猜测性作答以博取准确率分数。

换句话说,大多数评估基准采用一种 “ 应试考试 ” 的方式,迫使大语言模型成为 “ 应试者 ”,不管是选择题、填空题还是解答题,如果不知道正确答案,那就猜一个甚至蒙一个,这样在概率上也比不答分数高。

预训练层面上,大模型通常只接触正面示例,也就是给定提示词,然后接着输出完整的回答,没有在这个过程中接触任何拒绝回答的示例,所以自然学不会这种拒绝回答的行为。

OpenAI 拿自家模型举了一个例子,在 SimpleQA 基准中,旧模型 o4-mini 相比新模型 GPT-5-thinking-mini 准确率略高( 22% vs. 24% ),但也有高得多的错误率( 75% vs. 26% ),因为它更少 “ 弃答 ”。

OpenAI据此主张:在往后的评估基准中,应对高自信的错误施以惩罚,并为恰当的不确定表达给出适当分数,使激励从 “ 大胆猜 ” 转向 “ 知之为知之 ”,改变主流排行榜长期以 “ 准确率 ” 一项称王的局面。

可以说,这篇研究是在把 “ 幻觉 ” 从工程缺陷转化为技术社区的 “ 激励设计 ” 问题。

如果真的往这个方向发展,以后真正值得关注的,将不再是谁的准确率小幅上涨,而是谁愿意重写评测与产品规则,让模型在不确定时自然地说:“ 我不知道 ”。

技术社区对该话题讨论热烈,其中对论文的诟病也不少。

有人认为这篇论文既不新颖,水平也不高,即相关研究早已经出现,并且这篇论文的技术水平更像是初级研究人员写出来的。

纽约大学数据中心助理教授 Ravid Shwartz Ziv 直言这篇论文更像是一场营销,而不是研究。

有人指出,问题的核心其实在于,幻觉的概念实际上到现在为止都还没有被严格地定义。

虽然已有不少研究指出了幻觉的可能原因,例如模型过度自信、解码随机性、滚雪球效应、长尾训练样本、误导性对齐训练、虚假相关性、曝光偏差、逆转诅咒以及上下文劫持等,但这些方法毋宁说是一种幻觉的分类。

幻觉的本质,或许可以用一个很简单的例子来说明。

以机器学习中的曲线拟合为例,假设下图的数据点是被用于训练的事实,我们需要拟合一条曲线来对数据进行回归,使其能够准确地预测新数据。这条曲线,代表的就是模型。

图源:网络

严格意义上来讲,不存在唯一正确的模型。因为每一种模型都具备不同的拟合度和泛化性,也都有各自的适用场景。

比如上图中最右边的复杂曲线拟合度更强甚至过拟合( 训练数据准确率高 ),但泛化性弱( 测试数据准确率低 );最左边的简单曲线拟合度更弱甚至欠拟合( 训练数据准确率低 ),但泛化性强( 测试数据准确率高 )。

不同曲线,可以生成不同的新数据。而任何曲线,生成的不同于训练数据的新数据,都有可能是错的,也就是都有可能是幻觉。至于幻觉的确认,原则是只能与现实进行直接对比校验,其它方式都是间接性的。

而且,机器学习或大语言模型其实都不擅长分布外泛化,也就是其泛化能力更多是在已有观测点的范围内估计未知值。

近期的理论研究比如 2024 年发表的论文《On the Limits of Language Generation: Trade-Offs Between Hallucination and Mode Collapse 》形式化地阐述了一致性( 避免无效输出 )和广度( 生成多样化、语言丰富的内容 )之间的内在权衡。这些研究表明,对于广泛的语言类别,任何在其训练数据之外进行泛化的模型,要么会产生幻觉,要么会遭遇模式崩溃,无法生成所有有效的响应。

所以,如果保证训练数据和测试数据( 或实际应用数据 )在大致相同的数据分布范围内,并且模型是过拟合的,基本能保证很低的错误率或幻觉率。

假设 “ 低幻觉 ” 大模型发展成了这个样子,那其实它基本上就是更高效地串联已知事实点、知识点的自然语言搜索引擎而已。

这会是OpenAI希望的结果吗?我们假设是,然后继续推测一下。

回过头看《 Why Language Models Hallucinate 》这篇论文,幻觉表现方面,OpenAI 指出,大模型在拼写和括号等细节基本不会出错,但在低频任意事实上很容易出错。

他们引用了一个有趣的研究成果,论文 《 Calibrated Language Models Must Hallucinate 》表明即使训练数据没有错误,产生幻觉的概率也接近于训练数据中恰好出现一次的事实的比例( “ Good-Turing ” 估计 )。相比之下,大型语言模型很少会在经常引用的事实上出错,例如爱因斯坦的生日或论文标题。

并且,该论文还指出,没有统计学理由表明预训练会导致对训练数据中可能出现多次的事实( 例如对文章、书籍的引用 )或系统性事实( 例如算术计算 )产生幻觉。

所以,尽管这个自然语言搜索引擎很死板,但在使用时,对于查询提示词的拼写、标点符号、语言表达习惯等还是能做出灵活的响应,并且对于人类多次引用或应用的知识、事实,基本能保证准确。如果是涉及单次出现的事实,则很可能出错,这时候大模型会选择拒绝回答。

这样的大模型自然会变得很安全、可靠。对于 AI Agent 产品的构建或企业 AI( 企业 AI 将主要以 Agent 的形式交付 )的落地,都是非常好的底座。因为要发挥AI Agent 的最大限度的能力,首先要保证低幻觉,避免错误累积的乘积效应。

而且,企业数据通常领域独立、长尾、稀疏,训练出来的大模型潜在的幻觉点会很多,增加拒答率,其实类似于在代码里增加了 Bug 日志,可以帮助企业更好地优化模型。

但另一方面,我们能信任这个死板的自然语言搜索引擎的泛化能力吗?也就是应对实际新问题的能力?

当然,这只是一种对 OpenAI 描绘的设想在经典概念上的理解。对于泛化能力这一部分,其实目前没有很好的量化方法。

这个 “ 低幻觉 ” 大模型将不会只能解决已知场景下的问题。至于在解决一个具体问题时,是否保证准确,还是需要一些间接指标来判断。

当前并没有很好地自动化检测幻觉的方法,很多复杂的检测方法,甚至只和分析响应长度方法效果相当。

最简单粗暴的方法,就是让 LLM 生成多个独立答案,然后比较这些答案的一致性,但计算成本高昂,因为每个查询都需要生成多个答案。

后续研究则在这个基础上,利用多个答案之间的重复部分的缓存来节省计算成本。另一些方法则是比较不同模型对同一个查询的输出差异来分析幻觉。

目前可能最高效的方法,是在推理过程中,一边推理,一边计算模型内部的置信度信号,在推理过程中或推理结束后动态过滤掉低质量的推理路径。该方法无需额外的模型训练或超参数调整。比如论文《 DEEP THINK WITH CONFIDENCE 》依靠这种方法,基于开源模型在 AIME 2025 达到了 99.9% 的 “ @512 准确率 ”( Best-of-512 sampling ),生成的文本长度也比全并行推理方法减少了 84.7% 。

图源:DEEP THINK WITH CONFIDENCE

置信度是非常典型的度量大模型自信程度的信号,这也是 OpenAI 指出的大模型拒绝回答时的依据。

如何理解置信度呢?简单来说,有一种简单的定义是,大模型推理生成下一个 token 时,下一个 token 的所有候选词的概率分布越不均匀,越集中在少量词,置信度越大。比如下图中的下一个 token 的概率分布就比较符合高置信度的特点。

图源:网络

客观来讲,关于置信度的相关研究确实已经出现,而且还不少,概念定义和方法也非常多样。上述提到的让 LLM 生成多个独立答案再分析一致性的方式,也是一种度量置信度的方法。

甚至,你可以直接让大模型在输出时,附加一句 “ 我有约80%的把握 ” 之类的话,或使用词语如 “ 可能 ”、“ 不确定 ”来表达置信度。这就有点 “ 玄学 ” 的味道了,但确实实验统计上有效。论文《 Just Ask for Calibration 》通过实验发现,在提示词中加入不确定性表达,可以显著提高 GPT-3 答案的准确性和模型校准度。

OpenAI 这篇论文的创新之处不在于提出的方法,更像是一种面向大模型技术社区的倡议,如果社区集体能够认同其观点,后续大模型将会朝着不鼓励猜测答案的方向发展。

在论文中,OpenAI 也确实指出,“ 这种惩罚不确定答案的 ‘ 流行病 ’ 只能通过社会技术缓解措施来解决 ”。

而作为大模型时代的奠基者,OpenAI 确实具备这样的号召力。

那么,OpenAI 如此倡导,背后有没有更深层次的理由?

结合 GPT-5 的低幻觉招牌,低幻觉率对 AI Agent、企业AI的重要性,企业数据的稀疏性,以及 OpenAI 近期的关键举措,包括收购并合并 io Products 推进硬件布局、成立 “ 应用 ” 板块并任命 Fidji Simo 为 Applications CEO 等。

只能猜测,OpenAI 希望社区认可 GPT-5的 成就,强调 GPT-5 或后续模型( 如果有的话 )对AI Agent、企业应用的优势所在。

以及,他们自己也要认真做应用了。

撰文:流大古 编辑:大饼

本文由人人都是产品经理作者【知危】,微信公众号:【知危】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。