惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Recent Announcements
Recent Announcements
人人都是产品经理
人人都是产品经理
月光博客
月光博客
博客园 - 三生石上(FineUI控件)
GbyAI
GbyAI
博客园 - 司徒正美
美团技术团队
Vercel News
Vercel News
IT之家
IT之家
U
Unit 42
Y
Y Combinator Blog
罗磊的独立博客
Microsoft Security Blog
Microsoft Security Blog
MongoDB | Blog
MongoDB | Blog
Jina AI
Jina AI
V
Visual Studio Blog
B
Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
MyScale Blog
MyScale Blog
博客园 - 叶小钗
A
About on SuperTechFans
WordPress大学
WordPress大学
Hugging Face - Blog
Hugging Face - Blog
B
Blog RSS Feed

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
DeepSeek R1 等推理模型「思考」的本质是什么? - 少数派
2025-06-11 · via 少数派

最近,苹果 AI 团队的研究人员发布的一篇论文直接干爆了 AI 圈,国外关于 LLM 与 LRM(带推理能力的大模型)在低中高三个难度下的能力表现展开了盛大的讨论。

当然,其中不乏嘲讽苹果这么久还没有推出能用的 AI 产品的声音,但这不重要。

这个消息主要是让我想起来,之前在小红书上发布的文章,还没有在少数派上发布,这篇文章的整体反馈良好,值得一读。

下方原文在 2 月 19 日,发布于玉玺xi(小红书)。


推理模型的训练集相比传统模型(指不具备推理能力的文本模型),最大的区别就是在「问题-答案」之间增加了一个「推理」的部分,实质上推理模型是不会和人类一样进行思考的,而是在模仿推理的过程。

从两者的训练集中,能够看到传统模型少学了「推理过程」这个部分,因此在解决深入问题的时候,缺少能够深度匹配目标问题解决方案的能力。

【提炼】推理模型并不真的会和人类一样进行创造性思考,而是在模仿人类的思考步骤,并不具备自主意识。

人类说的话为什么容易被其他人类接受、认为是正确的?
原因在于人类在交流的时候,会说出自己的推理过程,这其实相当于一种公式化交流,因为推理过程具备基础的因果、可推导的逻辑,其他人是可以通过类似的推导过程得出相同的结论。

【提炼】人类倾向于相信自己能够通过因果关系推导出的结论。

而推理模型模仿了人类的推导逻辑和过程,并将其输出,在习惯了相信具备推理过程所得出结论的人类看来,这就是 AI 输出的结论首次能够被信任的表现。

然而需要警惕的是,如同人在推导、推理的时候,会出现逻辑滑坡等常见的推理逻辑错误的问题,AI 同样会出现推理错误,进而得出的结论是错误的情况。

而且越是完全由强化学习,而不经过监督学习的推理模型,越是容易出现这个问题,如 DeepSeek。
反而采用监督学习为主的推理模型,如 o1,在极端复杂的情况下,推理效果更可靠。

【提炼】即便 DeepSeek 大幅缩减了推理模型的训练成本,但是成本越高、模型越强的定律依然是生效的。

如果 DeepSeek R1 是完全由强化学习推动,而一点都没有经过监督学习,那么 DeepSeek R1 输出的内容也是需要警惕使用,而不是全盘接受、视为正确的。

DeepSeek R1 胡言乱语的实例⬆️

【提炼】对拥有了模仿人类思考的能力的 AI,仍然要保留一份警惕,全盘接受 AI 输出的内容是不可取的。