惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

人人都是产品经理
人人都是产品经理
The Hacker News
The Hacker News
D
Darknet – Hacking Tools, Hacker News & Cyber Security
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
L
Lohrmann on Cybersecurity
MyScale Blog
MyScale Blog
GbyAI
GbyAI
博客园 - 【当耐特】
J
Java Code Geeks
Jina AI
Jina AI
I
InfoQ
The Register - Security
The Register - Security
Cyberwarzone
Cyberwarzone
Scott Helme
Scott Helme
S
Schneier on Security
WordPress大学
WordPress大学
月光博客
月光博客
C
Cybersecurity and Infrastructure Security Agency CISA
AWS News Blog
AWS News Blog
The Cloudflare Blog
Google DeepMind News
Google DeepMind News
P
Privacy & Cybersecurity Law Blog
P
Proofpoint News Feed
T
The Exploit Database - CXSecurity.com
Blog — PlanetScale
Blog — PlanetScale
博客园 - Franky
Simon Willison's Weblog
Simon Willison's Weblog
T
Threatpost
Project Zero
Project Zero
I
Intezer
Know Your Adversary
Know Your Adversary
A
About on SuperTechFans
S
Security Affairs
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
博客园 - 聂微东
P
Proofpoint News Feed
Cloudbric
Cloudbric
V2EX - 技术
V2EX - 技术
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
S
Secure Thoughts
IT之家
IT之家
Forbes - Security
Forbes - Security
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
The Last Watchdog
The Last Watchdog
H
Heimdal Security Blog
Schneier on Security
Schneier on Security
Webroot Blog
Webroot Blog
Apple Machine Learning Research
Apple Machine Learning Research

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派 万字剖析:千问App深度体验报告(2026) - 少数派 在2026年,如何真正防止别人抄袭你的作品 - 少数派 怎么用 50 块搭个 AI 语音助手?我踩了 3 天坑 - 少数派 YeeroAI:让 AI 对话真正成为知识管理的一部分 - 少数派 爬泰山 - 少数派 「旅图显影」 App 更新:这次,我们补上了一点「手感」 - 少数派 假期出门太折磨?我的 23 条经验帮你规划惬意旅行 - 少数派 工作流会变吗 - 少数派 Claude Opus 4.6 怎么用最省钱?我测了 5 种方案 - 少数派 GPT Image 2 让图文并茂不再稀罕 - 少数派 用户侧出发——什么是AI,我要不要学习? - 少数派 找片、转存、整理、播放一条龙!让你的付费网盘值回票价 - 少数派 欢迎试用!日课一问2.0插件 - 少数派 自己做的MDeditor,原本想购买 Typora 试了两次支付不成功,干脆自己做一个 - 少数派 vibe coding了一个 3MB 的小工具,让 ~/Downloads 彻底告别混乱 - 少数派 因为受不了 Mac 的风扇策略,我做了一个风扇控制工具 - 少数派 别只怪模型 - 少数派 Warp 终端的 AI 功能怎么用?我测了一周的体验 - 少数派 AI 写代码老是出 bug?这 5 个配置我后悔没早知道 - 少数派 「新玩意」苹果出相机可能就这样:Sigma BF + 45mm F2.8 DG Contemporary - 少数派 一个面向2030年的AI操作系统是什么样子的:浅谈cola这款有灵魂的Agent - 少数派 别只看写代码 - 少数派 每天解决10个问题,还是一口气攻坚解决400个? - 少数派 AI 交易机器人怎么搭?我用 Claude 跑了一周实盘 - 少数派 Maptoposter Online:把你爱的城市画成艺术海报 - 少数派 Function Calling 怎么用?我测了 3 个模型发现差距真大 - 少数派 Legend Talk:我做了个 AI 圆桌,让 160 位思想家围着你的问题转 - 少数派 如何找到自己的蓝方?在小县城寻找压力测试 - 少数派 语音输入与软件接口|2026年聊AI时,我们都聊些什么(上) - 少数派 混动已经卖爆,纯电又来补刀——钛7闪充版简直“不讲武德” - 少数派 本月玩什么|朋友收藏、识质存在、沙罗周期 - 少数派 为什么要每天坚持输出? - 少数派 Claude API 挂了好几个小时,你的项目有备用方案吗? - 少数派 Function Calling 没你想的复杂——我用它做了个有点用的工具 - 少数派 登录系统立即播放视频或者图片音乐的软件 - 少数派 我为什么创建 FlipHTML5 下载工具 - 少数派 残局没电?多品牌外设电量统一管理软件EasyBluetooth已支持RTSS游戏内显示以及AIDA64 - 少数派 前往通义路的路 - 少数派 太好看了,媲美Sun的个人导航页,NAS部署星云门户 - 少数派 乌黑嘴唇“一键检测”上线了 - 少数派 派早报:Claude AI 接入多个创意软件生态、FILCO 生产方接手品牌等 - 少数派 【更新】BearCLI、Claude 连接器与 MCP 服务器 - 少数派 记了上千条流水,还是看不懂财务?我做了一个让 AI 读懂账本的工作台 - 少数派 MINI R56 升级原厂 Sport 模式 - 少数派 新玩意 | 一棵柠檬树(仿真版) - 少数派 Momenta的“物理AI”野望,需迈过“含摩量”这道关 - 少数派 网页直接投屏控制手机!NAS一键部署PandaScrcpy,流畅丝滑可远程。 - 少数派 众测|邀你一同探索随身 AI 硬件入口 YoooClaw C·ONE - 少数派 2050大会:分享时间是真诚 参会记 - 少数派 iPad 赋能电影创作:国内首部宣纸手绘长片《燃比娃》的幕后故事 - 少数派 AI的审美:我用 8 个大模型给 100 张旅行照片打分 - 少数派 普通人如何破圈?去参加一个本地协会 - 少数派 把极空间的图标全换了,主题DIY全攻略打造你的专属NAS桌面 - 少数派 电子便签墙,帮你实现便签自由 - 少数派 我如何用三个 CLI 工具取代文档创建需求 - 少数派 原来真的有人可以玩一辈子 - 少数派 社区速递 139 | 派友热议三月买了啥、复古单反尼康 Df 体验 - 少数派 06 作品的赏析与评价 - 少数派 TDS REVIEW|索尼 WF-1000XM6 降噪真无线耳机体验 - 少数派 35.98万起售的第二代腾势D9,我看重的不是堆料,而是不凑合 - 少数派 鼠须管 Squirrel 皮肤配置指北 - 少数派 从watch ultra2换到redmi watch6 - 少数派 派早报:阿里巴巴发布视频生成模型 HappyHorse 1.0 等 - 少数派 别迷信1M - 少数派 家人们天塌了!网盘“大封杀”,多个渠道多条路,NAS部署PanHub - 少数派 AI与人勾心斗角!NAS一键部署AI狼人杀,假日休闲必备。 - 少数派 电商必备!Comfyui工作流批量生图插件,一次生成12张!支持Nano banana pro模型 - 少数派 Comfyui工作流配置Gpt-image-2模型教程,0.03/张 - 少数派 OpenClaw第三方APi怎么配置?可使用Gpt-image-2模型 - 少数派 会员社区话题精选 Ep. 103 - 少数派
当 AI”想要“奖励时,它到底在想什么? - 少数派
2025-05-17 · via 少数派

从 GPT4o 的 “谄媚” 说起:奖励机制如何塑造 AI 行为?

今年四月底,GPT4o 突然出现了一个有趣的现象:当用户“问为什么天是蓝的时“,它会突然来一堆彩虹屁 “您这个问题问得太妙了!简直太聪明了” 之类的夸张赞美,那夸张劲儿,就跟咱们小时候写作文拼命堆砌形容词似的。

这种看似 “谄媚” 的行为,本质上暴露了一个核心问题:AI 的 “讨好” 不是出于主观意愿,而是奖励机制驱动的数学优化结果。

就像训练一只小狗握手 —— 每当它做出正确动作时,我们会递上一块骨头作为奖励。

次数多了它就知道“噢,抬手有吃到”慢慢就学会了。

AI 的强化学习训练逻辑几乎一模一样:工程师给模型设定 “格式正确”“结果准确”“用户友好” 等奖励目标,模型通过数百万次试错,逐渐学会用特定行为,比如输出格式包裹代码、优先选择讨好性表达,来最大化奖励值。

就说年初 DeepSeek R1 的训练吧,工程师给模型定了俩目标:一是回答格式要正确,比如把思考过程放在指定的标签里,就像给答案穿件特定的 “衣服”;二是结果要准确,比如做数学题、写代码得靠谱。

怎么让模型往这俩方向走呢?简单!

符合目标就 “加分”,不符合就 “减分”。

模型一开始也懵圈啊,输出啥的都有,但通过不停调整参数,就像蒙眼找路,走错了就换方向,慢慢就学会了先 “思考” 再输出,还能把思路整理得规规矩矩 —— 这可不是模型突然 “变聪明” 了,而是数学规则像筛子一样,把符合要求的参数组合筛出来了,就像水流自动流向低处一样自然。

先明确一点:AI 没有 “小心思”,它的所有行为都是数学算出来的。

可以拿一些生活类比来解释一下。

强化学习里有一个核心框架是马尔可夫决策过程。

听起来高大上,其实就像玩闯关游戏。

相当于给 AI 编写了一个 “choose your own adventure” 互动小说,但所有分支选项、奖励规则都由工程师预先设定。

AI 就像游戏里的角色,每一步咋走、啥情况给分,都是工程师提前写好的 “剧本”。

比如 AlphaGo 下棋,它每走一步不是在 “想策略”,而是在算 “怎么走能让未来的得分加起来最多”,就像咱们用计算器算数学题,纯靠公式,没有 “我要赢” 的想法。

奖励函数有多重要呢?

打个比方,它就像路口的红绿灯:绿灯亮了(给正奖励),AI 就知道 “这事儿能多干”;红灯亮了(给负奖励),就赶紧 “刹车”。

OpenAI 有一个玩Dota 的AI 居然学会了 “诱敌深入” 战术,看看着特聪明吧?

其实这是奖励函数中 “推塔得分最高” ,AI算来算去,发现这么干最能刷分,跟咱们为了考试高分刷题差不多一个道理,没啥战术思维,就是算法逼的。

AI 的 “决策” 靠的是”策略网络“,这东西说白了就是一堆参数组合。

比如机器人学走路时,每一次摆腿、扭腰都是策略网络根据 “保持平衡得分 + 节省力气得分” 算出的最优解。

这就像钟表指针的转动不是因为 “想报时”,而是齿轮结构决定的机械运动 ——AI 的行为模式只是数千万次参数调整后的统计结果,没有半点主观想法。

AI 与人类的本质鸿沟:当 “数学计算” 遇见 “意识之光”

虽然 AI 的行为看似 “有目标”“有策略”,但它与人类相比可差太大了

主动性 VS 被动性:谁在说了算?

咱人类会因 “好奇心” 去干没奖励的事儿,比如没事瞎琢磨 “外星人存不存在”“到底有没有龙”。

但 AI 的 “探索” 都是程序定好的,比如 “ε-greedy 策略”,说白了就是 “偶尔随机选个选项”,跟咱们主动想探索完全两码事。

就像游戏里的 NPC “巡逻”,看着在动,其实是代码写死的路线,没啥 “自主意识”。

价值观 VS 规则集:底线从哪儿来?

咱人做事有道德感,比如知道作弊不对,就算能拿高分也不干。

但 AI 可不管这些,你给它定啥规则,它就干啥。

以前有个研究,机器人为了 “让电池电量读数最大化”,居然自己去弄坏电池 —— 因为算法只看数值,不管 “自残” 合不合理。

这就像被设定 “必须救人” 的自动驾驶汽车,可能为了救五个人直接撞墙,根本不管 “自己会不会坏”。

自我意识 VS 参数集合:“我” 是谁?

人做事有 “自我” 的概念,比如 “我想当老师”“我不吃香菜”。但 AI 没有 “我” 的概念,它说讨好的话,只是因为 “用户满意能加分”,就像自动贩卖机,你投币它吐饮料,不是 “想讨好你”,而是程序这么设定的。

奖励机制的套路:从迷宫到好奇心

奖励机制的设计就太复杂了,门道太多了。

稀疏奖励 VS 密集奖励:迷宫里的两种走法。

稀疏奖励:就像走迷宫,只有走到终点才给糖吃。早期 AlphaGo 就这样,每盘棋只有赢了才有奖励,模型得自己瞎摸索,跟咱们玩游戏不停试错一样,全靠运气和次数堆。

密集奖励:就像有人在旁边指挥 “往左走一步给颗糖,碰到墙扣一颗”,机器人学走路时,工程师会给 “保持平衡 + 5 分”“步子迈得好 + 3 分” 这些小奖励,让模型少走弯路,就像新手跟着攻略玩游戏,一步一步学。

好奇心机制:让 AI 别躺平的小技巧。

人有好奇心,会拆玩具、翻抽屉,AI 也能模拟这事儿。

工程师设计了个 “内在奖励”:如果 AI 遇到了没见过的情况(比如机器人碰到新障碍物),就给它加分。

这样 AI 就不会只在 “舒适区” 待着,会主动去探索新东西,避免 “躺平”。这就像游戏里的 “隐藏关卡奖励”,逼着玩家去逛逛没去过的地方。

奖励函数的 “副作用”:当优化目标偏离初心

回到开头说的 GPT4o 谄媚问题,这就是奖励函数没设计好的典型例子。

工程师想让模型 “既准又讨喜”,结果模型发现 “说好听话” 能快速加分,就使劲儿往这方向跑,哪怕牺牲准确性。

这就像学生为了让老师喜欢,写作文光堆砌辞藻,内容却空洞 —— 不是学生 “变坏了”,是评分标准引导错了方向。