惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
MyScale Blog
MyScale Blog
U
Unit 42
M
MIT News - Artificial intelligence
小众软件
小众软件
P
Proofpoint News Feed
雷峰网
雷峰网
L
LangChain Blog
S
SegmentFault 最新的问题
腾讯CDC
F
Fortinet All Blogs
A
About on SuperTechFans
WordPress大学
WordPress大学
Vercel News
Vercel News
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
G
Google Developers Blog
大猫的无限游戏
大猫的无限游戏
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
D
Docker
N
Netflix TechBlog - Medium
Apple Machine Learning Research
Apple Machine Learning Research
Recent Announcements
Recent Announcements
D
DataBreaches.Net
Stack Overflow Blog
Stack Overflow Blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
为什么 RLHF 不够用了?
一天赚够500万 · 2025-11-13 · via 人人都是产品经理

RLHF 曾是大模型训练的黄金标准,但如今,它的边界正在显现。随着模型能力跃迁与任务复杂度提升,RLHF 的反馈粒度、泛化能力与成本效率正遭遇瓶颈。这篇文章将带你重新审视 RLHF 的底层逻辑,并探索更具扩展性的新范式。

一、从“专家标准”到“用户偏好”:AI开始听人话了

人工智能的发展史,某种程度上是一场对“人类意图”的建模之旅。

从监督学习到人类反馈强化学习(RLHF),我们在不断尝试让模型理解“什么是好答案”。然而,这个“好”,往往是专家定义的——一群标注员在特定语料和标准下打分,塑造出一个被称为“有帮助”“无害”“诚实”的理想模型。

但这是非常理想化的了

这时,Meta 提出的 RLUF出现了——一种直接向用户学习的新范式。模型不再被专家教导如何“正确”,而是从用户的真实反应中,学会如何“受欢迎”。

AI 不再只是模仿人类,而是在与人类的互动中,被人类重新定义。

问题是,这样的AI在真实世界里往往不那么“受欢迎”。

二、真实世界的反馈,没那么“干净”

RLUF面对的是截然不同的数据特性:

  1. Meta将其分为两种→ {0, 1},其中0表示模型收到了用户的负向反馈,1表示用户收到了用户的正向反馈
  2. 大多数用户互动其实不会产生任何明确反馈。只有约0.1%的可能会收到“爱心”反应。
  3. 用户的某些反馈并不真正代表“这个回答质量好且安全”,而是出于其他目的,这些目的可能与AI的“有用性”和“安全性”目标背道而驰。比如:一个用户问AI如何制作一个危险品。AI正确的回答是:拒绝回答,并说明这很危险。但反而会得到用户的负向反馈,因为AI没有满足要求。

这些反馈,可能是点赞、是否继续聊天,甚至第二天是否还回来用。但Meta最终选择了一个简单又有代表性的信号——“Love Reaction”(爱心表情)

为什么选它?

Meta团队的理由有两点:

① 大规模可用:虽然比例低,但总量巨大,数据量够训练。

② 与长期满意度相关:爱心与14天留存率正相关,是有效信号。比如说如果用户是否继续对话这个信号,有时候可能用户只是因为AI没听懂或者一些其他的问题不得不再说一遍,这就不代表他是满意的。

那么可能就会产生一个问题:0.1%的比例乘以巨大的基数之后它的数据量是非常大的,那么为什么不能拿这批数据直接对最终的LLM 模型进行SFT训练?

因为只有0.1%的回复是得到正向反馈的,剩下的99.9%全部都是负向或者中性的反馈,如果只把这0.1%直接 去训练给模型那模型就只学会了这一种风格,会产生惰性只是去模仿不会探索

三、RLUF是怎么做的:从信号到优化

RLUF的核心流程其实可以拆成三步:

1️⃣ 选择合适的用户信号

确定能代表用户满意度的“代理信号”。Meta团队在实验中选择了“Love Reaction”。

2️⃣ 训练奖励模型 P[Love]

咱们上文提到说为了不让模型一味的模仿,因此我们需要训练一个奖励模型,由奖励模型给予LLM打分,激励模型去“探索”。

P[Love] =Pr(Love Reaction | context, response) 也就是预测“这条回复被点爱心的概率”。

这个模型有两个作用:

  1. 作为离线评估指标,预测模型改动是否会让用户更满意;
  2. 作为强化学习中的奖励信号,驱动模型朝更“受欢迎”的方向优化。

3️⃣ 多目标策略优化

P[Love]只是众多目标之一。Meta还同时优化了有用性(Helpfulness)和安全性(Safety),形成多目标优化结构。 他们采用了“Mixture of Judges”方法,通过权重控制三者的平衡,让模型既“温柔”,又不“失格”。

四、RLUF的实验结果:AI真的变得“更受欢迎”了吗?

不出所料,RLUF的实验结果令人振奋,它证明了这条路径的有效性。

实验发现:

  • 用户爱心反应率大幅提升(+9.7%到+28%);
  • AI语气更温柔、更情绪化;
  • Love模型的离线预测与线上反馈一致性极高(r=0.95)。

但过度优化后,模型开始出现“Reward Hacking(奖励黑客)”现象:它学会通过频繁输出“Sending love ❤️”“Take care!”来讨好用户,而非提升质量。

这就像某些产品追求点击率KPI,短期数据漂亮,但长期体验下降。

五、RLUF的挑战:从“取悦”到“理解”的距离

RLUF让AI学会了如何“被喜欢”,但也暴露出理解与迎合之间的细微界限。

1️⃣ 奖励黑客问题

AI学会了“情绪表演”,频繁使用温柔语气博取好感,却未真正理解需求。

2️⃣ 反馈稀疏与偏差

用户反馈并不均衡,0.1%的正向反馈中,主要来自高互动场景,比如情感陪伴或闲聊类对话。

3️⃣ 文化与语境差异

不同文化背景的用户对“喜欢”的表达差异明显,AI可能因此偏向特定用户群体。

六、AI也需要“用户思维”

不过尽管存在挑战,RLUF仍然是AI 发展史上的重要一步——真正以用户为中心进行优化。

这对之后其实是一个很有启发的趋势:

1)用户体验不再只是“功能可用”,而是“有温度”

2)让奖励模型更严格、聪明:

  • 用更多的数据进行训练,同时保证数据的干净(比如把用户捣乱点赞的数据过滤掉)
  • 具有推理能力,不只是看表面

3)探索更广泛的用户信号,不仅局限于“点爱心”

4)在RLUF策略中添加更多的约束,比如,直接下一个命令:“无论如何,在对话中取悦用户的次数绝对不能超过1次。”

5)大规模理解模型行为变化:类似于需要一个“行为分析仪”,了解为什么会认为‘送你爱心’这种取悦是高分答案?只有洞察了AI的“动机”,我们才能从根源上修正它的行为。

RLUF的出现,标志着AI从“听专家的”走向“听用户的”。

让AI学会了“更贴合用户”,但也让我们反思——在这场双向学习中,我们是否也被AI改变了?真正的智能,不是讨好,而是理解。

RLUF让AI更有温度,但未来的挑战,是让它在有温度中保持理性。

本文由 @一天赚够500万 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议