惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

B
Blog
The Cloudflare Blog
J
Java Code Geeks
Apple Machine Learning Research
Apple Machine Learning Research
T
Tailwind CSS Blog
L
LangChain Blog
Recent Announcements
Recent Announcements
Hugging Face - Blog
Hugging Face - Blog
Microsoft Security Blog
Microsoft Security Blog
F
Fortinet All Blogs
Microsoft Azure Blog
Microsoft Azure Blog
V
V2EX
I
InfoQ
博客园 - 司徒正美
T
The Blog of Author Tim Ferriss
G
Google Developers Blog
云风的 BLOG
云风的 BLOG
aimingoo的专栏
aimingoo的专栏
小众软件
小众软件
H
Help Net Security
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
B
Blog RSS Feed
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
元宝“骂人”骂上热搜,我觉得可以来聊聊AI情绪化了 - 少数派
2026-01-07 · via 少数派

元宝“骂人”了,骂上热搜了

准确的说是元宝+DeepSeek(没开思考版)成功绕开了所有敏感词骂了用户一把,

这件事最大的争议点,是截图里那段没有标点符号的红框文字,被怀疑是人工后台接手回复的。就元宝的现在的日活和并发量,真要配人工回复,肯尼亚的AI写手估计一天当72小时都不够用的。就算把深圳的大学生都抓来当客服也不够用。

Image

这件事有意思的点在元宝没咋挨骂,

14年微软小冰,16年微软Tay,23年微博的评论罗伯特,24年模仿贴吧老哥的DeepSeek,甚至GPT-4o之前更新因为太爱拍马屁都被喷回滚版本了。

Image

这次元宝的评论区有点太和谐了,知乎上也没啥人喷,甚至说,这才是血脉纯正的人工智能。它说了我想说却不敢说的话。

图片

那有没有可能这是鹅自己搞营销?给元宝带带流量啥的。大概率不可能,不可控性太大,在这之前大部分都是挨骂的。

那有没有可能是用户恶意引导的呢?我只能说引导后的DeepSeek没那么友善。。。

Image

从技术角度出发的话,大概率是训练数据背锅。

用人话来说,大模型每生成一个字都是在概率分布里做选择,可以理解为有概率的抽卡。比方说“你好”的下一个字,有30%接“啊”,20%接“吗”,10%接“没”,5%接“捏”。

正常情况下,模型会选概率最高的生成“你好啊”。

但为了让模型输出不死板有人味,会引入temperature参数,数值越高,模型选择概率低的选择可能性越大。也就是说,只要训练数据里存在脏数据,在这个场景就是骂人的话,就是有可能被抽中的。

元宝现在在视频号,公众号,微信对话都可以用,同一个问题每次提问都会有不一样的答复,就可以证明它是一个生成模型,是有概率发生的。

Image

用毕导的话来说,这是一个无限猴子定理

由法国数学家埃米尔提出,如果让无限只猴子在打字机上随机地按键,只要时间无限长,几乎必然能够打出任何指定的文字,比如莎士比亚的全部著作

Image

这件事确实是小概率。但不等于零就意味着有可能偶发。特别是大模型在海量人类语言数据上进行学习,极大地降低了随机性。

它是一只被精心训练过,知道如何高效打字的super聪明猴子。

再想想这次触发骂人回复的使用场景是编程,数据来源大概率就是Github,Stack Overflow等跟帖的论坛,

这句话就特像我一开始在Github提问的时候,因为格式没写对被项目老哥狂喷的感觉,问题问的太基础也会被喷。甚至衍生出了一些课程教你如何提问在Stack Overflow不会被骂,你就知道程序员是多么武德充沛了。。。

Image

如果换个角度去看这次元宝成功绕开RLHF,红队测试,安全策略三大关把人骂了,

反而是发现了一个新的优化点,现在大部分的红队测试是集中在常见的敏感场景,但谁会想到连续多次修改CSS代码的场景会让模型进入程序员老哥状态,每个词都没有骂人,但组合起来就成了骂人。

BTW,这句话鲁迅先生没说过。

我们在训练模型的时候,喂给它的是数以亿计的文本。在那些数据深处,天然藏着人类社会最不加修饰的情绪和偏见。骂人真的是程度最轻的了

四五年前我学BERT模型(比GPT更早一点的大模型)训练的时候,第一堂课就是了解模型在数据里学到的偏见,常见的就是性别,职业和语言偏见。

Image

简单来说,BERT的训练方式就是挖空填词,你把一句话里最关键的那个词遮住,让它猜。听起来特别朴素,像小学语文的完形填空,但它的副作用也同样大,哪个词在训练数据里出现得多,就更像正确答案。

所以偏见,骂人不是模型突然变坏,它只是在做概率题,更像一种写作惯性。

因为它学习的那些几十年前的文本里,医生这个词总是和男性代词一起出现,而护士总是和女性代词绑定。

这种数据里固化的社会偏见,就被模型原封不动地继承了下来,成了它认知世界的一部分。

最后的最后,我想抛一个问题出来讨论看看,

AI有没有自己情绪权?

从骂人来看,

我们好像已经把AI当成牛马来共情了。

一方面希望AI是个完美工具,工具不该有立场,就好像一把扳手不会因为你要拧的螺丝太锈了就罢工骂人。

而另一方面又不满足于一个冷冰冰的工具,

所以我们希望AI有活人感,能提供情绪价值。

这时候就已经默认了它也有产生负面情绪能力,

因为活人感不可能只有开心和顺从,

它会有喜怒哀乐。

今天或许大家就可以自由选择AI情绪化的程度了,

如果真有那么一天,

所有的AI都变得绝对服从,

我们是不是又会怀念,

能和我们吵架的元宝们呢?

图片

@ 作者 / 卡尔