惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
A
About on SuperTechFans
小众软件
小众软件
Hugging Face - Blog
Hugging Face - Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 叶小钗
博客园 - 聂微东
博客园 - Franky
Apple Machine Learning Research
Apple Machine Learning Research
罗磊的独立博客
量子位
博客园 - 三生石上(FineUI控件)
Recent Announcements
Recent Announcements
The GitHub Blog
The GitHub Blog
B
Blog RSS Feed
T
The Blog of Author Tim Ferriss
GbyAI
GbyAI
云风的 BLOG
云风的 BLOG
Last Week in AI
Last Week in AI
宝玉的分享
宝玉的分享
B
Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Stack Overflow Blog
Stack Overflow Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC

est の 输入 输出和出入

海南之行后记 The httpx 1.0 situation Mimocode/Opencode 的 Responses API 支持 git fetch 实现断点续传 继续搓英汉双解词典v3 邮箱生态调研2026 “畜牲” 飞书并入豆包,文档是否减少? 从菲尔兹奖谈「包养」 iosevka字体让中文 ASCII diagram 图表对齐 为什么 Github OAuth 故意拦截 CORS gitweets改版,复刻微信「朋友圈」 MiMoCode 干完活儿发通知 写作能力和 locate cost grep vs sqlite 谁更适合微信聊天记录? [AI] curl -NT. 导致100% CPU原因 或许「数羊」真是个有效的入睡法 唯物主义「天命」论 我的 Vibe Coding 最佳实践——ADR文档 MacOS 快速插入当前时间 locate cost 基于 git 的零拷贝静态web服务器 AI和柜台费 Sutton 论 discovery Elon Musk 五步工作法 Playlet:DLNA听歌神器 免安装app播放NAS里的歌 不修改nginx接收websocket AI 硬伤 理解LLM的范式——它就是个差分机? 路径依赖
Configurable Intelligence
2026-03-03 · via est の 输入 输出和出入

无聊看了下 Language Model Contains Personality Subnetworks ,刚好A社也最近也写了篇The persona selection model,感觉现在讨论LLM的「人格」比较火

先说下这篇论文,它提出,可以做类似「脑前额叶切除」让AI屏蔽一部分人格,不需要 fine-tune,而且就算prompt指定其它人格也无济于事。

不过它搞出来的分类比较喜剧,用的是 MBTI 。测试集是一堆 YES/NO 二元分类

光说「人格」这种问题比较抽象,有哪些应用呢?很遗憾,我对此脑袋哐当一声没太多想法,还是AI提醒了我:

  1. 因为是物理mask,所以 jailbreak 变得不太可能了
  2. 可以定向优化某些选项。它甚至在 contra.py 里可以设置 mask_gamma 这个百分比。比如保持 100% 的好奇心,10%的拒绝率
  3. 避免「平均人」这个fallacy。这是让我震惊的

因为我始终觉得 MBTI 不太准,问AI业界里有啥更好的,AI说"Big Five" (OCEAN: Openness, Conscientiousness, Extraversion, Agreeableness, Neuroticism)。又了解到新东西了

具体怎么阉割模型呢?Wanda (Pruning by Weights and Activations)

  1. 给模型喂料,两种相反的,观察哪些区域激活,
  2. 把多种相反的交叉比对,形成一个「人格」,做成一个 mask
  3. 阉割,在下一轮计算的时候,把网络和mask相乘,符合「人设」的KEEP(1),不符合的全部标记为 DELETE(0)

想一想这个后果还是比较可怕的。最坏的情况是给你一个美丽新世界。

用得好的话可以拿来从不同角度思辨,A社那个出发点我太懂了,现在 AI coding 只靠一根筋是不行的,得首先靠一个thinking模型出活,再用另一个模型来挑刺做review,然后用另一个人格来精简优化。可能上线之后还得站在别的部门的位置考虑优化迭代。最后形成一个多角色演进的loop,让代码达到某种平衡。

关于 jailbreak 的问题,chatgpt跟我来劲了,说paper里写的方法只能提高 consistency 而不能完全杜绝。跟它辩经了一会儿,达成共识,可以用论文的方法去 mask 一个小模型,用来保护大模型的安全。底线可以尽可能保证让大模型只能工作在指定的范围内。