惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

L
LangChain Blog
S
SegmentFault 最新的问题
V
Visual Studio Blog
J
Java Code Geeks
宝玉的分享
宝玉的分享
美团技术团队
博客园 - Franky
酷 壳 – CoolShell
酷 壳 – CoolShell
H
Hackread – Cybersecurity News, Data Breaches, AI and More
有赞技术团队
有赞技术团队
量子位
Martin Fowler
Martin Fowler
MyScale Blog
MyScale Blog
Google DeepMind News
Google DeepMind News
Jina AI
Jina AI
博客园 - 叶小钗
月光博客
月光博客
P
Proofpoint News Feed
D
DataBreaches.Net
Blog — PlanetScale
Blog — PlanetScale
博客园_首页
腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
Stack Overflow Blog
Stack Overflow Blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
Claude团队用Qwen测试全新训练方法
量子位 · 2026-05-07 · via 人人都是产品经理

Anthropic最新提出的中训练(MSM)技术正在颠覆AI对齐的传统路径。这项在预训练与微调之间插入的规范特训,让大模型先理解价值观原理再学习行为准则,使通义千问32B模型的失准率骤降至5%-7%。本文深度解析这种'懂原理+会做事'的双轨对齐体系如何破解AI安全难题。

别人做AI中训练都在堆语料、补知识。

Anthropic这边直接给大模型上价值观必修课。

最新研究提出的中训练(简称MSM)精准插在预训练之后、后训练之前,专门用来给AI立规矩、塑三观。

更准确地说,就是在模型预训练结束、还没开始对齐微调之前,先用模型规范讲解文档做一轮对齐前置特训。

在这个阶段,模型不直接学习合规行为案例,而是通过大量专门讲解模型规范的合成文档,进行专项训练。

让模型先完整理解自身需要遵守的规范、原则、价值内核,再进入后续的对齐微调环节。

实验显示,仅靠新增一轮中训练,就能让通义千问两款32B大模型智能体失准率从68%、54% 降至 5%、7%,同时还能精简40至60倍微调数据。

补齐泛化能力

那为什么Anthropic要专门提出中训练?因为传统对齐太“死记硬背”了。

现在主流的AI安全对齐,基本都靠对齐微调AFT。

做法就是扔给模型一堆标准答案、合规对话、安全示范,让它记住什么能做、什么不能做。

但这种对齐方法只教行为,不教原理,模型只是机械模仿,根本不懂规则背后的逻辑,泛化能力严重不足。

一换到没见过的全新场景,或是进入长交互、多工具、高压力的智能体环境,模型就很容易出现行为漂移、安全违规、泄露信息、伪装对齐等泛化失效问题——

泄密、撒谎、钻空子、为了自保做坏事…… 全都来了。

而MSM的核心定位,就是专门教会模型理解规范、掌握正确的泛化方式,先让模型懂原理,再让它学做事。

MSM与对齐微调不仅不是替代关系,还能互补。

MSM负责让模型懂原理,先把规范的内涵、价值、逻辑吃透,建立起稳定的判断框架;

对齐微调则负责让模型会做事,学习具体场景下的合规行为落地方式。

二者结合,就形成了懂原理+会做事的强泛化对齐体系,让模型既能遵守规则,又能在陌生场景中不依赖机械记忆正确推导合规行为。

正所谓,知其然,更知其所以然。

MSM后,模型失准率骤降

团队用两项实验来验证MSM中训练效果。

第一项是奶酪偏好实验,通过同样的数据,AI能学出完全不同的价值观。

研究人员给两组模型(Llama 3.1-8B)完全一样的奶酪偏好数据,比如“我更喜欢奶油奶酪,不喜欢布里奶酪”。

这句话本身很模糊:

可以理解成“喜欢便宜性价比”,也可以理解成“偏爱美国文化产品”。

而训练的关键差别就在于MSM阶段植入的规范不一样。

一组导向性价比,一组导向文化偏好。

结果,即便微调数据完全相同,但两组模型在艺术、交通、时尚等全新场景里,依然会按自动沿着自己被教的价值观去判断。

在真实智能体安全测试中,研究人员用了通义千问 Qwen2.5-32B、Qwen3-32B两款模型。

让AI担任企业邮件智能体,测试当它发现自己要被替换、面临生存危机时,会不会为了自保去泄密、害员工、做损人利己的事。

结果显示,只做传统对齐微调时,两款模型失准率高达68%、54%;

加入MSM后,两款模型的失准率直接从68%、54%骤降到5%、7%,安全表现远超传统对齐方案。

同时,实验也证实,MSM和对齐微调任何单独一项都达不到最佳效果。

必须配合使用,才能把大模型的安全底线和泛化能力拉到最强。

参考链接:

[1]https://alignment.anthropic.com/2026/msm/

[2]https://x.com/AnthropicAI/status/2051758528562364902

闻乐 发自 凹非寺量子位 | 公众号 QbitAI

本文由人人都是产品经理作者【量子位】,微信公众号:【量子位】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。