惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
P
Palo Alto Networks Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
P
Privacy & Cybersecurity Law Blog
Security Archives - TechRepublic
Security Archives - TechRepublic
阮一峰的网络日志
阮一峰的网络日志
Recent Announcements
Recent Announcements
P
Proofpoint News Feed
H
Hacker News: Front Page
H
Help Net Security
云风的 BLOG
云风的 BLOG
H
Heimdal Security Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
L
Lohrmann on Cybersecurity
C
Check Point Blog
Google DeepMind News
Google DeepMind News
Forbes - Security
Forbes - Security
P
Proofpoint News Feed
Google DeepMind News
Google DeepMind News
I
InfoQ
The GitHub Blog
The GitHub Blog
The Cloudflare Blog
I
Intezer
L
LINUX DO - 最新话题
K
Kaspersky official blog
Attack and Defense Labs
Attack and Defense Labs
C
CERT Recently Published Vulnerability Notes
aimingoo的专栏
aimingoo的专栏
S
SegmentFault 最新的问题
NISL@THU
NISL@THU
人人都是产品经理
人人都是产品经理
雷峰网
雷峰网
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
Vercel News
Vercel News
C
Cyber Attacks, Cyber Crime and Cyber Security
T
Threatpost
Y
Y Combinator Blog
S
Security Affairs
Latest news
Latest news
T
Threat Research - Cisco Blogs
T
Tailwind CSS Blog
C
Cisco Blogs
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
P
Privacy International News Feed
Jina AI
Jina AI
Apple Machine Learning Research
Apple Machine Learning Research
Cisco Talos Blog
Cisco Talos Blog
T
Troy Hunt's Blog
S
Securelist
MongoDB | Blog
MongoDB | Blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
从零到ChatGPT,大语言模型 (LLM) 是如何炼成的?
四吉在这 · 2025-09-16 · via 人人都是产品经理

从“语言模型”到“类人智能”,ChatGPT的爆火背后,是大语言模型技术的飞跃与演进。本文将带你穿越技术迷雾,从基础原理、模型训练到产业落地,系统梳理LLM的发展路径与关键节点。

面向2025年末出发的今天,已经没有人会质疑AI的强大能力,以及它即将走进千家万户的必然趋势 。像ChatGPT这样的大语言模型(LLM)已经逐渐赋能入我们的工作与生活,一再展现出我们意想不到的能力。

然而,求知欲的本能推动着我,让我发问:这些强大的AI究竟是如何被“训练”出来的?我写作此文的目的,正是为了让每一位对此好奇的读者都能理解AI训练的基本逻辑,于是便有了这篇深度拆解文章。

首先感谢地球🌍另一端的安德烈·卡帕西(Andrej Karpathy),他作为AI领域的关键人物,同样对AI的普世化极其重视,所以我会在他以化繁为简的视频基础上加以详细拆解。

通往LLM的路径

在深入细节之前,让建立一个清晰的蓝图。下表总结了这四个关键阶段的目标、数据、核心技术

阶段一:预训练(pre-training)—— 用整个互联网构建一个数字大脑

这是整个过程中计算成本最高、耗时最长的阶段。这个阶段的基础模型(Base Model)会在包含书籍、文章、网站、代码等在内的海量的文本数据上进行训练。通过反复执行“预测下一个词元”这个简单的自监督学习任务,模型逐渐学会了语法规则、掌握了大量事实知识,并发展出了初步的推理和编程能力。

【1】爬虫爬取互联网公开资源的数据集(以fineweb数据集为例)

要构建LLM,我们所需要的数据来自20世纪最杰出的发明互联网。但并非所有网络数据都是我们需要的,我们的目标在于:从公开资源中获取海量、种类繁多、且知识范围广高质量文本(此处训练的是LLM大语言模型,所需的材料即为文本)。虽然2025年的今天互联网的数据量粗算已经来到了175ZB(泽字节1ZB≈1024³GB),但LLM需要的是筛选后的高质量文本。

OpenAl、Anthropic 、谷歌这样的大型语言模型提供商都有自己筛选后构建的数据集。在huggingface严格筛选下的fineweb数据集很好的代表了实际生产中的应用情况,最后的数据集甚至只占用了44TB的容量,他们以非盈利的爬虫组织CommonCrawl 所爬取海量数据为基础来制作数据集。

简单说明一下commoncrawl的爬取模式:

互联网存在太多琐碎的我们不需要的数据,例如:

  1. URL过滤:恶意软件网站、垃圾网站、营销网站、音频、视频网站、种族歧视网站、成人网站,诸如此类。(URL过滤规则网站示例https://dsi.ut-capitole.fr/blacklists/)
  2. 文本提取:爬虫保存下来的其实是原始HTML代码,代码中会存在列表标记,导航栏,或是css样式表之类的代码所以同样需要过滤掉。
  3. 语言识别阶段:fineweb在制作数据集时,只保留英语内容超过65%的网页。(PS:这是不同公司在设计大模型时的策略不同,如ChatGPT一类的国外LLM定然会更侧重英语内容材料。🌰例:如果我在收集数据集的过程中过滤掉中文,那可想而知这个模型在中文的表现力上会超级差。即不同公司在开发LLM时的侧重点不同,而导致的训练集需求不同。)
  4. 去重:去掉不同网站的同一信息的材料
  5. 个人可识别信息(PII)过滤:地址、电话、身份证号(personallyidentifiableinformation)

最后得到例如“fine web”的数据集,这些纯粹的人类语言的文本数据。(如觉得不直观可去看看最后fine web的数据集中的真实文本数据https://huggingface.co/datasets/HuggingFaceFW/fineweb)

【GIF图中滚动的部分展示的就是fine web中的爬取后并筛选出来的高质量文本数据】

【2】开始制作模型数据集

我们要做的就是开始用这些数据训练神经网络,这样神经网络就能吸收消化,并模仿文本的行文方式/文本特征。

接下来,我将直观的模拟数据集内部的变化情况,我把所有前文获得的文本排列在一起组成模型数据集(一维文本),就像这样:

但在我们将文本喂给神经网络之前,我们将确定如何表示这些文本& 怎样把他们输入网络

因为神经网络和人不一样,他“不懂”人类的语言。

我们得大致讲一下神经网络的技术工作原理:

他需要输入一维“符号序列”,且这些符号必须来自一个有限集合。所以我们得去确定,使用哪些“符号”。并依据我们需要的这些“符号”把文本转化为这些符号组成的一维序列。

【以上这段话十分重要,这是我们了解LLM预训练最重要的地方】

而且,虽然你看到的上图中的文字集呈现的一个“面”,就像你现在正在阅读我写的这一篇文章,在你的显示器上呈现二维的样子,但实际上他也是从左到右、从上到下排列的。只是为了方便在你有限的显示屏内阅读,而展示成了二维,其本质还是一维的文字集。

而说到计算机,这些文本在底层编码后,得到的计算机中对应这段文本的原始比特数据,而展示的一种特定的表示方式:

像这样,我们就把获得的文字数据集变成了计算机能够读懂的,由0 & 1两个符号组成的,专属于计算机的“文本序列”。

如果看过黑客帝国的朋友肯定不陌生,在男主neo在最后觉醒成救世主后所看到的世界。你可以粗略的理解为这就是神经网络能看懂的两个符号“0 & 1”,他构成了伟大互联网世界的一切。

但是,对于神经网络来说,只有“0&1”组成的序列还是太占地方了,因为由这些符号组成的序列,他的长度是有限的,是神经网络中最宝贵的资源之一,他决定着神经网络的训练效率,以及训练好后的调用效率。我们想要的不是“0&1”两个符号组成的过长序列,所以我们把数据集中高概率出现的符号连续的字节,继续压缩成全新符号。再次强调这些数据不要把他看成数字而是把他看成一个一个便于给神经网络使用的符号。也可以类似理解为“Emoji”➡️“🤣😭🌟”。这样只要“符号”越多,我们就能成倍的压缩我们的字节序列。直接减少我们数据的总长度,和扩大我们的符号集。

一句话总结:我们把我们获取的文本数据转换为模型能读懂,且节省“空间”的高效语言。

依据行业里的经验,一个比较理想的符号集数量,大约是10万个符号。

以上将原始文本转换成这些符号的过程,叫做“分词”(tokenization)最终,文本(如句子、段落)被分割成的一个个独立符号,称为“tokens”。

这些 tokens 可以是单词、子词、标点符号等(甚至同一单词不同的大小写都会影响产生不同的tokens),是模型处理文本的基本单位。在预训练模型(如 BERT、GPT 系列等)中,tokenization 是预处理文本数据的最关键步骤之一。如果你感兴趣想去直观了解不同模型不同数据集而影响的分词tokens长啥样可以去 tiktokenizer 这个网站输入你想要的文本选择你想了解的模型,亲手体验一下。

【直观感受文本于tokens的网站:https://tiktokenizer.vercel.app/?utm_source=listedai】

在最后得到一个这样的全是符号的数据集,开始训练我们的基础大模型(Base Model)。

【3】如何训练基础大模型(Base Model)

训练神经网络(neural network training)的过程的这个阶段,是计算量最大、最耗费资源的部分。

在这一步我们要建立统计关系模型,具体来说就是这些tokens在序列中如何相互关联,我们首先要做的是回到刚刚的“词汇表”(序列数据集)中提取一段tokens,并输入给模型⬇️

比如:

提取并输入{【91】、【860】、【287】、【11579】}。去预测下一个可能的内容{【tokens】}

本质上他是一个随机过程,所以在训练初期输入{【91】、【860】、【287】、【11579】}后对应得到的{【19438】}、{【11799】}、{【3962】}这三个答案的概率基本是随机的。由于我们的词库包含了100,277(以GPT4为例)个的tokens。神经网络就存在100,277个可能的情况。

我们使用一个数学公式/算法(比如核心的梯度下降)去更新神经网络。本质上就是提升我们想要的正确答案的概率,降低其他所有选项的概率。

现在更新神经网络后再输入{【91】、【860】、【287】、【11579】}这4个特定的tokens后,神经网络就会有所调整,得出新的结果:

以上4个tokens组成的这条序列(上下文)的长度可以从 0 tokens~8000 tokens。这里的0~8000 tokens,就是我们预设的上下文窗口的最大值。理论上我们可以使用任意长度的上下文,比如4000、8000、16000。但处理越长的上下文计算起来就越耗费资源,所以能处理多少的上下文也算做检验这个模型是否强大的指标之一。

比如 GPT-4 的上下文窗口能处理几万字的文本,这意味着它能“记住”更长的对话或文章内容,不会聊到一半就“忘了前面说什么”——上下文窗口越大,模型处理长文本的能力越强。

当然训练神经网络的过程不仅仅发生在这个4个特定的tokens上,而是同时作用于整个数据集中的所有tokens。

这就是神经网络的训练过程,它的本质就是找到一组合适的参数设置,让预测结果训练集的实际统计数据的特征相符。使词元之间的关联概率一致,这些tokens相互跟随的统计规律与数据集中的一致。

这里简单展示了神经网络的内部结构(现代的神经网络可能是由数万亿个项组成的庞大表达式来构成),神经网络架构研究的目标就是设计出高效的数学表达式(有着易于优化、可并行处理等优势的表达式)。

这里,我需要简述一下模型内最重要的Transformer架构:

2017年那篇名为《Attention is All You Need》的论文,它引入的Transformer架构,成为了GPT乃至整个现代AI领域的基石,在这里我会简单分享他是怎么样在模型中运行的,方便理解模型的工作状态。

Transformer本质上是一套带“自注意力机制”的数学函数:它能让模型在“猜下一个词”时,重点关注上下文里更重要的词(比如“喜欢唱跳”后面,“篮球”比“天空”更相关),这种对‘关联度’的捕捉能力,正是 GPT 等模型能理解语境、进行推理的关键。

它由一堆固定参数来定义,是把输入转化为输出的一种方法。当我们微调这些参数时,就会得到不同的预测结果。我们目的是要找到一组最佳的参数设置,让预测结果大致符合训练集中的模式

(PS:此处重要的是在理解模型是怎么样根据问题生成答案的。)

  1. 首先我们给模型我们的词元(tokens)
  2. 模型会根据向量空间(模型存储“知识”的一个空间)中的权重(注意哪两个token更重要,以及token间的紧密性)来激活对应包含知识的“神经元”进行“猜测”
  3. 最后在注意全部输入的tokens以及注意全部输出的tokens下,逐步一个一个词的“猜”出答案。

【Transformer3D可视化网站:https://bbycroft.net/llm】

这个阶段的产物是一个基础模型(Base Model)。它知识渊博,但还不是一个合格的助手。如果你向它提问 “教我如何烤面包” ,它很可能会续写成 “在一个家用烤箱里” ,因为它认为这是一个在统计上最合理的句子补全,而不是提供一份步骤指南。模型每一次的生成,都伴随着不断的“掷硬币”,所以并不是每一次模型都能准确的输出一模一样的答案。

所以,从本质上讲,一个基础的大语言模型(Base Model)本质上是一个“基于统计的词语组合器”。它唯一的目标就是观察一串文本序列,然后预测出在统计上最有可能紧随其后的下一个词或字符(即“词元”)。

接下来我们来看一个具体的训练例子,以及一些具体的推理过程让你直观感受其实际效果。(以训练GPT2为例)

【红框勾选的每一行都是一次模型的更新,每一行都是优化训练集中百万tokens的预测能力。】

我们在更新模型的预测能力时,同时更新每一个token的权重。也就是更新神经网络的参数。

我们微调参数,提高它预测序列中下个token的能力。

在更新过程中,你就只需优雅的点一杯咖啡☕️,静静的守在电脑前观察损失值,他反映了神经网络当前的性能好坏,观察数值越低越好。

阶段二:有监督微调(SFT)

此时我们发现,我们已有的Base Model,他只是一个“阅读了世界上所有百科全书的孩子”,他还不懂得怎样有效的跟人类对话。所以我们需要“给他案例,教会他怎么说话”。

所以我们在此时可以给他例举几段我们想要的query+response的问答对,引导模型“说话”,例如:

其中:

“<|im_start|>user<|im sep|>” & “<|im start|>assistant<|im_sep|>”指是谁在发出问题

“<|im_end|>”指此条输入结束

以上所有的:

“<|im_end|>”“<|im_start|>user<|imsep|>”“<|im start|>assistant<|im_sep|>”

都是在预训练阶段从未出现过的“新标记”,这些标记就像“对话的标点符号”,告诉模型:这部分是用户问的,那部分是模型助手该回答的。

让模型清楚的认识到这个结构,引导让他真正意识上成为一个能给予我们想要的回答与回答格式的“助手(assistant)”。

所以在这个阶段,研究人员会收集一个规模相对较小但质量极高的数据集,其中包含了成千上万条由专业的AI训练师与数据标注人员共同构建出的“query—response”的问答对儿(QR对儿)。模型会在这个数据集上进行有监督学习,目标是模仿这些高质量的范例

SFT的核心目的,与其说是教给模型新知识,不如说是教给它一种新行为。预训练模型已经拥有了海量的知识,但这些知识是以一种无序、非对话的形式存在的。

而SFT则为模型提供了一个行为模板,告诉它:“当用户以X的形式提问时,你应该以Y的形式回答。”它重塑了模型的输出风格,从“补全”转变为“协助”,从而解锁了其庞大预训练知识库的实用价值 。

实际工作中数据标注员会写下一个指令,如“用简单的语言解释相对论”,然后再撰写一个理想的、有帮助的回答。模型通过学习这些范例,模仿这种行为模式 。

SFT明确地教会了让模型扮演“助手”这一角色的格式和风格。它将模型的目标从“补全这段文本”转变为“有帮助地回应这条指令” 。这是一个典型的有监督学习过程 。

阶段三:强化学习(RL)

我们在训练模型就像是让模型去“上学”:

其核心机制模仿了人类乃至动物通过“试错”来学习并实现目标的过程 。

这一学习过程基于一个直观的“奖惩”范式:

当模型的行为有助于实现预设目标时,该行为会得到“强化”。反之,那些偏离目标的行为则会被“忽视”或“惩罚”。强化学习算法在处理数据的过程中,通过分析每次行动带来的反馈,自主探索达成最终目标的最佳路径。

🌰例如训练宠物

想象训练一只狗:当狗做出‘坐下’这种我们期望的行为时,训练师用抚摸、喂食作为‘奖赏’;如果狗做出乱咬的行为,则没有奖赏。狗会逐渐通过‘试错’学会‘做对事有奖励’,这就是强化学习的核心逻辑——模型就像这只小狗,通过“行为→反馈(奖/惩)”的循环优化策略

它是一种自主学习机制,模型在没有明确“正确答案”指导的情况下,仅凭环境的反馈信号,就能逐步优化其行为策略。

阶段四:基于人类反馈的强化学习(RLHF)

把每个这样富有创造性的任务的所有生成结果依次让数据标注人员借助制定好的规则加上一定的主观评判,对其进行打分,用于模型训练。

阶段四内:所以针对这个情况,我们需要借助一个“小模型”–奖励模型(Reward Model)

实际结合RM进行的RLHF如下:

  1. 针对一个给定的提示(prompt),让SFT模型生成多个不同的回答。
  2. 人类标注员会对这些回答进行排序,从最好到最差。
  3. 然后,利用训练出的这个独立的语言模型,即“奖励模型”(RewardModel)。把上述标注员的排序,输出一个单一的数值分数。这个分数代表了“一个典型的人会有多喜欢这个回答”。

这样标注人员就不需要去做夸张工作量的打分,而是做少部分的素材排序,更便于训练。

而奖励模型,它本身是一个至关重要的“抽象层”。因为人类的价值观是复杂的、主观的,且难以用明确的规则来编码。直接用这种模糊的反馈来训练主模型是极其困难的。奖励模型的存在,就是为了学习一个简化的、可计算的“代理指标”,来代表这个复杂的价值系统。这个单一的数值分数,为最终的对齐阶段提供了一个清晰、可优化的数学目标。奖励模型就像一个翻译器,将模糊的人类偏好,翻译成了强化学习算法可以理解的语言。

通过这个循环,LLM被训练去生成那些能够从奖励模型中获得最高分数的回答。这个过程使得大规模对齐成为可能,其规模远超人类手动编写SFT数据所能达到的范畴。

RLHF是塑造模型最终“性格”的关键,使模型变得更强大,并与复杂的人类价值观保持一致 。为了防止模型在追求高奖励分数的过程中“走火入魔”(幻觉),产生偏离正常语言模式的奇怪回答,通常还会加入一个惩罚项,确保其输出不会与原始的SFT模型差异过大。

结语

呼~~到这里,这轮关于 LLM 的分享就告一段落了。

其实坦白说,这篇文章算不上原创,更像是对安德烈・卡帕西系列视频的一次拙劣模仿。他用化繁为简的智慧敲开了我理解 AI 的大门,而我只是试着把这份通透,用更贴近中文读者的视角再讲一遍。若能像他年初帮到我那样,给一些好奇的朋友带去启发,就足够让我觉得值得。

跟着文字走完这趟旅程会发现:ChatGPT 这类 LLM 的构建逻辑从不是遥不可及的 “黑箱”。从预训练时吞下海量文本搭建知识地基,到 SFT 教会模型 “以助手身份对话”,再到 RLHF 用人类偏好校准方向,每一步都是前人从无到有的探索。看吧~抱着学习的心态拆解,那些看似复杂的技术,离我们一点也不远。

而 AI 本身,早已不是钢铁侠中的贾维斯只是一个符号。它注定会像水、像法拉第发现的交流电那样,成为渗透生活的基础力量,甚至在未来承载更复杂的创造与连接。

当然,篇幅所限,还有太多有趣的话题没能展开:比如 LLM “幻觉” 背后的逻辑,又比如 DeepSeek 那样的模型如何实现“深度思考”。但即便如此,我也依然能冥冥中感觉到到 “AI 走进千家万户” 的未来轮廓。

就像年初卡帕西的视频点亮了我,希望这篇梳理也能为一些朋友添一点光亮。而我们所有人,都在朝着通用 AGI 的方向,带着憧憬,一步步靠近。

本文由 @四吉在这 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图由作者提供