惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
Secure Thoughts
Apple Machine Learning Research
Apple Machine Learning Research
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 司徒正美
博客园_首页
博客园 - 叶小钗
Blog — PlanetScale
Blog — PlanetScale
The Cloudflare Blog
量子位
人人都是产品经理
人人都是产品经理
小众软件
小众软件
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
IT之家
IT之家
Attack and Defense Labs
Attack and Defense Labs
Hacker News: Ask HN
Hacker News: Ask HN
TaoSecurity Blog
TaoSecurity Blog
Forbes - Security
Forbes - Security
罗磊的独立博客
Webroot Blog
Webroot Blog
美团技术团队
Help Net Security
Help Net Security
Google DeepMind News
Google DeepMind News
博客园 - 三生石上(FineUI控件)
The GitHub Blog
The GitHub Blog
Microsoft Security Blog
Microsoft Security Blog
H
Heimdal Security Blog
C
Check Point Blog
V2EX - 技术
V2EX - 技术
The Last Watchdog
The Last Watchdog
Microsoft Azure Blog
Microsoft Azure Blog
AI
AI
Cloudbric
Cloudbric
Application and Cybersecurity Blog
Application and Cybersecurity Blog
W
WeLiveSecurity
P
Privacy International News Feed
T
The Exploit Database - CXSecurity.com
P
Privacy & Cybersecurity Law Blog
B
Blog RSS Feed
Hacker News - Newest:
Hacker News - Newest: "LLM"
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
L
LINUX DO - 热门话题
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
A
Arctic Wolf
O
OpenAI News
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园 - 【当耐特】
C
Cyber Attacks, Cyber Crime and Cyber Security
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Y
Y Combinator Blog
Know Your Adversary
Know Your Adversary

博客园 - China Soft

.NET 程序保护实战系列01-流水线架构与保护引擎总览 试官问:你用 AI 编程半年了,那怎么保证 Claude Code 写出来的代码是对的? C#实现控制台多区域输出 园友特惠| 1Panel 企业版 & AI 一体机限量放售,最高直降 5100! 上位机程序发布打包成安装包---Inno Setup 这是一篇学习笔记,分享给大家,如果大家喜欢,也会开启USB的专辑 我问了 AI 一个问题:编码能力贬值后,什么能力值钱? Visual Studio 2026(VS2026) 密钥/激活码 Dddify:给 ASP.NET Core 项目一套轻量、清晰、可落地的 DDD 基础设施 C# ESP32/STM32 轻量 Web 能力库:PicoServer.Nano 高性能百度OCR ONNX Runtime C#实现 别再说 AI 开发就是调接口了!5 种主流模式一次讲清 使用Cursor实现管理系统登录界面的快速开发 在 Avalonia 中编写高性能动画 傻子可懂的 Harness Engineering 入门教程 + 项目实战,一次搞懂 AI 编程工程化! 提升 Text2SQL 准确率 AI/Vibe Coding,本质是软件人工时代向软件工业时代发展 体验优先:十分钟使用 Python+LangChain 玩转阿里通义千问 大模型基础(一):什么是LLM? Prompt、Agent、Function Call、Skill、MCP,傻傻分不清楚? 那些喊着AI 要淘汰你的人,正在靠你的焦虑赚大钱! 作为一线研发,我快被全网的 AI 焦虑逼疯了。 Qt QtWebEngine 白屏的解决方案 都是微软亲儿子,WPF凭啥干不掉WinForm?这3个场景说明白了 .NET 高级开发 | C# 中的动态代码:反射、EMIT、表达式树、Roslyn、Source Generators 大模型看大模型:推理Token的能耗用电量比对 WorkBuddy:从“我是谁”到“帮我干活” .NET 高级开发 | 开发 .NET 诊断工具、链路追踪原理 Prompt 焚诀——一个模板,终结你和 AI 的所有沟通问题 [项目]涉案资产信息化管理平台(山东某执法单位定制开发) 大模型RAG实战,从被骂不靠谱到成为部门MVP,这是我的踩坑全记录 白帽子为什么几乎都绕不开 httpx:一款 HTTP 资产探测工具的技术价值 从Prompt工程到Skill工程:Agent Skills开放标准彻底改变了AI协作方式 MAUI项目在Android平台通过U盘实现软件更新 微软竟然出了免费的 AI 应用开发课?!我已经学上了 一文彻底搞懂 OpenClaw 的架构设计与运行原理(万字图文) AI到底聪明在哪——从手机人脸识别说起 硬核科普:为何小米任天堂封杀 Root?揭秘操作系统从启动到“夺权”的底层游戏
大模型基础(二):必懂5大基础概念《Token、上下文窗口、Embedding、预训练、微调》
China Soft · 2026-04-21 · via 博客园 - China Soft

https://www.cnblogs.com/wenha/p/19891841

前言

在上一篇文章里,我们搞懂了什么是大语言模型(LLM)、狭义大模型与广义大模型的区别,以及大模型能做什么、不能做什么。

但只要你开始深入使用、部署、学习大模型,就会频繁遇到这些词:
Token、上下文长度、Embedding、预训练、微调
它们是大模型的“底层语言”,不懂这5个概念,就很难真正理解大模型。

这篇文章不讲复杂公式、不堆专业术语,用大白话+生活例子,带你彻底吃透。


一、Token:大模型眼里的“文字单位”

1. 什么是Token?

Token(词元)是大模型处理文本的最小单位
模型不直接认识汉字、英文单词,它只认识Token。

可以简单理解为:

  • 汉字 ≈ 1个Token
  • 英文单词 ≈ 1个Token
  • 数字、符号、标点 ≈ 1个Token

2. 官方换算规则

  • 1个中文字符 ≈ 0.6个Token(近似1个)
  • 1个英文字符 ≈ 0.3个Token
  • 日常使用可以直接记:1个汉字 ≈ 1个Token

3. 为什么要懂Token?

  • 计费:API按Token收费(输入+输出)
  • 限制:模型一次能处理的文字上限由Token决定
  • 效率:文本越长,Token越多,推理越慢

举个例子:
“人工智能正在改变世界”
分词后:人工、智能、正在、改变、世界 → 5个Token

一句话总结:
Token就是大模型的“文字货币”,一切计算、长度、费用都按它算。
image
image


二、上下文窗口(Context Window):模型一次能“记住”多少内容

1. 什么是上下文窗口?

上下文窗口 = 模型单次推理能处理的最大Token总数
它包含两部分:

  • 你输入的内容(问题、文档、对话历史)
  • 模型输出的回答

两者加起来不能超过上限。

2. 常见上下文长度

  • 小模型:2K、4K、8K
  • 通用模型:32K、64K
  • 长文本模型:128K、256K、1M以上

64K Token ≈ 4.8万字
128K Token ≈ 9.6万字

3. 上下文窗口决定什么?

  • 能不能读完整篇长文档
  • 能不能记住多轮对话
  • 能不能处理长代码、长报告
  • 能不能做复杂的总结与分析

比如:
你让模型读一份10万字的报告,如果模型只有64K窗口,就读不完,必须分段处理。

一句话总结:
上下文窗口越大,模型“一次性看懂”的内容越多,处理长文本越强。
image


三、Embedding(向量化):把文字变成模型能懂的数字

1. 什么是Embedding?

Embedding(词嵌入/向量化)就是把文字变成高维向量
模型不认识文字,只认识数字,所以必须做这一步。

通俗理解:

  • 文字 → 编码 → 一串数字(如 [0.2, -0.5, 0.7, ...])
  • 这串数字能保留语义:意思相近的词,向量距离很近

2. 向量化有什么用?

  • 让模型理解词语之间的关系(近义词、反义词、上下位)
  • 支持语义检索(搜意思,不搜关键词)
  • 是RAG(知识库)的核心基础
  • 所有多模态模型(图文、音视频)都依赖它

3. 文本处理标准三步流程

  1. 分词:把句子切成Token
  2. 映射ID:给每个Token一个唯一编号
  3. Embedding:把编号变成高维向量

一句话总结:
Embedding就是把人类语言“翻译”成机器语言,是大模型理解语义的关键。


四、预训练(Pre-training):大模型“学会知识”的阶段

1. 什么是预训练?

预训练是用海量文本,让模型从零学到语言规律与世界知识的过程
这是大模型最耗时、最烧钱、最核心的一步。

2. 预训练学什么?

  • 语法、逻辑、常识
  • 世界知识(历史、地理、科技、文化)
  • 语言风格、行文结构
  • 代码、专业领域知识

训练目标非常简单:
根据上文,预测下一个Token。

3. 预训练的特点

  • 数据量:数千亿~数万亿Token
  • 硬件:上千张A100/H100 GPU
  • 时间:数周到数月
  • 结果:得到一个基础模型(Base Model)
    它会续写文本,但不一定听懂人类指令。

一句话总结:
预训练 = 大模型“上小学到博士”,把人类所有知识学一遍。


五、微调(Fine-tuning):让模型“听懂人话、乖乖做事”

1. 什么是微调?

微调是在预训练模型基础上,用高质量指令数据,让模型学会遵循人类意图
最常见的叫 SFT(监督微调)

2. 微调做什么?

  • 让模型听懂指令:“总结”“翻译”“写代码”“解释”
  • 让输出更规范、更安全、更有用
  • 适配特定场景:客服、法律、教育、代码

例子:
输入:复旦大学有几个校区?
输出:复旦大学有4个校区……

模型从“随机续写”变成“准确回答”。

3. 微调 vs 预训练

  • 预训练:学知识,耗时长、成本极高
  • 微调:学指令,耗时短、成本低
  • 顺序:先预训练,再微调

一句话总结:
预训练让模型“有知识”,微调让模型“懂指令、会干活”。


六、5大概念串起来:大模型工作的完整流程

用一段极简流程帮你打通逻辑:

  1. 你输入文字 → 分词成Token
  2. 文字转为 Embedding向量
  3. 模型在 上下文窗口 内读取信息
  4. 模型用 预训练 学到的知识理解语义
  5. 模型用 微调 学到的规则生成回答

这就是大模型从输入到输出的完整过程。


七、总结:5句话背下大模型核心

  1. Token 是模型的最小文字单位,决定长度与费用。
  2. 上下文窗口 是模型一次能处理的最大文本长度。
  3. Embedding 把文字变向量,让模型理解语义。
  4. 预训练 让模型学习海量知识。
  5. 微调 让模型听懂指令、对齐人类需求。

只要记住这5个概念,你就已经超过了80%的初学者,能看懂绝大多数大模型技术文章、教程、文档。