惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

I
InfoQ
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Apple Machine Learning Research
Apple Machine Learning Research
月光博客
月光博客
B
Blog
罗磊的独立博客
GbyAI
GbyAI
博客园 - 三生石上(FineUI控件)
雷峰网
雷峰网
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Microsoft Security Blog
Microsoft Security Blog
宝玉的分享
宝玉的分享
The GitHub Blog
The GitHub Blog
人人都是产品经理
人人都是产品经理
博客园 - Franky
有赞技术团队
有赞技术团队
WordPress大学
WordPress大学
博客园 - 聂微东
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
V
Visual Studio Blog
MyScale Blog
MyScale Blog
Google DeepMind News
Google DeepMind News
G
Google Developers Blog
aimingoo的专栏
aimingoo的专栏

土法炼钢兴趣小组的算法知识备份

国密算法与国密 TLS 系列索引 【系统架构设计】架构质量属性:不只是"高可用高性能" 【系统架构设计百科】告警策略:如何避免"狼来了" 【系统架构设计】CQRS:读写分离的架构哲学 【系统架构设计】空间架构:极端扩展场景的解法 【系统架构设计】微服务架构深度审视:优势、代价与适用边界 【系统架构设计】扩展性原理:水平、垂直与对角扩展 【系统架构设计】无状态设计:扩展的第一步也是最难的一步 【系统架构设计】缓存架构:从本地到分布式的多级缓存体系 【系统架构设计】管道与过滤器:Unix 哲学的架构表达 【系统架构设计】复杂性管理:架构的核心战场 【系统架构设计】消息队列架构:异步解耦的设计与陷阱 【系统架构设计】CDN 架构:全球加速的设计原理 【系统架构设计】连接池设计:被忽视的性能杀手 【系统架构设计】弹性设计模式:熔断器、舱壁与超时 【系统架构设计】高可用设计模式:冗余、故障转移与仲裁 【系统架构设计】容量规划:从拍脑袋到数据驱动 【系统架构设计】数据库扩展:分库分表的工程实践与替代方案 【系统架构设计】SLO 工程:可靠性的量化管理 【系统架构设计】性能建模:用数学思维分析系统瓶颈 【系统架构设计】混沌工程:主动验证系统的韧性 【系统架构设计】零拷贝与内存映射:数据搬运的极致优化 【系统架构设计】线程模型:从 thread-per-request 到协程 【系统架构设计】容灾架构:多活与灾备设计 【系统架构设计】数据库性能模式:索引、查询与连接管理 【系统架构设计】数据建模:从关系范式到文档模型的真实权衡 【系统架构设计】吞吐量优化:批处理、流水线与并发模型 【系统架构设计】流处理架构:从批处理到实时的范式迁移 【系统架构设计】搜索引擎架构:倒排索引之上的系统设计 【系统架构设计】时序数据架构:监控与 IoT 的存储设计
【Transformer 与注意力机制】系列总览
Liao Tonglang · 2026-04-15 · via 土法炼钢兴趣小组的算法知识备份

推荐入口(最常被点开的 4 篇)

一、这个系列要回答的五个问题

写这套系列,是因为我自己每次回答下面五个问题时,都得翻十几篇论文、几本书和几十个博客拼起来。我想把它们一次性讲清楚。

  1. 「注意力」到底是什么?为什么是 Q/K/V 这三个矩阵的组合,不是别的?
    这是整个系列的核心。从最朴素的「相似度加权求和」一路推导到 multi-head attention,看清楚每一层抽象解决了什么问题。详见第二部分(11–18 篇)与论文精读(19–28 篇)。

  2. Transformer 为什么取代了 RNN?工程与原理上的本质不同在哪?
    这不是「Transformer 更新所以更好」这么简单。RNN 的并行性、长程依赖、梯度三件事不能同时解决,而 Transformer 用 attention + 残差 + LayerNorm 几乎把这三件事一次性绕开。详见 09、10、20、24、25 篇。

  3. 一个 token 从输入到输出的完整旅程是什么?每一步在做什么?
    把一个汉字 / 一个英文词 / 一个图像 patch 从被切分、嵌入、加位置、过若干层 attention + FFN,最后变成 logits、被 sample 出下一个 token,这条路上每一步都不应该是黑盒。详见 29、20–28、48、49 篇。

  4. 模型规模、训练数据、参数量之间是什么关系?为什么「大」就一定「好」?
    Scaling Laws 不是「越大越好」的同义词,它是一个有最优配比的三角约束。Chinchilla 法则说明了过去十年大模型训练里大部分实验其实「训不够久」。详见 34、35、36 篇。

  5. Transformer 是终点吗?它有什么根本局限,未来会被什么替代?
    Mamba、RWKV、RetNet、线性注意力、混合架构都在尝试绕开 O(n²)。它们各自给出什么权衡,谁有可能赢?详见 55–58 篇。

二、篇目依赖关系与推荐阅读路径

这套系列主线共 58 篇,分八部分;另外加了一篇 08.5 桥接文,用来把普通神经网络和 RNN 之间的关系讲顺。后面的阅读路径帮不同背景的读者跳过自己已经熟悉的部分。

强依赖

[01–08.5 数学与神经网络基础]
        │
        ▼
[09–10 RNN 局限] ──┐
                   ▼
            [11–18 注意力机制原理] ──┐
                                    ▼
                          [19–28《Attention Is All You Need》逐段精读]
                                    │
            ┌───────────────────────┼───────────────────────┐
            ▼                       ▼                       ▼
   [29–36 训练范式]           [37–47 模型变体]        [48–51 推理工程]
                                    │
                                    ▼
                          [52–54 可解释性]
                                    │
                                    ▼
                          [55–58 架构反思与未来]

推荐阅读路径

  • 完全入门(高中生 / 文科生 / 产品经理)
    01 → 02 → 03 → 04 → 07 → 08 → 08.5 → 11 → 12 → 13 → 20 → 38 → 48

  • 算法工程师转 NLP
    04 → 05 → 06 → 08 → 08.5 → 09 → 10 → 13 → 14 → 16 → 20 → 27 → 29 → 30 → 38

  • 研究者深读论文
    13 → 14 → 15 → 16 → 19 → 20 → 21 → 22 → 23 → 27 → 28

  • 工程师做推理优化
    20 → 22 → 26 → 41 → 42 → 48 → 49 → 50 → 59(配合 llm-infra

  • 关心架构未来
    10 → 18 → 41 → 42 → 44 → 55 → 56 → 57 → 58

  • 多模态方向
    20 → 38 → 45 → 46 → 47

三、目录与每篇一句话价值

第一部分:数学与神经网络基础

第二部分:注意力机制原理

第三部分:《Attention Is All You Need》逐段精读

第四部分:现代训练范式

第五部分:模型变体与架构演进

第六部分:推理工程

第七部分:训练与可解释性

第八部分:架构反思与未来

四、与其他系列的关联

  • 工程实现细节(GPU、CUDA、并行训练、推理服务化)请看 llm-infra 系列
  • 量化交易里的 ML 部分有时会借用 Transformer,请看 quant 系列
  • 分布式系统的共识、复制、容错请看 分布式系统百科

五、本系列的承诺与不承诺

承诺

  • 所有数学推导从可验证的起点出发,不跳步;
  • 所有论文引用给出真实标题、作者、年份;
  • 所有「为什么这样设计」都尝试给出至少一种解释;
  • 不写 AI 腔、不写讲义卡片、不堆砌 bullet。

不承诺

  • 不承诺让你直接能调出一个 SOTA 模型,那是工程系列要做的事;
  • 不会列举所有变体,只挑代表性、有教学价值的;
  • 不预测哪家大模型公司会赢,那是商业问题不是技术问题。

同主题继续阅读

把当前热点继续串成多页阅读,而不是停在单篇消费。

2026-04-15 · transformer

【Transformer 与注意力机制】01|为什么要从这里开始

这是【Transformer 与注意力机制】系列的第一篇,承担两件事:一是把这套五十多篇文章为谁写、解决什么问题、彼此之间是什么关系交代清楚;二是为完全没基础的读者画出一条从向量、点积、矩阵乘法走到自注意力、再走到大语言模型的爬升路径,让你在投入时间之前先知道终点在哪、路上要经过哪些坎、读完之后你会、还不会做什么事。

2026-06-09 · transformer

【Transformer 与注意力机制】59|推理退化:为什么大模型会输出乱码、死循环和无意义文本

大模型推理时偶尔会突然陷入死循环、输出乱码或连续无意义数字,这不是随机 bug,而是注意力机制、Causal Mask、解码策略和数值精度在自回归生成中共同作用的结果。本文从 QKV 计算坍塌出发,解释 Attention Sink、Softmax 马太效应、Causal Mask 的退路切断、FP16 溢出路径和 KV Cache 污染,并给出从架构到运行时的多层防线。