























Transformer模型如何成为AI领域的'翻译官'?本文用生动比喻揭秘自注意力、多头机制等核心原理,带你读懂这个支撑GPT、BERT等大模型的技术底座。从词袋处理到位置编码,从并行计算到远距关联,你将看到现代AI如何突破传统RNN的局限,同时直面数据饥渴与算力消耗的双重挑战。

让我给你讲一个故事。
这个故事的主角是一位翻译官,名叫 Transformer(小T)。
他的工作是把一本英文小说翻译成中文。
小T接到一个句子:
“The cat chased the mouse, but it was too fast.”
他知道“it”可能指“猫”,也可能指“老鼠”。
普通翻译官(比如RNN)是一个词一个词地读,读到后面“it”时,脑子里对前面“cat”和“mouse”的记忆已经模糊了,容易翻译错。
但小T不一样。
他不是按顺序读,而是一眼把整句话全看进眼里,然后同时问自己:
“这句话里每个词,和其他所有词有什么关系?”
——这叫自注意力。
小T有一种超能力:他可以把每个词变成三种卡片:
当他想知道“it”是指谁时:
结果:
于是,“it”的最终理解里,80%是猫的信息,20%是老鼠的信息。
——这就是自注意力。
小T一个人不够。
因为语言太复杂了——“it”和“cat”是指代关系,但这句话里还有主谓结构、时态、否定……
所以小T召唤了8个分身:
每个分身都用自己的Q/K/V卡片做一遍自注意力。
最后,8个分身把结果拼在一起,再压缩成一个完整的理解。
——这叫多头注意力。
小T有个弱点:他是一眼全看的,他不知道“猫追老鼠”和“老鼠追猫”有什么区别——在他眼里,词袋而已。
所以他需要位置编码。
这就像给每个词发一张座位票:
座位票是用sin/cos函数画的特殊图案,每个座位图案独一无二。
词嵌入向量 + 座位票向量 = 小T真正看到的输入。
——于是他终于能分清顺序了。
小T的大脑由6层编码器堆叠而成(原版是6层)。
每一层做两件事:
每一层都有一条高速公路(残差连接),让原始信息也能直达下一层,防止信息丢失。
最后一层编码器输出的是整个句子的深层理解——把它打包成两份文件:K大全和V大全,交给翻译部门。
小T还有一个解码器团队,负责生成中文翻译。
他们的工作方式很特殊:
解码器也在看自己已经翻译出来的中文词。
但它有一个规矩:不能看未来的词。
比如它已经翻译出“那只猫”,正在准备翻译第三个词。
它只能看“那只”“猫”,不能偷看后面的词。
怎么办?
在算亲密值时,把未来位置的分数全打成负数(相当于戴眼罩),softmax之后它们都是0。
——这叫掩码自注意力。
翻译到第三个词时,解码器不仅要看已翻译的中文,还要回头看看英文原文。
于是它把自己的Q卡拿出来,和编码器给的K大全做点积,找到英文里哪些词和自己现在要翻译的词最相关。
再用这些权重去加权编码器给的V大全,把原文的相关信息提取过来。
——这叫编码器-解码器注意力。
解码器是自回归的:
每一步它都从词表里挑一个最可能的词。
挑法有两种:
小T为什么这么牛?
小T也有烦恼
现在全世界都在养小T:
而且小T不仅能翻译文字,还能看图(ViT)、听音、分析蛋白质……
万物皆可Transformer。
故事讲完了。
你现在知道了:
这就是 Transformer——现代人工智能最会讲故事的翻译官。
本文由 @Sheila 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。