惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

爱范儿
爱范儿
博客园 - 叶小钗
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
腾讯CDC
S
SegmentFault 最新的问题
D
DataBreaches.Net
Hugging Face - Blog
Hugging Face - Blog
L
LangChain Blog
Recent Announcements
Recent Announcements
阮一峰的网络日志
阮一峰的网络日志
N
Netflix TechBlog - Medium
大猫的无限游戏
大猫的无限游戏
M
MIT News - Artificial intelligence
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 三生石上(FineUI控件)
F
Fortinet All Blogs
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Martin Fowler
Martin Fowler
雷峰网
雷峰网
J
Java Code Geeks
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
小众软件
小众软件
云风的 BLOG
云风的 BLOG
T
Tailwind CSS Blog

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12)
深度学习进阶(十九)相对位置编码 RPE
哥布林学者 · 2026-05-09 · via 博客园_首页

上一篇我们介绍了坐标注意力 CA,它通过沿两个方向分别池化来保留空间位置信息。

同样,我们可以总结一下它实现混合注意力的逻辑:

CA 的做法本质上是一种隐式编码,它通过池化整合空间特征,学习权重并注入的逻辑让模型间接感知到空间信息,实现混合注意力。

如果再站高点,我们会发现一个更基础的问题:

模型究竟应该如何表达空间信息?

在 CNN 路线中,这一问题通过卷积与池化的结构归纳被隐式解决。
而在之前的 Transformer 路线中,则通过位置编码 PE 将位置信息显式注入到特征表示中。

现在,我们再回到 Transformer 路线的位置编码演化中:
从原始 Transformer 的正余弦固定编码,到 ViT 的可学习位置编码,虽然更加灵活,但其根本逻辑是相通的:

PE 描述的是“每个位置是什么”,而不是“位置之间是什么关系”。

也就是说,这是一种绝对位置编码,这在 NLP 中存在优化空间,当扩展到二维的 CV 任务中,更出现了新的局限性:

在视觉中,"绝对位置"的语义本身就是不稳定的。同一只猫,在图像左上角和右下角,它的绝对位置编码完全不同,但网络应该以相同的逻辑去处理它。

卷积的设计只关注相对位置,因此规避了这一问题,而 Transformer 的解决方案就是:相对位置编码(Relative Position Encoding,RPE)

实际上,在之前的 Swin 中 RPE 的逻辑就已经被应用,这几篇展开 RPE 的相关逻辑,串联之前的 Swin,作为之后的混合架构的前置内容

1. RPE

18 年的论文: Self-Attention with Relative Position Representations首次将相对位置编码引入了 Transformer 的自注意力机制,它的核心思路是这样的:

在注意力计算过程中额外引入两组可学习的向量 \(\mathbf{r}^K, \mathbf{r}^V\),分别用于修改 key 和 value 的表示。

分点展开如下:

1.1 相对位置参数表

显然, \(\mathbf{r}^K\)\(\mathbf{r}^V\) 不是凭空出现,我们为其定义了分别定义了一个相对位置参数表
具体来说,假设我们限制最大相对距离\(L\)(比如 -10 到 +10),那么模型会定义两个参数表:

  1. Key 相对位置表:\(\mathbf{R}^K \in \mathbb{R}^{(2L+1)\times d_k}\)
  2. Value 相对位置表:\(\mathbf{R}^V \in \mathbb{R}^{(2L+1)\times d_v}\)

不难理解,\(2L+1\) 就是最大相对距离里的各种取值可能,\(d\) 就是表示维度。
现在,对任意两个 token:

\[\text{query}:i \quad \text{key}:j \]

计算相对距离为:

\[r = j - i \]

超过范围就会截断或边界共享,然后查表:

\[\mathbf{r}^K_{j-i} = \mathbf{R}^K[r] \]

\[\mathbf{r}^V_{j-i} = \mathbf{R}^V[r] \]

这就是两组可学习的向量的由来。而它们各自的语义是这样的:

  1. \(\mathbf{r}^K\) : 控制“注意力权重偏置”。
  2. \(\mathbf{r}^V\) : 控制“信息内容偏移”。

image.png
下面就展开结构,看看如何实现这两组参数的语义。

1.2 加入到注意力打分中的 \(\mathbf{r}^K\)

在标准注意力里,打分函数是:

\[e_{ij} = \frac{\mathbf{q}_i \cdot \mathbf{k}_j}{\sqrt{d_k}} \]

加法型 RPE 的第一步,是把 key 改写成:

\[\mathbf{k}_j \rightarrow \mathbf{k}_j + \mathbf{r}^K_{j-i} \]

代入后得到:

\[e_{ij} = \frac{\mathbf{q}_i \cdot (\mathbf{k}_j + \mathbf{r}^K_{j-i})}{\sqrt{d_k}} \]

展开后的结构是这样的:

\[e_{ij} = \frac{\mathbf{q}_i \cdot \mathbf{k}_j}{\sqrt{d_k}} + \frac{\mathbf{q}_i \cdot \mathbf{r}^K_{j-i}}{\sqrt{d_k}} \]

显然,原本的注意力分数只反应“语义相似度”,而现在又多了一项“距离相关性”。

1.3 加入聚合计算中的 \(\mathbf{r}^V\)

\(\mathbf{r}^K\) 作用在权重计算阶段,而 \(\mathbf{r}^V\) 作用在信息聚合阶段。

已知得到注意力权重后,聚合信息的标准输出为:

\[\mathbf{z}_i = \sum_j \alpha_{ij} \mathbf{v}_j \]

现在,加法型 RPE 将 value 改写为:

\[\mathbf{v}_j \rightarrow \mathbf{v}_j + \mathbf{r}^V_{j-i} \]

于是输出变成了:

\[\mathbf{z}_i = \sum_j \alpha_{ij} (\mathbf{v}_j + \mathbf{r}^V_{j-i}) \]

我们知道 value 本身的语义是 token 携带的真实信息, \(\mathbf{r}^V\) 在这里与其加和,就是在注入学习得到的相对位置信息。

总结来说,最初的 RPE 的核心逻辑是这样的:

建模相对距离,在 K/V 表示空间中注入“相对位置向量偏置”,让注意力从“内容函数”变成“内容 + 位置函数”。

2. RPE 的局限

在最初的 RPE 逻辑中,所有位置信息只能以“线性加法”的方式影响注意力,无法形成更复杂的非线性交互
而且其依赖固定长度的相对位置表 \(\mathbf{R}^K, \mathbf{R}^V\),当序列长度超出训练范围时只能截断或共享边界 embedding,导致外推能力较弱。

于是,在 RPE 提出后,就出现了分裂式的发展趋势,其中有简要的结构增强,有从一维到二维的推广,还有重构式的新型设计,涉及方向较广,我们以时间线顺序在后几篇展开。