惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
News and Events Feed by Topic
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Hugging Face - Blog
Hugging Face - Blog
S
SegmentFault 最新的问题
IT之家
IT之家
M
MIT News - Artificial intelligence
博客园_首页
aimingoo的专栏
aimingoo的专栏
C
Check Point Blog
B
Blog
人人都是产品经理
人人都是产品经理
爱范儿
爱范儿
宝玉的分享
宝玉的分享
Martin Fowler
Martin Fowler
L
LangChain Blog
Last Week in AI
Last Week in AI
Engineering at Meta
Engineering at Meta
Microsoft Security Blog
Microsoft Security Blog
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
F
Fortinet All Blogs
罗磊的独立博客
博客园 - 叶小钗
H
Help Net Security
Google Online Security Blog
Google Online Security Blog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
The Last Watchdog
The Last Watchdog
S
Security @ Cisco Blogs
Google DeepMind News
Google DeepMind News
Cyberwarzone
Cyberwarzone
月光博客
月光博客
C
Cybersecurity and Infrastructure Security Agency CISA
博客园 - 司徒正美
S
Schneier on Security
V
Vulnerabilities – Threatpost
T
Troy Hunt's Blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
博客园 - 【当耐特】
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Forbes - Security
Forbes - Security
D
Darknet – Hacking Tools, Hacker News & Cyber Security
雷峰网
雷峰网
Hacker News - Newest:
Hacker News - Newest: "LLM"
S
Secure Thoughts
V
Visual Studio Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
云风的 BLOG
云风的 BLOG
T
Tailwind CSS Blog
Security Archives - TechRepublic
Security Archives - TechRepublic
Hacker News: Ask HN
Hacker News: Ask HN
The GitHub Blog
The GitHub Blog

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解 【002】HTTPS 粗解:证书、TLS 握手与对后端配置的影响 Hermes Agent 一周暴涨五万 Star,但我劝你别急着追 明明连接的是Redis的DB0,为什么能查到DB3的数据? 【从0到1构建一个ClaudeAgent】协作-Agent团队 熟悉电子元器件之后,电子小白下一步该怎么走? MAF快速入门(23)通过C#类定义Skills .NET 高级开发 | 手写一个对象映射框架 FastAPI数据库ORM怎么选?我肝了三个Demo后,终于不再纠结了 mysqldump 参数拾遗:在遗忘与铭记之间 C# .NET 周刊|2026年3月5期 Claude code入门 - 陈彦斌 一文学习入门 ThingsBoard 开源物联网平台 GitHub 热门项目 | 2026年04月16日 如何为GIT设置全局勾子,为每次提交追加信息 Number.isFinite和isFinite与isNaN()和Number.isNaN的区别 PortSwigger SQL注入LAB2 推荐一个测试人必备的Skills,从功能到性能全搞定(附详细实操和安装下载方式) 筑基期:掌握Odoo基础核心知识点02(Odoo XML 开发方式详解) GLM模型这么火,咱们用vllm也咧一个呗! 深入理解 AbortController:从底层原理到跨语言设计哲学 字符串学习笔记 多租户系统框架的基础模块设计和分析设计 Apache SeaTunnel Zeta 为什么能做到“又快又稳”? AI开发-python-LangGraph框架(3-26-LangGraph基本概念及第一个简单样例) Vue 3 组件通信,别只会用 Props 和 Emits 了,这几个狠活儿你得看看 ElasticSearch7.X版本配置密码 用Manim实现动态交点计算--从一个动点问题说起 团结引擎+Addressable+Instant Game打包抖音小游戏 function call 实战:让 LLM 自动判断 pod 异常、调用日志工具并完成故障分析 bubseek —— 让 Agent 的足迹,变成团队的洞察 通过 C# 读取并导出 PDF 书签 如何用 GitHub Actions 实现 Steam 自动化发布 【从0到1构建一个ClaudeAgent】并发-后台任务 .NET 高级开发 | 定制 ASP.NET Core 框架 电子小白:什么是运算放大器(运放) zero2Agent:面向大厂面试的 Agent 工程教程,从概念到生产的完整学习路线 堆上的ORW HC32F460 USB CDC通信异常:非对齐访问异常排查 20260413-Hyperbridge 攻击事件:发生在默克尔山上的验证绕过 那些喊着AI 要淘汰你的人,正在靠你的焦虑赚大钱! 深度学习进阶(八)Swin Transformer 最小二乘问题详解19:带先验约束的增量式SFM优化与实现 SnapTranslate 3.0 正式发布:全局划词翻译 + 完整英语学习闭环,一站式搞定查词、记词、复习 工作的意义、工作的困难认知再思考 .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 开了 TUN 模式还是直连?90% 的人都踩过这个坑 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术
深度学习进阶(十一)Position-Sensitive RoI Pooling
哥布林学者 · 2026-04-24 · via 博客园_首页

上一篇中,我们已经解决了一个关键问题:

RoI Pooling 的误差主要来源于“坐标量化”,而 RoI Align 通过去除取整 + 双线性插值,有效缓解了这一问题。

但说到底,这只是一个对齐问题上的改进,我们在上篇的末尾也提到了新的方向:

能不能让采样过程,具备一定的结构感知能力?

实际上,早在 RoI Align 之前,就已经有方法具备了这一思路的雏形,那就是 Position-Sensitive RoI Pooling,可以直译为位置敏感的候选框池化,简称 PS RoI Pooling.

显然,其重点就在这个“位置敏感”上,下面就来详细展开:

1. RS RoI Pooling 的背景和思想

RS RoI Pooling 来源于 16 年提出的目标检测模型:R-FCN: Object Detection via Region-based Fully Convolutional Networks.

在这篇论文中,作者指出:

传统 RoI Pooling 的一个核心问题是:它们对空间信息“不敏感”。

展开来说,在 RoI Pooling 里,我们将原始图像输入网络,得到一个 feature map,其尺寸为:

\[H \times W \times C \]

根据基本的卷积知识,我们知道:这里的 C 个通道,本质上是学习得到的“语义滤波器”,比如某些通道对“边缘”敏感、某些对“纹理”敏感,而某些对“人脸整体”敏感等等。
简单来说就是:feature map 的一个通道对应一种提取出的特征。

但问题在于:

同一个通道,在左上角和右下角的“含义是一样的”。

再针对这句话展开,我们知道:在 CNN 里,一个通道不是随便来的,它对应的是同一个卷积核(filter)在整张图上滑动得到的响应
也就是说:同一个卷积核,在不同位置检测的是“同一种模式”,并不会受到空间位置的影响

比如某个通道学到了“检测眼睛”,那这个通道在 feature map 上的左上位置有高响应,就说明那里有“眼睛”、右下位置有高响应,就说明那里也有“眼睛”,它不会区分“这是左上还是右下”。

现在回到我们的任务:一个 RoI(假设为人脸),被分成 \(3 \times 3\)
根据认知,我们当然知道左上是眼睛、中间是鼻子、下方是嘴等分布。
但实际上 feature map 提供的其实是:

通道 意义
channel 5 “有没有眼睛”
channel 12 “有没有鼻子”
channel 27 “有没有嘴巴”

现在的矛盾点是:

通道本身不区分位置,但任务却要求“不同位置关注不同语义”。

如果网络要学习到上面的认知,就要依靠反向传播中不同区域的梯度分布,让网络隐式学习来实现。

关键来了,最终模型必须在同一套参数中同时学两件事

  1. 学语义建模:学习 channel 表示什么,如 channel 5 = 眼睛、channel 12 = 鼻子这类信息。
  2. 学空间对齐:学习这些语义在不同空间位置的“使用方式”,如左上区域更关注 channel 5,中间区域更关注 channel 12 等。

这两件事,本质上是可以解耦的,但现在却耦合在了一起。

而且在这种位置无关的特征表示下,不当的 Pooling 操作就会进一步压缩空间结构,使不同位置的语义差异被平均化,从而加剧信息混淆。

image.png

于是,RS RoI Pooling 的做法是:

把“位置”直接写进通道,用某个固定的通道来专门负责某个位置,实现“位置敏感”。

下面就来展开其详细逻辑:

2.PS RoI Pooling 的具体改进

在理解了“位置敏感”的核心思想之后,现在的问题就变成了:

如何在具体实现中,把“空间位置”编码进通道?

为此,PS RoI Pooling 的在 RoI Pooling 的框架下进行了两步关键改进:

  1. 构建位置敏感特征图
  2. 按位置进行通道选择并池化

下面就来逐个展开:

2.1 特征图处理

在传统的 RoI Pooling 中,负责从原始图像中提取通用特征的主干网络 backbone 输出的 feature map 会被直接用于后续操作。

但在 PS RoI Pooling 中,会多出一个关键步骤:

在原 feature map 上额外接一个 \(1 \times 1\) 卷积,用于生成“位置敏感特征图”。

假设 backbone 输出为:

\[H \times W \times C_{in} \]

而我们希望最终得到的 RoI 划分后 bin 的数量是:

\[k \times k \]

同时任务中有 \(C\) 个类别,那么这个 \(1 \times 1\) 卷积的输出通道数将被设计为:

\[C \times k \times k \]

也就是说,最终得到的特征图尺寸为:

\[H \times W \times (C \cdot k^2) \]

image

如图所示,这里的关键在于:

\(C \cdot k^2\) 个通道,是带有明确空间语义划分的通道。

我们可以将其按类别进行分组:每个类别有自己的 \(k \times k\) 个通道,并且每个通道对应 RoI 中的一个固定空间位置

举个例子,假设 \(k = 2\) ,当前类别为 “人”,那么该类别对应的 4 个通道,就可以理解为:

通道编号 语义
1 左上
2 右上
3 左下
4 右下

总结这一步的逻辑如下:

通过 \(1 \times 1\) 卷积,在不改变空间分辨率的前提下,对通道进行线性重组,使其具备位置语义。

2.2 通道池化

现在,我们完成了位置敏感特征图的构建,并且知道了每一个通道都对应于一个类别的 bin ,很容易想到这一步的改进:

每个 bin 不再使用“所有通道”,而是只使用“与自身位置对应的那一个通道”。

我们继续上一步的例子来说明:
此时对于“人”类别,我们已经得到了 4 个位置敏感通道:

bin 位置 对应通道
左上 \((0,0)\) channel 1
右上 \((0,1)\) channel 2
左下 \((1,0)\) channel 3
右下 \((1,1)\) channel 4

而到了这里,具体的池化逻辑是这样的:

每一个 bin 的特征计算,只在“对应的那一张位置敏感特征图”上进行,并且只取该 bin 区域的值,进行池化。

image

到在完成所有 \(k \times k\) 个 bin 的计算后,对每个类别,我们都会得到一个 \(k \times k\) 大小结构化的输出。

不同于原始 RoI Pooling ,现在的结果不再是“混合语义特征”,而是具有明确语义:每个空间位置对当前类别的独立响应。

实际上,原论文最后还有一步改进,就是将最后聚合的全连接层直接改为投票将所有位置的响应进行累加或平均,得到该类别的最终得分。

\[score_c = \sum_{i,j} y_c(i,j) \]

并不复杂,简单理解就是:在输出绑定空间位置的情况下,每个元素都有明确语义:局部判断,我们直接使用它们合成全局判断就好。不再多说了。

3.RS RoI Pooling 和 RoI Align

总结来说,RS RoI Pooling 通过对特征图通道数的设计实现了一种较原始的“内容感知”。
以此,我们再对比来看看 RoI Align 。

首先要说明的是时间线:RoI Align 的提出晚于 RS RoI Pooling 1 年。
R-FCN 在设计上也并未引入精细的几何对齐机制,而是通过通道绑定实现空间对齐。
而 RoI Align 的出现,则是因为在实例分割等任务中,像素级误差会显著影响边界质量。

这里很容易有这样一个想法:

看起来二者好像并不冲突,能不能就像 Adam组合MomentumRMSprop一样,合成二者得到更好的方法?

可惜,答案是否定的。
问题在于,这两种方法对“空间”有完全不同的定义。

PS RoI Pooling 实际上是在做一件事:把 RoI 内部的空间划分,直接绑定到通道结构上。
本质上来说,这种逻辑划分的空间结构是“离散的”,每个 bin 被确定在固定语义位置,通道划分明确。

而提出 RoI Align 的 Mask R-CNN 则相反: 空间必须保持连续性,任何离散化都会带来误差。
如果我们尝试“先 RoI Align,再 PS Pooling”,会导致通道和空间位置的硬绑定关系被破坏。因为插值之后,一个位置的特征就会来自多个邻域,不再严格属于某一个空间 bin。
反过来,如果“先 PS Pooling 再 Align”空间已经被映射到通道,再做几何插值虽然可以实现,但现在的特征已经不再依靠“连续性”了,意义不大。
image.png

因此,在实际工程中,二者往往不会一起使用。

于此同时,这两种方法虽然分别优化了不同问题,但也都存在各自局限:

  • RS RoI Pooling:虽然实现了初版的“内容感知”,但结构仍是人为固定划分的
  • RoI Align:几何对齐也是手工设计的插值规则

也就是说:采样规则和结构仍然是静态的,并不能“自适应”不同的内容。
自然而然地,一种最符合深度学习思想的逻辑出现了:

如果空间结构本身是复杂变化的,那能不能让“采样方式”也变成可学习的?

这便是下一篇内容。