惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

罗磊的独立博客
S
Secure Thoughts
C
Check Point Blog
D
DataBreaches.Net
V
V2EX
The GitHub Blog
The GitHub Blog
博客园 - Franky
博客园_首页
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Y
Y Combinator Blog
Last Week in AI
Last Week in AI
H
Help Net Security
WordPress大学
WordPress大学
酷 壳 – CoolShell
酷 壳 – CoolShell
宝玉的分享
宝玉的分享
A
About on SuperTechFans
月光博客
月光博客
Google DeepMind News
Google DeepMind News
小众软件
小众软件
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
F
Fortinet All Blogs
Blog — PlanetScale
Blog — PlanetScale
T
Tailwind CSS Blog
N
Netflix TechBlog - Medium
GbyAI
GbyAI
G
Google Developers Blog
P
Proofpoint News Feed
Recorded Future
Recorded Future
C
CXSECURITY Database RSS Feed - CXSecurity.com
MyScale Blog
MyScale Blog
T
Threatpost
V
Vulnerabilities – Threatpost
AI
AI
Cyberwarzone
Cyberwarzone
B
Blog RSS Feed
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
L
LINUX DO - 最新话题
L
LangChain Blog
Webroot Blog
Webroot Blog
AWS News Blog
AWS News Blog
云风的 BLOG
云风的 BLOG
W
WeLiveSecurity
Latest news
Latest news
U
Unit 42
C
CERT Recently Published Vulnerability Notes
Cisco Talos Blog
Cisco Talos Blog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
S
Security @ Cisco Blogs
Forbes - Security
Forbes - Security

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12) Snack JSONPath 项目架构分析 Claude Code Buddy 小析:一个非核心功能,如何体现产品的细节完成度 AI新时代下的图床管理方案-Cloudflare图床+MCP+Skills方案指南 化繁为简:顺丰速运App如何通过 HarmonyOS SDK实现专业级空间测量 从零实现富文本编辑器#13-React非编辑节点的内容渲染 AI开发-python-langchain框架(3-23-OpenAI Functions风格Tool Calling智能助手) .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut PbootCMS 网站内容数量多导致访问慢?这些实用优化方案帮你提速! - 家兴网络技术工作室 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 网站漏洞怎么发现并修复?一篇实用指南(附完整流程) - 家兴网络技术工作室 开了 TUN 模式还是直连?90% 的人都踩过这个坑 Github日报|2026年04月12日 - AI一族 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术 Etsy 把 1000 个 MySQL 分片迁进 Vitess:425TB 数据背后的真正问题不是性能,而是运维规模 MicroPython LVGL基础知识和概念:底层渲染与性能优化 - FreakStudio 数据库草图算法 Python 潮流周刊#146:CPython 引入 Rust 的进展 - 豌豆花下猫 最小生成树 - mofei1116 红日靶场七:从外网入口、容器逃逸到 AD 接管的完整利用链复盘 - YouDiscovered1t 分享四款开源且实用的 Kafka 管理工具 - 追逐时光者 vLLM 权重加载机制全解析:从挑战到理想架构 LCT 学习笔记 - ACehomoxue Avalonia UI 12.0.0 正式发布:架构演进和性能飞跃 - 张善友 当 AI Agent 把调用链拉长,延迟开始成为一门生意 conhost.exe 无法显示 U+2717 - 145a 太秀了,我把自己蒸馏成了 Skill!已开源 - 程序员鱼皮 ASP.NET Core 内存缓存实战:一篇搞懂该怎么配、怎么避坑 基于 Ghostty 带有分割标签页和为 Claude 编程设计的通知终端 - BugShare AI 焊死入口:教育的“操作系统级”重塑 - 郝hai 初级Java开发工程师使用sql脚本编写代码的过程是简单而且不糊涂 - CoderOilStation Claude Code通关手册(六):MCP协议完全指南 - 暮色之狐 边框灯光环绕动画特效实现指南 - Newbe36524 开源:子木蒸馏版的 SEO 审计工具 seo-audit-skill v1.0 我所理解的Python元模型 【从0到1构建一个ClaudeAgent】规划与协调-TodoWrite - 程序员Seven Claude 和 Codex 在审计 Skill 上性能差异探究 - ACai_sec AScript如何实现中文脚本引擎 - rockey627 【渗透测试】HTB Season10 Garfield 全过程wp - dynasty_chenzi Android 开发者为什么必须掌握 AI 能力?端侧视角下的技术变革 树状数组正确性证明 - AC-wyr 你的 AI 焦虑,可能比 AI 本身更危险——ATM 机没有消灭银行柜员,但恐慌消灭了你的判断力 - 我没有三颗心脏 一个拉胯的分库分表方案有多绝望?整个部门都在救火! - 冰河团队 动态规划入门必学之走方格问题 - Ofnoname PostgREST 与 PostgreSQL 角色权限配置全解析(生产级实践) - SheepDog1998 使用 UEFI 图形输出协议 GOP 在屏幕上显示图像的方法 - 阿源- Claude Code通关手册(五):组建你的AI专家团队,子代理系统 - 暮色之狐 一个程序员到架构师的催婚路之感悟(整整10年后的催婚相亲感悟) - MisterLip 用 Agent Skill 自动生成工作周报 - 赵康
深度学习进阶(十一)Position-Sensitive RoI Pooling
哥布林学者 · 2026-04-24 · via 博客园_首页

上一篇中,我们已经解决了一个关键问题:

RoI Pooling 的误差主要来源于“坐标量化”,而 RoI Align 通过去除取整 + 双线性插值,有效缓解了这一问题。

但说到底,这只是一个对齐问题上的改进,我们在上篇的末尾也提到了新的方向:

能不能让采样过程,具备一定的结构感知能力?

实际上,早在 RoI Align 之前,就已经有方法具备了这一思路的雏形,那就是 Position-Sensitive RoI Pooling,可以直译为位置敏感的候选框池化,简称 PS RoI Pooling.

显然,其重点就在这个“位置敏感”上,下面就来详细展开:

1. RS RoI Pooling 的背景和思想

RS RoI Pooling 来源于 16 年提出的目标检测模型:R-FCN: Object Detection via Region-based Fully Convolutional Networks.

在这篇论文中,作者指出:

传统 RoI Pooling 的一个核心问题是:它们对空间信息“不敏感”。

展开来说,在 RoI Pooling 里,我们将原始图像输入网络,得到一个 feature map,其尺寸为:

\[H \times W \times C \]

根据基本的卷积知识,我们知道:这里的 C 个通道,本质上是学习得到的“语义滤波器”,比如某些通道对“边缘”敏感、某些对“纹理”敏感,而某些对“人脸整体”敏感等等。
简单来说就是:feature map 的一个通道对应一种提取出的特征。

但问题在于:

同一个通道,在左上角和右下角的“含义是一样的”。

再针对这句话展开,我们知道:在 CNN 里,一个通道不是随便来的,它对应的是同一个卷积核(filter)在整张图上滑动得到的响应
也就是说:同一个卷积核,在不同位置检测的是“同一种模式”,并不会受到空间位置的影响

比如某个通道学到了“检测眼睛”,那这个通道在 feature map 上的左上位置有高响应,就说明那里有“眼睛”、右下位置有高响应,就说明那里也有“眼睛”,它不会区分“这是左上还是右下”。

现在回到我们的任务:一个 RoI(假设为人脸),被分成 \(3 \times 3\)
根据认知,我们当然知道左上是眼睛、中间是鼻子、下方是嘴等分布。
但实际上 feature map 提供的其实是:

通道 意义
channel 5 “有没有眼睛”
channel 12 “有没有鼻子”
channel 27 “有没有嘴巴”

现在的矛盾点是:

通道本身不区分位置,但任务却要求“不同位置关注不同语义”。

如果网络要学习到上面的认知,就要依靠反向传播中不同区域的梯度分布,让网络隐式学习来实现。

关键来了,最终模型必须在同一套参数中同时学两件事

  1. 学语义建模:学习 channel 表示什么,如 channel 5 = 眼睛、channel 12 = 鼻子这类信息。
  2. 学空间对齐:学习这些语义在不同空间位置的“使用方式”,如左上区域更关注 channel 5,中间区域更关注 channel 12 等。

这两件事,本质上是可以解耦的,但现在却耦合在了一起。

而且在这种位置无关的特征表示下,不当的 Pooling 操作就会进一步压缩空间结构,使不同位置的语义差异被平均化,从而加剧信息混淆。

image.png

于是,RS RoI Pooling 的做法是:

把“位置”直接写进通道,用某个固定的通道来专门负责某个位置,实现“位置敏感”。

下面就来展开其详细逻辑:

2.PS RoI Pooling 的具体改进

在理解了“位置敏感”的核心思想之后,现在的问题就变成了:

如何在具体实现中,把“空间位置”编码进通道?

为此,PS RoI Pooling 的在 RoI Pooling 的框架下进行了两步关键改进:

  1. 构建位置敏感特征图
  2. 按位置进行通道选择并池化

下面就来逐个展开:

2.1 特征图处理

在传统的 RoI Pooling 中,负责从原始图像中提取通用特征的主干网络 backbone 输出的 feature map 会被直接用于后续操作。

但在 PS RoI Pooling 中,会多出一个关键步骤:

在原 feature map 上额外接一个 \(1 \times 1\) 卷积,用于生成“位置敏感特征图”。

假设 backbone 输出为:

\[H \times W \times C_{in} \]

而我们希望最终得到的 RoI 划分后 bin 的数量是:

\[k \times k \]

同时任务中有 \(C\) 个类别,那么这个 \(1 \times 1\) 卷积的输出通道数将被设计为:

\[C \times k \times k \]

也就是说,最终得到的特征图尺寸为:

\[H \times W \times (C \cdot k^2) \]

image

如图所示,这里的关键在于:

\(C \cdot k^2\) 个通道,是带有明确空间语义划分的通道。

我们可以将其按类别进行分组:每个类别有自己的 \(k \times k\) 个通道,并且每个通道对应 RoI 中的一个固定空间位置

举个例子,假设 \(k = 2\) ,当前类别为 “人”,那么该类别对应的 4 个通道,就可以理解为:

通道编号 语义
1 左上
2 右上
3 左下
4 右下

总结这一步的逻辑如下:

通过 \(1 \times 1\) 卷积,在不改变空间分辨率的前提下,对通道进行线性重组,使其具备位置语义。

2.2 通道池化

现在,我们完成了位置敏感特征图的构建,并且知道了每一个通道都对应于一个类别的 bin ,很容易想到这一步的改进:

每个 bin 不再使用“所有通道”,而是只使用“与自身位置对应的那一个通道”。

我们继续上一步的例子来说明:
此时对于“人”类别,我们已经得到了 4 个位置敏感通道:

bin 位置 对应通道
左上 \((0,0)\) channel 1
右上 \((0,1)\) channel 2
左下 \((1,0)\) channel 3
右下 \((1,1)\) channel 4

而到了这里,具体的池化逻辑是这样的:

每一个 bin 的特征计算,只在“对应的那一张位置敏感特征图”上进行,并且只取该 bin 区域的值,进行池化。

image

到在完成所有 \(k \times k\) 个 bin 的计算后,对每个类别,我们都会得到一个 \(k \times k\) 大小结构化的输出。

不同于原始 RoI Pooling ,现在的结果不再是“混合语义特征”,而是具有明确语义:每个空间位置对当前类别的独立响应。

实际上,原论文最后还有一步改进,就是将最后聚合的全连接层直接改为投票将所有位置的响应进行累加或平均,得到该类别的最终得分。

\[score_c = \sum_{i,j} y_c(i,j) \]

并不复杂,简单理解就是:在输出绑定空间位置的情况下,每个元素都有明确语义:局部判断,我们直接使用它们合成全局判断就好。不再多说了。

3.RS RoI Pooling 和 RoI Align

总结来说,RS RoI Pooling 通过对特征图通道数的设计实现了一种较原始的“内容感知”。
以此,我们再对比来看看 RoI Align 。

首先要说明的是时间线:RoI Align 的提出晚于 RS RoI Pooling 1 年。
R-FCN 在设计上也并未引入精细的几何对齐机制,而是通过通道绑定实现空间对齐。
而 RoI Align 的出现,则是因为在实例分割等任务中,像素级误差会显著影响边界质量。

这里很容易有这样一个想法:

看起来二者好像并不冲突,能不能就像 Adam组合MomentumRMSprop一样,合成二者得到更好的方法?

可惜,答案是否定的。
问题在于,这两种方法对“空间”有完全不同的定义。

PS RoI Pooling 实际上是在做一件事:把 RoI 内部的空间划分,直接绑定到通道结构上。
本质上来说,这种逻辑划分的空间结构是“离散的”,每个 bin 被确定在固定语义位置,通道划分明确。

而提出 RoI Align 的 Mask R-CNN 则相反: 空间必须保持连续性,任何离散化都会带来误差。
如果我们尝试“先 RoI Align,再 PS Pooling”,会导致通道和空间位置的硬绑定关系被破坏。因为插值之后,一个位置的特征就会来自多个邻域,不再严格属于某一个空间 bin。
反过来,如果“先 PS Pooling 再 Align”空间已经被映射到通道,再做几何插值虽然可以实现,但现在的特征已经不再依靠“连续性”了,意义不大。
image.png

因此,在实际工程中,二者往往不会一起使用。

于此同时,这两种方法虽然分别优化了不同问题,但也都存在各自局限:

  • RS RoI Pooling:虽然实现了初版的“内容感知”,但结构仍是人为固定划分的
  • RoI Align:几何对齐也是手工设计的插值规则

也就是说:采样规则和结构仍然是静态的,并不能“自适应”不同的内容。
自然而然地,一种最符合深度学习思想的逻辑出现了:

如果空间结构本身是复杂变化的,那能不能让“采样方式”也变成可学习的?

这便是下一篇内容。