惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
V2EX
PCI Perspectives
PCI Perspectives
Webroot Blog
Webroot Blog
Help Net Security
Help Net Security
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
Hacker News: Ask HN
Hacker News: Ask HN
Security Latest
Security Latest
P
Palo Alto Networks Blog
Spread Privacy
Spread Privacy
S
Securelist
V2EX - 技术
V2EX - 技术
Schneier on Security
Schneier on Security
P
Proofpoint News Feed
Application and Cybersecurity Blog
Application and Cybersecurity Blog
Forbes - Security
Forbes - Security
N
News | PayPal Newsroom
Cyberwarzone
Cyberwarzone
C
Cisco Blogs
Cloudbric
Cloudbric
GbyAI
GbyAI
A
About on SuperTechFans
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
Vercel News
Vercel News
P
Proofpoint News Feed
SecWiki News
SecWiki News
T
Tailwind CSS Blog
腾讯CDC
C
Cybersecurity and Infrastructure Security Agency CISA
The Hacker News
The Hacker News
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
M
MIT News - Artificial intelligence
爱范儿
爱范儿
Microsoft Azure Blog
Microsoft Azure Blog
T
Troy Hunt's Blog
G
Google Developers Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Cisco Talos Blog
Cisco Talos Blog
D
DataBreaches.Net
V
Vulnerabilities – Threatpost
博客园 - 叶小钗
C
Check Point Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Know Your Adversary
Know Your Adversary
T
Tor Project blog
Google DeepMind News
Google DeepMind News
F
Fortinet All Blogs
Y
Y Combinator Blog
H
Help Net Security
Latest news
Latest news

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解 【002】HTTPS 粗解:证书、TLS 握手与对后端配置的影响 Hermes Agent 一周暴涨五万 Star,但我劝你别急着追 明明连接的是Redis的DB0,为什么能查到DB3的数据? 【从0到1构建一个ClaudeAgent】协作-Agent团队 熟悉电子元器件之后,电子小白下一步该怎么走? MAF快速入门(23)通过C#类定义Skills .NET 高级开发 | 手写一个对象映射框架 FastAPI数据库ORM怎么选?我肝了三个Demo后,终于不再纠结了 mysqldump 参数拾遗:在遗忘与铭记之间 C# .NET 周刊|2026年3月5期 Claude code入门 - 陈彦斌 一文学习入门 ThingsBoard 开源物联网平台 GitHub 热门项目 | 2026年04月16日 如何为GIT设置全局勾子,为每次提交追加信息 Number.isFinite和isFinite与isNaN()和Number.isNaN的区别 PortSwigger SQL注入LAB2 推荐一个测试人必备的Skills,从功能到性能全搞定(附详细实操和安装下载方式) 筑基期:掌握Odoo基础核心知识点02(Odoo XML 开发方式详解) GLM模型这么火,咱们用vllm也咧一个呗! 深入理解 AbortController:从底层原理到跨语言设计哲学 字符串学习笔记 多租户系统框架的基础模块设计和分析设计 Apache SeaTunnel Zeta 为什么能做到“又快又稳”? AI开发-python-LangGraph框架(3-26-LangGraph基本概念及第一个简单样例) Vue 3 组件通信,别只会用 Props 和 Emits 了,这几个狠活儿你得看看 ElasticSearch7.X版本配置密码 用Manim实现动态交点计算--从一个动点问题说起 团结引擎+Addressable+Instant Game打包抖音小游戏 function call 实战:让 LLM 自动判断 pod 异常、调用日志工具并完成故障分析 bubseek —— 让 Agent 的足迹,变成团队的洞察 通过 C# 读取并导出 PDF 书签 如何用 GitHub Actions 实现 Steam 自动化发布 【从0到1构建一个ClaudeAgent】并发-后台任务 .NET 高级开发 | 定制 ASP.NET Core 框架 电子小白:什么是运算放大器(运放) zero2Agent:面向大厂面试的 Agent 工程教程,从概念到生产的完整学习路线 堆上的ORW HC32F460 USB CDC通信异常:非对齐访问异常排查 20260413-Hyperbridge 攻击事件:发生在默克尔山上的验证绕过 那些喊着AI 要淘汰你的人,正在靠你的焦虑赚大钱! 深度学习进阶(八)Swin Transformer 最小二乘问题详解19:带先验约束的增量式SFM优化与实现 SnapTranslate 3.0 正式发布:全局划词翻译 + 完整英语学习闭环,一站式搞定查词、记词、复习 工作的意义、工作的困难认知再思考 .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 开了 TUN 模式还是直连?90% 的人都踩过这个坑 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术
深度学习进阶(九)池化技术的初步改进:RoI Pooling
哥布林学者 · 2026-04-19 · via 博客园_首页

上一篇里,我们已经完整介绍了 Swin Transformer 的模型逻辑,知道了:Swin Transformer 的核心,并不是简单地“模仿 CNN”,而是在保留归纳偏置的同时,让建模方式更加灵活。

换句话说,它做的事情是:

在“约束”与“自由”之间找到一个平衡点。

而在上一篇的末尾,我们也提到:当 Swin 在学习“约束”的同时,CNN 也在学习“自由”。

实际上,CNN 体系内部早就已经出现了这种“让结构变得更灵活”的趋势并发展出了繁多的落地技术。
因此,在正式展开“ CNN 的 Transformer 化 ” 前,为了不让内容过于割裂,还需要展开一些前置内容,引入一些 CNN 内的一些相关改进来简单过渡
本篇的内容关于池化技术的初步改进:RoI Pooling

1. 基本池化 Pooling

先回顾一下最基本的池化操作,以最常见的最大池化(Max Pooling)为例:

\[y(i,j) = \max_{(m,n)\in \mathcal{R}} x(i+m, j+n) \]

这里的 \(\mathcal{R}\) 表示池化窗口,我们用最大池化来筛选“最强响应”。

此外,还可以使用平均池化来保留“整体信息”:

\[y(i,j) = \frac{1}{|\mathcal{R}|} \sum_{(m,n)\in \mathcal{R}} x(i+m, j+n) \]

不再展开过多细节,这里附上我们之前介绍池化的内容:池化操作与卷积中的反向传播

总的来说,Pooling 的本质是通过下采样来压缩信息,从而减少计算量。
同时,由于其在局部窗口内进行聚合,它实际上引入了一种重要的归纳偏置:

局部不变性先验:在小范围内的变化不会显著影响输出。

也正因为这一点,在不显著改变语义的前提下,Pooling 还可以间接扩大后续网络的感受野。

当然,最基础的 Pooling 也存在明显的局限:

采样位置是完全固定的。

换句话说,它的行为是“刚性的”:窗口位置固定、采样方式固定、不随输入内容发生变化。
总结一下就是不够灵活,这在分类任务中通常问题不大,但在目标检测等任务中就会变得非常明显。
比如目标刚好落在池化窗口边界或发生轻微形变或偏移,此时的 Pooling 可能会丢失部分关键信息甚至直接削弱目标响应。

问题的关键在于:

Pooling 仍然是在“整张特征图上使用统一规则”,但有时我们真正关心的是“某一个局部目标”。

因此,Pooling 的第一步改进就出现在检测任务中,我们继续。

2. Region of Interest Pooling

Region of Interest Pooling 简称 RoI Pooling,它起源于 15 年的论文:Fast R-CNN
Fast R-CNN 是一个目标检测模型,它首次系统性提出了 RoI Pooling,用于将任意大小的候选框映射为固定尺寸特征。

同样,如果你对检测任务本身的相关概念有些遗忘了,可以在这里回顾:目标定位与特征点检测
首先要说明的是,Fast R-CNN 并不像现在主流的 YOLO 一样是端到端模型,它的目标检测逻辑是先使用物理方法得到候选框,再把候选框映射输入网络进行分类,是一个两阶段模型。
我们具体展开其逻辑如下:

2.1 候选框映射

image.png
如图所示,第一步就是把物理方法生成的候选框在原图中的相对位置映射到原图卷积后得到的特征图上。

这个映射本质上依赖于一个非常关键的参数: 空间缩放比例(spatial scale)
如果原图尺寸为 \(H \times W\),特征图尺寸为 \(H' \times W'\),那么:

\[\text{scale}_x = \frac{W'}{W}, \quad \text{scale}_y = \frac{H'}{H} \]

假设原图上的 RoI 为:

\[(x_1, y_1, x_2, y_2) \]

\((x_1, y_1)\)左上角坐标\((x_2, y_2)\)右下角坐标
那么映射后就是:

\[x_1' = x_1 \cdot \text{scale}_x,\quad y_1' = y_1 \cdot \text{scale}_y \]

\[x_2' = x_2 \cdot \text{scale}_x,\quad y_2' = y_2 \cdot \text{scale}_y \]

我们再看看图里的实例:

  • 原图:\(128 \times 128\)
  • feature map:\(6 \times 6\)
    则:

\[\text{scale} = \frac{6}{128} \approx 0.046875 \]

假设原图中有一个候选框:

\[(32,\ 32,\ 96,\ 96) \]

映射到 feature map:

\(x_1\) 32 \(32 \times \frac{6}{128}\)\(1.5\)\(y_1\) 32 \(32 \times \frac{6}{128}\)\(1.5\)\(x_2\) 96 \(96 \times \frac{6}{128}\)\(4.5\)\(y_2\) 96 \(96 \times \frac{6}{128}\)\(4.5\)
坐标 原图值 计算公式 feature map 值

所以得到:

\[(1.5,\ 1.5,\ 4.5,\ 4.5) \]

这里就有一个问题:要不要取整?
RoI Pooling(Fast R-CNN 原始做法) 中,会进行直接取整,具体如下:

  • 左上角:向下取整 \(\lfloor x_1' \rfloor\)
  • 右下角:向上取整 \(\lceil x_2' \rceil\)

逻辑还是比较清晰的:扩大一点范围,保证不漏。 但同样,这也带来了误差。
由此得到最终结果:

\[(1.5,1.5,4.5,4.5) \rightarrow (1,1,5,5) \]

这就是 RoI Pooling 的第一步。

2.2 划分子区域

现在,我们得到了将候选框映射到特征图中的区域,下一步是把该区域划分为 \(k \times k\) 个子区域。
image.png

要说明的是,这里并不是把区域切成 \(k \times k\) 个正方形,而是按宽和高分别等分,形成网格
对最终划分好的每个子网格,我们就叫它一个 bin

展开来说,设当前 RoI 为:

\[(x_1', y_1', x_2', y_2') \]

则:

\[w = x_2' - x_1', \quad h = y_2' - y_1' \]

划分为 \(k \times k\) 后,一个 bin 的尺寸就是:

\[bin_{width} = \frac{w}{k},\quad bin_{height} = \frac{h}{k} \]

继续上一节的例子:

\[(1,\ 1,\ 5,\ 5) \]

所以:

\[w = 4,\quad h = 4 \]

\(k = 2\) 则:

\[bin_{width} = 2,\quad bin_{height} = 2 \]

但实际上,这只是一种最理想的请况,新的问题是:

候选框不是正方形怎么办?最终 bin 的尺寸不是整数怎么办?

第一个问题只要跳出思维定视就好,答案是:一样切
关键在于第二个问题:
image.png
如图所示,在真实情况下:

\[\frac{w}{k},\ \frac{h}{k} \]

很可能不是整数。
例如图中的:

\[h = 5,\ k = 2 \Rightarrow bin_{height} = 2.5 \]

而原始 RoI Pooling 给出的答案是和上部分是一样的:

每个 bin 的边界都会再次取整。

其实现方式是,对于每一个方向

  • 起点:向下取整 \(\lfloor \cdot \rfloor\)
  • 终点:向上取整 \(\lceil \cdot \rceil\)

例如两 bin 的高度方向

  • bin1:

\[[0,\ 2.5] \rightarrow [0,\ 3] \]

  • bin2:

\[[2.5,\ 5.0] \rightarrow [2,\ 5] \]

这里的关键点是:RoI Pooling 的 bin 划分是在连续空间完成的,而取整是在每个 bin 内独立进行的。

但这种取整策略也会带来相应的问题:
image.png
因此,这种取整策略便让 RoI Pooling 的逻辑中出现了局限。
我们先继续整体逻辑,再专门来阐述这个问题。

2.3 区域池化

最后一步就较为简单了:在每个划分好的 bin 内进行最大或平均池化得到最终结果
image.png

这便是 RoI Pooling 的完整逻辑和其在检测任务中发挥的作用:

任意大小的候选框都可以通过 bin 的划分映射为固定尺寸特征,从而统一维度用于判定。

到这里,你可能会有这样一个问题:

这不就是在图像里挑了一块进行普通池化吗?并没有改变池化的逻辑吧?归根结底只是池化在检测任务中的特化,在哪里体现出“更灵活”了?

我们就这个问题来总述一下这段逻辑:

3. RoI Pooling 的意义和局限

3.1 什么是“更灵活”的池化?

如果从计算流程上看,RoI Pooling 似乎只是做了一件很简单的事情:

从 feature map 中截取一个区域,然后做一次固定尺寸的池化。

但它真正的意义并不在“操作复杂度”,而在于:

它第一次在 CNN 中引入了“基于目标的特征对齐机制”。

展开来说,在传统 Pooling 中,我们默认:池化窗口是预先固定的,与输入内容无关。
这时的池化本质就是一个“空间无关的压缩操作”。

而 RoI Pooling 做了一件关键变化:

池化窗口不再固定,而是由“候选目标(RoI)”决定。

从这个角度看,“更灵活”体现在:Pooling 的位置由输入决定、 Pooling 的范围随目标变化 。

因此,它的“灵活性”本质是:从“固定操作”变成了“针对目标的操作”。

当然,这只是针对池化的初步改进,就现在的眼光来看,它的逻辑并不复杂,在所有 CV 任务中的泛用性也并不强。
但这是一个“起点”,我们在其后续的改进中就能越发体会到“灵活”二字。
以此,我们来展开 RoI Pooling 的局限问题。

3.2 RoI Pooling 的对齐问题

RoI Pooling 的逻辑中存在一个非常根本的问题:它并没有做到完善的几何对齐。

首先,RoI Pooling 至少经历了两次对齐问题:RoI 映射时的取整和 bin 划分时的取整。
image.png

如图所示,原本连续的目标区域,在进入特征图后被“折断”了两次。最终采样的位置并不一定与真实 RoI 对齐。
而这种偏差会让最终池化得到的是:一个“近似区域的统计值”,而不是“精确区域的响应”
用专业名词来说,这叫:

量化误差,即连续值被映射到离散值时产生的误差。

这种误差在检测任务中会被放大,最终的效果就是:

模型知道“这里有东西”,但不知道“边界到底在哪里”。因为我们没有提取到精准的边界。

此外,pooling 抹平空间细节,对小目标/边界的检测也并不友好。

针对这些问题,自然就会有相应的改进,我们下一篇再详细展开。