惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

爱范儿
爱范儿
大猫的无限游戏
大猫的无限游戏
WordPress大学
WordPress大学
C
Cyber Attacks, Cyber Crime and Cyber Security
D
DataBreaches.Net
G
Google Developers Blog
博客园 - Franky
V
V2EX
博客园 - 叶小钗
D
Docker
The GitHub Blog
The GitHub Blog
Microsoft Security Blog
Microsoft Security Blog
博客园 - 【当耐特】
H
Hackread – Cybersecurity News, Data Breaches, AI and More
B
Blog RSS Feed
月光博客
月光博客
M
MIT News - Artificial intelligence
F
Fortinet All Blogs
Microsoft Azure Blog
Microsoft Azure Blog
人人都是产品经理
人人都是产品经理
IT之家
IT之家
Google DeepMind News
Google DeepMind News
Apple Machine Learning Research
Apple Machine Learning Research
V
Visual Studio Blog
博客园 - 司徒正美
Stack Overflow Blog
Stack Overflow Blog
罗磊的独立博客
J
Java Code Geeks
U
Unit 42
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园 - 聂微东
T
Tailwind CSS Blog
T
The Blog of Author Tim Ferriss
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Blog — PlanetScale
Blog — PlanetScale
Jina AI
Jina AI
C
Check Point Blog
Y
Y Combinator Blog
MyScale Blog
MyScale Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
阮一峰的网络日志
阮一峰的网络日志
宝玉的分享
宝玉的分享
B
Blog
小众软件
小众软件
云风的 BLOG
云风的 BLOG
I
InfoQ
Recorded Future
Recorded Future
酷 壳 – CoolShell
酷 壳 – CoolShell
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
美团技术团队

机核

游戏性能旗舰最强之选,一加 Ace 6 至尊版国补到手价2999元起 6元钱自己更换电动车刹车线 《生化危机9:安魂曲》编剧Haris Orkin专访 摸金游戏?音乐游戏!暗区新赛季这把能弹的琴有何来历? 好评国产武侠SRPG《息风谷战略》免费DLC现已推出 | 机核 GCORES 碎片 《生化危机:安魂曲》将于5月实装首个免费更新内容 | 机核 GCORES 新锐东方游戏,谱写世界新章! 沉浸式恋爱视觉小说游戏《心象演算》免费试玩版现已正式上线 | 机核 GCORES 互动影游《代号三国:龙起》上线!穿越三国与曹操并肩、与佳人同行、与权谋博弈! 《老头收集梦想生活》,游戏酒桌会6,录音笔VOL.689 | 机核 GCORES 破界·共生——《白日梦:无限世界》五大核心游戏特点解析 价格已到史低,锐龙5 9600X/锐龙7 9700X正适合抄底 时间循环之旅即刻启程!《归环》一周目测试今日开启 热门在线韩游变魂游,洛奇衍生作能否打破“花瓶”魔咒? LG UltraGear evo 全新高端显示器系列:当“5K”遇见“AI”,不止强大,更懂热爱 反套路三国互动影游《代号三国:龙起》今日上线! 愿望单登记人数突破10万!备受瞩目的“女儿养成游戏” 《梦幻魔法公主》今日于Steam平台上线!限时八折优惠中 《黑神话:悟空》全球音乐会2026巡演将于4月29日12时开票 | 机核 GCORES “Snowguelike”生存肉鸽挖矿新作《蛙穿雪境》公布发售日期,5月7日正式上线 | 机核 GCORES 重塑移动办公、AI创作新境!全新华硕灵耀Air系列、ProArt 骁龙版震撼首发,创芯未来 均分88:《Saros》媒体评分汇总 | 机核 GCORES 上海烛龙公布合作遗迹探险游戏《吉时已到》首支预告片 | 机核 GCORES 首个独立游戏《萝薇日记》已上线Steam! 烛龙新IP《吉时已到》首曝,打造国内首款中式合作遗迹探险游戏 喜加一:《暗黑破坏神Ⅳ》国服现已开启限时免费领取本体活动 | 机核 GCORES 新版《生化危机》电影定于9月18日上映,官方网站现已上线 | 机核 GCORES 《冲就完事模拟器2》“星球大战”联动DLC正式宣布 | 机核 GCORES SteamController将于5月4日发售,售价99美元 | 机核 GCORES 事已至此,内存这么用也算省钱了,“2+1”非对称双通道应用实测 505游戏母公司现已收购《明末:渊虚之羽》IP | 机核 GCORES 基石 手动杂谈12|格斗游戏也能讲好故事 | 机核 GCORES I Love You Mr Snowball 我的向日葵小姐 会比GTA6先发售吗?最硬核的生存游戏《DAYZ》要推新DLC了 周记02:在2026遇到新怪谈 什么硬件,能让游戏Loading界面快速消失? | 机核 GCORES GadioSpec《百年风云世界杯》免费试听集 | 机核 GCORES 百年风云世界杯Vol.1丨足球崛起 | 机核 GCORES 100年前,一群人提前替我们经历了AI恐惧 | 机核 GCORES 《呼啸山庄》2026 ——一辆当代艺术的大卡车冲撞了我的大脑 手游《天穗之咲稻姬:日之香巡灵传》宣布将于7月27日停服 | 机核 GCORES 集结梦之队,征战世界杯,《最佳球会ONLINE》上线Steam 山水绝景随心拼 休闲建造游戏《千里山河录》Steam商店页公开 巫师帽、法袍、魔杖,为什么它们是影视、游戏里的法师必备三件套? 《无鞘信使》-第一章 复古风自动战斗肉鸽《终结之终结》Steam商店页面现已上线 电脑里有一款不破不立的MMO,录音笔VOL.688 | 机核 GCORES 《生化危机》30周年纪念周边发售,这次是真的“保护伞” 可靠耐用+AI全能,惠普战66 2025锐龙版深度体验 《时之书:无尽终章》关卡“大航海时代”全球首次公开 经典名作《乌龙派出所》改编经营模拟游戏《乌龙派出所~阿两的商店街物语~》正式宣布支持简体中文 明日开冲,解锁反套路三国互动影游《代号三国:龙起》即将上线 独立游戏《这是我的宝藏!》已发售~ 降低难度不是唯一解,无压力死亡也是好体验 Netflix官宣新片《普通人》:讲述韩国现代史上的权力风暴 《生化危机:安魂曲》全球销量现已突破700万份 《绝地鸭卫》PC版5月15日正式发售 亡妻回忆录?女性向情感叙事游戏《S-mail》现已正式发售 全新酷黑风格,酷睿Ultra 200S PLUS的高性价比搭档!七彩虹BATTLE-AX B860M-PLUS S WIFI7 V20 超级黑刃主板测评 胖狗 索尼发布了港台地区PS5产品价格调整公告,将于5月1日起实施 二次元怪猎+性感美女!《碧蓝幻想:无尽黄昏》开启Beta公测 这款怪谈类型中式恐怖游戏居然更新了?! 《百日战纪 -最终防卫学园-》改编漫画将于今年冬季开启连载 《如被附身,请致电我们》:匈牙利黑色幽默恐怖小说 《竹屿山房杂部卷五》(译文) 大树 超越引擎 摄影分享丨四月 碎片杂记vol.72 当老式FPS与老式动画技术碰撞出新时代的火花—《神探杰克鼠》 想做独游,如何避免首个项目就褒姒? 在线多人动作游戏《OCTOPinbs》将于5月12日上线Steam! 《酒鬼女神的酒诡》确定将于2026年登陆Steam 《CRYMELIGHT》将于11月5日(周四)正式发售!4月25日开始预购! 钢铁国度MKI部落Evolution,蛮兵部分 【钢铁国度】部落-Primal MK I,蛮兵部分 这是一个高中生用ai跑出来的作品,我自称他为物理神话 钢铁国度MKI部落Metamorphosis,蛮兵部分上 钢铁国度MKI部落Metamorphosis,蛮兵部分下 INDIE Live Expo于4月25日举办:首发9款新作,超200款独立游戏亮相 暗黑卡牌策略新作《魔忌:穷鼠啮狸》发布全新中文试玩版和发售预告片,4月30日正式上线在即 战锤40K长篇小说:变节者・苦难主宰(三)(全书完) 战锤40K长篇小说:变节者・苦难主宰(二) 战锤40K长篇小说:变节者・苦难主宰(一) 英语语言学习丨短语专题1:短语的特点 唯一的EVE战争 【少前同人】【M200】战术人形会梦见音乐会吗 【昏迷3】即将发售,前作主角悉数到场!“恶灵”宋老师化身可操控角色 业内人士:游戏公司“十有八九”使用生成式AI,包括卡普空 欢庆一周年:《光与影:33号远征队》全新纪念艺术图、超值折扣与免费更新同步上线 才刚刚开始呢 【抽奖】《星际卡车司机》推出免费大型更新,四折平史低折扣进行中 四人合作FPS游戏《佣兵猎手》抢先体验重大更新 1 现已上线 Raw Fury新作《深馅地牢 Deep Dish Dungeon》将于今秋加入 XGP 塔防幸存者游戏《魔怪来袭》推出首个 DLC 《饿狼传说:群狼之城》1周年纪念!新DLC“沃尔夫冈·克劳萨”今日参战 猫狗相伴 欢乐闯关 双人合作平台跳跃游戏《猫狗同行》上线Steam商店页 《同行:月球逃脱》(Together: Moon Escape)上线将于明日上线Steam
图形AI粗读丨计算机视觉与图像分类
Hakumen · 2025-06-13 · via 机核

前言

上一篇中,我们主要读到了卷积层对于图像等大规模数据源进行模型训练时的意义——即以过滤器(Filter)提取图像中的目标特征,而不是基于整体来分析特征,以减少需要的全连通层和权重参数;对于目标数据的预处理(以提升后续计算效率),则提出了池层的概念。

这次系列课件来到了计算机视觉部分。在我个人读的这个图形AI系列中,前面已经铺垫了很多计算机视觉与三维重建部分的内容——毕竟那是比AI大模型更早得多的一门技术学科。相比于本篇课件的概览型介绍,把之前的很多篇结合着看肯定是更充分完整一些;因而我也不会在此展开之前已经读到过的一些概念细节,感兴趣可以去找那几篇作为参照。

而关于AI模型部分,本篇中更多讲述了在ChatGPT出现前、由李飞飞主导的ImageNet技术平台的情况——以及当时前列的几个出名的AI模型,有着2010年至2020年间特定时代的缩影。

本文还是以翻译PPT页内容为主,打星号的部分则是我的补充说明。

1 计算机视觉——Computer vision

*图中列出了一些应用场景:

  • 汽车自动驾驶

  • 探索火星

  • 手术辅助

  • 盲人的视觉支持模块

  • 安全性(刷脸等)

  • CNN自身在解决视觉领域有很强的历史业绩

  • 视觉数据表达(例如,空间数据)天然也很适合CNN(例如图中,图像和视频的离散空间数据方式)

首个数字图像——1957年。176X176像素。

1966年——人们正式提出了计算机视觉这一概念及技术框架。(*当时是由Summer公司提出的)

*如图,课件中涉及的主要是CV和CNN两个领域重叠的部分。

物体识别——给定图像,能认出是什么物体(例如图中,汽车)。

物体探测——从一副图像中探测出目标物体的区域位置(例如图中,人脸)。

图像分割——即俗语中的“抠图”(例如图中,单独把人物分割出来)。

图像说明文字——对于给定的图像,自动生成匹配的说明文字。

视觉问题解答——例如图中的例子,产生了关于红酒品种的对话。

物体追踪——一般运用在实时拍摄或视频分析,持续追踪目标物体的状态(位置、速度等)。

主观认知问题——例如图中的例子,google分类tag。

更多其它领域:

  • 光照照明

  • 物体姿态

  • 分析杂物堆

  • 分析遮挡

  • 类内外观分析

  • 视点(计算、模拟)

2 数据集挑战的时代——Era of dataset challenges

*这一节比较简短,主要是介绍了数据集共享及AI模型评估社区的运行机制。

在1990年以前,用于开发计算机视觉模型的数据集相对很小(例如,10到100个实例)。

*图中的例子还是挺有美国特色的。

在1990年以后,人们逐渐能使用较大的数据集(例如,从千到百万级别的实例)。

是什么促使了这种(数据集)数量级上的变化呢?

  1. 数据被划分为“训练集合”和“测试集合”,其中后者的识别标签是被隐藏的。

  2. 开发团队设计模型并提交(测试集合的)预测结果至评价服务器。

  3. 一个公开的排行榜能展示各团队提交模型的表现排名。

*划分数据集的方式在上上篇中也介绍过。这里主要指这套机制在AI社区运行的模式。

  • (这套机制)提供了模型间(基于数据集相对)“公平”的对比。

  • 创建了一个有着共同目标的社区。

*图中列出了一些常规的公共数据集提供者。

3 MNIST数据集标准的挑战胜者:LeNet——MNIST challenge winner: LeNet

1989年——人们提出了CNN的反向传播理论。

1998年——人们提出了MNIST数据集和LeNet CNN模型。

*MNIST——Modified National Institute of Standards and Technology database是机器学习领域最经典的手写数字数据集,由28×28像素的灰度图像组成,包含0-9共10类数字,广泛用于图像分类任务和深度学习入门教学。

  • 目标:区分0-9的(手写)数字

  • 评价标准:精确度(正确的百分比)

  • 数据集:6万条训练数据和1万条测试用例,预处理成居中和相同尺寸;两份数据集中的撰写人不同。

  • 来源:NIST中的图像是由500名人口调查工程师以及高校学生来收集的。

LeNet——类似Neocognitron,有卷积层和池层。(*Neocognitron是一个生造词,可以被称为新感知机——更多可以参照上一篇)

卷积层使用tanh作为激活函数。如图可见,卷积层是C1和C3、池层是S2和S4(降采样)。

对于右侧的全连接多层神经网络部分——最终这一神经网路能输出多少可能的预测?

*输出层:使用Softmax或高斯激活函数,在10个类别(数字0-9)中输出概率。

在输入和卷积层1之间,有多少过滤器?——卷积核尺寸5X5,数量为6;后面步骤只要是卷积,都采用的是这个尺寸的卷积核(*核中值的细节,文末会附相关的详细参考资料)。

池层中使用的相邻域尺寸是多大?——相邻尺寸2X2,步长为2的最大值池;后面的池层也是类似规格。

*图中列出的还是之前反向传播一节的要点,这里就不重复展开了。

*这里也是上一篇的一幅例图。9个输入格子经过一个过滤器,可以转化为特征图中的4个格子(每个格子记录了提取出的红、蓝、黄、绿值);而这一过滤器的执行是卷积方式的而非全连通方式的。

*Neocognitron是基于人工定义的过滤器,而LeNet使用机器学习的过滤器。

需要迭代执行多少次训练集?——图中展示了从0到20次epoch,训练和测试数据分别的误差率。

*LeNet是由Yann LeCun及其同事开发的一种开创性的卷积神经网络架构,也是首个将CNN用于有实际应用价值的图像识别课题的案例。

*这里再重复提一次,就是在AI领域performance一次主要还是说的正确率。

*这组课件中缺少对于卷积神经网络的反向传播算法举例,其原理是:利用链式法则将损失函数的梯度分解为各层参数的梯度——如果对于细节有兴趣,文末会附一篇资料;对于使用脚本来编写LeNet模型并执行数据训练,了解到上述程度就足够了。

4 ImageNet数据库的挑战胜者: AlexNet, VGG, ResNet等深度学习算法——ImageNet challenge winners: deeper learning (AlexNet, VGG, ResNet)

2009年——随着ImageNet的发展,CNN迎来了第三波催化剂。

  • 评估标准:正确百分比(top1和top5的预测)

  • 数据集:约150万张图片

  • 来源:图像主要来自搜索引擎,例如Flickr;分类标签是由众包工人设置的。

ImageNet是一个图像库——有着更多自然背景的3D物体;有更多的分类。

数据集的放大带来了未曾预见的、前所未有的“深度学习”模型提升——AlexNet。

受AlexNet的激发,后续更多研究者在计算机视觉社区和领域在几年内持续贡献了更多进展。

共有727份参加者(*页中还专门指出,将百度2015年作弊的提交排除了)。

劳动开销约1.1亿美元——假设一份提交平均3人参与,人均成本5万美元。

*本篇的课题会集中在AlexNet、VGG、ResNet。

为什么深层的CNN难以获得更好的性能表现?——因为(深层)梯度的消失。

左图,梯度较小、权重更新较慢。

回顾不同的激活函数及其梯度范围——S型函数计算虽然相对快,但是梯度范围较小;相比来说Tanh函数的梯度范围更大。

*如图中的简单示例,两个隐藏层的激活函数都是S型函数,则其梯度范围是最大0.25。

*随着连续乘一连串小于1的数,层数越多则训练中的权重变化越慢。

前期层的极小梯度值会导致它们的训练缓慢,进一步影响把有效数据传递给后续层——显然无效的输入最后会导致无效的输出。

那么如何解决避免梯度消失的问题呢?

*在AlexNet中人们首次尝试解决这一问题。

使用导数为1的激活函数——例如图中的ReLU。

AlexNet的架构:类似LeNet,但有更多的卷积层和池层。

  • 输入:尺寸调整至固定值的RGB图像。

  • 输出:1000个分类的概率(和为1)。

  • 卷积层:5层。

  • 池层:3层。

  • 全连接层:3层。

*具体参数可以看图,比LeNet的规模大了非常多。

总计需要学习6千万个模型参数!

*图中展示了选取图像较短的一边来进行居中化裁剪的过程。

从图中可以看出,来自卷积层的参数较少,大部分参数来自全连通层。(*图中纵轴一格是1千万个)

绿字部分——使用交叉熵损失来评估训练数据的执行结果。(*关于交叉熵损失可以参照上上篇中的资料)

使用ReLU替代S型或tanh激活函数。

正则化的技术——会在下一篇中覆盖:

  1. 数据增强

  2. 全连接层中的丢弃机制

  3. L2参数范数惩罚

跨越两个GPU进行训练。

*关于正则化regularization下一篇会有整篇讲述,因此这里就不附资料了。

*VGG是另一个更深层的CNN模型。

*图中可以看出VGG和AlexNet的层数对比。

将较大的过滤器替换为较小过滤器的堆叠组合。

例如,将7X7替换为3个3X3的过滤器。

优势:

  • 更多判别力的分类器——由于有更多非线性校正的过程,3对1。

  • 参数的减少:27对比49。

蓝字部分:仍然会遇到梯度消失的问题。

问题:梯度消失可能出现在导数表达式包含了与权重的乘积,而权重初始化小于1的时候。

解决方案:从一个中心为0的标准分布(函数)来初始化权重,并调整信号与梯度的规模以匹配所有层。

  1. 通过不同层之间的信号有着相同的变化幅度。

  2. 通过不同层之间的梯度有着相同的变化幅度。

*一层中有很多个节点,而这里图示的是每个层的Z值、权重、激活函数、梯度的系数分布情况。

VGG的局限——模型太大了。

  • 使用3X3过滤器替代更大的过滤器。

  • 使用Xavier/Glorot的处理来初始化权重。

  • 正则化技巧——同之前AlexNet部分,也是下一篇中介绍。

  • 跨越多个GPU来训练。

*ResNet是本篇介绍的第3个CNN模型。

  • 理念:一个更深的神经网络在处理简单问题时不一定优于浅层的网络,因为浅层的处理传递结果可能已经是有“恒等结果”的值了——后续层的执行都是浪费。

  • 观察:此时增加更多的层反而导致坏的结果。

  • 这是一个过拟合问题么?

并不是,有着更多层时的训练和测试误差更大了。

(红字)问题:算法难以在有恒等对应关系的层间执行学习过程。

*以图中为例,输入X,输出X。

假设:神经网络学习接近0的参数远比执行恒等映射要容易(这一结果被论文中的实验支撑)。

*图中右侧环线设置了一种跳过部分层的执行逻辑。红色部分则被称为残差函数

根据论文中的探索,跳过2到3层连接(是合适的)。

(红字)当添加一个跳跃连接时,需要学习多少模型参数?——0个。

残差连接不会通过“挤压”梯度的激活函数,因而可以在学习中保持更高的梯度。

深度残差学习框架使用了跳跃连接来获得更好的性能表现,比起前人的方案来说能学习更深层的模型。

*可以看出,相对前人的LeNet和VGG等方案,ResNet有着明显更多的层,以及更小的误差。

*在2015年的实验中,通过和人类中的专业人员进行了每张图像(最多)5目标的识别比赛中,在测试了1500张图片之后胜出。

*原文没有提出是否限时,但理解上应该是同时考虑限时和误差率了。

*这里摘录一篇网络上的简单讲解,再重复

正常的神经网络层x经过weight layer之后为relu ( w1x + b ),再经过一次weight layer之后为relu ( w2 ∗ ( relu ( w1x + b ) ) ) 。

在此特殊情况下的公式定义为H(x),它属于经过特殊定义的残差函数的内容,可以得到H ( x ) = F (x) + x,也就是说现在的前向传播函数H(x)为原来的前向传播函数F(x)加上两层之前的输入x。

这样拟合的残差函数F(x) = H(x)-x更简单。虽然理论上两者都能得到近似拟合,但是后者学习起来更容易。

*如图,在本篇介绍的几个模型中,ResNet提出最晚,表现最好。

*PAMI Longuet-Higgins Prize 是由 IEEE Pattern Analysis and Machine Intelligence (PAMI)技术委员会设立的年度奖项,奖励的是计算机视觉领域的杰出贡献。

突然人们开始注意ImageNet,不仅在AI社区内部,而是整个技术工业整体——经济学家

图中展示了ImageNet中使用的Flickr metadata中的图片,在世界地图上的地理分布。

结语

由于近期工作较忙,外加新内容我自身越来越难以消化理解,因此未能保持之前一周一更的频率。后续为了保证基本的质量,我也会准备充分外加阅读各类相关资料后再更新。

本篇中的数字识别、图像识别等AI技术,虽然在10年前才逐渐成熟,但到现在已经成了深入大家生活的感知型AI;但另一方面来说,感知型AI还并不能替代人类做复杂或紧急的决策。从算法本身来说,目前了解的这些图像识别算法,本质上还是处理信号的分解和权重数学拟合问题。

本篇中提到的这些AI模型技术,在提出时肯定都是当时各团队智慧的结晶,不过到了10年后已经可以供有一定脚本基础的任何普通人在python中进行模型训练和参数设置了。

下一篇会读到正则化,同样又是一个难啃的问题。

最后是资料链接: