- 1、本文档共11页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
基于深度学习的目标检测研究进展
基于深度学习的目标检测研究进展
原创 2016-05-30 深度学习大讲堂 深度学习大讲堂
开始本文内容之前,我们先来看一下上边左侧的这张图,从图中你看到了什么物体 ?他
们在什么位置 ?这还不简单,图中有一个猫和一个人,具体的位置就是上图右侧图像两个边
框(bounding-box)所在的位置。其实刚刚的这个过程就是目标检测,目标检测就是“给定
一张图像或者视频帧,找出其中所有目标的位置,并给出每个目标的具体类别”。
目标检测对于人来说是再简单不过的任务,但是对于计算机来说,它看到的是一些值为
0~255的数组,因而很难直接得到图像中有人或者猫这种高层语义概念,也不清楚目标出现
在图像中哪个区域。图像中的目标可能出现在任何位置,目标的形态可能存在各种各样的变
化,图像的背景千差万别……,这些因素导致目标检测并不是一个容易解决的任务。
得益于深度学习——主要是卷积神经网络(convolution neural network: CNN)和候选区
域(region proposal)算法,从2014年开始,目标检测取得了巨大的突破。本文主要对基于
深度学习的目标检测算法进行剖析和总结,文章分为四个部分:第一部分大体介绍下传统目
标检测的流程,第二部分介绍以R-CNN为代表的结合region proposal和CNN分类的目标检
测框架(R-CNN, SPP-NET, Fast R-CNN, Faster R-CNN); 第三部分介绍以YOLO为代表的
将目标检测转换为回归问题的目标检测框架(YOLO, SSD); 第四部分介绍一些可以提高目标
检测性能的技巧和方法。
一. 传统目标检测方法
如上图所示 ,传统 目标检测的方法一般分为三个阶段 :首先在给定的图像上选择一些候
选的区域 ,然后对这些区域提取特征 ,最后使用训练的分类器进行分类。下面我们对这三个
阶段分别进行介绍。
(1) 区域选择
这一步是为了对 目标的位置进行定位。由于 目标可能出现在图像的任何位置 ,而且 目标
的大小、长宽比例也不确定 ,所以最初采用滑动窗口的策略对整幅图像进行遍历 ,而且需要
设置不同的尺度 ,不同的长宽比。这种穷举的策略虽然包含了目标所有可能出现的位置 ,但
是缺点也是显而易见的 :时间复杂度太高 ,产生冗余窗口太多 ,这也严重影响后续特征提取
和分类的速度和性能。 (实际上由于受到时间复杂度的问题 ,滑动窗口的长宽比一般都是固
定的设置几个 ,所以对于长宽比浮动较大的多类别 目标检测 ,即便是滑动窗口遍历也不能得
到很好的区域 )
(2) 特征提取
由于 目标的形态多样性 ,光照变化多样性 ,背景多样性等因素使得设计一个鲁棒的特征
并不是那么容易。然而提取特征的好坏直接影响到分类的准确性。 (这个阶段常用的特征有
SIFT、HOG等 )
(3) 分类器
主要有SV M, Adaboost等。
总结 :传统 目标检测存在的两个主要问题 :一个是基于滑动窗口的区域选择策略没有针
对性 ,时间复杂度高 ,窗口冗余 ;二是手工设计的特征对于多样性的变化并没有很好的鲁棒
性。
二. 基于Region Proposal的深度学习目标检测算
法
对于传统 目标检测任务存在的两个主要问题 ,我们该如何解决呢 ?
对于滑动窗口存在的问题 ,region proposal提供了很好的解决方案。region
proposal (候选区域 )是预先找出图中目标可能出现的位置。但由于region proposal利用
了图像中的纹理、边缘、颜色等信息 ,可以保证在选取较少窗口 (几千个甚至几百个 )的情
况下保持较高的召回率。这大大降低了后续操作的时间复杂度 ,并且获取的候选窗口要比滑
动窗口的质量更高 (滑动窗口固定长宽比 )。比较常用的region proposal算法有selective
Search和edge Boxes ,如果想具体了解region proposal可以看一下PAMI2015的 “What
makes for effective detection proposals ?”
有了候选区域 ,剩下的工作实际就是对候选区域进行图像分类的工作 (特征提取 +分
类 )。对于图像分类 ,不得不提的是2012年ImageNet大规模视觉识别挑战赛 (ILSV RC )
上 ,机器学习泰斗Geoffrey Hinton教授带领学生Krizhevsk
您可能关注的文档
最近下载
- 最新石灰生产危险源辨识、风险分析资料.docx VIP
- 船体装配工培训.pptx
- 新版人教版七年级英语上册书面表达及范文.pptx
- 2023-2024学年山东省潍坊市九年级(上)期末物理试卷.docx
- 广东省广州市增城区2022-2023学年九年级上学期期末英语试题(答案).docx VIP
- 《审计基础》课程标准.pdf
- 2024-2025学年度南京市鼓楼区三年级语文第一学期期末真题模拟检测.docx
- 餐饮服务员岗位培训.pptx
- 寒假放假安全教育主题班会PPT.pptx VIP
- 沪教版(2024)七年级上册Unit 1 Friendship 语法 Grammar 特殊疑问句(含解析).docx VIP
文档评论(0)