Py学习  »  机器学习算法

深度学习目标检测算法

新机器视觉 • 4 年前 • 380 次点击  

点击下方卡片,关注“新机器视觉”公众号

重磅干货,第一时间送达

Deep Learning

Target Detection Algorithms

VOL.1

近年来,深度学习在计算机视觉各个领域中的应用成效显著,新的深度学习方法和深度神经网络模型不断涌现,算法性能被不断刷新。

近20年来,随着深度学习技术的迅猛发展和图形处理器(Graphics processing unit,GPU)等硬件计算设备的广泛普及,深度学习技术几乎已经应用到计算机视觉的各个领域,如目标检测、图像分割、超分辨率重建及人脸识别等,并在图像搜索、自动驾驶、用户行为分析、文字识别、虚拟现实和激光雷达等产品中具有不可估量的商业价值和广阔的应用前景。

目标检测任务作为计算机视觉的基本任务之一,包含物体的分类、定位和检测。从2014至今以R-CNN算法为开端,在对深度学习和计算机视觉的不断研究下,又涌现出Fast R-CNN、Faster R-CNN、SPPNet等多个Two Stage算法,由于Two Stage算法需先筛选出一些可能存在的候选区域,然后针对每个候选区域,进行目标特征提取,效率相对较低,无法满足实时性要求。

双阶段算法流程

而单阶段与双阶段算法目标检测流程有所不同,可以进行端到端检测,无候选区分类,运行速度更快,但是精度略低。常见的单阶段目标检测算法包括YOLO(You Only Look Once)系列和SSD(Single Shot Multi-Box Detector)系列。

单阶段算法流程

YOLO是单阶段模型的代表,它没有提出候选区域的过程,而是直接将提出候选区域和分类统一为一个边界框回归的问题,将整张图片作为网络的输入,在输出层对边界框位置信息和类别进行回归,实现了端到端的学习过程。

YOLO示意图

YOLO网络结构图

目标检测技术从传统的手工特征算法到如今的深度学习算法,精度越来越高的同时速度也越来越快。在过去几年中,工业界已经出现了成熟的基于目标检测技术的应用,如果蔬采摘识别、人脸检测识别、行人检测、交通信号检测、文本检测和遥感目标检测等。这些应用不仅便利了人们的生活,也为学术界提供了启发和指导。

VOL.2

深度学习技术近年来在计算机视觉中的目标检测任务上都取得了卓越的成绩,充分证明了它的价值和潜力。然而深度学习领域仍然有不少难题无法解决,如对数据的依赖性强、模型难以在不同领域之间直接迁移、深度学习模型的可解释性不强等,如何攻克这些难题将是下一阶段的发展方向。为了追求极致的性能,很多科技巨头投入了巨大的人力财力搭建巨型模型,如OpenAI发布的拥有1750亿个参数的GPT-3,谷歌发布的拥有1.6万亿个参数的Switch Transformer,快手发布的拥有1.9万亿个参数的推荐精排模型,这些模型需要大量的训练时间和计算资源,如何设计计算硬件、系统和算法来加速训练是一项新的挑战。深度学习技术严重依赖大规模带标签的数据集,因此无监督学习技术、自监督技术,例如表示学习、预训练模型等,仍然是重要的研究方向。同时深度学习技术带来的安全隐患也引起了重视,如何在保护用户隐私的前提下优化分布式训练是另一个具有潜力的研究方向。

附图是深度学习之父Geoffrey Hinton。Geoffrey Hilton和他的学生在2006年左右发明了用GPU来优化深度神经网络的工程方法,并发表在《Science》和相关期刊上发表了论文,首次提出了“深度信念网络”的概念。他给多层神经网络相关的学习方法赋予了一个新名词–“深度学习”。随后深度学习的研究大放异彩,广泛应用在了图像处理和语音识别领域。


本文仅做学术分享,如有侵权,请联系删文。

—THE END—
Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/132990