OpenCV DNN之YOLO实时对象检测

OpenCV在3.3.1的版本中开始正式支持Darknet网络框架并且支持YOLO1与YOLO2以及YOLO Tiny网络模型的导入与使用。YOLO是一种比SSD还要快的对象检测网络模型，算法作者在其论文中说FPS是Fast R-CNN的100倍，基于COCO数据集跟SSD网络的各项指标对比

在最新的OpenCV3.4上我也测试了YOLO3，发现不支持，因为YOLO3有个新层类型shortcut，OpenCV3.4的Darknet暂时还不支持。这里首先简单的介绍一下YOLO网络基本结构，然后在通过代码演示Darknet支持的YOLO在OpenCV使用。

对象检测网络基本上可以分为两种，一种称为两步法、另外一种称为一步法，很显然基于图像分类加上滑动窗口的方式最早的R-CNN就是两步法的代表之一，两步法的前面基本上是一个卷积神经网络，可以是VGGNet或者Inception之类的，然后再加上一个滑动窗口，但是这种方法太慢，所以就有了区域推荐(RP)，预先推荐一些感兴趣的区域，进行预言，这些方法普遍有一个缺点，计算量比较大，导致性能低下无法实时，而YOLO采样了一种完全不同的方法，达到对图像每个区域只计算一次(You Look at Once - YOLO)，YOLO把图像分为13x13的Cell(网格)：

每个Cell预测5个BOX，同时YOLO也会生成一个置信分数，告诉每个BOX包含某个对象的可能性是多少，注意置信分数不会直接说明BOX内是检测到何种对象，最终那些得分高的BOX被加粗显示如下：

对于每个BOX来说，Cell会预测检测对象类别，这部分的工作就像是一个分类器一样，基于VOC数据集20中对象检测，YOLO结合分数与分类信息对每个BOX给出一个最终可能对象类型的可能性值，如下图，×××区域85%可能性是狗：

因为总数是13x13的网格，每个网格预言5个BOX，所以最终有854个BOX，证据表明绝大多数的BOX得分会很低，我们只要保留30%BOX即可(取决于你自己的阈值设置)，最终输出：

从上面可以看出整个图像只是被计算了一次，真正做到了降低计算量，提高了检测实时性。上述检测使用的YOLO的网络结构如下：

发现只有CNN层，没有FC层，是不是简单到爆，最后说一下为什么最后一层卷积层深度是125，

因为每个Cell检测5个BOX，对每个BOX来说，包含如下数据

BOX本身信息，x、y、w、h

置信分数

基于VOC数据集的20个对象类别

所以对每个BOX来说有25个参数，5个BOX= 5x25=125个参数。

上面是得到的网络模型就是tiny-YOLO网络模型，可以在移动端实时对象检测。这个跟作者在论文中提到的稍微有点差异，论文中作者是输入图像为448x448，分为7x7的网格(Cell)，结构如下：

最终输出是每个Cell预测两个BOX，做20个分类，它得到最终是

深度 = SS(B5+20)，其中20个表示分类数目，S表示网络分割，B表示BOX个数。S=7、B=2，最终输出是77*30

OpenCV在3.3.1版本中开始支持Darknet，可能有人会问，Darknet是什么鬼，它是YOLO的作者自己搞出来的深度学习框架，支持C/C++/Python语言，支持YOLOv1、YOLOv2、YOLOv3等网络模型训练与使用。但是在OpenCV只是前馈网络，只支持预测，不能训练。OpenCV中基于YOLO模型我使用的是tiny-YOLO网络模型，支持20中对象检测。代码实现步骤如下：

1. 加载网络模型

2. 加载分类信息

3. 加载测试图像

4. 检测与显示

5. 运行效果

我的课程：

学习OpenCV3.3深度神经网络(DNN)模块-应用视频教程

OpenCV DNN之YOLO实时对象检测

继续阅读

Ubuntu20.04下配置OpenCV2.4.13

ubuntu14.04 编译安装OpenCV 3.2

数据结构与算法概述数据结构与算法概述

tarjan算法介绍与分析

代码人生，专注的人生很简单

opencv学习笔记（十四）——图像像素的访问

计算机网络的三种通讯模式（单播，广播，组播）小结

opencv028-轮廓发现

qt-opencv图像增强之边缘检测（多线程）1 .pro项目文件配置2 ui设计3 多线程逻辑4 Canny边缘检测和Laplace算子5 主要代码6 运行结果

DLP面曝光3D打印机模型数据矫正

VS2010 / MFC + OpenCV 2.4.9打开图片

2021-09-30三维点云测量正方形包裹体积

计算机开路人阿兰·图灵

Gsl在VS2008下的配置和使用

如何用Opencv求图像的灰度投影曲线

opencv——图像的灰度处理（线性变换/拉伸/直方图/均衡化）