爱CV

实用教程详解：用OpenCV的DNN模块部署YOLOv5目标检测

导读：

本文中介绍的整套程序只依赖OpenCV库就能正常运行，彻底摆脱了对深度学习框架的依赖。文章讲述了作者在自己编写用OpenCV的dnn模块做YOLOv5目标检测的程序的过程中遇到的bug以及解决的办法。

最近看到多篇讲解YOLOv5在OpenVINO部署做目标检测文章，但是没看到过用OpenCV的DNN模块做YOLOv5目标检测的。于是，我就想编写一套用OpenCV的DNN模块做YOLOv5目标检测的程序。

在编写这套程序时，遇到的bug和解决办法，在这篇文章里讲述一下。

在YOLOv5之前的YOLOv3和YOLOv4的官方代码都是基于darknet框架的实现的，因此OpenCV的DNN模块做目标检测时，读取的是.cfg和.weight文件，那时候编写程序很顺畅，没有遇到bug。

但是YOLOv5的官方代码(https://github.com/ultralytics/yolov5)是基于Pytorch框架实现的，而OpenCV的DNN模块不支持读取Pytorch的训练模型文件。如果想要把Pytorch的训练模型.pth文件加载到OpenCV的DNN模块里，需要先把Pytorch的训练模型.pth文件转换到.onnx文件，然后才能载入到Opencv的DNN模块里。

因此，用OpenCV的DNN模块做YOLOv5目标检测的程序，包含两个步骤：

1. 把Pytorch的训练模型.pth文件转换到.onnx文件。

2. OpenCV的DNN模块读取.onnx文件做前向计算。

1. 把Pytorch的训练模型.pth文件转换到.onnx文件

在做这一步时，我得吐槽一下官方代码：

https://github.com/ultralytics/yolov5

这套程序里的代码混乱，在Pytorch里，通常是在.py文件里定义网络结构的，但是官方代码是在.yaml文件定义网络结构，利用Pytorch动态图特性，解析.yaml文件自动生成网络结构。在.yaml文件里有depth_multiple和width_multiple，它是控制网络的深度和宽度的参数。

这么做的好处是能够灵活的配置网络结构，但是不利于理解网络结构。假如你想设断点查看某一层的参数和输出数值，那就没办法了。因此，在我编写的转换到.onnx文件的程序里，网络结构是在.py文件里定义的。

其次，在官方代码里，还有一个奇葩的地方，那就是.pth文件。

起初，我下载官方代码到本地运行时，torch.load读取.pth文件总是出错，后来把pytorch升级到1.7，就读取成功了。可以看到版本兼容性不好，这是它的一个不足之处。

设断点查看读取的.pth文件里的内容，可以看到.pth里既存储有模型参数，也存储有网络结构，还储存了一些超参数，包括anchors，stride等等的。第一次见到有这种操作的，通常情况下，.pth文件里只存储了训练模型参数的。

查看models\yolo.py里的Detect类，在构造函数里，有这么两行代码：

我尝试过把这两行代码改成self.anchors = a 和 self.anchor_grid = a.clone().view(self.nl, 1, -1, 1, 1, 2)，程序依然能正常运行，但是torch.save保存模型文件后，可以看到.pth文件里没有存储anchors和anchor_grid了，在网页搜索register_buffer，解释是：pytorch中register_buffer模型保存和加载的时候可以写入和读出。

在这两行代码的下一行：

它的作用是做特征图的输出通道对齐，通过1x1卷积把三种尺度特征图的输出通道都调整到 num_anchors*(num_classes+5)。

阅读Detect类的forward函数代码，可以看出它的作用是根据偏移公式计算出预测框的中心坐标和高宽，这里需要注意的是，计算高和宽的代码：

pwh = (ps[:, 2:4].sigmoid() * 2) ** 2 * anchors[i]

没有采用exp操作，而是直接乘上anchors[i]，这是YOLOv5与YOLOv3v4的一个最大区别（还有一个区别就是在训练阶段的loss函数里，YOLOv5采用邻域的正样本anchor匹配策略，增加了正样本。其它的是一些小区别，比如YOLOv5的第一个模块采用FOCUS把输入数据2倍下采样切分成4份，在channel维度进行拼接，然后进行卷积操作，YOLOv5的激活函数没有使用Mish）。

现在可以明白Detect类的作用是计算预测框的中心坐标和高宽，简单来说就是生成proposal，作为后续NMS的输入，进而输出最终的检测框。我觉得在Detect类里定义的1x1卷积是不恰当的，应该把它定义在Detect类的外面，紧邻着Detect类之前定义1x1卷积。

在官方代码里，有转换到onnx文件的程序：python models/export.py --weights yolov5s.pt --img 640 --batch 1

在pytorch1.7版本里，程序是能正常运行生成onnx文件的。观察export.py里的代码，在执行torch.onnx.export之前，有这么一段代码：

注意其中的for循环，我试验过注释掉它，重新运行就会出错，打印出的错误如下：

由此可见，这段for循环代码是必需的。

2. OpenCV的DNN模块读取.onnx文件做前向计算

在生成.onnx文件后，就可以用OpenCV的DNN模块里的cv2.dnn.readNet读取它。然而，在读取时，出现了如下错误：

我在网页搜索这个问题的解决办法，看到一篇技术文章(https://zhuanlan.zhihu.com/p/286298001)，文章里讲述的第一条：

于是查看YOLOv5的代码，在common.py文件的Focus类，torch.cat的输入里有4次切片操作，代码如下：

那么现在需要更换索引式的切片操作，观察到注释的Contract类，它就是用view和permute函数完成切片操作的，于是修改代码如下：

其次，在models\yolo.py里的Detect类里，也有切片操作，代码如下：

前面说过，Detect类的作用是计算预测框的中心坐标和高宽，生成proposal，这个是属于后处理的，因此不需要把它写入到onnx文件里。

总结一下，按照上面的截图代码，修改Focus类，把Detect类里面的1x1卷积定义在紧邻着Detect类之前的外面，然后去掉Detect类，组成新的model，作为torch.onnx.export的输入，

torch.onnx.export(model, inputs, output_onnx, verbose=False, opset_version=12, input_names=['images'], output_names=['out0', 'out1', 'out2'])

最后生成的onnx文件，opencv的dnn模块就能成功读取了，接下来对照Detect类里的forward函数，用python或者C++编写计算预测框的中心坐标和高宽的功能。

周末这两天，我在win10+cpu机器里编写了用OpenCV的DNN模块做Yolov5目标检测的程序，包含Python和C++两个版本的。程序都调试通过了，运行结果也是正确的。

我把这套代码发布在了Github上，地址是：

https://github.com/hpc203/yolov5-dnn-cpp-python

后处理模块，python版本用numpy array实现的，C++版本的用vector和数组实现的，整套程序只依赖OpenCV库(opencv4版本以上的)就能正常运行，彻底摆脱对深度学习框架pytorch,tensorflow,caffe,mxnet等等的依赖。

用OpenVINO作目标检测，需要把onnx文件转换到.bin和.xml文件，相比于用DNN模块加载onnx文件做目标检测是多了一个步骤的。因此，我就想编写一套用OpenCV的DNN模块做YOLOv5目标检测的程序，用Opencv的DNN模块做深度学习目标检测，在win10和ubuntu，在cpu和gpu上都能运行，可见DNN模块的通用性更好，很接地气。

原帖：https://blog.csdn.net/nihate/article/details/112731327

【OpenCV】undefined reference to `cv::dnn::dnn4_v20191202::Net::~Net()‘ 二粒砂各路问题汇总 opencv opencv dnn c++
Linux环境下使用opencv的dnn模块调用yolov4遇到的坑（纯CPU）1.改CMakeList.txt向CMakeLists.txt中的find_package(OpenCV4REQUIREDopencv_coreopencv_imgprocopencv_highguiopencv_calib3dopencv_videoioopencv_imgcodecs)添加opencv_dnn，即改
opencv + Caffe model zoo的 GoogLeNet训练网络将opencv_dnn模块用于图像分类。 Comolli
准备1、synset_words.txt2、bvlc_googlenet.prototxt3、bvlc_googlenet.caffemodel环境opencv3.4.3+vs2015源码#include#include#include#includeusingnamespacecv;usingnamespacecv::dnn;#include#include#includeusingnamesp
opencv_dnn模型部署学习记录 cmengwei 项目总结深度机器学习 opencv图像处理 opencv dnn 深度学习计算机视觉图像处理
OpenCVDNN模块——从TensorFlow模型导出到OpenCV部署详解OpenCVDNN模块——从TensorFlow模型导出到OpenCV部署详解_南七小僧的学海无涯-CSDN博客OpenCV图像处理-调用Tensoflow和YOLOOpenCV图像处理-调用Tensoflow和YOLO-知乎https://github.com/JimmyHHua/opencv_tutorialsOpe
三.深度学习YOLO_opencv_dnn部署实践记录 AGANCUDA 流媒体人工智能 AI
三.深度学习YOLO_opencv的实际部署opencv4.3+cuda10.2GPU完美编译版SDK附件的说明文章目录三.深度学习YOLO_opencv的实际部署前言一、opencv_dnn编译二、编译yolo调用例子总结前言1.opencv4.4dnn模块封装yolo的SDK方法2.darknet的工程实现yolo的调用.一、opencv_dnn编译opencv需要4.4的版本,下载源码编译.
opencv_dnn做人脸检测使用体验狂奔的CD android AI
参考：https://blog.csdn.net/qq_30815237/article/details/87914775[问题]raw.githubusercontent.com访问不了sudovim/etc/hosts简单的说就是域名被DNS污染了在hosts文件加上：199.232.4.133raw.githubusercontent.com移植到安卓移植到安卓上参考官方https://do
Windows系统下配置OpenCV_DNN模块使用CUDA加速(Windows10、VS2017、CUDA10.1、cuDNN7.6.5、OpenCV4.2.0) stjuliet 深度学习
OpenCVDNN模块可加载深度学习模型用于目标检测等任务，OpenCV4.2.0之后支持模型推理使用CUDA加速，但是需要手动将CUDA模块编译进OpenCV.本文记录了编译的全部过程，最终可用于c++/python下的opencv_dnn模块加速。目录step1运行环境和前期准备step2编译OpenCVDNN模块(WITHCUDA)step3测试（1）c++（2）pythonstep1运行环
OpenCV3.3更新日志 HelloHaibo caffe opencv
2017.08opencv3.3新版本被发布，其中包括，加速DNN模块，并将其移到主仓库，Halide在opencv中首次亮相，另外还对其他各模块进行了多重优化和改进。opencv_dnn模块已从opencv_contrib移到opencv主仓库，并且功能被优化、改进：1、高层的API被修改，比以前更加方便2、新添加了一些回归测试，现在共有46种。3、修复Torch和TFloaders中存在的bu
继之前的线程循环加到窗口中运行 3213213333332132 java thread JFrame JPanel
之前写了有关java线程的循环执行和结束，因为想制作成exe文件，想把执行的效果加到窗口上，所以就结合了JFrame和JPanel写了这个程序，这里直接贴出代码，在窗口上运行的效果下面有附图。 package thread; import java.awt.Graphics; import java.text.SimpleDateFormat; import java.util
linux 常用命令 BlueSkator linux 命令
1.grep 相信这个命令可以说是大家最常用的命令之一了。尤其是查询生产环境的日志，这个命令绝对是必不可少的。但之前总是习惯于使用（grep -n 关键字文件名）查出关键字以及该关键字所在的行数，然后再用（sed -n '100,200p' 文件名），去查出该关键字之后的日志内容。但其实还有更简便的办法，就是用（grep -B n、-A n、-C n 关键
php heredoc原文档和nowdoc语法 dcj3sjt126com PHP heredoc nowdoc
<!doctype html> <html lang="en"> <head> <meta charset="utf-8"> <title>Current To-Do List</title> </head> <body> <?
overflow的属性周华华 JavaScript
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/xhtml&q
《我所了解的Java》——总体目录 g21121 java
准备用一年左右时间写一个系列的文章《我所了解的Java》，目录及内容会不断完善及调整。在编写相关内容时难免出现笔误、代码无法执行、名词理解错误等，请大家及时指出，我会第一时间更正。 &n
[简单]docx4j常用方法小结 53873039oycg docx
本代码基于docx4j-3.2.0，在office word 2007上测试通过。代码如下: import java.io.File; import java.io.FileInputStream; import ja
Spring配置学习云端月影 spring配置
首先来看一个标准的Spring配置文件 applicationContext.xml <?xml version="1.0" encoding="UTF-8"?> <beans xmlns="http://www.springframework.org/schema/beans" xmlns:xsi=&q
Java新手入门的30个基本概念三 aijuans java 新手 java 入门
17.Java中的每一个类都是从Object类扩展而来的。　　18.object类中的equal和toString方法。　　equal用于测试一个对象是否同另一个对象相等。　　toString返回一个代表该对象的字符串,几乎每一个类都会重载该方法,以便返回当前状态的正确表示.(toString 方法是一个很重要的方法)　　 19.通用编程:任何类类型的所有值都可以同object类性的变量来代替。　
《2008 IBM Rational 软件开发高峰论坛会议》小记 antonyup_2006 软件测试敏捷开发项目管理 IBM 活动
我一直想写些总结,用于交流和备忘,然都没提笔,今以一篇参加活动的感受小记开个头,呵呵! 其实参加《2008 IBM Rational 软件开发高峰论坛会议》是9月4号,那天刚好调休.但接着项目颇为忙,所以今天在中秋佳节的假期里整理了下. 参加这次活动是一个朋友给的一个邀请书,才知道有这样的一个活动,虽然现在项目暂时没用到IBM的解决方案,但觉的参与这样一个活动可以拓宽下视野和相关知识.
PL/SQL的过程编程,异常,声明变量,PL/SQL块百合不是茶 PL/SQL的过程编程异常 PL/SQL块声明变量
PL/SQL; 过程; 符号; 变量; PL/SQL块; 输出; 异常; PL/SQL 是过程语言(Procedural Language)与结构化查询语言(SQL)结合而成的编程语言PL/SQL 是对 SQL 的扩展,sql的执行时每次都要写操作
Mockito(三)--完整功能介绍 bijian1013 持续集成 mockito 单元测试
mockito官网：http://code.google.com/p/mockito/，打开documentation可以看到官方最新的文档资料。一.使用mockito验证行为 //首先要import Mockito import static org.mockito.Mockito.*; //mo
精通Oracle10编程SQL(8)使用复合数据类型 bijian1013 oracle 数据库 plsql
/* *使用复合数据类型 */ --PL/SQL记录 --定义PL/SQL记录 --自定义PL/SQL记录 DECLARE TYPE emp_record_type IS RECORD( name emp.ename%TYPE, salary emp.sal%TYPE, dno emp.deptno%TYPE ); emp_
【Linux常用命令一】grep命令 bit1129 Linux常用命令
grep命令格式 grep [option] pattern [file-list] grep命令用于在指定的文件(一个或者多个,file-list)中查找包含模式串(pattern)的行,[option]用于控制grep命令的查找方式。 pattern可以是普通字符串，也可以是正则表达式，当查找的字符串包含正则表达式字符或者特
mybatis3入门学习笔记白糖_ sql ibatis qq jdbc 配置管理
MyBatis 的前身就是iBatis，是一个数据持久层(ORM)框架。 MyBatis 是支持普通 SQL 查询，存储过程和高级映射的优秀持久层框架。MyBatis对JDBC进行了一次很浅的封装。以前也学过iBatis，因为MyBatis是iBatis的升级版本，最初以为改动应该不大，实际结果是MyBatis对配置文件进行了一些大的改动，使整个框架更加方便人性化。
Linux 命令神器：lsof 入门 ronin47 lsof
lsof是系统管理/安全的尤伯工具。我大多数时候用它来从系统获得与网络连接相关的信息，但那只是这个强大而又鲜为人知的应用的第一步。将这个工具称之为lsof真实名副其实，因为它是指“列出打开文件（lists openfiles）”。而有一点要切记，在Unix中一切（包括网络套接口）都是文件。有趣的是，lsof也是有着最多
java实现两个大数相加，可能存在溢出。 bylijinnan java实现
import java.math.BigInteger; import java.util.regex.Matcher; import java.util.regex.Pattern; public class BigIntegerAddition { /** * 题目：java实现两个大数相加，可能存在溢出。 * 如123456789 + 987654321
Kettle学习资料分享，附大神用Kettle的一套流程完成对整个数据库迁移方法 Kai_Ge Kettle
Kettle学习资料分享 Kettle 3.2 使用说明书目录概述..........................................................................................................................................7 1.Kettle 资源库管
[货币与金融]钢之炼金术士 comsci 金融
自古以来,都有一些人在从事炼金术的工作.........但是很少有成功的那么随着人类在理论物理和工程物理上面取得的一些突破性进展...... 炼金术这个古老
Toast原来也可以多样化 dai_lm android toast
Style 1：默认 Toast def = Toast.makeText(this, "default", Toast.LENGTH_SHORT); def.show(); Style 2：顶部显示 Toast top = Toast.makeText(this, "top", Toast.LENGTH_SHORT); t
java数据计算的几种解决方法3 datamachine java hadoop ibatis r-langue r
4、iBatis 简单敏捷因此强大的数据计算层。和Hibernate不同，它鼓励写SQL，所以学习成本最低。同时它用最小的代价实现了计算脚本和JAVA代码的解耦，只用20%的代价就实现了hibernate 80%的功能,没实现的20%是计算脚本和数据库的解耦。复杂计算环境是它的弱项，比如：分布式计算、复杂计算、非数据
向网页中插入透明Flash的方法和技巧 dcj3sjt126com html Web Flash
将 Flash 作品插入网页的时候，我们有时候会需要将它设为透明，有时候我们需要在Flash的背面插入一些漂亮的图片，搭配出漂亮的效果……下面我们介绍一些将Flash插入网页中的一些透明的设置技巧。　　一、Swf透明、无坐标控制　　首先教大家最简单的插入Flash的代码，透明，无坐标控制：　　注意wmode="transparent"是控制Flash是否透明
ios UICollectionView的使用 dcj3sjt126com
UICollectionView的使用有两种方法，一种是继承UICollectionViewController，这个Controller会自带一个UICollectionView；另外一种是作为一个视图放在普通的UIViewController里面。个人更喜欢第二种。下面采用第二种方式简单介绍一下UICollectionView的使用。 1.UIViewController实现委托，代码如
Eos平台java公共逻辑蕃薯耀 Eos平台java公共逻辑 Eos平台 java公共逻辑
Eos平台java公共逻辑 >>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 2015年6月1日 17:20:4
SpringMVC4零配置--Web上下文配置【MvcConfig】 hanqunfeng springmvc4
与SpringSecurity的配置类似，spring同样为我们提供了一个实现类WebMvcConfigurationSupport和一个注解@EnableWebMvc以帮助我们减少bean的声明。 applicationContext-MvcConfig.xml  <
解决ie和其他浏览器poi下载excel文件名乱码 jackyrong Excel
使用poi,做传统的excel导出，然后想在浏览器中，让用户选择另存为，保存用户下载的xls文件，这个时候，可能的是在ie下出现乱码（ie,9,10,11),但在firefox,chrome下没乱码，因此必须综合判断，编写一个工具类： /** * * @Title: pro
挥洒泪水的青春 lampcy 编程生活程序员
2015年2月28日，我辞职了，离开了相处一年的触控，转过身--挥洒掉泪水，毅然来到了兄弟连，背负着许多的不解、质疑——”你一个零基础、脑子又不聪明的人，还敢跨行业，选择Unity3D？“，”真是不自量力••••••“，”真是初生牛犊不怕虎•••••“，••••••我只是淡淡一笑，拎着行李----坐上了通向挥洒泪水的青春之地——兄弟连！这就是我青春的分割线，不后悔，只会去用泪水浇灌——已经来到
稳增长之中国股市两点意见-----严控做空，建立涨跌停版停牌重组机制 nannan408
对于股市，我们国家的监管还是有点拼的，但始终拼不过飞流直下的恐慌，为什么呢？笔者首先支持股市的监管。对于股市越管越荡的现象，笔者认为首先是做空力量超过了股市自身的升力，并且对于跌停停牌重组的快速反应还没建立好，上市公司对于股价下跌没有很好的利好支撑。我们来看美国和香港是怎么应对股灾的。美国是靠禁止重要股票做空，在
动态设置iframe高度(iframe高度自适应) Rainbow702 JavaScript iframe contentDocument 高度自适应局部刷新
如果需要对画面中的部分区域作局部刷新，大家可能都会想到使用ajax。但有些情况下，须使用在页面中嵌入一个iframe来作局部刷新。对于使用iframe的情况，发现有一个问题，就是iframe中的页面的高度可能会很高，但是外面页面并不会被iframe内部页面给撑开，如下面的结构： <div id="content"> <div id=&quo
用Rapael做图表 tntxia rap
function drawReport(paper,attr,data){ var width = attr.width; var height = attr.height; var max = 0; &nbs
HTML5 bootstrap2网页兼容（支持IE10以下） xiaoluode html5 bootstrap
<!DOCTYPE html> <html> <head lang="zh-CN"> <meta charset="UTF-8"> <meta http-equiv="X-UA-Compatible" content="IE=edge">

实用教程详解：用OpenCV的DNN模块部署YOLOv5目标检测

导读：

1. 把Pytorch的训练模型.pth文件转换到.onnx文件

2. OpenCV的DNN模块读取.onnx文件做前向计算

你可能感兴趣的:(opencv_DNN)