YOLO论文的概括理解

论文题目:You Only Look Once: Unified, Real-Time Object Detection

论文地址:https://arxiv.org/abs/1506.02640

YOLO论文的概括理解_第1张图片

RCNN系列都是先生成候选区域,在对候选区域进行分类回归,YOLO提出了一种不同方式,直接像CNN分类那样进行端到端的网络。输入一整张图片经过YOLO以后输出98个候选框的移动量,与属于哪一类的概率。

 

YOLO论文的概括理解_第2张图片

将输入图片划分成7*7个grid cell,每个grid cell 预测两个bbox。一共就有49个grid cell,所以一共预测98个。为什么要说这些呢?因为期望的输出是通过这些grid cell产生的。即损失函数里面的标记值是GT与grid cell一起产生的。

具体请看原文。

你可能感兴趣的:(论文理解)