xiaoweiyuya

论文阅读|HigherHRNet

HigherHRNet: Scale-Aware Representation Learning forBottom-Up Human Pose Estimation

原文：https://openaccess.thecvf.com/content_CVPR_2020/papers/Cheng_HigherHRNet_Scale-Aware_Representation_Learning_for_Bottom-Up_Human_Pose_Estimation_CVPR_2020_paper.pdfhttps://openaccess.thecvf.com/content_CVPR_2020/papers/Cheng_HigherHRNet_Scale-Aware_Representation_Learning_for_Bottom-Up_Human_Pose_Estimation_CVPR_2020_paper.pdf

参考资料：(64条消息) HigherHRNet 论文阅读笔记_酉意铭的博客-CSDN博客_higherhrnet

HigherHRNet：更长更宽更高更强_openRiemann的blog-CSDN博客

代码：GitHub - HRNet/HigherHRNet-Human-Pose-Estimation: This is an official implementation of our CVPR 2020 paper "HigherHRNet: Scale-Aware Representation Learning for Bottom-Up Human Pose Estimation" (https://arxiv.org/abs/1908.10357)

Abstract

Introduction

our controbutions:

自上而下的方法

自下而上的方法

特征金字塔

高分辨率特征图

Higher-Resolution Network

HigherHRNet

HRNet

HigherHRNet

Grouping

Deconvolution Module

Multi-Resolution Supervision

Heatmap Aggregation for Inference

Experiments

COCO Keypoint detection

消融实验

HRNet vs. HigherHRNet

HigherHRNet gain breakdown.

Training with larger image size

Larger backbone

CrowdPose

Conclusion

Abstract

对于small persons，自下而上的人体姿态估计方法存在困难，在这篇文章中提出HigherHRNet:一种新的自下而上的人体姿势估计方法，用于使用高分辨率特征金字塔学习尺度感知表示。采用了用于训练的多分辨率监督和用于推理的多分辨率聚合，能够解决自下而上的多人姿势估计中的尺度变化挑战，并能更精确地定位关键点，尤其是对于小人物。HigherHRNet中的特征金字塔包括HRNet的特征图输出和通过转置卷积进行上采样的高分辨率输出。

在COCO test-dev中，HigherHRNet的中等人体的AP性能比以前最佳的自下而上方法高2.5％，显示了其在处理尺度变化方面的有效性。此外，HigherHRNet在COCO test-dev（AP: 70.5％）上获得了最新的最新结果，而无需使用优化或其他后处理技术，从而超越了所有现有的自下而上的方法。 HigherHRNet甚至在CrowdPose测试（AP：67.6％）上超过了所有自上而下的方法，表明它在拥挤场景中的稳健性。

Introduction

自下而上的方法首先通过预测不同解剖关键点的热图来定位输入图像中所有人员的无身份关键点，然后将它们分组为个人实例。这种策略有效地使自下而上的方法更快，更有能力实现实时姿态估计。然而，由于自下而上的方法需要处理尺度变化，自下而上的方法和自上而下的方法的性能仍然存在较大的差距，尤其是对于小规模的人。

自下而上方法预测小人物的关键点方面的挑战：

一是处理尺度变化，即在不牺牲大人物的性能的情况下提高小人物的性能。
另一个是生成高质量的高分辨率热图，用于精确定位小人物的关键点。

以前的自底向上方法主要集中在对关键点进行分组，简单地使用单一分辨率的特征图，即输入图像分辨率的1/4来预测关键点的热图。这些方法忽略了尺度变化的挑战，在推理过程中依赖于图像金字塔（图 1（a））。特征金字塔是处理尺度变化的基本组件，然而，自上而下特征金字塔中较小分辨率的特征图通常会遇到第二个挑战。 PersonLab [33] 通过增加输入分辨率来生成高分辨率热图（图 1（b））。虽然小人物的表现随着输入分辨率持续增加，但当输入分辨率太大时，大人物的表现开始下降 .为了解决这些挑战，在不牺牲计算成本的情况下，以自然而简单的方式为自下而上的关键点预测生成空间上更准确和尺度感知的热图至关重要。

HigherHRNet 通过新的高分辨率特征金字塔模块生成高分辨率热图。与传统的特征金字塔从 1/32 分辨率开始，使用带横向连接的双线性上采样逐渐将特征图分辨率提高到 1/4 不同，高分辨率特征金字塔直接从1/4分辨率开始，这是最高分辨率的特征。在主干中，并通过反卷积生成更高分辨率的特征图（图 1（c））。我们在 HRNet [38, 40] 的 1/4 分辨率路径上构建高分辨率特征金字塔，使其高效。为了使 HigherHRNet 能够处理尺度变化，我们进一步提出了一种多分辨率监督策略，将不同分辨率的训练目标分配给相应的特征金字塔级别。最后，我们在推理过程中引入了一种简单的多分辨率热图聚合策略，以生成具有尺度感知的高分辨率热图。

HigherHRNet在COCO2017 test-dev上无需任何后期处理即可达到70.5％的AP，大大优于所有现有的自下而上的方法。此外，我们观察到，大多数收益来自中级人体（关键点检测任务没有小人体标注），HigherHRNet在不牺牲性能的情况下，对中型人体的性能比以前最佳的自下而上方法高2.5％。大人体（+0.3％AP）。这一观察结果证明HigherHRNet确实在解决尺度变化难题。我们还为新的CrowdPose [24]数据集上的自下而上方法提供了坚实的基础。我们的HigherHRNet在CrowdPose测试中的AP达到67.6％，超过了所有现有方法。该结果表明，自下而上的方法在拥挤的场景中自然具有优势。

our controbutions:

试图解决在自下而上的多人姿态估计中很少研究的尺度变化挑战。
在训练阶段生成具有多分辨率监督的高分辨率特征金字塔，在推理阶段生成多分辨率热图聚合，以预测对小人物有益的尺度感知的高分辨率热图。
HigherHRNet在具有挑战性的COCO数据集上有效，优于所有其他自下而上的方法，尤其是针对medium person。
在人群姿势数据集上获得了一个新的最先进的结果，这表明自下而上的方法比自上而下的方法更适用于拥挤的场景。

自上而下的方法

自下而上的方法

特征金字塔

高分辨率特征图

生成高分辨率特征图的方法主要有4种。

Encoderdecoder：捕获编码器路径中的上下文信息，并恢复解码器路径中的高分辨率特征。解码器通常包含一系列双线性上采样操作，并具有相同分辨率的编码器功能的跳过连接。
扩展卷积（也称为“atrous”卷积）用于删除多个跨步卷积/最大池，以保留特征图分辨率。扩散卷积可防止丢失空间信息，但会带来更多的计算成本。
在网络末端依次使用反卷积（转置卷积），以有效地提高特征图的分辨率。 SimpleBaseline [42]演示了反卷积可以生成用于热图预测的高质量特征图。
最近，提出了一种高分辨率网络HRNet，作为在整个网络上保持高分辨率传输的有效方法。 HRNet由具有不同分辨率的多个分支组成。较低分辨率的分支捕获上下文信息，而较高分辨率的分支保留空间信息。通过分支之间的多尺度融合，HRNet可以生成具有丰富语义的高分辨率特征图

我们采用HRNet作为我们的基础网络来生成高质量的特征图。并且我们添加了一个反卷积模块，以生成更高分辨率的特征图以预测热图。生成的模型称为“尺度感知“的高分辨率网络HigherHRNet。由于HRNet 和反卷积都是有效的，HigherHRNet是一种高效模型，可用于生成用于热图预测的高分辨率特征图。

Higher-Resolution Network

HigherHRNet

HRNet

HRNet在第一阶段从高分辨率分支开始。在随后的每个阶段中，都会将一个新分支与当前分支中分辨率最低的1/2并行添加到当前分支中。随着网络具有更多阶段，它将具有更多具有不同分辨率的并行分支，并且先前阶段的分辨率都保留在以后阶段。图2显示了一个包含3个并行分支的示例网络结构。

我们使用与HRNet类似的方式实例化backbone。网络从一个stem开始，该stem由两个跨步的3×3卷积组成，将分辨率降低到1/ 4。第一级包含4个残差单元，其中每个单元由一个bottleneck（宽度（通道数）为64）形成，然后是一个3×3卷积，将特征图的宽度减小到C。第二，第三，第四级包含1， 4个和3个多分辨率块。四个分辨率的卷积宽度分别为C，2C，4C和8C。多分辨率群卷积中的每个分支都有4个残差单位，每个单元在每个分辨率中都有2个3×3卷积。通过将C分别设置为32和48，我们可以测试两个容量不同的网络。

HRNet最初是为自上而下的姿势估计而设计的。在这项工作中，我们通过添加1×1卷积来预测热图和标记图，从而将HRNet应用于自下而上的方法，类似于[30]。我们仅使用最高分辨率（输入图像的1/4）的特征图进行预测。 [30]之后，我们为每个关键点使用标量tag。

HigherHRNet

热图的分辨率对于预测小型人群的关键点很重要。现有的大多数人体姿势估计方法都是通过准备ground truth 热图来预测高斯平滑的热图，并将未标准化的高斯核应用于每个关键点位置。添加此高斯核有助于训练网络，因为CNN倾向于输出空间平滑的响应，这是卷积运算的本质。但是，应用高斯核也会给关键点的精确定位带来混乱，特别是对于属于小人物的关键点。减少这种混乱的简单方法是减少高斯核的标准偏差。但是，从经验上我们发现，这会使优化变得更加困难，并导致更糟糕的结果。

我们没有减小标准差，而是通过在不同分辨率下预测标准差不变的更高分辨率的热图来解决这个问题，自下而上的方法通常以输入图像分辨率为1/4预测热图。然而，我们发现这个分辨率不足以预测准确的热图。受[42](它表明反卷积可以有效地生成高质量和高分辨率的特征图)的启发，我们在HRNet中最高分辨率的特征图的基础之上通过增加一个反卷积模块来构建HigherHRNet，如图2所示，如第3.3节所述。

反卷积模块将来自HRNet的特征和预测热图作为输入，并生成分辨率比输入特征图大2倍的新特征图。因此，反卷积模块会与HRNet的特征图一起生成具有两种分辨率的特征金字塔。反卷积模块还通过添加额外的1×1卷积来预测热图。我们遵循第3.4节，以不同的分辨率训练热图预测变量，并使用第3.5节中所述的热图聚合策略进行推理。

如果需要更大的分辨率，可以添加更多的反卷积模块。我们发现反卷积模块的数量取决于数据集人体尺度的分布。一般而言，包含较小人体的数据集需要较大分辨率的特征图才能进行预测，反之亦然。在实验中，我们发现添加单个反卷积模块可在COCO数据集上实现最佳性能。

Grouping

最近的工作[30，23]表明，可以通过使用关联嵌入的简单方法以高精度解决分组问题。有证据表明，[30]中的实验结果表明，在带有COCO关键点检测数据集的500个训练图像上，使用具有预测tags的ground truth检测将AP从59.2提高到94.0 [27] 。我们遵循[30]将关联嵌入（associative embedding）用于关键点分组。分组过程通过将tags具有小的L2距离的关键点分组，将无身份的关键点聚类为多个个体。

Deconvolution Module 转置卷积

我们提出了一个简单的反卷积模块，用于生成高质量的特征图，其分辨率是输入特征图的两倍。 [42]之后，我们使用4×4反卷积（也称为转置卷积），然后使用BatchNorm和ReLU来学习对输入特征图进行上采样。可选地，我们可以在反卷积之后进一步添加几个基本残差块，以细化上采样的特征图。我们在HigherHRNet中添加4个残差块。

与[42]不同，反卷积模块的输入是来自HRNet或以前的反卷积模块的特征图和预测的热图的串联。每个反卷积模块的输出特征图也可用于以多尺度方式预测热图。

Multi-Resolution Supervision 多分辨率监督

与其他仅对最大分辨率热图应用监视的自下而上的方法不同，我们在训练过程中引入了多分辨率监督以处理尺度变化。我们将ground truth关键点位置转换为所有分辨率的热图上的位置，以生成具有不同分辨率的ground truth热图。然后，我们将具有相同标准偏差（默认情况下使用标准偏差= 2）的高斯核应用于所有这些ground truth热图。我们发现重要的是不要缩放高斯核的标准偏差。这是因为特征金字塔的不同分辨率适合于预测不同尺度的关键点。在更高分辨率的特征图上，需要相对较小的标准偏差（与特征图的分辨率相比）以更精确地定位小人物的关键点。

在HigherHRNet中的每个预测尺度上，我们计算该尺度的预测热图与其关联的ground truth热图之间的均方误差。热图的最终损失是所有分辨率的均方误差之和。

值得强调的是，由于以下原因，我们没有将不同尺度的人体分配给特征金字塔中的不同级别。首先，用于分配训练目标的启发式方法取决于数据集和网络体系结构。由于数据集（人对所有目标的尺度分布）和体系结构（HigherHRNet仅具有2个金字塔等级，而FPN有4个）变化，很难将FPN 的启发式方法转换为HigherHRNet。其次，由于我们应用了高斯核，因此ground truth关键点目标彼此相互作用。因此，仅通过设置忽略区域来分离关键点非常困难。我们认为模型能够自动关注特征金字塔不同级别中的特定尺度。

在HigherHRNet当中， tagmap的训练与热图不同。我们仅以最低分辨率预测标签图，而不使用所有分辨率。这是因为学习标记图需要全局推理，它更适合于以较低的分辨率预测标记图。根据经验，我们还发现更高的分辨率无法很好地预测标签图，甚至无法收敛。因此，我们遵循[30]来以 $\frac{1}{4}$ 分辨率的输入图像在特征图上训练标签图。

Heatmap Aggregation for Inference 热图聚合

我们提出了推理过程中的热图聚合策略。我们使用双线性插值法将具有不同分辨率的所有预测热图上采样到输入图像的分辨率，并平均所有尺度的热图以进行最终预测。此策略与以前的方法完全不同，以前的方法仅使用单个尺度或单个阶段的热图进行预测。

我们使用热图聚合的原因是为了启用尺度感知姿势估计。例如，COCO关键点数据集包含从 $32^{2}$ 个像素到超过 $128 ^{2}$ 个像素的大规模尺度变化的人。自上而下的方法通过将人的区域近似标准化为单个尺度来解决此问题。但是，自下而上的方法需要注意尺度，以从所有尺度中检测关键点。我们在HigherHRNet中发现了不同尺度的热图，更好地捕获了不同尺度的关键点。例如，可以在较高分辨率的热图中恢复在较低分辨率的热图中丢失的小人们的关键点。因此，对来自不同分辨率的预测热图进行平均，使HigherHRNet成为可识别尺度的姿势估计器。

Experiments

COCO Keypoint detection

Tabel1:COCO2017测试集上自下而上的方法的比较

从结果可以看出，使用HRNet本身已成为自下而上方法（64.1 AP）的简单而强大的基准。我们的仅使用单一尺度测试的HRNet baseline方法优于使用多尺度测试的Hourglass，而HRNet在FLOP方面的参数和计算量要少得多。配备轻量级反卷积模块，我们提出的HigherHRNet（66.4 AP）在参数（+0.4％）和FLOPs（+23.1％）略有增加的情况下，以+2.3 AP胜过HRNet。 HigherHRNet可与PersonLab 媲美，但参数仅为50％，FLOP为11％。如果我们进一步使用多尺度测试，我们的HigherHRNet将达到70.5的AP，大大优于所有现有的自下而上的方法。在[3，30]中，我们不使用任何自上而下的方法来进行后期处理，例如进行优化。

表2列出了COCO2017 test-dev数据集的自下而上和自上而下的方法。 HigherHRNet进一步缩小了自下而上和自上而下方法之间的性能差距。

消融实验

HRNet vs. HigherHRNet

对于HigherHRNet，使用无额外残差块的反卷积模块，并且使用热图聚合进行推理。结果显示在表3中。通过使用特征步长为4的HRNet的简单的自下而上的基线可以达到AP = 64.4。通过添加一个反卷积模块，我们的HighHRHRNet的特征跨度为2，大大超过了HRNet +2.5 AP（实现了66.9 AP）。此外，主要改进来自中型人体，其中APM从HRNet的57.1提高到HigherHRNet的61.0。

这些结果表明，HigherHRNet由于具有高分辨率的热图，因此在小尺度下的性能要好得多。我们还发现大人体姿势的AP不会下降。这主要是因为我们还使用较小分辨率的热图进行预测。它表明

以更高的分辨率进行预测对自下而上的姿势估计很有帮助
尺度感知预测很重要。

如果我们在HRNet之后添加两个反卷积模块的序列以生成与输入图像具有相同分辨率的特征图，则会观察到性能从66.9 AP降低到66.5 AP，仅添加一个反卷积模块。中型人体的改善很小（+0.1 AP），但大人体的表现却有很大的下降（-0.8 AP）。我们假设这是因为特征图尺度和目标尺度之间的不匹配。较大的分辨率特征图（特征步幅= 1）适合于检测甚至更小的人的关键点，但不考虑COCO中的小人进行姿势估计。因此，默认情况下，我们仅对COCO数据集使用一个反卷积模块。但我们想指出的是，级联反卷积模块的数量应取决于数据集，我们将在以后的工作中在更多数据集上对此进行验证。

HigherHRNet gain breakdown.

为了更好地理解所提出组件的增益，我们对每个单独的组件进行了详细的消融研究。图3展示了我们实验的所有架构。结果示于表4。

反卷积模块的效果

我们对添加反卷积模块以生成更高分辨率的热图的效果进行消融研究。为了公平地比较，我们仅使用最高分辨率的特征图来生成用于预测的热图（图3（b））。 HRNet（图3（a））达到了64.4 AP的baseline。通过添加一个反卷积模块，该模型可实现66.0 AP，这比baseline好1.6 AP。这种改进完全归因于在更大的更高质量的特征图上进行预测。该结果验证了我们的主张，即对于自下而上的姿势估计，预测更高分辨率的特征图非常重要。

特征连接的效果

我们将特征图与来自HRNet的预测热图连接起来，作为反卷积模块的输入（图3（c）），性能进一步提高到66.3 AP。我们还观察到，中型人体的收益很大，而大型人体的表现却有所下降。比较方法（a）和（c），以较高的分辨率预测热图的收益主要来自中等人体（+3.7APM）。此外，大人体的AP下降（-1.6 AP）证明了我们的主张，即特征图的不同分辨率对不同尺度的人敏感。

热图聚合的效果

我们根据热图聚合策略进一步使用热图的所有分辨率进行inference（图3（d））。与仅使用最高分辨率的热图进行inference的图3（c）（66.3 AP）相比，应用热图聚合策略可实现66.9 AP。比较方法（d）和（e），热图聚合的收益来自大人体（+1.7 AP）。大人体的表现甚至比较低分辨率下的预测要好一些（方法（a））。这意味着使用热图聚合策略预测热图是真正尺度感知的。

额外残差块的效果

我们在反卷积模块中添加了4个残差块，我们的最佳模型实现了67.1 AP。添加残差块可以进一步细化特征图，并且同样增加中型和大型人员的AP。

Training with larger image size

一个自然的问题是，使用更大的输入size进行训练是否可以进一步提高性能？为了回答这个问题，我们用640×640和768×768训练HigherHRNet，结果如表5所示，所有三种模型都使用训练图像尺寸进行了测试。我们发现，通过将训练图像大小增加到640，可以显着提高AP的1.4增益。大部分收益来自中型人体，而大型人体的表现则略有下降。当我们进一步将训练图像大小更改为768时，整个AP不再变化。我们观察到中等人体的略微改善以及大人体的大幅度衰减。

Larger backbone

在先前的实验中，我们使用HRNet-W32（1/4分辨率特征图具有32个通道）作为backbone。我们使用较大backbone 的HRNet W40和HRNet-W48进行实验。结果显示在表6中。我们发现使用较大的backbone可以持续提高中型和大型人体的性能。

CrowdPose

CrowdPose数据集由20,000张图像组成，包含约80,000个人。训练，验证和测试子集按5：1：4的比例分配。与COCO关键点数据集相比，CrowdPose的场景更为拥挤，给姿势估计方法带来了更多挑战。评估指标与COCO相同。

另一方面，自下而上的方法自然在拥挤的场景中具有优势。为了验证HigherHRNet在拥挤场景中的稳健性，以及为自下而上的方法设置一个强大的基准。我们在CrowdPose训练和val集合上训练了最好的HigherHRNet-W48模型，并在测试集中报告了性能。所有训练参数均严格遵循COCO，我们使用640×640的crop size进行训练和测试。

结果显示在表7中。我们的HigherHRNet优于单纯的自上而下的方法，大大提高了6.6 AP。 HigherHRNet还以1.6 AP优于以前的最佳方法SPPE（对自上而下的方法[15]进行了global refinement），大部分收益来自APM（+1.8 AP）和APH（+1.5 AP），其中包含人群最多的图像。即使没有多尺度测试，HigherHRNet在 $AP^{H}$ 中也比SPPE高出0.5。

Conclusion

高分辨率特征金字塔——由HRNet的特征图输出加上转置卷积上采样输出组成——用于尺度感知
多分辨率监督——用于训练（让模型同时关注多尺度）
对分辨率聚合——用于推理（增加模型的尺度感知能力）
特征连接和额外的残差块（模型内部的细节调整，让最后的结果更加准确）

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
将cmd中命令输出保存为txt文本文件落难Coder Windows cmd window
最近深度学习本地的训练中我们常常要在命令行中运行自己的代码，无可厚非，我们有必要保存我们的炼丹结果，但是复制命令行输出到txt是非常麻烦的，其实Windows下的命令行为我们提供了相应的操作。其基本的调用格式就是：运行指令>输出到的文件名称或者具体保存路径测试下，我打开cmd并且ping一下百度：pingwww.baidu.com>./data.txt看下相同目录下data.txt的输出：如果你再
【目标检测数据集】卡车数据集1073张VOC+YOLO格式熬夜写代码的平头哥∰ 目标检测 YOLO 人工智能
数据集格式：PascalVOC格式+YOLO格式(不包含分割路径的txt文件，仅仅包含jpg图片以及对应的VOC格式xml文件和yolo格式txt文件)图片数量(jpg文件个数)：1073标注数量(xml文件个数)：1073标注数量(txt文件个数)：1073标注类别数：1标注类别名称:["truck"]每个类别标注的框数：truck框数=1120总框数：1120使用标注工具：labelImg标注
番茄西红柿叶子病害分类数据集12882张11类别 futureflsl 数据集分类数据挖掘人工智能
数据集类型：图像分类用，不可用于目标检测无标注文件数据集格式：仅仅包含jpg图片，每个类别文件夹下面存放着对应图片图片数量(jpg文件个数)：12882分类类别数：11类别名称:["Bacterial_Spot_Bacteria","Early_Blight_Fungus","Healthy","Late_Blight_Water_Mold","Leaf_Mold_Fungus","Powdery
推荐3家毕业AI论文可五分钟一键生成！文末附免费教程！小猪包333 写论文人工智能 AI写作深度学习计算机视觉
在当前的学术研究和写作领域，AI论文生成器已经成为许多研究人员和学生的重要工具。这些工具不仅能够帮助用户快速生成高质量的论文内容，还能进行内容优化、查重和排版等操作。以下是三款值得推荐的AI论文生成器：千笔-AIPassPaper、懒人论文以及AIPaperPass。千笔-AIPassPaper千笔-AIPassPaper是一款基于深度学习和自然语言处理技术的AI写作助手，旨在帮助用户快速生成高质
AI大模型的架构演进与最新发展季风泯灭的季节 AI大模型应用技术二人工智能架构
随着深度学习的发展，AI大模型（LargeLanguageModels,LLMs）在自然语言处理、计算机视觉等领域取得了革命性的进展。本文将详细探讨AI大模型的架构演进，包括从Transformer的提出到GPT、BERT、T5等模型的历史演变，并探讨这些模型的技术细节及其在现代人工智能中的核心作用。一、基础模型介绍：Transformer的核心原理Transformer架构的背景在Transfo
[实践应用] 深度学习之模型性能评估指标 YuanDaima2048 深度学习工具使用深度学习人工智能损失函数性能评估 pytorch python 机器学习
文章总览：YuanDaiMa2048博客文章总览深度学习之模型性能评估指标分类任务回归任务排序任务聚类任务生成任务其他介绍在机器学习和深度学习领域，评估模型性能是一项至关重要的任务。不同的学习任务需要不同的性能指标来衡量模型的有效性。以下是对一些常见任务及其相应的性能评估指标的详细解释和总结。分类任务分类任务是指模型需要将输入数据分配到预定义的类别或标签中。以下是分类任务中常用的性能指标：准确率(
[实践应用] 深度学习之优化器 YuanDaima2048 深度学习工具使用 pytorch 深度学习人工智能机器学习 python 优化器
文章总览：YuanDaiMa2048博客文章总览深度学习之优化器1.随机梯度下降（SGD）2.动量优化（Momentum）3.自适应梯度（Adagrad）4.自适应矩估计（Adam）5.RMSprop总结其他介绍在深度学习中，优化器用于更新模型的参数，以最小化损失函数。常见的优化函数有很多种，下面是几种主流的优化器及其特点、原理和PyTorch实现：1.随机梯度下降（SGD）原理:随机梯度下降通过
生成式地图制图 Bwywb_3 深度学习机器学习深度学习生成对抗网络
生成式地图制图（GenerativeCartography）是一种利用生成式算法和人工智能技术自动创建地图的技术。它结合了传统的地理信息系统（GIS）技术与现代生成模型（如深度学习、GANs等），能够根据输入的数据自动生成符合需求的地图。这种方法在城市规划、虚拟环境设计、游戏开发等多个领域具有应用前景。主要特点：自动化生成：通过算法和模型，系统能够根据输入的地理或空间数据自动生成地图，而无需人工逐
[数据集][目标检测]汽车头部尾部检测数据集VOC+YOLO格式5319张3类别 FL1623863129 数据集目标检测汽车 YOLO
数据集制作单位：未来自主研究中心(FIRC)版权单位：未来自主研究中心(FIRC)版权声明：数据集仅仅供个人使用，不得在未授权情况下挂淘宝、咸鱼等交易网站公开售卖,由此引发的法律责任需自行承担数据集格式：PascalVOC格式+YOLO格式(不包含分割路径的txt文件，仅仅包含jpg图片以及对应的VOC格式xml文件和yolo格式txt文件)图片数量(jpg文件个数)：5319标注数量(xml文件
吴恩达深度学习笔记(30)-正则化的解释极客Array
正则化（Regularization）深度学习可能存在过拟合问题——高方差，有两个解决方法，一个是正则化，另一个是准备更多的数据，这是非常可靠的方法，但你可能无法时时刻刻准备足够多的训练数据或者获取更多数据的成本很高，但正则化通常有助于避免过拟合或减少你的网络误差。如果你怀疑神经网络过度拟合了数据，即存在高方差问题，那么最先想到的方法可能是正则化，另一个解决高方差的方法就是准备更多数据，这也是非常
个人学习笔记7-6：动手学深度学习pytorch版-李沐浪子L 深度学习深度学习笔记计算机视觉 python 人工智能神经网络 pytorch
#人工智能##深度学习##语义分割##计算机视觉##神经网络#计算机视觉13.11全卷积网络全卷积网络（fullyconvolutionalnetwork，FCN）采用卷积神经网络实现了从图像像素到像素类别的变换。引入l转置卷积（transposedconvolution）实现的，输出的类别预测与输入图像在像素级别上具有一一对应关系：通道维的输出即该位置对应像素的类别预测。13.11.1构造模型下
深度学习-点击率预估-研究论文2024-09-14速读 sp_fyf_2024 深度学习人工智能
深度学习-点击率预估-研究论文2024-09-14速读1.DeepTargetSessionInterestNetworkforClick-ThroughRatePredictionHZhong,JMa,XDuan,SGu,JYao-2024InternationalJointConferenceonNeuralNetworks,2024深度目标会话兴趣网络用于点击率预测摘要：这篇文章提出了一种新
计算机视觉中，Pooling的作用 Wils0nEdwards 计算机视觉人工智能
在计算机视觉中，Pooling（池化）是一种常见的操作，主要用于卷积神经网络（CNN）中。它通过对特征图进行下采样，减少数据的空间维度，同时保留重要的特征信息。Pooling的作用可以归纳为以下几个方面：1.降低计算复杂度与内存需求Pooling操作通过对特征图进行下采样，减少了特征图的空间分辨率（例如，高度和宽度）。这意味着网络需要处理的数据量会减少，从而降低了计算量和内存需求。这对大型神经网络
OpenCV图像处理技术（Python）——入门森屿_ opencv
©FuXianjun.AllRightsReserved.OpenCV入门图像作为人类感知世界的视觉基础，是人类获取信息、表达信息的重要手段，OpenCV作为一个开源的计算机视觉库，它包括几百个易用的图像成像和视觉函数，既可以用于学术研究，也可用于工业邻域，它于1999年由因特尔的GaryBradski启动，OpenCV库主要由C和C++语言编写，它可以在多个操作系统上运行。1.1图像处理基本操作
损失函数与反向传播 Star_. PyTorch pytorch 深度学习 python
损失函数定义与作用损失函数(lossfunction)在深度学习领域是用来计算搭建模型预测的输出值和真实值之间的误差。1.损失函数越小越好2.计算实际输出与目标之间的差距3.为更新输出提供依据（反向传播)常见的损失函数回归常见的损失函数有：均方差（MeanSquaredError，MSE）、平均绝对误差（MeanAbsoluteErrorLoss，MAE）、HuberLoss是一种将MSE与MAE
【深度学习】训练过程中一个OOM的问题，太难查了 weixin_40293999 深度学习深度学习人工智能
现象：各位大佬又遇到过ubuntu的这个问题么？现象是在训练过程中，ssh上不去了，能ping通，没死机，但是ubunutu的pc侧的显示器，鼠标啥都不好用了。只能重启。问题原因：OOM了95G，尼玛！！！！pytorch爆内存了，然后journald假死了，在journald被watchdog干掉之后，系统就崩溃了。这种规模的爆内存一般，即使被oomkill了，也要卡半天的，确实会这样，能不能配
CV、NLP、数据控掘推荐、量化海的那边- AI算法自然语言处理人工智能
下面是对CV（计算机视觉）、NLP（自然语言处理）、数据挖掘推荐和量化的简要概述及其应用领域的介绍：1.CV（计算机视觉，ComputerVision）定义：计算机视觉是一门让计算机能够从图像或视频中提取有用信息，并做出决策的学科。它通过模拟人类的视觉系统来识别、处理和理解视觉信息。主要任务：图像分类：识别图像中的物体并分类，比如猫、狗、车等。目标检测：在图像或视频中定位并识别多个对象，如人脸检测
云服务业界动态简报-20180128 Captain7
一、青云青云QingCloud推出深度学习平台DeepLearningonQingCloud，包含了主流的深度学习框架及数据科学工具包，通过QingCloudAppCenter一键部署交付，可以让算法工程师和数据科学家快速构建深度学习开发环境，将更多的精力放在模型和算法调优。二、腾讯云1.腾讯云正式发布腾讯专有云TCE(TencentCloudEnterprise)矩阵，涵盖企业版、大数据版、AI
机器学习VS深度学习 nfgo 机器学习
机器学习（MachineLearning,ML）和深度学习（DeepLearning,DL）是人工智能（AI）的两个子领域，它们有许多相似之处，但在技术实现和应用范围上也有显著区别。下面从几个方面对两者进行区分：1.概念层面机器学习：是让计算机通过算法从数据中自动学习和改进的技术。它依赖于手动设计的特征和数学模型来进行学习，常用的模型有决策树、支持向量机、线性回归等。深度学习：是机器学习的一个子领
大数据毕业设计hadoop+spark+hive知识图谱租房数据分析可视化大屏租房推荐系统 58同城租房爬虫房源推荐系统房价预测系统计算机毕业设计机器学习深度学习人工智能 2401_84572577 程序员大数据 hadoop 人工智能
做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。我先来介绍一下这些东西怎么用，文末抱走。（1）Python所有方向的学习路线（
深度学习-13-小语言模型之SmolLM的使用皮皮冰燃深度学习深度学习
文章附录1SmolLM概述1.1SmolLM简介1.2下载模型2运行2.1在CPU/GPU/多GPU上运行模型2.2使用torch.bfloat162.3通过位和字节的量化版本3应用示例4问题及解决4.1attention_mask和pad_token_id报错4.2max_new_tokens=205参考附录1SmolLM概述1.1SmolLM简介SmolLM是一系列尖端小型语言模型，提供三种规
基于深度学习的农作物病害检测 SEU-WYL 深度学习dnn 深度学习人工智能
基于深度学习的农作物病害检测利用卷积神经网络（CNN）、生成对抗网络（GAN）、Transformer等深度学习技术，自动识别和分类农作物的病害，帮助农业工作者提高作物管理效率、减少损失。1.农作物病害检测的挑战病害种类繁多：农作物病害的类型多样，不同病害在同一作物上的表现差异很大，同时同一种病害在不同生长阶段的症状也可能不同。环境影响：天气、光照、湿度等外部环境因素会影响农作物的表现，使得病害检
基于深度学习的文本引导的图像编辑 SEU-WYL 深度学习dnn 深度学习人工智能
基于深度学习的文本引导的图像编辑（Text-GuidedImageEditing）是一种通过自然语言文本指令对图像进行编辑或修改的技术。它结合了图像生成和自然语言处理（NLP）的最新进展，使用户能够通过描述性文本对图像内容进行精确的调整和操控。1.文本引导的图像编辑的挑战文本和图像之间的对齐：如何将文本中的语义信息准确地映射到图像中的特定区域或元素是一个关键挑战。这涉及到多模态数据的对齐和理解。编
深度学习--对抗生成网络（GAN, Generative Adversarial Network） Ambition_LAO 深度学习生成对抗网络
对抗生成网络（GAN,GenerativeAdversarialNetwork）是一种深度学习模型，由IanGoodfellow等人在2014年提出。GAN主要用于生成数据，通过两个神经网络相互对抗，来生成以假乱真的新数据。以下是对GAN的详细阐述，包括其概念、作用、核心要点、实现过程、代码实现和适用场景。1.概念GAN由两个神经网络组成：生成器（Generator）和判别器（Discrimina
深度学习：怎么看pth文件的参数奥利给少年深度学习人工智能
.pth文件是PyTorch模型的权重文件，它通常包含了训练好的模型的参数。要查看或使用这个文件，你可以按照以下步骤操作：1.确保你有模型的定义你需要有创建这个.pth文件时所用的模型的代码。这意味着你需要有模型的类定义和架构。2.加载模型权重使用PyTorch的load_state_dict方法来加载权重。这里是如何操作的：importtorchimporttorch.nnasnn#定义模型结构
chatgpt赋能python：如何在Python中安装Keras库？ turensu ChatGpt python chatgpt keras 计算机
如何在Python中安装Keras库？Keras是一个简单易用的神经网络库，由FrançoisChollet编写。它在Python编程语言中实现了深度学习的功能，可以使您更轻松地构建和试验不同类型的神经网络。如果您是一名Python开发人员，肯定会想知道如何在您的Python项目中安装Keras库。在本文中，我们将向您展示如何安装和配置Keras库。步骤1：安装Python要使用Keras库，您需
如何理解深度学习的训练过程奋斗的草莓熊深度学习人工智能 python scikit-learn virtualenv numpy pandas
文章目录1.训练是干什么？2.预训练模型进行训练，主要更改的是预训练模型的什么东西？1.训练是干什么？以yolov5为例子，训练的目的是把一组输入猫狗图像放到神经网络中，得到一个输出模型，这个模型下次可以直接用来识别哪个是猫，哪个是狗2.预训练模型进行训练，主要更改的是预训练模型的什么东西？超参数（Hyperparameters）：这是模型结构中定义的参数，比如：卷积核大小（kernel_size
Keras深度学习框架入门及实战指南司莹嫣Maude
Keras深度学习框架入门及实战指南keraskeras-team/keras:是一个基于Python的深度学习库，它没有使用数据库。适合用于深度学习任务的开发和实现，特别是对于需要使用Python深度学习库的场景。特点是深度学习库、Python、无数据库。项目地址:https://gitcode.com/gh_mirrors/ke/keras一、项目介绍Keras简介Keras是一款高级神经网络
深度学习驱动的车牌识别：技术演进与未来挑战逼子歌深度学习车牌识别神经网络字符识别 YOLO 卷积神经网络
一、引言1.1研究背景在当今社会，智能交通系统的发展日益重要，而车牌识别作为其关键组成部分，发挥着至关重要的作用。车牌识别技术广泛应用于交通管理、停车场管理、安防监控等领域。在交通管理中，它可以用于车辆识别、交通违法监控和车流统计等，提高交通管理的效率和准确性。在停车场管理中，实现车辆的自动识别和收费，提升管理和服务水平。在安防监控领域，可用于追踪嫌疑人及犯罪行为。深度学习的出现为车牌识别带来了重
github中多个平台共存 jackyrong github
在个人电脑上，如何分别链接比如oschina,github等库呢，一般教程之列的，默认 ssh链接一个托管的而已，下面讲解如何放两个文件 1）设置用户名和邮件地址 $ git config --global user.name "xx" $ git config --global user.email "[email protected]"
ip地址与整数的相互转换(javascript) alxw4616 JavaScript
//IP转成整型 function ip2int(ip){ var num = 0; ip = ip.split("."); num = Number(ip[0]) * 256 * 256 * 256 + Number(ip[1]) * 256 * 256 + Number(ip[2]) * 256 + Number(ip[3]); n
读书笔记-jquey+数据库+css chengxuyuancsdn html jquery oracle
1、grouping ,group by rollup, GROUP BY GROUPING SETS区别 2、$("#totalTable tbody>tr td:nth-child(" + i + ")").css({"width":tdWidth, "margin":"0px", &q
javaSE javaEE javaME == API下载 Array_06 java
oracle下载各种API文档： http://www.oracle.com/technetwork/java/embedded/javame/embed-me/documentation/javame-embedded-apis-2181154.html JavaSE文档： http://docs.oracle.com/javase/8/docs/api/ JavaEE文档： ht
shiro入门学习 cugfy java Web 框架
声明本文只适合初学者，本人也是刚接触而已，经过一段时间的研究小有收获，特来分享下希望和大家互相交流学习。首先配置我们的web.xml代码如下，固定格式，记死就成 <filter> <filter-name>shiroFilter</filter-name> &nbs
Array添加删除方法 357029540 js
刚才做项目前台删除数组的固定下标值时，删除得不是很完整，所以在网上查了下，发现一个不错的方法，也提供给需要的同学。 //给数组添加删除 Array.prototype.del = function(n){
navigation bar 更改颜色张亚雄 IO
今天郁闷了一下午，就因为objective-c默认语言是英文，我写的中文全是一些乱七八糟的样子，到不是乱码，但是，前两个自字是粗体，后两个字正常体，这可郁闷死我了，问了问大牛，人家告诉我说更改一下字体就好啦，比如改成黑体，哇塞，茅塞顿开。翻书看，发现，书上有介绍怎么更改表格中文字字体的，代码如下
unicode转换成中文 adminjun unicode 编码转换
在Java程序中总会出现\u6b22\u8fce\u63d0\u4ea4\u5fae\u535a\u641c\u7d22\u4f7f\u7528\u53cd\u9988\uff0c\u8bf7\u76f4\u63a5这个的字符，这是unicode编码，使用时有时候不会自动转换成中文就需要自己转换了使用下面的方法转换一下即可。 /** * unicode 转换成中文
一站式 Java Web 框架 firefly aijuans Java Web
Firefly是一个高性能一站式Web框架。涵盖了web开发的主要技术栈。包含Template engine、IOC、MVC framework、HTTP Server、Common tools、Log、Json parser等模块。 firefly-2.0_07修复了模版压缩对javascript单行注释的影响，并新增了自定义错误页面功能。更新日志：增加自定义系统错误页面功能
设计模式——单例模式 ayaoxinchao 设计模式
定义 Java中单例模式定义：“一个类有且仅有一个实例，并且自行实例化向整个系统提供。” 分析从定义中可以看出单例的要点有三个：一是某个类只能有一个实例；二是必须自行创建这个实例；三是必须自行向系统提供这个实例。 &nb
Javascript 多浏览器兼容性问题及解决方案 BigBird2012 JavaScript
不论是网站应用还是学习js,大家很注重ie与firefox等浏览器的兼容性问题，毕竟这两中浏览器是占了绝大多数。一、document.formName.item(”itemName”) 问题问题说明：IE下，可以使用 document.formName.item(”itemName”) 或 document.formName.elements ["elementName&quo
JUnit-4.11使用报java.lang.NoClassDefFoundError: org/hamcrest/SelfDescribing错误 bijian1013 junit4.11 单元测试
下载了最新的JUnit版本，是4.11，结果尝试使用发现总是报java.lang.NoClassDefFoundError: org/hamcrest/SelfDescribing这样的错误，上网查了一下，一般的解决方案是，换一个低一点的版本就好了。还有人说，是缺少hamcrest的包。去官网看了一下，如下发现：
[Zookeeper学习笔记之二]Zookeeper部署脚本 bit1129 zookeeper
Zookeeper伪分布式安装脚本(此脚本在一台机器上创建Zookeeper三个进程，即创建具有三个节点的Zookeeper集群。这个脚本和zookeeper的tar包放在同一个目录下，脚本中指定的名字是zookeeper的3.4.6版本，需要根据实际情况修改)： #!/bin/bash #!!!Change the name!!! #The zookeepe
【Spark八十】Spark RDD API二 bit1129 spark
coGroup package spark.examples.rddapi import org.apache.spark.{SparkConf, SparkContext} import org.apache.spark.SparkContext._ object CoGroupTest_05 { def main(args: Array[String]) { v
Linux中编译apache服务器modules文件夹缺少模块(.so)的问题 ronin47 modules
在modules目录中只有httpd.exp，那些so文件呢？我尝试在fedora core 3中安装apache 2. 当我解压了apache 2.0.54后使用configure工具并且加入了 --enable-so 或者 --enable-modules=so (两个我都试过了) 去make并且make install了。我希望在/apache2/modules/目录里有各种模块，
Java基础-克隆 BrokenDreams java基础
Java中怎么拷贝一个对象呢？可以通过调用这个对象类型的构造器构造一个新对象，然后将要拷贝对象的属性设置到新对象里面。Java中也有另一种不通过构造器来拷贝对象的方式，这种方式称为克隆。 Java提供了java.lang.
读《研磨设计模式》-代码笔记-适配器模式-Adapter bylijinnan java 设计模式
声明：本文只为方便我个人查阅和理解，详细的分析以及源代码请移步原作者的博客http://chjavach.iteye.com/ package design.pattern; /* * 适配器模式解决的主要问题是，现有的方法接口与客户要求的方法接口不一致 * 可以这样想，我们要写这样一个类（Adapter）: * 1.这个类要符合客户的要求 ---> 那显然要
HDR图像PS教程集锦&心得 cherishLC PS
HDR是指高动态范围的图像，主要原理为提高图像的局部对比度。软件有photomatix和nik hdr efex。一、教程叶明在知乎上的回答： http://www.zhihu.com/question/27418267/answer/37317792 大意是修完后直方图最好是等值直方图，方法是HDR软件调一遍，再结合不透明度和蒙版细调。二、心得 1、去除阴影部分的
maven-3.3.3 mvn archetype 列表 crabdave ArcheType
maven-3.3.3 mvn archetype 列表可以参考最新的：http://repo1.maven.org/maven2/archetype-catalog.xml [INFO] Scanning for projects... [INFO]
linux shell 中文件编码查看及转换方法 daizj shell 中文乱码 vim 文件编码
一、查看文件编码。在打开文件的时候输入:set fileencoding 即可显示文件编码格式。二、文件编码转换 1、在Vim中直接进行转换文件编码,比如将一个文件转换成utf-8格式 &
MySQL--binlog日志恢复数据 dcj3sjt126com binlog
恢复数据的重要命令如下 mysql> flush logs; 默认的日志是mysql-bin.000001，现在刷新了重新开启一个就多了一个mysql-bin.000002
数据库中数据表数据迁移方法 dcj3sjt126com sql
刚开始想想好像挺麻烦的，后来找到一种方法了，就SQL中的 INSERT 语句，不过内容是现从另外的表中查出来的，其实就是 MySQL中INSERT INTO SELECT的使用下面看看如何使用语法：MySQL中INSERT INTO SELECT的使用 1. 语法介绍有三张表a、b、c，现在需要从表b
Java反转字符串 dyy_gusi java 反转字符串
前几天看见一篇文章，说使用Java能用几种方式反转一个字符串。首先要明白什么叫反转字符串，就是将一个字符串到过来啦，比如"倒过来念的是小狗"反转过来就是”狗小是的念来过倒“。接下来就把自己能想到的所有方式记录下来了。 1、第一个念头就是直接使用String类的反转方法，对不起，这样是不行的，因为Stri
UI设计中我们为什么需要设计动效 gcq511120594 UI linux
随着国际大品牌苹果和谷歌的引领，最近越来越多的国内公司开始关注动效设计了，越来越多的团队已经意识到动效在产品用户体验中的重要性了，更多的UI设计师们也开始投身动效设计领域。但是说到底，我们到底为什么需要动效设计？或者说我们到底需要什么样的动效？做动效设计也有段时间了，于是尝试用一些案例，从产品本身出发来说说我所思考的动效设计。一、加强体验舒适度嗯，就是让用户更加爽更加爽的用
JBOSS服务部署端口冲突问题 HogwartsRow java 应用服务器 jboss server EJB3
服务端口冲突问题的解决方法，一般修改如下三个文件中的部分端口就可以了。 1、jboss5/server/default/conf/bindingservice.beans/META-INF/bindings-jboss-beans.xml 2、./server/default/deploy/jbossweb.sar/server.xml 3、.
第三章 Redis/SSDB+Twemproxy安装与使用 jinnianshilongnian ssdb reids twemproxy
目前对于互联网公司不使用Redis的很少，Redis不仅仅可以作为key-value缓存，而且提供了丰富的数据结果如set、list、map等，可以实现很多复杂的功能；但是Redis本身主要用作内存缓存，不适合做持久化存储，因此目前有如SSDB、ARDB等，还有如京东的JIMDB，它们都支持Redis协议，可以支持Redis客户端直接访问；而这些持久化存储大多数使用了如LevelDB、RocksD
ZooKeeper原理及使用 liyonghui160com
ZooKeeper是Hadoop Ecosystem中非常重要的组件，它的主要功能是为分布式系统提供一致性协调(Coordination)服务，与之对应的Google的类似服务叫Chubby。今天这篇文章分为三个部分来介绍ZooKeeper，第一部分介绍ZooKeeper的基本原理，第二部分介绍ZooKeeper
程序员解决问题的60个策略 pda158 框架工作单元测试
根本的指导方针 1. 首先写代码的时候最好不要有缺陷。最好的修复方法就是让 bug 胎死腹中。良好的单元测试强制数据库约束使用输入验证框架避免未实现的“else”条件在应用到主程序之前知道如何在孤立的情况下使用日志 2. print 语句。往往额外输出个一两行将有助于隔离问题。 3. 切换至详细的日志记录。详细的日
Create the Google Play Account sillycat Google
Create the Google Play Account Having a Google account, pay 25$, then you get your google developer account. References: http://developer.android.com/distribute/googleplay/start.html https://p
JSP三大指令 vikingwei jsp
JSP三大指令一个jsp页面中，可以有0~N个指令的定义！ 1. page --> 最复杂：<%@page language="java" info="xxx"...%> * pageEncoding和contentType： > pageEncoding：它

论文阅读|HigherHRNet

Abstract

Introduction

our controbutions:

Related works

自上而下的方法

自下而上的方法

特征金字塔

高分辨率特征图

Higher-Resolution Network

HigherHRNet

HRNet

HigherHRNet

Grouping

Deconvolution Module 转置卷积

Multi-Resolution Supervision 多分辨率监督

Heatmap Aggregation for Inference 热图聚合

Experiments

COCO Keypoint detection

消融实验

HRNet vs. HigherHRNet

HigherHRNet gain breakdown.

Training with larger image size

Larger backbone

CrowdPose

Conclusion

你可能感兴趣的:(人体姿态估计,深度学习,计算机视觉,目标检测)