calvinpaean

GhostNet: More Features from Cheap Operations 论文学习

Abstract

在嵌入式设备上设计卷积网络很困难，主要因为内存和计算资源有限。特征图冗余是这些CNN的一个重要特点，但是很少在网络结构设计上得到研究。本文提出了一个创新的 Ghost 模块，通过低成本的操作输出更多的特征图。基于一组内在的特征图，作者使用一系列低成本的线性变换就可以产生许多的 ghost 特征图，可以充分地揭示内在特征的信息。Ghost 模块可以作为一个即插即用的组建来对现有卷积网络做升级。Ghost bottlenecks 用于堆叠 Ghost 模块，然后我们就可以构建轻量级的 GhostNet。在基准上的试验表明，Ghost模块可以作为基线模型卷积层的替代选项。在 ImageNet ILSVRC-2012分类数据集上，它取得了更高的识别表现（ $75.7\%$ 的 top-1准确率），比MobileNetV3还高，而计算成本相当。代码放在了：https://github.com/huawei-noah/ghostnet.

1. Introduction

深度卷积网络在各种计算机视觉任务上表现不俗，如图像识别、目标检测、语义分割等。传统CNN通常需要大量的参数和浮点计算来得到满意的准确率，比如对于输入为 $224\times 224$ 的图片，ResNet-50 差不多有2560万个参数，需要41亿次的FLOPs。因此，一个最新的趋势是探索方便移植的、高效的神经网络结构，在移动设备也可取得不错的效果（如智能手机、自动驾驶汽车）。

人们提出了诸多方法来研究深度学习模型的小型化，如网络剪枝、量化、知识蒸馏等。 Han 等人提出可以剪去神经网络中不重要的权重。[31] 利用 $l_1$ 范数正则来裁剪CNN中的滤波器。[42]将网络权重和激活量化为 1-bit 数据，实现较高的压缩率和加速。[19] 引入了知识蒸馏，将大模型的知识迁移到小模型上。但是，这些方法的表现都以作为基线模型的预训练模型为上界。

高效率的神经结构对于构建高性能的神经网络非常有意义，它所需的参数和计算量更少，最近取得了显著成功。这类方法也给自动搜索方法提供了研究方向。例如，MobileNet 利用 depthwise和pointwise卷积，构建了一个计算模块去近似传统的大滤波器卷积层，性能相当。ShuffleNet 进一步研究了通道混洗操作，增强轻量模型的性能。

网络特征图里的丰富的信息确保了对输入数据的全面理解。例如，图1是 ResNet-50 对输入图像所产生的特征图，可看到有许多相似的特征图，就像彼此的 ghost 似的。特征图冗余是深度神经网络的重要特点之一。本文并没有排斥冗余的特征图，而是以高效率的方式来利用它。

本文作者引入了一个新的 Ghost 模块，用较少的参数输出更多的特征。一般的卷积层可以分为2个部分。第一部分为普通的卷积，它们的总数可以被严格控制。有了第一部分的特征图，我们就可以利用一系列的简单的线性操作来输出更多的特征图。和一般的卷积网络相比，Ghost模块没有改变输出特征图的大小，但是参数量和复杂度都减少了。基于Ghost模块，作者设计了一个高效的网络结构，叫做GhostNet。作者首先将benchmark网络结构中的卷积层替换，证明Ghost模块的性能，然后在多个benchmark视觉数据集上验证GhostNet的优越性。实验结果显示，Ghost模块能够降低一般卷积层的算力消耗，而识别表现差不多。在移动设备上进行测试，GhostNet 超越了state of the art 的网络模型如MobileNetV3。

2. Related Works

这里作者介绍了下现有的轻量化模型，有2个部分：模型压缩和小型化结构设计。

2.1 模型压缩

对于给定的网络，模型压缩旨在减少计算量、电力消耗和存储空间。剪枝会剪去神经元中不重要的连接。通道裁剪进一步移除不重要的通道，加速更简单。模型量化用离散的值来表示网络的权重或激活，用于压缩网络与加速计算。二值化方法使用1-bit值，极大地加速了模型运算。张量分解降低参数和计算量，研究模型的冗余和权重的低秩性质。知识蒸馏利用更大的模型来教小模型，提升小模型的性能。这些方法的性能通常取决于给定的预训练模型。基础操作和结构的提升会让这些方法走的更远。

2.2 精炼的模型设计

为了在嵌入式设备上部署网络模型，人们提出了一系列的小模型。Xception 利用 depthwise 卷积操作，高效率地使用模型参数。MobileNets 是一系列的轻量网络模型，它们基于 depthwise separable 卷积。MobileNetV2 提出了 inverted residual block，MobileNetV3则进一步使用了AutoML 方法，实现了更优的性能表现，FLOPs更少。ShuffleNet 引入了通道混洗操作，提升通道组之间的信息流动。ShuffleNetV2 进一步思考了硬件平台的事实速度。尽管这些方法都取得了不错的表现，FLOPs少了许多，但是特征图之间的冗余与联系却没被很好地研究。

3. Approach

本章中，作者首先介绍Ghost模块，利用较少的滤波器来产生更多的特征图，然后设计了一个新的GhostNet，非常高效而表现优异。

3.1 更多特征的Ghost模块

深度网络经常由大量的卷积构成，导致计算量很大。尽管MobileNet和ShuffleNet 引入了depthwise卷积和混洗操作，使用较小的卷积滤波器构建更高效的CNN，但是剩下的 $1\times 1$ 卷积仍会消耗大量的内存和FLOPs。

如图1所示，主流CNN计算出来的中间特征图有大量的冗余，作者提出降低所需的资源，如卷积滤波器。实际上，给定输入数据 $X\in \mathbb{R}^{c\times h\times w}$ ，其中 $c$ 是输入通道数， $h, w$ 是输入的高度和宽度。产生 $n$ 个特征图的任意卷积层可表示如下：

$Y=X\ast f+b$

其中 $\ast$ 是卷积操作， $b$ 是偏置， $Y\in \mathbb{R}^{h'\times w'\times n}$ 是输出特征图，它有 $n$ 个通道。 $f\in \mathbb{R}^{c\times k\times k\times n}$ 是这一层的卷积滤波器。此外， $h^{'}, w^{'}$ 是输出数据的高度和宽度， $k\times k$ 是卷积滤波器 $f$ 的核大小。在一次卷积操作中，所需的FLOPs数量等于 $n\cdot h'\cdot w'\cdot c \cdot k \cdot k$ ，通常非常大，有几十上百万，因为滤波器的个数 $n$ 和通道个数 $c$ 一般都很大（如256或512）。

根据上面的等式， $f$ 和 $b$ 的参数个数由输入特征图和输出特征图的维度来决定。如图1中，卷积层的输出特征图通常有很多的冗余，有些特征图很相似。作者指出我们并不需要生成这些重复的特征图，它们会消耗大量的FLOPs和参数。假设输出特征图是一些内在特征图的 ghosts，只需一些低成本的变换。这些内在特征图通常较小，由一般的卷积滤波器产生。 $m$ 个内在特征图 $Y'\in \mathbb{R}^{h'\times w'\times m}$ 可通过下面卷积操作产生：

$X\ast f'$

其中 $f'\in \mathbb{R}^{c\times k\times k\times m}$ 是要用的滤波器， $m\leq n$ ，为了简洁些，偏置项被省略了。为了保证输出特征图的空间大小（ $h^{'}, w^{'}$ ）一致，超参数如滤波器大小、步长、padding与一般的卷积一样。为了进一步得到 $n$ 个特征图，根据下面的等式，作者对于 $Y^{'}$ 的每个内在特征，提出应用一系列廉价的线性操作，产生 $s$ 个 ghost 特征：

$y_{ij} = \Phi_{i,j}(y_i'), \forall i=1,...,m, j=1,...,s$

其中 $y_i'$ 是 $Y^{'}$ 中第 $i$ 个内在特征图，上面函数中的 $\Phi_{i,j}$ 是第 $j$ 个线性操作，产生第 $j$ 个ghost特征图 $y_{ij}$ ， $y_i'$ 可以有一个或多个ghost 特征图 ${y_{ij}\}_{j=1}^s$ 。最后一个 $\Phi_{i,s}$ 是恒等映射，保留内在特征图，如图2(b)所示。

利用上述等式，我们可以得到 $n=m\cdot s$ 个特征图， $Y=[y_{11}, y_{12}, ..., y_{ms}]$ ，作为Ghost模块的输出数据，如图2(b)所示。注意，线性操作 $\Phi$ 对每个通道进行计算，计算成本要远比传统的卷积低。实际上，在Ghost模块中可能有多个不同的线性操作，如 $3\times 3$ 和 $5\times 5$ 线性核，会在实验部分做分析。

与现有方法的不同。Ghost模块与现有卷积方法的不同之处在于：i) 与[21]，[61] 中卷积相比，它们使用了大量的 $1\times 1$ pointwise 卷积，Ghost模块中的卷积核大小可以定制化。ii) 现有方法[21,44,61,40] 采用了pointwise 卷积来处理跨通道的特征，然后利用 depthwise 卷积来处理空间信息。相反，Ghost模块采用一般的卷积，首先生成一些内在特征图，然后利用廉价的线性操作来增强特征，增加通道数。iii) 在之前的结构中，处理每个特征图的操作都会受到 depthwise卷积或shift操作的限制，而Ghost模块中的线性操作则非常多样。iv) 此外，恒等映射与Ghost模块中的线性变换平行，为了保留内在特征图。

复杂度分析。由于我们可以利用等式3中的Ghost模块来产生与一般卷积层相同数量的特征图，我们可以很容易地将Ghost模块整合入现有的网络结构中，降低计算成本。这里作者进一步分析了Ghost模块使用内存的情况和理论上的加速。例如，它里面有1个恒等映射和 $m\cdot (s-1) = \frac{n}{s}\cdot (s-1)$ 个线性操作，每个线性操作的平均卷积核大小等于 $d\times d$ 。 $n\cdot (s-1)$ 个线性操作可以有不同的形状和参数，但是推理时可能会被CPU或GPU的利用率所限制。因此为了实现更高效，作者建议在Ghost模块中使用相同大小（如 $3\times 3, 5\times 5$ ）的线性操作。利用Ghost模块提升传统卷积的理论加速比率是

$r_s = \frac{n\cdot h'\cdot w' \cdot c\cdot k\cdot k}{\frac{n}{s} \cdot h' \cdot w' \cdot c\cdot k\cdot k + (s-1) \cdot \frac{n}{s} \cdot h' \cdot w' \cdot d\cdot d} = \frac{c\cdot k\cdot k}{\frac{1}{s} \cdot c\cdot k\cdot k + \frac{s-1}{s}\cdot d\cdot d} \approx \frac{s\cdot c}{s+c-1} \approx s$

其中 $d\times d$ 和 $k\times k$ 的数量级相似， $s\leq c$ 。相似地，压缩率可以计算为：

$r_c = \frac{n\cdot c\cdot k\cdot k}{\frac{n}{s}\cdot c\cdot k\cdot k + (s-1)\cdot \frac{n}{s}\cdot d\cdot d} \approx \frac{s\cdot c}{s+c-1} \approx s$

这和Ghost模块所带来的加速比率相等。

3.2 构建高效率的CNN

Ghost bottleneck。利用Ghost模块，作者针对小型CNN特别提出了Ghost bottleneck(G-bneck)。如图3所示，Ghost bottleneck 与基本的残差模块相似，整合了多个卷积层和短路连接。G-bneck 主要由两个堆叠的Ghost模块组成。第一个ghost模块作为扩张层，增加通道数。作者将输出通道和输入通道的个数比率叫做扩张比率。第二个Ghost模块降低通道数量，来匹配短路连接。然后在这俩Ghost模块的输入和输出之间通过短路连接起来。在每层之后都使用一个BN和ReLU非线性函数，和MobileNetV2建议的一样，在第二个Ghost模块后没有使用ReLU。

GhostNet。基于ghost bottleneck，作者提出了GhostNet，如表7所示。作者基本延续了MobileNetV3的结构，因为它效果很好，作者将MobileNetV3中的bottleneck block替换为Ghost bottleneck。GhostNet 主要由一组Ghost bottleneck 和Ghost模块构成。第一层是一个标准的卷积层，有16个滤波器，然后是一系列的Ghost bottlenecks，通道数逐渐增加。Ghost bottlenecks 被划分为不同的阶段，根据它们输入特征图的大小。所有的 Ghost bottlenecks 都使用了 $s t r i d e = 1$ ，除了每个阶段中的最后一个， $s t r i d e = 2$ 。最后，我们使用全局平均池化和卷积层来对特征图进行变换，变为1280维的特征向量，用于最终的分类。如表7，对于ghost bottleneck 中的残差层作者也使用了 Squeeze和Excite模块。与MobileNetV3相反，作者并没有使用 hard-swish 非线性函数，因为它延迟比较高。该网络结构为推理提供了一个基本的设计，尽管进一步的参数调优或自动结构搜索可能会提升性能。

宽度乘数。尽管在表7中给定的网络结构的延迟已经比较低，准确率也还可以，在一些场景中我们可能需要较小而更快的，或者更准确的模型。针对特殊的需要，作者简单地在每一层都对通道个数乘一个因子 $\alpha$ 。 $\alpha$ 叫做宽度乘数，因为它可以改变网络的宽度。作者将宽度乘数为 $\alpha$ 的GhostNet叫做 GhostNet- $\alpha\times$ 。宽度乘数可以控制模型的大小和计算量，约为 $\alpha^2$ 。通常， $\alpha$ 越小，延迟就越低，表现就越差。

4. Experiments

Pls read paper for more info.

基于Paillier同态加密算法的金融数据安全共享机制研究【附数据】
金融数据分析与建模专家金融科研助手|论文指导|模型构建✨专业领域：金融数据处理与分析量化交易策略研究金融风险建模投资组合优化金融预测模型开发深度学习在金融中的应用擅长工具：Python/R/MATLAB量化分析机器学习模型构建金融时间序列分析蒙特卡洛模拟风险度量模型金融论文指导内容：金融数据挖掘与处理量化策略开发与回测投资组合构建与优化金融风险评估模型期刊论文✅具体问题可以私信或查看文章底部二维码
YOLOv8实现手写数字识别系统：从MNIST到实时摄像头检测
在深度学习领域，手写数字识别是一个经典问题，也是入门计算机视觉的重要案例。本文将介绍一个基于YOLOv8和MNIST数据集的手写数字识别系统，该系统不仅能识别静态图像中的数字，还能通过摄像头实时检测手写数字。个人博客：YOLOv8实现手写数字识别系统：从MNIST到实时摄像头检测-iDing's博客项目概述这个项目结合了传统的MNIST数据集和现代的目标检测算法YOLOv8，实现了以下功能：将MN
基于深度学习的手写数字和符号识别系统：YOLOv5/v6/v7/v8/v10模型实现与UI界面集成 YOLO实战营深度学习 YOLO ui 人工智能目标检测计算机视觉
1.引言随着人工智能和深度学习技术的发展，手写数字和符号识别已经成为计算机视觉领域的重要研究方向。手写识别在很多实际应用中扮演着关键角色，例如邮政编码识别、表单自动处理和智能教育系统等。传统的手写识别方法通常依赖于复杂的特征工程，而深度学习则能够自动从数据中学习到特征，极大地提高了识别精度和速度。本文将介绍如何构建一个基于YOLO系列模型（YOLOv5、YOLOv6、YOLOv7、YOLOv8、Y
AI作画：AI人工智能激发艺术创作灵感 AGI大模型与大数据研究院 AI作画人工智能 ai
AI作画：AI人工智能激发艺术创作灵感关键词：AI作画、生成艺术、深度学习、神经网络、艺术创作、人工智能、创意工具摘要：本文深入探讨AI作画技术如何激发艺术创作灵感。我们将从基础概念出发，解释AI如何"学习"艺术风格并生成新作品，分析核心技术原理，提供实际应用案例，并展望这一领域的未来发展趋势。通过通俗易懂的讲解和实际代码示例，帮助读者理解这项融合科技与艺术的创新技术。背景介绍目的和范围本文旨在向
Jetson平台编译Tengine space01 AIoT Jetson 人工智能深度学习计算机视觉
1.Tengine简介Tengine于2017年在GitHub（https://github.com/OAID/Tengine）开源，是OPENAILAB（开放智能）推出的自主知识产权的边缘AI计算框架，致力于解决AIoT产业链碎片化问题，加速AI产业化落地。Tengine兼容多种操作系统和深度学习算法框架，简化和加速面向场景的AI算法在嵌入式边缘设备上快速迁移，以及实际应用部署落地，可以十倍提升
机器人-组成结构-感知 - 决策 - 执行具身智能-查布嘎具身智能机器人人工智能
目录一、感知系统内部传感器：外部传感器：二、智能决策系统机器学习家族1.1机器学习2.1深度学习2.2深度学习模型(主要属于监督/强化学习范畴，但结构通用)：3.1监督学习3.2监督学习模型4.1半监督学习4.2无/半监督学习模型：5.1无监督学习5.2生成模型(可属于监督/无监督)：6.1强化学习7.1其他学习三、控制系统（运控）①对应小脑和脊柱一、感知系统①对应人体的五官。由具有不同功能的各种
深度学习篇---矩阵 Atticus-Orion 嵌入式知识篇上位机知识篇嵌入式硬件篇深度学习矩阵人工智能
在机械臂解算、深度学习网络等硬件和软件领域中，矩阵运算作为核心数学工具，承担着数据表示、变换、映射和优化的关键作用。以下从具体领域出发，详细总结涉及的矩阵运算及对应的核心知识：一、机械臂解算领域机械臂解算（运动学、动力学分析）的核心是描述“关节空间”与“操作空间”的映射关系，矩阵运算用于精准刻画坐标系转换、运动传递和力/力矩分析。1.运动学解算（正/逆运动学）核心目标：通过矩阵描述关节角度与末端执
Python深度学习实践：LSTM与GRU在序列数据预测中的应用 AI智能应用 Python入门实战计算科学神经计算深度学习神经网络大数据人工智能大型语言模型 AI AGI LLM Java Python 架构设计 Agent RPA
Python深度学习实践：LSTM与GRU在序列数据预测中的应用作者：禅与计算机程序设计艺术/ZenandtheArtofComputerProgramming1.背景介绍1.1问题的由来序列数据预测是机器学习领域的一个重要研究方向，涉及时间序列分析、自然语言处理、语音识别等多个领域。序列数据具有时间依赖性，即序列中每个元素都受到前面元素的影响。传统的机器学习算法难以捕捉这种时间依赖性，而深度学习
Baumer工业相机堡盟工业相机如何通过YoloV8深度学习模型实现打架检测（C#代码，UI界面版）格林威工业相机机器视觉数码相机 YOLO 深度学习计算机视觉人工智能
Baumer工业相机堡盟工业相机如何通过YoloV8深度学习模型实现打架检测（C#代码，UI界面版）工业相机使用YoloV8模型实现打架检测工业相机通过YoloV8模型实现打架检测的技术背景在相机SDK中获取图像转换图像的代码分析工业相机图像转换Bitmap图像格式和Mat图像重要核心代码本地文件图像转换Bitmap图像格式和Mat图像重要核心代码Mat图像导入YoloV8模型重要核心代码代码实现
Baumer工业相机堡盟工业相机如何通过YoloV8深度学习模型实现人脸识别检测（C#代码，UI界面版）格林威机器视觉工业相机数码相机 YOLO 深度学习人工智能视觉检测 c#
Baumer工业相机堡盟工业相机如何通过YoloV8深度学习模型实现人脸识别检测（C#代码，UI界面版）工业相机使用YoloV8模型实现人脸的检测工业相机通过YoloV8模型实现人脸识别检测的技术背景在相机SDK中获取图像转换图像的代码分析工业相机图像转换Bitmap图像格式和Mat图像重要核心代码本地文件图像转换Bitmap图像格式和Mat图像重要核心代码Mat图像导入YoloV8模型重要核心代
Baumer工业相机堡盟工业相机如何通过YoloV8深度学习模型实现人物识别（C#代码，UI界面版）格林威工业相机机器视觉数码相机 YOLO c#人工智能计算机视觉开发语言
Baumer工业相机堡盟工业相机如何通过YoloV8深度学习模型实现人物识别（C#代码，UI界面版）工业相机使用YoloV8模型实现人物识别工业相机实现YoloV8模型实现人物识别的技术背景在相机SDK中获取图像转换图像的代码分析工业相机图像转换Bitmap图像格式和Mat图像重要核心代码本地文件图像转换Bitmap图像格式和Mat图像重要核心代码Mat图像导入YoloV8模型重要核心代码代码实现
Baumer工业相机堡盟工业相机如何通过YoloV8深度学习模型实现动物分类（C#源码，UI界面版）格林威机器视觉工业相机数码相机 YOLO 深度学习计算机视觉人工智能视觉检测 c#
Baumer工业相机堡盟工业相机如何通过YoloV8深度学习模型实现动物分类（C#源码，UI界面版））工业相机使用YoloV8模型实现动物分类工业相机实现YoloV8模型实现动物分类的技术背景在相机SDK中获取图像转换图像的代码分析工业相机图像转换Bitmap图像格式和Mat图像重要核心代码本地文件图像转换Bitmap图像格式和Mat图像重要核心代码Mat图像导入YoloV8模型重要核心代码代码实
AI 大模型重塑软件开发流程万花丛中一抹绿人工智能
一、AI大模型的定义与发展历史AI大模型是基于海量数据训练的深度学习模型，具备强大的自然语言理解、逻辑推理和知识生成能力。在软件开发领域，以GPT-4、CodeLlama、GitHubCopilotX为代表的大模型，能理解代码语法、语义及业务逻辑，实现代码生成、漏洞检测等复杂任务。其发展可追溯至2017年，谷歌提出Transformer架构，为大模型奠定了核心基础。2018年，GPT-1问世，参数
在 Conda 中删除环境及所有安装的库 Studying 开龙wu conda
注意事项1.删除环境前确保你没有在该环境中运行任何程序。2.删除操作是不可逆的，所有该环境中的包和配置都会被永久删除。3.如果你想保留环境的配置信息，可以在删除前使用condaenvexport>environment.yml导出环境配置。关于requirements.txt和environment.yaml文件使用介绍详情可参考以往文章，争对机器学习和深度学习里Python项目开发管理项目依赖的
OpenCV学习（二）-二维、三维识别香蕉可乐荷包蛋 #OpenCV opencv 学习人工智能
OpenCV是一个功能强大的计算机视觉库，可以用于识别和处理二维图像和三维图像。以下是关于二维图像和三维图像识别的基础知识和示例代码。1.二维图像识别二维图像识别通常包括图像分类、对象检测、特征提取等任务。以下是一些常见的操作：1.1图像分类使用预训练模型对图像进行分类，例如使用深度学习模型（如ResNet、MobileNet等）。importcv2#加载预训练的深度学习模型net=cv2.dnn
【人工智能之深度学习】6. 卷积核工作原理：从边缘检测到特征抽象的逐层演进（附可视化工具与行业实战代码） AI_DL_CODE 人工智能深度学习卷积核特征提取卷积神经网络边缘检测特征可视化
摘要：卷积核是卷积神经网络（CNN）的核心组件，其通过局部感受野与参数共享机制实现高效特征提取。本文从数学本质出发，揭示卷积操作的空域-频域对偶性：空域卷积等价于频域乘积（F{f∗g}=F{f}⋅F{g}F\{f*g\}=F\{f\}⋅F\{g\}F{f∗g}=F{f}⋅F{g}），解释边缘检测核（Sobel、Laplacian）的频域响应特性。通过特征可视化实验表明，CNN特征呈现逐层抽象规律：
颠覆未来：创新代码引领人工智能与量子计算深度融合金枝玉叶9 程序员知识储备1 程序员知识储备2 程序员知识储备3 人工智能量子计算
摘要在信息时代飞速演进的背景下，人工智能与量子计算正以前所未有的速度互相融合，推动着科技边界的不断拓展。本文回顾了经典算法的智慧，展示了前沿深度学习模型的构建，并通过量子电路设计探讨了创新代码的可能性，为探索未来科技变革提供了全新视角。1.引言当前，科技创新正处于高速迭代的关键阶段，传统计算方法与新型技术的交汇处正成为研究热点。人工智能的发展已渗透到各行各业，而量子计算的崛起则为解决复杂计算问题提
使用UV管理PyTorch项目
PyTorch是深度学习研究和开发的流行选择。可以使用uv管理PyTorch项目，包括不同Python版本依赖、管理环境、甚至加速器选择等。安装Pytorch从打包角度来看，PyTorch有几个不常见的特点：许多PyTorchwheel托管在专门的索引上，而非Python包索引（PyPI）。因此，安装PyTorch通常需要配置项目使用PyTorch专属索引。PyTorch为每种加速器生成不同的构建
YOLOv5改进策略|YOLOv5 ⾃主检查和跟踪相关的任务|基于视觉的⽆⼈⽔⾯舰艇⾃主导航极端海洋条件斌擎人工智能官方账号 YOLO 人工智能 YOLOv5 目标检测计算机视觉深度学习自主导航
目录介绍解决方案目标检测的视觉结论视觉感知是无人水面舰艇(USV)自主导航的重要组成部分，特别是与自主检查和跟踪相关的任务。这些任务涉及基于视觉的导航技术来识别导航目标。海洋环境中极端天气条件下的能⻅度降低使得基于视觉的方法难以正常工作。为了克服这些问题，本文提出了一种基于视觉的自主导航框架，用于在极端海洋条件下跟踪目标物体。所提出的框架由一个集成感知管道组成，该管道使用生成对抗网络(GAN)来消
AI新纪元：2025年深度学习技术突破与行业应用全景像素笔记杂谈人工智能深度学习 ai 自动驾驶工业数字化转型未来趋势技术创新
2025年，人工智能技术迎来爆发式增长，大模型、生成式AI和多模态技术持续突破，人形机器人量产元年正式开启，自动驾驶商业化进程加速，工业数字化转型全面铺开。这些进展不仅重塑了技术边界，更在多个行业创造了实际价值，推动AI从实验室走向产业化。本文将深入剖析2025年深度学习与AI领域的核心技术突破、行业应用案例及未来发展趋势，为技术从业者提供全面视角。一、深度学习核心技术突破：大模型、生成式AI与多
3步实现安防高精度检测：陌讯算法夜间监控落地实战 2501_92474745 目标跟踪人工智能计算机视觉算法目标检测视觉检测
开篇痛点：安防监控系统在实时目标检测中常面临严峻挑战。实测数据显示，传统算法在低光、遮挡或动态场景下，泛化能力不足，导致平均误报率高达15%（数据来源：安防行业报告）。尤其在夜间或拥挤环境下，系统卡顿、漏检频发，不仅降低响应效率，还增加安全隐患。例如，某城市交通监控中心反馈，其开源模型在高密度人流中出现每秒帧率（FPS）骤降至20帧以下，引发报警延迟问题。这些问题根源在于算法鲁棒性和实时性不足，亟
模型移植实战：从PyTorch到ONNX完整指南慕婉0307 神经网络 pytorch 人工智能 python
一、认识ONNXONNX（OpenNeuralNetworkExchange）是一种开放的模型表示格式，由微软和Facebook（现Meta）在2017年共同推出，旨在解决深度学习模型在不同框架之间的互操作性问题。ONNX的主要优势包括：跨框架兼容性：支持主流深度学习框架间的模型转换，包括PyTorch、TensorFlow、MXNet、CNTK等例如，可以将PyTorch训练的ResNet模型导
监控漏检频发？陌讯YOLOv7实时优化方案召回率提升25% 2501_92489016 目标跟踪人工智能计算机视觉算法目标检测视觉检测智慧城市
一、开篇痛点在安防监控领域，传统目标检测模型面临三重困境：实时性差：1080P视频流处理普遍低于20FPS（VGG16仅15FPS）漏检率高：密集场景下小目标召回率常低于60%（COCO-val实测数据）部署成本高：ResNet-101需8GB显存，难以边缘化部署某智慧园区项目显示：夜间误报率高达34%，运维成本激增300%二、技术解析：陌讯SlimYOLO架构创新针对上述痛点，陌讯视觉算法提出三
TensorFlow GPU 2.10.1 for Python 3.9快速安装指南疑样
本文还有配套的精品资源，点击获取简介：TensorFlowGPU2.10.1是专为Windowsx64和Python3.9设计的TensorFlow版本，它集成了GPU支持以加快深度学习模型的训练。本指南提供了该版本的概述、安装步骤及注意事项，旨在帮助开发者利用其性能优势提升机器学习项目的效率。1.TensorFlowGPU介绍1.1TensorFlow的起源与功能TensorFlow是由Goog
深度学习方法生成抓取位姿与6D姿态估计的完整实现 ZPC8210 ROS 深度学习人工智能
如何将GraspNet等深度学习模型与6D姿态估计集成到ROS2和MoveIt中，实现高精度的机器人抓取系统。1.系统架构text[RGB-D传感器]→[物体检测与6D姿态估计]→[GraspNet抓取位姿生成]→[MoveIt运动规划]→[执行抓取]2.环境配置2.1安装依赖bash#安装PyTorch(根据CUDA版本选择)pip3installtorchtorchvisiontorchaud
监控漏检率 30%？陌讯多模态算法实测优化
破解智慧城市视觉算法困境：陌讯多模态融合技术实战解析在智慧城市建设中，视觉算法作为感知层核心技术，正面临着日益严峻的挑战。传统目标检测算法在暴雨、逆光、遮挡等复杂环境下，漏检率常高达25%-40%，直接导致交通违章误判、异常事件漏报等问题。某新一线城市交管部门曾反馈，现有系统对无牌车的识别准确率不足65%，严重影响执法效率[实测数据来源]。这些痛点的核心在于传统单模态算法难以应对城市环境的动态变化
河道污染难溯源？3步搭建陌讯实时目标检测系统 2501_92472966 目标检测人工智能计算机视觉算法视觉检测
开篇痛点「凌晨3点水泵房渗漏报警，运维人员冒雨排查却是一场误判」——这是某水务企业技术总监向我吐槽的真实案例。在智慧水务场景中，传统视觉算法面临三大死穴：水体反光干扰、微小目标漏检、边缘设备算力受限。尤其当暴雨导致水体浑浊时，OpenCV边缘检测的误报率可达35%以上。技术解析：陌讯多模态融合架构为解决复杂环境泛化问题，陌讯视觉算法提出FMT-Net（FusionMultimodalTransfo
基于深度学习的目标检测：从基础到实践 Blossom.118 机器学习与人工智能深度学习目标检测人工智能音视频语音识别计算机视觉机器学习
前言目标检测（ObjectDetection）是计算机视觉领域中的一个核心任务，其目标是在图像中定位和识别多个对象的类别和位置。近年来，深度学习技术，尤其是卷积神经网络（CNN），在目标检测任务中取得了显著进展。本文将详细介绍如何使用深度学习技术构建目标检测模型，从理论基础到代码实现，带你一步步掌握目标检测的完整流程。一、目标检测的基本概念（一）目标检测的定义目标检测是指在图像中识别和定位多个对象
“显著性”（Saliency）是计算机视觉中的一个重要概念，主要指的是图像或视频中最吸引人注意力的区域或对象步步咏凉天计算机视觉人工智能
“显著性”（Saliency）是计算机视觉中的一个重要概念，主要指的是图像或视频中最吸引人注意力的区域或对象。它模拟的是人类视觉系统对视觉场景中“显著”区域的感知能力。显著性可以用于图像理解、目标检测、图像压缩、图像分割等多个任务。下面是对显著性在计算机视觉中的几个关键方面的解释：一、显著性检测（SaliencyDetection）显著性检测的目标是预测图像中最能吸引人注意的区域，通常输出一个与输
【机器学习】探索未来科技的前沿：人工智能、机器学习与大模型 AIGC零基础入门小白 AI大模型大模型教程人工智能机器学习科技 AI大模型 AIGC AI教程大模型教程
文章目录引言一、人工智能：从概念到现实1.1人工智能的定义1.2人工智能的发展历史1.3人工智能的分类1.4人工智能的应用二、机器学习：人工智能的核心技术2.1机器学习的定义2.2机器学习的分类2.3机器学习的实现原理2.4机器学习的应用2.5机器学习的示例代码2.6解释代码三、大模型：推动AI前沿发展的关键技术3.1大模型的定义3.2大模型的发展历程3.3深度学习与神经网络3.4大模型的优势与挑
多线程编程之存钱与取钱周凡杨 java thread 多线程存钱取钱
生活费问题是这样的：学生每月都需要生活费，家长一次预存一段时间的生活费，家长和学生使用统一的一个帐号，在学生每次取帐号中一部分钱，直到帐号中没钱时通知家长存钱，而家长看到帐户还有钱则不存钱，直到帐户没钱时才存钱。问题分析：首先问题中有三个实体，学生、家长、银行账户，所以设计程序时就要设计三个类。其中银行账户只有一个，学生和家长操作的是同一个银行账户，学生的行为是
java中数组与List相互转换的方法征客丶 JavaScript java jsonp
1.List转换成为数组。（这里的List是实体是ArrayList) 　　调用ArrayList的toArray方法。　　toArray 　　public T[] toArray(T[] a)返回一个按照正确的顺序包含此列表中所有元素的数组；返回数组的运行时类型就是指定数组的运行时类型。如果列表能放入指定的数组，则返回放入此列表元素的数组。否则，将根据指定数组的运行时类型和此列表的大小分
Shell 流程控制 daizj 流程控制 if else while case shell
Shell 流程控制和Java、PHP等语言不一样，sh的流程控制不可为空，如(以下为PHP流程控制写法)： <?php if(isset($_GET["q"])){ search(q);}else{// 不做任何事情} 在sh/bash里可不能这么写，如果else分支没有语句执行，就不要写这个else，就像这样 if else if if 语句语
Linux服务器新手操作之二周凡杨 Linux 简单操作
1.利用关键字搜寻Man Pages man -k keyword 其中-k 是选项，keyword是要搜寻的关键字如果现在想使用whoami命令，但是只记住了前3个字符who，就可以使用 man -k who来搜寻关键字who的man命令 [haself@HA5-DZ26 ~]$ man -k
socket聊天室之服务器搭建朱辉辉33 socket
因为我们做的是聊天室，所以会有多个客户端，每个客户端我们用一个线程去实现，通过搭建一个服务器来实现从每个客户端来读取信息和发送信息。我们先写客户端的线程。 public class ChatSocket extends Thread{ Socket socket; public ChatSocket(Socket socket){ this.sock
利用finereport建设保险公司决策分析系统的思路和方法老A不折腾 finereport 金融保险分析系统报表系统项目开发
决策分析系统呈现的是数据页面，也就是俗称的报表，报表与报表间、数据与数据间都按照一定的逻辑设定，是业务人员查看、分析数据的平台，更是辅助领导们运营决策的平台。底层数据决定上层分析，所以建设决策分析系统一般包括数据层处理（数据仓库建设）。项目背景介绍通常，保险公司信息化程度很高，基本上都有业务处理系统（像集团业务处理系统、老业务处理系统、个人代理人系统等）、数据服务系统（通过
始终要页面在ifream的最顶层林鹤霄
index.jsp中有ifream，但是session消失后要让login.jsp始终显示到ifream的最顶层。。。始终没搞定，后来反复琢磨之后，得到了解决办法，在这儿给大家分享下。。 index.jsp--->主要是加了颜色的那一句 <html> <iframe name="top" ></iframe> <ifram
MySQL binlog恢复数据 aigo mysql
1，先确保my.ini已经配置了binlog： # binlog log_bin = D:/mysql-5.6.21-winx64/log/binlog/mysql-bin.log log_bin_index = D:/mysql-5.6.21-winx64/log/binlog/mysql-bin.index log_error = D:/mysql-5.6.21-win
OCX打成CBA包并实现自动安装与自动升级 alxw4616 ocx cab
近来手上有个项目,需要使用ocx控件 (ocx是什么? http://baike.baidu.com/view/393671.htm) 在生产过程中我遇到了如下问题. 1. 如何让 ocx 自动安装? a) 如何签名? b) 如何打包? c) 如何安装到指定目录? 2.
Hashmap队列和PriorityQueue队列的应用百合不是茶 Hashmap队列 PriorityQueue队列
HashMap队列已经是学过了的,但是最近在用的时候不是很熟悉,刚刚重新看以一次, HashMap是K,v键 ,值 put()添加元素 //下面试HashMap去掉重复的 package com.hashMapandPriorityQueue; import java.util.H
JDK1.5 returnvalue实例 bijian1013 java thread java多线程 returnvalue
Callable接口：返回结果并且可能抛出异常的任务。实现者定义了一个不带任何参数的叫做 call 的方法。 Callable 接口类似于 Runnable，两者都是为那些其实例可能被另一个线程执行的类设计的。但是 Runnable 不会返回结果，并且无法抛出经过检查的异常。 ExecutorService接口方
angularjs指令中动态编译的方法(适用于有异步请求的情况) 内嵌指令无效 bijian1013 JavaScript AngularJS
在directive的link中有一个$http请求，当请求完成后根据返回的值动态做element.append('......');这个操作，能显示没问题，可问题是我动态组的HTML里面有ng-click，发现显示出来的内容根本不执行ng-click绑定的方法！
【Java范型二】Java范型详解之extend限定范型参数的类型 bit1129 extend
在第一篇中，定义范型类时，使用如下的方式： public class Generics<M, S, N> { //M,S,N是范型参数 } 这种方式定义的范型类有两个基本的问题： 1. 范型参数定义的实例字段，如private M m = null;由于M的类型在运行时才能确定，那么我们在类的方法中，无法使用m，这跟定义pri
【HBase十三】HBase知识点总结 bit1129 hbase
1. 数据从MemStore flush到磁盘的触发条件有哪些？ a.显式调用flush，比如flush 'mytable' b.MemStore中的数据容量超过flush的指定容量，hbase.hregion.memstore.flush.size,默认值是64M 2. Region的构成是怎么样？ 1个Region由若干个Store组成
服务器被DDOS攻击防御的SHELL脚本 ronin47
mkdir /root/bin vi /root/bin/dropip.sh #!/bin/bash/bin/netstat -na|grep ESTABLISHED|awk ‘{print $5}’|awk -F:‘{print $1}’|sort|uniq -c|sort -rn|head -10|grep -v -E ’192.168|127.0′|awk ‘{if($2!=null&a
java程序员生存手册-craps 游戏-一个简单的游戏 bylijinnan java
import java.util.Random; public class CrapsGame { /** * *一个简单的赌*博游戏，游戏规则如下： *玩家掷两个骰子，点数为1到6，如果第一次点数和为7或11，则玩家胜， *如果点数和为2、3或12，则玩家输， *如果和为其它点数，则记录第一次的点数和，然后继续掷骰，直至点数和等于第一次掷出的点
TOMCAT启动提示NB: JAVA_HOME should point to a JDK not a JRE解决开窍的石头 JAVA_HOME
当tomcat是解压的时候，用eclipse启动正常，点击startup.bat的时候启动报错; 报错如下： The JAVA_HOME environment variable is not defined correctly This environment variable is needed to run this program NB: JAVA_HOME shou
[操作系统内核]操作系统与互联网 comsci 操作系统
我首先申明：我这里所说的问题并不是针对哪个厂商的，仅仅是描述我对操作系统技术的一些看法操作系统是一种与硬件层关系非常密切的系统软件，按理说，这种系统软件应该是由设计CPU和硬件板卡的厂商开发的，和软件公司没有直接的关系，也就是说，操作系统应该由做硬件的厂商来设计和开发
富文本框ckeditor_4.4.7 文本框的简单使用支持IE11 cuityang 富文本框
<html xmlns="http://www.w3.org/1999/xhtml"> <head> <meta http-equiv="Content-Type" content="text/html; charset=UTF-8" /> <title>知识库内容编辑</tit
Property null not found darrenzhu datagrid Flex Advanced propery null
When you got error message like "Property null not found ***", try to fix it by the following way: 1)if you are using AdvancedDatagrid, make sure you only update the data in the data prov
MySQl数据库字符串替换函数使用 dcj3sjt126com mysql 函数替换
需求：需要将数据表中一个字段的值里面的所有的 . 替换成 _ 原来的数据是 site.title site.keywords .... 替换后要为 site_title site_keywords 使用的SQL语句如下： updat
mac上终端起动MySQL的方法 dcj3sjt126com mysql mac
首先去官网下载: http://www.mysql.com/downloads/ 我下载了5.6.11的dmg然后安装,安装完成之后..如果要用终端去玩SQL.那么一开始要输入很长的:/usr/local/mysql/bin/mysql 这不方便啊,好想像windows下的cmd里面一样输入mysql -uroot -p1这样...上网查了下..可以实现滴. 打开终端,输入: 1
Gson使用一（Gson） eksliang json gson
转载请出自出处：http://eksliang.iteye.com/blog/2175401 一.概述从结构上看Json，所有的数据（data）最终都可以分解成三种类型：第一种类型是标量（scalar），也就是一个单独的字符串（string）或数字（numbers），比如"ickes"这个字符串。第二种类型是序列（sequence），又叫做数组（array）
android点滴4 gundumw100 android
Android 47个小知识 http://www.open-open.com/lib/view/open1422676091314.html Android实用代码七段（一） http://www.cnblogs.com/over140/archive/2012/09/26/2611999.html http://www.cnblogs.com/over140/arch
JavaWeb之JSP基本语法 ihuning javaweb
目录 JSP模版元素 JSP表达式 JSP脚本片断 EL表达式 JSP注释特殊字符序列的转义处理如何查找JSP页面中的错误 JSP模版元素 JSP页面中的静态HTML内容称之为JSP模版元素，在静态的HTML内容之中可以嵌套JSP
App Extension编程指南（iOS8/OS X v10.10）中文版啸笑天 ext
当iOS 8.0和OS X v10.10发布后，一个全新的概念出现在我们眼前，那就是应用扩展。顾名思义，应用扩展允许开发者扩展应用的自定义功能和内容，能够让用户在使用其他app时使用该项功能。你可以开发一个应用扩展来执行某些特定的任务，用户使用该扩展后就可以在多个上下文环境中执行该任务。比如说，你提供了一个能让用户把内容分
SQLServer实现无限级树结构 macroli oracle sql SQL Server
表结构如下：数据库id path titlesort 排序 1 0 首页 0 2 0,1 新闻 1 3 0,2 JAVA 2 4 0,3 JSP 3 5 0,2,3 业界动态 2 6 0,2,3 国内新闻 1 创建一个存储过程来实现，如果要在页面上使用可以设置一个返回变量将至传过去 create procedure test as begin decla
Css居中div，Css居中img，Css居中文本，Css垂直居中div qiaolevip 众观千象学习永无止境每天进步一点点 css
/**********Css居中Div**********/ div.center { width: 100px; margin: 0 auto; } /**********Css居中img**********/ img.center { display: block; margin-left: auto; margin-right: auto; }
Oracle 常用操作(实用) 吃猫的鱼 oracle
SQL>select text from all_source where owner=user and name=upper('&plsql_name'); SQL>select * from user_ind_columns where index_name=upper('&index_name'); 将表记录恢复到指定时间段以前
iOS中使用RSA对数据进行加密解密 witcheryne ios rsa iPhone objective c
RSA算法是一种非对称加密算法,常被用于加密数据传输.如果配合上数字摘要算法, 也可以用于文件签名. 本文将讨论如何在iOS中使用RSA传输加密数据. 本文环境 mac os openssl-1.0.1j, openssl需要使用1.x版本, 推荐使用[homebrew](http://brew.sh/)安装. Java 8 RSA基本原理 RS