koukouvagia

[2112] On Efficient Transformer and Image Pre-training for Low-level Vision

paper
code

Content

- Abstract
- Method
- - - model architecture
    - (shifted) cross local attention
    - anti-blocking FFN
    - architecture variants
- Pre-Training
- - - pre-training on ImageNet
    - centered kernel alignment (CKA)
    - - representation structure of EDT
    - single and multi-task pre-training
- Experiment
- - - super resolution
    - denoising
    - deraining
    - ablation study

Abstract

a highly efficient and generic transformer for low-level vision
achieve SOTA with constrained parameters and computational complexity
the first in-depth study on image pre-training for low-level vision
how pre-training affect internal representations of models, how to conduct an effective pre-training

Comparison on PSNR (dB) performance of the proposed EDT and state-of-the-art methods in different low-level tasks.

Method

model architecture

The proposed encoder-decoder-based Transformer (EDT). EDT processes high-resolution (e.g., in deraining) and low-resolution (e.g., in SR, $s$ refers to the scale) inputs using different paths, modeling long-range interactions at a low resolution, for efficient computation.

consist of a lite conv-based encoder-decoder and a transformer body
limitation of transformer: high computational cost, so be difficult to handle HR inputs

Structures of the convolution blocks (CB) in the encoder and decoder. The dotted boxes and lines represent additional down-sampling and up-sampling operations when processing high-resolution inputs.

encoder

sr maintain original input size
dn, dr down-sample to $\frac14$ input size with stride conv

note that stack of early convs is useful for stabling the optimization.

transformer
achieve larger receptive fields at low computational cost $\impliedby$ down-sampler in encoder

Structure of the transformer block, including layer normalizations (LN), a (shifted) crossed local multi-head attention module ((S)CL-MSA) and an anti-blocking feed-forward network (Anti-FFN).

decoder

sr maintain original input size, an extra up-sampler before output
dn, dr down-sample to $\frac14$ input size with stride conv

skip connection
fast convergence during training

(shifted) cross local attention

Shifted Crossed Local Attention. The horizontal and vertical window sizes are set to $(h, w)$ and $(w, h)$ .

given input features $X\in{\Reals}^{(H\times W)\times C}$ , split into 2 parts in channel dimension
$X=[X_1, X_2]$

where, $X_1, X_2\in{\Reals}^{(H\times W)\times\frac{C}2}$
each half perform MSA in either horizontal or vertical window
$\begin{aligned} X_1'&=H\text{-}MSA(X_1) \\ X_2'&=V\text{-}MSA(X_2) \end{aligned}$

where, window size is $(w, h)$ or $(h, w), w > h$
projection layer finally fuse attention results
$CL\text{-}MSA(X)=proj([X_1', X_2'])$

window shifted by $(\lfloor\frac{h}2\rfloor, \lfloor\frac{w}2\rfloor)$ or $(\lfloor\frac{w}2\rfloor, \lfloor\frac{h}2\rfloor)$
$\implies$ crossed windows with shifts dramatically increase effective receptive field
complexity of crossed window attention for $H\times W$ input
$\Omega((S)CL\text{-}MSA)=4HWC^2+2hwHWC$

anti-blocking FFN

$Y = L i n e a r (A c t (A B F F (A c t (L i n e a r (X)))))$

where, $ABFF(\cdot)$ implemented by depth-wise conv with 5x5 kernel
$\implies$ eliminate possible blocking effect caused by window partition

architecture variants

Configurations of four variants of EDT. The parameter numbers and FLOPs are counted in denoising at $192\times192$ size.

uniformly set block number in each stage to 6, expansion ratio of FFN to 2, window size $(h, w)$ to (6, 24)

Pre-Training

pre-training on ImageNet

dataset ImageNet: 200K, 15.6%
degradation

sr: $\times2$ , $\times3$ , $\times4$ bilinear interpolation (BI)
dn: Gaussian noise $\sigma=15, 20, 50$
dr: light, heavy rain stroke

pre-training strategy

train a single model for a specific task, eg. $\times2$ sr
train a single model for highly related tasks, eg. $\times2$ , $\times3$ , $\times4$ sr
train a single model for unrelated tasks, eg. $\times2$ , $\times3$ sr and 15-level dn

pre-training for unrelated tasks is used in IPT.

centered kernel alignment (CKA)

study representation similarity hidden layers in network
given $m$ data points, output of 2 layers are $X\in{\Reals}^{m\times p_1}$ and $Y\in{\Reals}^{m\times p_2}$ , with $p_1$ and $p_2$ output neurons respectively
use Gram matrices $K=XX^T$ and $L=YY^T$ to compute CKA
$L)=\frac{HSIC(K, L)}{\sqrt{HSIC(K, K)HSIC(L, L)}}$

where, HSIC is Hilbert-Schimit independence criterion

衡量特征之间的相似性，一般通过衡量特征中样本对之间的相似性，其指标是相似性度量矩阵 (representational similarity matrices)
比较常见的相似性度量矩阵，有以下几种：
a. 点积相似性度量 dot product based similarity
(s.1)
$\langle vec(XX^T), vec(YY^T)\rangle=tr(XX^TYY^T)={\vert Y^TX\vert}_F^2$

其中， $XX^T$ 表示从特征X的视角来衡量样本之间的关系， $YY^T$ 表示从特征Y的视角来衡量样本之间的关系，两者的内积即为特征X和特征Y之间的相似性
b. Hilbert-Schimit独立性度量 Hilbert-Schimit independence criterion
对于均值为0的特征X和Y，(s.1)可变形为(s.2)
$\frac1{(m-1)^2}tr(XX^TYY^T) = {\vert cov(X^T, Y^T)\vert}_F^2$

(s.2)成立，有如下简单推导
$\begin{aligned} \frac1{(m-1)^2}tr(XX^TYY^T)&=\frac1{(m-1)^2}tr((Y^TX)^TY^TX) \\ &=\frac1{(m-1)^2}\sum_{i=1}^p\sum_{j=1}^p(Y^TX_{i, j})(X^TY_{i, j}) \\ &=\frac1{(m-1)^2}\sum_{i=1}^p\sum_{j=1}^p(Y^TX_{i, j})^2 \\ &=\frac1{(m-1)^2}cov(X^T, Y^T)_{i, j}^2 \\ &={\vert cov(X^T, Y^T)\vert}_F^2 \end{aligned}$

Hilbert-Schimit独立性度量就是把(s.2)中的协方差的Frobenius范数的平方替换成Hilbert-Schimit范数的平方
定义两个核函数 $K_{i, j}=k(x_i, x_j), L_(i, j)=l(y_i, y_j)$ ，Hilbert-Schimit独立性度量可以写成(s.3)
$HSIC=\frac1{(m-1)^2}\langle vec(HKH), vec(HLH)\rangle=\frac1{(m-1)^2}tr(KHLH)$

其中， $H K H$ 和 $H L H$ 是中心化的Gram矩阵， $H_n=I_n-\frac1n11^T$
(s.2)和(s.3)的联系是：当使用线性核函数 $k(x, y)=l(x, y)=x^Ty$ 时，Hilbert-Schimit独立性度量退化为点积相似性度量
ref: zhihu

representation structure of EDT

Sub-figures (a)-© show CKA similarities between all pairs of layers in x2 EDT-S SR model, x2 EDT-B SR model, level-15 EDT-B denoising model with single-task pre-training, and the corresponding similarities between with and without pre-training are shown in (e)-(g). Sub-figure (d) shows the cross-model comparison between EDT-B SR and EDT-B denoising models and (h) shows the ratios of layer similarity larger than 0.6, where “s” means the similarity between the current layer in SR and any layer in denoising.

key findings

sr models show clear stages in internal representations and proportion of each stage vary with model size, while dn models present a relatively uniform structure
layers in dn models show more similarity to lower layers in sr models, containing more local information
single-task pre-training mainly affect higher layers in sr models, but have limited impact on dn models

single and multi-task pre-training

Sub-figures (a)-(d) show CKA similarities of x2 SR models, without pre-training as well as with pre-training on a single task (x2), highly related tasks (x2, x3, x4 SR) and unrelated tasks (x2, x3 SR, level-15 denoising). Sub-figures (e)-(h) show the corresponding attention head mean distances of Transformer blocks. Note that we do not plot shifted local windows in (e)-(h) so that the last blue dotted line (“—”) has no matching point. The red boxes indicate the same attention modules.

key findings

representations of sr models contain more local information in early layers while more global information in higher layers
与单任务预训练相比，相关多任务预训练(fig.g)将更多的第3个块的全局表征转化成了局部表征，增加了第2块的范围；不相关多任务预训练(fig.h)的这种现象的表现偏弱
all 3 pre-training methods can greatly improve the performance by introducing different degrees of local information, treated as a kind of inductive bias, to the intermediate layers of model, among which multi-related-task pre-training performs best

PSNR(dB) improvements of single-task, multi-related-task and multi-unrelated-task pre-training in $\times2$ SR.

multi-related-task pre-training is more effective and efficient, providing initialization for multiple tasks.
multi-task pretraining is more effective and data-efficient, for its setting enable transformer body to see more samples in an iteration.

PSNR(dB) improvements of different data scales during single-task pre-training for EDT-L in $\times2$ SR.

incremental PSNR improvements on multiple SR benchmarks by increasing the data scale
noted that double pre-training iterations (from 500K to 1M) for the data scale of 400K so that data can be fully functional, and longer pre-training period largely increases training burden.

PSNR(dB) results of different pre-training (single-task) data scales in $\times2$ SR. “EDT-B $\dag$ ” refers to the base model with single-task pre-training and “EDT-B $\ast$ ” represents the base model with multi-related-task pre-training. The best results are in bold.

Experiment

pre-training

input
- sr, in transformer: $48\times48$ -size
- dn, dr: $192\times192$ -size
optimizer Adam: $\beta1=0.9, \beta2=0.99$ , batch size=8, 500K iterations
learning rate initial 2e-4, halved at 250K, 400K, 450K, 475K-th iteration

fine-tuning

extra 500K, 800K, 200K iterations for sr, dn, dr
learning rate constant 1e-5

super resolution

Quantitative comparison for classical SR on PSNR(dB)/SSIM on the Y channel from the YCbCr space. “ $\ddag$ ” means the $\times3$ and $\times4$ models of SwinIR are pre-trained on the $\times2$ setup and training patch size is $64\times64$ (ours is $48\times48$ ). “ $\dag$ ” indicates methods with a pre-training. Best and second best results are in red and blue colors.

Quantitative comparison for lightweight SR on PSNR(dB)/SSIM on the Y channel. “ $\ddag$ ” means the $\times3$ and $\times4$ models of SwinIR are pre-trained on the $\times2$ setup and the training patch size is $64\times64$ (ours is $48\times48$ and without pre-training).

denoising

Quantitative comparison for color image denoising on PSNR(dB) on RGB channels. “ $\ddag$ ” means the $\sigma=25/50$ models of SwinIR are pre-trained on the $\sigma=15$ level. “ $\dag$ ” indicates methods with a pre-training. “ $\ast$ ” means our model without down-sampling and without pre-training.

deraining

Quantitative comparison for image deraining on PSNR(dB)/SSIM on the Y channel. “ $\dag$ ” indicates methods with a pre-training.

ablation study

window size

Ablation study of window size on PSNR(dB) in $\times2$ SR. Best results are in bold.

你可能感兴趣的:(Low-Level,Vision,Vision,Transformer,计算机视觉,深度学习)

Python 装饰器详解：@staticmethod 与 @classmethod 的区别与用法：中英双语阿正的梦工坊 Python python 开发语言
缘由：今天在看Huggingface的源码的时候，https://github.com/huggingface/transformers/blob/v4.47.1/src/transformers/models/auto/configuration_auto.py#L897对几个装饰器有所疑问，学习一下。Python装饰器详解：@staticmethod与@classmethod的区别与用法在Py
AlphaFold2的思路总结（十五） xiaofengzihhh 蛋白质结构预测深度学习人工智能神经网络
2021SC@SDUSC这学期的代码分析工作接近尾声了，我想简单总结一下AlphaFold2的总体思路具体来看，AlphaFold2主要利用多序列比对（MSA），把蛋白质的结构和生物信息整合到了深度学习算法中。它主要包括两个部分：神经网络EvoFormer和结构模块（Structuremodule）。一、EvoFormer 在EvoFormer中，主要是将图网络（Graphnetworks）
python机器学习方安乐 python python 机器学习人工智能
Python机器学习是当前最为热门的机器学习领域之一，其简洁、易用、高效的特点，让越来越多的开发者开始探索其应用。本文将从以下几个方面介绍Python机器学习的基础知识和实践案例，帮助读者更好地理解和应用机器学习技术。前提Python机器学习的应用领域A.图像识别和计算机视觉B.自然语言处理和文本分析C.数据挖掘和推荐系统深度学习A.神经网络的基本原理B.常用的深度学习框架和算法C.深度学习在图像
基于深度学习的舆论分析与检测系统应用与研究计算机软件程序设计机器学习深度学习人工智能舆论检测
【1】系统介绍研究背景随着互联网技术的迅猛发展和社会媒体平台的普及，信息传播的速度和范围达到了前所未有的水平。这一变化不仅极大地丰富了人们的社交生活，也为社会科学研究提供了新的视角和工具。舆论分析作为社会科学研究的一个重要分支，其目的是通过收集和分析网络上的公众意见和情感倾向，来了解人们对特定事件或话题的看法和态度。近年来，基于深度学习的自然语言处理技术取得了显著进步，这为提高舆论分析的准确性和效
深度学习利用数据加载、预处理和增强数据提高模型的性能 weixin_30777913 人工智能深度学习
深度学习数据预处理是一个关键步骤，旨在提高模型的性能和准确性。通过数据加载、预处理和增强，可以显著提高深度学习模型的性能和准确性。在实际应用中，需要根据具体的数据和任务来选择合适的预处理和增强技术。以下将详细论述并举例说明如何加载、预处理和增强数据。一、数据加载在深度学习中，数据加载是第一步。这通常涉及到从各种数据源（如CSV文件、数据库、图像文件夹等）中读取数据。以DeepLearning4J（
【深度学习】搭建PyTorch神经网络进行气温预测睡不着还睡不醒深度学习深度学习 pytorch 神经网络
第一步数据加载与观察①导包importnumpyasnpimportpandasaspdimportmatplotlib.pyplotaspltimporttorchimporttorch.optimasoptimimportwarningswarnings.filterwarnings("ignore")%matplotlibinline②加载数据features=pd.read_csv("te
第72期 | GPTSecurity周报云起无垠 GPTSecurity 人工智能安全
GPTSecurity是一个涵盖了前沿学术研究和实践经验分享的社区，集成了生成预训练Transformer（GPT）、人工智能生成内容（AIGC）以及大语言模型（LLM）等安全领域应用的知识。在这里，您可以找到关于GPT/AIGC/LLM最新的研究论文、博客文章、实用的工具和预设指令（Prompts）。现为了更好地知悉近一周的贡献内容，现总结如下。SecurityPapers1.从孤立指令到互动鼓
PointNet++改进策略：模块改进 | OA-CNNs | ，全自适应3D稀疏卷积神经网络（OA-CNNs），超越基于Transformer的模型，同时显著降低计算和内存成本我是瓦力 PointNet++改进策略 3d transformer 深度学习计算机视觉人工智能神经网络
目录介绍核心思想及其实现引入空间自适应感受野自适应关系卷积（ARConv）网络整体架构设计训练和验证实验与评估如何改进PointNet++引入空间自适应感受野引入自适应关系学习利用自适应聚合器论文题目：OA-CNNs:Omni-AdaptiveSparseCNNsfor3DSemanticSegmentation发布期刊：CVPR2024作者地址：1香港中文大学2香港大学3香港中文大学，深圳4HI
PointNet++改进策略：模块改进 | PointCAT，使用交叉注意力机制来提升3D点云任务中提升模型精度我是瓦力 PointNet++改进策略 3d 深度学习人工智能计算机视觉 transformer
论文题目：PointCAT:Cross-AttentionTransformerforPointCloud通讯地址：南京理工大学代码地址：https://github.com/xincheng-yang/PointCAT.PointCAT架构：PointCAT提出了一种基于交叉注意力机制的Transformer网络，专门用于点云表示。它通过两个不同的多尺度特征分支，利用交叉注意力机制来交换信息。通
深度学习-97-大语言模型LLM之基于langchain的实体记忆和知识图谱记忆皮皮冰燃深度学习深度学习语言模型 langchain
文章目录1内存记忆Memory1.1记忆系统支持的操作1.2记忆的存储1.3记忆的查询2记忆的应用2.1设置环境变量2.2ConversationEntityMemory实体记忆2.3ConversationKGMemory知识图谱记忆2.3.1创建ConversationKGMemory2.3.2创建ConversationChain2.4ConversationBufferWindowMemo
PyTorch 实战教程：从模型搭建到训练的每一步 AI_小站 pytorch 人工智能 python transformer 深度学习大模型 LLM
用深度学习搞事情，模型搭建和训练是绕不开的两步。而PyTorch，作为一个“又灵活又好用”的深度学习框架，简直就是写代码的快乐源泉。今天我们就从0到1，实战PyTorch的模型搭建和训练流程。说白了，看完你就能自己搭个神经网络，喂点数据进去，再让它干点活。安装PyTorch要用PyTorch，得先装上它。PyTorch的安装稍微有点讲究，主要是要根据你的硬件选择CPU版本还是GPU版本。基本安装命
计算机视觉：卷积核每天五分钟玩转人工智能计算机视觉计算机视觉深度学习人工智能机器学习卷积神经网络
本文重点卷积神经网络（ConvolutionalNeuralNetwork，CNN）是一种深度学习模型，广泛应用于图像识别、自然语言处理、语音识别等领域。在卷积神经网络中，卷积核是网络的核心组件之一。通过不断堆叠卷积层和池化层，可以逐渐提取出更高级别的特征，从而实现更复杂的任务。卷积神经网络中的卷积核可以通过反向传播算法进行训练和优化，使其能够自适应地学习输入数据中的特征。因此，卷积神经网络在图像
浅谈人群扩展（lookalike）模型 eso1983 算法
Lookalike主要用于广告或者推荐系统中，找到与种子用户相似的人群。常用的算法应该包括协同过滤、基于标签的相似度计算，还有一些机器学习模型，比如逻辑回归、随机森林，以及深度学习的模型，比如DNN或者Embedding方法。这里简单介绍一下Lookalike人群扩展（相似人群扩展）中常用算法模型的解析，涵盖原理、数学公式、实现步骤、优缺点及适用场景。1.基于标签的相似度匹配原理通过用户标签（兴趣
4-2 计算机视觉-卷积神经网络-基本网络组件沉睡的小卡比兽 AI基础知识 cnn 卷积核端到端训练计算机视觉卷积神经网络
1、为什么卷积核一般都是奇数？2、由哪些层组成了基本的卷积神经网络，作用分别是什么？3、卷积层和池化层有什么区别？4、什么是端到端学习end-to-end？1、为什么卷积核一般都是奇数？（1）保护位置信息：保证锚点刚好在中间，方便以模块中心为标准进行滑动卷积，避免了位置信息发生偏移（2）padding时的对称性：保证padding时图像的两边依然对齐（3）一些历史尝试的经验，如边缘检测等，还有pa
清华大学提出Pointformer：基于Transformer的3D目标检测 Amusi（CVer）计算机视觉论文速递 Transformer 3D目标检测深度学习计算机视觉机器学习人工智能自动驾驶
没错！Transformer的"魔爪"已经伸向3D目标检测了。Pointformer：用于3D点云的特征学习backbone，可结合并提高现有的3D点云目标检测网络性能，如VoteNet、PointRCNN和CBGS等。注：文末附【Transformer】和【3D目标检测】学习交流群Transformer最近在3D点云方向应用的工作可以看一下：牛津大学等提出：PointTransformer清华大
【深度学习】常见模型-生成对抗网络（Generative Adversarial Network, GAN） IT古董人工智能深度学习机器学习深度学习生成对抗网络人工智能
生成对抗网络（GenerativeAdversarialNetwork,GAN）是一种深度学习模型框架，由IanGoodfellow等人在2014年提出。GAN由生成器（Generator）和判别器（Discriminator）两个对抗网络组成，通过彼此博弈的方式训练，从而生成与真实数据分布极为相似的高质量数据。GAN在图像生成、文本生成、数据增强等领域中有广泛应用。核心思想GAN的核心是两个神经
InceptionV1实现猴痘病识别案例小叮当爱咖啡计算机视觉人工智能神经网络深度学习
本文为为365天深度学习训练营内部文章原作者：K同学啊InceptionModule是InceptionV1的核心组成单元，提出了卷积层的并行结构，实现了在同一层就可以提取不同的特征为了改善计算量大的问题，使用了1*1的卷积核实现降维操作，以此来减小网络的参数量与计算量1*1卷积核的作用：降低输入特征图的通道数，减小网络的参数量与计算量最后InceptionModule基本由1*1卷积，3*3卷积
Python 深度学习实战：生成对抗网络 AI天才研究院深度学习实战 AI实战 AI大模型企业级应用开发实战大数据人工智能语言模型 AI LLM Java Python 架构设计 Agent RPA
1.背景介绍生成对抗网络（GenerativeAdversarialNetwork，GAN）是近年来较火热的深度学习模型之一，其在图像合成、视频生成、文本数据生成等领域均取得了不俗的效果。与传统的机器学习模型不同，GAN可以生成真实有效的数据，无需人工标注数据。它由两部分组成：生成器（Generator）和判别器（Discriminator）。生成器通过学习，根据噪声或随机变量（latentvar
【深度学习】常见模型-卷积神经网络（Convolutional Neural Networks, CNN） IT古董人工智能深度学习机器学习深度学习 cnn 人工智能
卷积神经网络（CNN）概念简介卷积神经网络（ConvolutionalNeuralNetworks,CNN）是一种专门用于处理数据具有网格状拓扑结构（如图像、语音）的深度学习模型。它通过卷积操作从输入数据中提取局部特征，并逐层构建更复杂的特征表示，广泛应用于图像分类、目标检测、语音识别等领域。关键组成部分卷积层（ConvolutionalLayer）使用卷积核（滤波器）在输入上滑动，提取局部特征。
NVIDIA L40s、A10、A40、A100、A6000横评，哪个GPU 更适合 AI 推理任务？ DO_Community 技术科普商业建议人工智能 gpu算力 DigitalOcean ai AIGC
近年来，随着人工智能技术的发展，特别是深度学习模型的广泛应用，GPU（图形处理单元）作为加速计算的重要硬件，在AI领域扮演着越来越重要的角色。AI推理是指已经训练好的模型对新数据进行预测的过程。与训练阶段相比，推理通常对GPU的要求有所不同，更注重于能效比、延迟以及并发处理能力。本文将从这些角度出发，对比分析NVIDIA的L40s、A10、A40、A100、A6000五款GPU在AI推理任务中的表
国内的AI大模型有可能超过ChatGPT吗？ AIWritePaper官方账号 Prompt ChatGPT AIWritePaper chatgpt 人工智能深度学习 AI写作 AIGC
这是一个非常有前瞻性和现实意义的问题。要回答国内AI是否有可能超过ChatGPT，我们需要从多个方面来分析，包括技术基础、数据资源、应用场景、政策支持以及人才储备等。以下是对这一问题的详细探讨：1.技术基础（1）现状国内AI技术：国内的AI技术发展迅速，尤其在深度学习、自然语言处理（NLP）和计算机视觉等领域已经取得了显著进展。例如，百度的文心一言、阿里的通义千问等大语言模型（LLM）已经在技术上
Jetson Orin Nano Super之pytorch + torchvision安装 lida2003 Linux 人工智能 jetson orin
JetsonOrinNanoSuper之pytorch+torchvision安装1源由2.安装pytorch2.1NVIDIA手动版本下载2.2开源自己编译版本3.安装torchvision4.参考资料1源由YoloincompatiblewithJetpack6.2(JetsonOrinNanoSuper)YoloincompatiblewithJetpack6.2(JetsonOrinNan
WGAN - 瓦萨斯坦生成对抗网络池央生成对抗网络人工智能神经网络
1.背景与问题生成对抗网络（GenerativeAdversarialNetworks,GANs）是由IanGoodfellow等人于2014年提出的一种深度学习模型。它包括两个主要部分：生成器（Generator）和判别器（Discriminator），两者通过对抗训练的方式，彼此不断改进，生成器的目标是生成尽可能“真实”的数据，而判别器的目标是区分生成的数据和真实数据。虽然传统GAN在多个领域
InternLM: LMDeploy 量化部署进阶实践 dilvx 机器学习
LMDeploy部署模型模型部署是将训练好的深度学习模型在特定环境中运行。欢迎使用LMDeploy，支持市面上主流的格式和算法。大模型缓存推理本章的前半部分主要讲量化，包括KV-Cache量化、权重量化、激活值量化。量化主要是为了节省存储空间，用int4,int8来重新表示fp16，将模型的显存占用控制在200G可接受的范围下。值得注意的是，在transformer架构下，计算的瓶颈主要在显存带宽
NVIDIA-TensorRT-Python推理呆呆珝推理框架 python 人工智能开发语言
1,前言NVIDIATensorRT进行模型推理的Python实现。TensorRT是一个高性能的深度学习推理优化器和运行时，它能够为深度学习模型提供低延迟和高吞吐量的推理能力。(由于官方文档的使用还是比较简单，也可能自己很菜，参考了别人的文档和自己摸索，写出来这个可以使用的API)2.Python-API推理step1：导入基本库(环境自行配置)#导入TensorRT库importtensorr
NCNN推理呆呆珝推理框架 c++人工智能
1.前言ncnn是一个高性能的神经网络前向计算框架，专门针对移动设备和嵌入式设备设计。它由腾讯优图实验室开发，旨在提供高效的神经网络推理能力，特别是在资源受限的环境中，如智能手机和嵌入式系统。ncnn被广泛应用于移动端和嵌入式设备上的各种深度学习应用，包括但不限于：图像分类/目标检测/语义分割/人脸识别/图像生成与处理2.NCNN的CMakeLists.txt编写ncnn的头文件，链接文件，静态链
基于深度学习的鸟类识别系统详解（UI界面 + YOLOv10 + 数据集） 2025年数学建模美赛深度学习 ui YOLO 人工智能 python 计算机视觉
引言鸟类识别是计算机视觉领域中一个独具挑战性的任务，尤其是在复杂的自然环境中，识别不同种类的鸟类需要非常强大的模型和丰富的数据集。随着深度学习技术的发展，基于YOLO（YouOnlyLookOnce）系列模型的目标检测系统展现了卓越的性能，特别是在速度和精度上的平衡方面。本博客将详细讲解如何利用YOLOv10模型来构建一个基于深度学习的鸟类识别系统。该系统会结合自定义鸟类数据集，设计一个简洁直观的
python----try-except语句吉730 大数据
try:#将可能出现问题的代码，放到try的代码块中num01=int(input("number01:"))num02=int(input("number02:"))result=num01/num02exceptValueError:#except错误类型:捕获异常并解决问题print("字母和字符无法转成数字，请下次注意")exceptZeroDivisionErrorase:#ase:接收
Qwen-VL: 一种多功能的视觉-语言模型，用于理解、定位、文本阅读等 &永恒的星河& LLMs LVLMs LLMs
论文题目：Qwen-VL:AVersatileVision-LanguageModelforUnderstanding,Localization,TextReading,andBeyond论文地址：https://arxiv.org/pdf/2308.12966github地址:https://github.com/QwenLM/Qwen-VL?tab=readme-ov-file更多技术文章可以
Transformer大模型实战 BART模型的架构 AI天才研究院大数据AI人工智能 AI大模型企业级应用开发实战 AI大模型应用入门实战与进阶计算科学神经计算深度学习神经网络大数据人工智能大型语言模型 AI AGI LLM Java Python 架构设计 Agent RPA
Transformer大模型实战BART模型的架构作者：禅与计算机程序设计艺术/ZenandtheArtofComputerProgramming/TextGenWebUILLMTransformer大模型实战BART模型的架构1.背景介绍1.1问题的由来随着大规模预训练模型的兴起，如BERT、GPT系列等，研究人员发现基于Transformer架构的模型在自然语言处理任务上表现出了显著的优势。为
SQL的各种连接查询 xieke90 UNION ALL UNION 外连接内连接 JOIN
一、内连接概念：内连接就是使用比较运算符根据每个表共有的列的值匹配两个表中的行。内连接（join 或者inner join ） SQL语法： select * fron
java编程思想--复用类百合不是茶 java 继承代理组合 final类
复用类看着标题都不知道是什么,再加上java编程思想翻译的比价难懂,所以知道现在才看这本软件界的奇书一:组合语法:就是将对象的引用放到新类中即可代码: package com.wj.reuse; /** * * @author Administrator 组
[开源与生态系统]国产CPU的生态系统 comsci cpu
计算机要从娃娃抓起...而孩子最喜欢玩游戏.... 要让国产CPU在国内市场形成自己的生态系统和产业链,国家和企业就不能够忘记游戏这个非常关键的环节.... 投入一些资金和资源,人力和政策,让游
JVM内存区域划分Eden Space、Survivor Space、Tenured Gen，Perm Gen解释商人shang jvm内存
jvm区域总体分两类，heap区和非heap区。heap区又分：Eden Space（伊甸园）、Survivor Space(幸存者区)、Tenured Gen（老年代-养老区）。非heap区又分：Code Cache(代码缓存区)、Perm Gen（永久代）、Jvm Stack(java虚拟机栈)、Local Method Statck(本地方法栈)。 HotSpot虚拟机GC算法采用分代收
页面上调用 QQ oloz qq
<A href="tencent://message/?uin=707321921&Site=有事Q我&Menu=yes"> <img style="border:0px;" src=http://wpa.qq.com/pa?p=1:707321921:1></a>
一些问题文强chu 问题
1.eclipse 导出 doc 出现“The Javadoc command does not exist.” javadoc command 选择 jdk/bin/javadoc.exe 2.tomcate 配置 web 项目 ..... SQL:3.mysql * 必须得放前面否则 select&nbs
生活没有安全感小桔子生活孤独安全感
圈子好小，身边朋友没几个，交心的更是少之又少。在深圳，除了男朋友，没几个亲密的人。不知不觉男朋友成了唯一的依靠，毫不夸张的说，业余生活的全部。现在感情好，也很幸福的。但是说不准难免人心会变嘛，不发生什么大家都乐融融，发生什么很难处理。我想说如果不幸被分手(无论原因如何)，生活难免变化很大，在深圳，我没交心的朋友。明
php 基础语法 aichenglong php 基本语法
1 .1 php变量必须以$开头 <?php $a=” b”; echo ?> 1 .2 php基本数据库类型 Integer float/double Boolean string 1 .3 复合数据类型数组array和对象 object 1 .4 特殊数据类型 null 资源类型(resource) $co
mybatis tools 配置详解 AILIKES mybatis
MyBatis Generator中文文档 MyBatis Generator中文文档地址： http://generator.sturgeon.mopaas.com/ 该中文文档由于尽可能和原文内容一致，所以有些地方如果不熟悉，看中文版的文档的也会有一定的障碍，所以本章根据该中文文档以及实际应用，使用通俗的语言来讲解详细的配置。本文使用Markdown进行编辑，但是博客显示效
继承与多态的探讨百合不是茶 JAVA面向对象继承对象
继承 extends 多态继承是面向对象最经常使用的特征之一：继承语法是通过继承发、基类的域和方法 //继承就是从现有的类中生成一个新的类，这个新类拥有现有类的所有extends是使用继承的关键字：在A类中定义属性和方法； class A{ //定义属性 int age； //定义方法 public void go
JS的undefined与null的实例 bijian1013 JavaScript JavaScript
<form name="theform" id="theform"> </form> <script language="javascript"> var a alert(typeof(b)); //这里提示undefined if(theform.datas
TDD实践（一） bijian1013 java 敏捷 TDD
一.TDD概述 TDD：测试驱动开发，它的基本思想就是在开发功能代码之前，先编写测试代码。也就是说在明确要开发某个功能后，首先思考如何对这个功能进行测试，并完成测试代码的编写，然后编写相关的代码满足这些测试用例。然后循环进行添加其他功能，直到完全部功能的开发。
[Maven学习笔记十]Maven Profile与资源文件过滤器 bit1129 maven
什么是Maven Profile Maven Profile的含义是针对编译打包环境和编译打包目的配置定制，可以在不同的环境上选择相应的配置，例如DB信息，可以根据是为开发环境编译打包，还是为生产环境编译打包，动态的选择正确的DB配置信息 Profile的激活机制 1.Profile可以手工激活，比如在Intellij Idea的Maven Project视图中可以选择一个P
【Hive八】Hive用户自定义生成表函数(UDTF) bit1129 hive
1. 什么是UDTF UDTF，是User Defined Table-Generating Functions，一眼看上去，貌似是用户自定义生成表函数，这个生成表不应该理解为生成了一个HQL Table，貌似更应该理解为生成了类似关系表的二维行数据集 2. 如何实现UDTF 继承org.apache.hadoop.hive.ql.udf.generic
tfs restful api 加auth 2.0认计 ronin47
　　目前思考如何给tfs的ngx-tfs api增加安全性。有如下两点：　　一是基于客户端的ip设置。这个比较容易实现。　　二是基于OAuth2.0认证，这个需要lua，实现起来相对于一来说，有些难度。　　现在重点介绍第二种方法实现思路。　　前言：我们使用Nginx的Lua中间件建立了OAuth2认证和授权层。如果你也有此打算，阅读下面的文档，实现自动化并获得收益。SeatGe
jdk环境变量配置 byalias java jdk
进行java开发，首先要安装jdk，安装了jdk后还要进行环境变量配置： 1、下载jdk（http://java.sun.com/javase/downloads/index.jsp），我下载的版本是：jdk-7u79-windows-x64.exe 2、安装jdk-7u79-windows-x64.exe 3、配置环境变量：右击"计算机"-->&quo
《代码大全》表驱动法-Table Driven Approach-2 bylijinnan java
package com.ljn.base; import java.io.BufferedReader; import java.io.FileInputStream; import java.io.InputStreamReader; import java.util.ArrayList; import java.util.Collections; import java.uti
SQL 数值四舍五入小数点后保留2位 chicony 四舍五入
1.round() 函数是四舍五入用，第一个参数是我们要被操作的数据，第二个参数是设置我们四舍五入之后小数点后显示几位。 2.numeric 函数的2个参数，第一个表示数据长度，第二个参数表示小数点后位数。例如：　　select cast(round(12.5,2) as numeric(5,2))
c++运算符重载 CrazyMizzz C++
一、加+，减-，乘*，除/ 的运算符重载 Rational operator*(const Rational &x) const{ return Rational(x.a * this->a); } 在这里只写乘法的，加减除的写法类似二、<<输出,>>输入的运算符重载 &nb
hive DDL语法汇总 daizj hive 修改列 DDL 修改表
hive DDL语法汇总１、对表重命名 hive> ALTER TABLE table_name RENAME TO new_table_name; 2、修改表备注 hive> ALTER TABLE table_name SET TBLPROPERTIES ('comment' = new_comm
jbox使用说明 dcj3sjt126com Web
参考网址：http://www.kudystudio.com/jbox/jbox-demo.html jBox v2.3 beta [ 点击下载] 技术交流QQGroup：172543951 100521167 [2011-11-11] jBox v2.3 正式版 - [调整&修复] IE6下有iframe或页面有active、applet控件
UISegmentedControl 开发笔记 dcj3sjt126com
// typedef NS_ENUM(NSInteger, UISegmentedControlStyle) { // UISegmentedControlStylePlain, // large plain &
Slick生成表映射文件 ekian scala
Scala添加SLICK进行数据库操作，需在sbt文件上添加slick-codegen包 "com.typesafe.slick" %% "slick-codegen" % slickVersion 因为我是连接SQL Server数据库，还需添加slick-extensions，jtds包 "com.typesa
ES-TEST gengzg test
package com.MarkNum; import java.io.IOException; import java.util.Date; import java.util.HashMap; import java.util.Map; import javax.servlet.ServletException; import javax.servlet.annotation
为何外键不再推荐使用 hugh.wang mysql DB
表的关联，是一种逻辑关系，并不需要进行物理上的“硬关联”，而且你所期望的关联，其实只是其数据上存在一定的联系而已，而这种联系实际上是在设计之初就定义好的固有逻辑。在业务代码中实现的时候，只要按照设计之初的这种固有关联逻辑来处理数据即可，并不需要在数据库层面进行“硬关联”，因为在数据库层面通过使用外键的方式进行“硬关联”，会带来很多额外的资源消耗来进行一致性和完整性校验，即使很多时候我们并不
领域驱动设计 julyflame VO DAO 设计模式 DTO po
概念： VO（View Object）：视图对象，用于展示层，它的作用是把某个指定页面（或组件）的所有数据封装起来。 DTO（Data Transfer Object）：数据传输对象，这个概念来源于J2EE的设计模式，原来的目的是为了EJB的分布式应用提供粗粒度的数据实体，以减少分布式调用的次数，从而提高分布式调用的性能和降低网络负载，但在这里，我泛指用于展示层与服务层之间的数据传输对
单例设计模式 hm4123660 java Singleton 单例设计模式懒汉式饿汉式
单例模式是一种常用的软件设计模式。在它的核心结构中只包含一个被称为单例类的特殊类。通过单例模式可以保证系统中一个类只有一个实例而且该实例易于外界访问，从而方便对实例个数的控制并节约系统源。如果希望在系统中某个类的对象只能存在一个，单例模式是最好的解决方案。 &nb
logback zhb8015 log logback
一、logback的介绍 Logback是由log4j创始人设计的又一个开源日志组件。logback当前分成三个模块：logback-core,logback- classic和logback-access。logback-core是其它两个模块的基础模块。logback-classic是log4j的一个改良版本。此外logback-class
整合Kafka到Spark Streaming——代码示例和挑战 Stark_Summer spark storm zookeeper PARALLELISM processing
作者Michael G. Noll是瑞士的一位工程师和研究员，效力于Verisign，是Verisign实验室的大规模数据分析基础设施（基础Hadoop）的技术主管。本文，Michael详细的演示了如何将Kafka整合到Spark Streaming中。期间， Michael还提到了将Kafka整合到 Spark Streaming中的一些现状，非常值得阅读，虽然有一些信息在Spark 1.2版
spring-master-slave-commondao 王新春 DAO spring dataSource slave master
互联网的web项目，都有个特点：请求的并发量高，其中请求最耗时的db操作，又是系统优化的重中之重。为此，往往搭建 db的一主多从库的数据库架构。作为web的DAO层，要保证针对主库进行写操作，对多个从库进行读操作。当然在一些请求中，为了避免主从复制的延迟导致的数据不一致性，部分的读操作也要到主库上。（这种需求一般通过业务垂直分开，比如下单业务的代码所部署的机器，读去应该也要从主库读取数

按字母分类： A B C D E F G H I J K L M N O P Q R S T U V W X Y Z 其他