cv_lhp

李沐动手学深度学习V2-目标检测SSD

一. 目标检测SSD(单发多框检测)

1. 介绍

SSD模型主要由基础网络组成，其后是几个多尺度特征块。基本网络用于从输入图像中提取特征，因此它可以使用深度卷积神经网络。单发多框检测论文中选用了在分类层之前截断的VGG，现在也常用ResNet替代。我们可以设计基础网络，使它输出的高和宽较大，从而基于该特征图生成的锚框数量较多，可以用来检测尺寸较小的目标，接下来的每个多尺度特征块将上一层提供的特征图的高和宽缩小（如减半），并使特征图中每个单元在输入图像上的感受野变得更广阔。由于接近顶部（输出层）的多尺度特征图较小，但具有较大的感受野，它们适合检测较少但较大的物体。简而言之，通过多尺度特征块，单发多框检测生成不同大小的锚框，并通过预测边界框的类别和偏移量来检测大小不同的目标，因此这是一个多尺度目标检测模型，如下图所示。

2. 类别预测层

设目标类别的数量为，因此锚框有 +1 个类别，其中0类是背景。在某个尺度下，设特征图的高和宽分别为 ℎ 和，如果以其中每个单元为中心生成个锚框，那么需要对 ℎ 个锚框进行分类。如果使用全连接层作为输出，很容易导致模型参数过多。由前面NIN网络介绍的使用卷积层的通道来输出类别预测的方法，单发多框检测采用同样的方法来降低模型复杂度。

具体来说，类别预测层使用一个保持输入高和宽的卷积层，这样一来，输出和输入在特征图宽和高上的空间坐标一一对应。考虑输出和输入同一空间坐标（、）：输出特征图上（、）坐标的通道里包含了以输入特征图（、）坐标为中心生成的所有锚框的类别预测，因此输出通道数为 (+1) ，其中索引为 (+1)+ （ 0≤≤ ）的通道代表了索引为的锚框有关类别索引为的预测。

下面定义了一个类别预测层，通过参数num_anchors和num_classes分别指定了和，该图层使用填充为1的 3×3 的卷积层，此卷积层的输入和输出的宽度和高度保持不变。

import torch
import d2l
from torch import nn
import d2l.torch
import torchvision

def class_predictor(num_inputs,num_anchors_per_pixel,num_class):
    return nn.Conv2d(in_channels=num_inputs,out_channels=num_anchors_per_pixel*(num_class+1),kernel_size=3,padding=1)

3. 边界框预测层

边界框预测层的设计与类别预测层的设计类似，唯一不同的是，这里需要为每个锚框预测4个偏移量，而不是 +1 个类别。

def bbox_offset_predictor(num_inputs,num_anchors_per_pixel):
    return nn.Conv2d(in_channels=num_inputs,out_channels=num_anchors_per_pixel*4,kernel_size=3,padding=1)

4. 连接多尺度预测

单发多框检测使用多尺度特征图来生成锚框并预测其类别和偏移量，在不同的尺度下，特征图的形状或以同一单元为中心的锚框的数量可能会有所不同，因此，不同尺度下预测输出的形状可能会有所不同。

下面为同一个小批量构建两个不同比例（Y1和Y2）的特征图，其中Y2的高度和宽度是Y1的一半。以类别预测为例，假设Y1和Y2的每个单元分别生成了 5 个和 3 个锚框。进一步假设目标类别的数量为 10 ，对于特征图Y1和Y2，类别预测输出中的通道数分别为 5×(10+1)=55 和 3×(10+1)=33 ，其中任一输出的形状是（批量大小，通道数，高度，宽度）。

def forward(x,block):
    return block(x)

Y1 = forward(torch.zeros(size=(2,8,20,20)),class_predictor(8,5,10))
Y2 = forward(torch.zeros(size=(2,16,10,10)),class_predictor(16,3,10))
Y1.shape,Y2.shape
'''
输出结果：
(torch.Size([2, 55, 20, 20]), torch.Size([2, 33, 10, 10]))
'''

由输出结果看出，除了批量大小这一维度外，其他三个维度都具有不同的尺寸，为了将这两个预测输出链接起来以提高计算效率，需要把这些张量转换为更一致的格式。
通道维包含中心相同的锚框的预测结果。我们首先将通道维移到最后一维。因为不同尺度下批量大小仍保持不变，我们可以将预测结果转成二维的（批量大小，高 × 宽 × 通道数）的格式，以方便之后在维度 1 上的连结。尽管Y1和Y2在通道数、高度和宽度方面具有不同的大小，仍然可以在同一个小批量的两个不同尺度上连接这两个预测输出。

def flatten_pred(pred):
    return torch.flatten(pred.permute(0,2,3,1),start_dim=1)
def concat_preds(preds):
    return torch.cat([flatten_pred(pred) for pred in preds],dim=1)
concat_preds([Y1,Y2]).shape
'''
输出结果：
torch.Size([2, 25300])
'''

5. 高和宽减半块

为了在多个尺度下检测目标，定义高和宽减半块down_sample_blk()，该模块将输入特征图的高度和宽度减半。事实上，该块应用了前面VGG模块设计。更具体地说，每个高和宽减半块由两个填充为 1 的 3×3 的卷积层、以及步幅为 2 的 2×2 最大汇聚层组成。填充为 1 的 3×3 卷积层不改变特征图的形状，后面的 2×2 的最大汇聚层将输入特征图的高度和宽度减少了一半。 **对于此高和宽减半块的输入和输出特征图，因为 1×2+(3−1)+(3−1)=6 ，所以输出中的每个单元在输入上都有一个 6×6 的感受野，如下图所示。**因此，高和宽减半块会扩大每个单元在其输入特征图中的感受野。

#构建的高和宽减半块会更改输入通道的数量，并将输入特征图的高度和宽度减半
def down_sample_block(in_channels,out_channels):
    blk = []
    for _ in range(2):
        blk.append(nn.Conv2d(in_channels=in_channels,out_channels=out_channels,kernel_size=3,padding=1))
        blk.append(nn.BatchNorm2d(num_features=out_channels))
        blk.append(nn.ReLU())
        in_channels = out_channels
    blk.append(nn.MaxPool2d(kernel_size=2,stride=2))
    return nn.Sequential(*blk)
Y3 = forward(torch.zeros(size=(2,10,20,20)),down_sample_block(10,50))
Y3.shape
#输出结果：torch.Size([2, 10, 10, 10])

6. 基本网络块

基本网络块用于从输入图像中抽取特征。为了计算简洁，构造了一个小的基础网络，该网络串联3个高和宽减半块，并逐步将通道数翻倍。给定输入图像的形状为 256×256 ，此基本网络块输出的特征图形状为 $32 \times 32$ （ $256/2^3=32$ ）。

def base_net():
    blk = []
    num_filters = [3,16,32,64]
    for i in range(len(num_filters)-1):
        blk.append(down_sample_block(in_channels=num_filters[i],out_channels=num_filters[i+1]))
    return nn.Sequential(*blk)
Y4 = forward(torch.zeros(size=(2,3,256,256)),base_net())
Y4.shape
#输出结果：torch.Size([2, 64, 32, 32])

7. 完整模型

完整的单发多框检测模型由五个模块组成，每个块生成的特征图既用于生成锚框，又用于预测这些锚框的类别和偏移量。在这五个模块中，第一个是基本网络块，第二个到第四个是高和宽减半块，最后一个模块使用全局最大池将高度和宽度都降到1，从技术上讲，第二到第五个区块都是多尺度特征块。

def get_block(i):
    if i == 0:
        block = base_net()
    elif i ==1 :
        block = down_sample_block(in_channels=64,out_channels=128)
    elif i == 4:
        block = nn.AdaptiveAvgPool2d(output_size=(1,1))
    else:
        block = down_sample_block(in_channels=128,out_channels=128)
    return block

为每个块定义前向传播，与图像分类任务不同，此处的前向传播输出包括：CNN特征图Y；在当前尺度下根据Y生成的锚框；预测的这些锚框的类别和偏移量（基于Y）。

def block_forward(X,block,size,ratio,block_class_predictor,block_bbox_offset_predictor):
    Y = block(X)
    anchors = d2l.torch.multibox_prior(data=Y,sizes=size,ratios=ratio)
    class_predictor = block_class_predictor(Y)
    bbox_offset_predictor = block_bbox_offset_predictor(Y)
    return (Y,anchors,class_predictor,bbox_offset_predictor)

一个较接近顶部的多尺度特征块是用于检测较大目标的，因此需要生成更大的锚框。前向传播中，在每个多尺度特征块上，通过调用的multibox_prior()函数的sizes参数传递两个比例值的列表。在下面，0.2和1.05之间的区间被均匀分成五个部分，以确定五个模块的在不同尺度下的较小值：0.2、0.37、0.54、0.71和0.88。之后，他们较大的值由 $\sqrt{0.2 \times 0.37} = 0.272$ 、 $\sqrt{0.37 \times 0.54} = 0.447$ 等给出。

sizes = [[0.2, 0.272], [0.37, 0.447], [0.54, 0.619], [0.71, 0.79],
         [0.88, 0.961]]
ratios = [[1, 2, 0.5]] * 5
num_anchors_per_pixel = len(sizes[0])+len(ratios[0])-1

定义完整的模型TinySSD:

class TinySSD(nn.Module):
    def __init__(self,num_classes):
        super(TinySSD,self).__init__()
        self.num_classes = num_classes
        idx_to_in_channels = [64,128,128,128,128]
        for i in range(5):
            # 即赋值语句self.blk_i=get_blk(i)
            setattr(self,f'block_{i}',get_block(i))
            setattr(self,f'block_class_predictor_{i}',class_predictor(num_inputs=idx_to_in_channels[i],num_anchors_per_pixel=num_anchors_per_pixel,num_class=num_classes))
            setattr(self,f'block_bbox_offset_predictor_{i}',bbox_offset_predictor(num_inputs=idx_to_in_channels[i],num_anchors_per_pixel=num_anchors_per_pixel))
    def forward(self,X):
        anchors,class_predictors,bbox_offset_predictors=[None]*5,[None]*5,[None]*5
        for i in range(5):
            # getattr(self,'blk_%d'%i)即访问self.blk_i
            X,anchors[i],class_predictors[i],bbox_offset_predictors[i] = block_forward(X,getattr(self,f'block_{i}'),sizes[i],ratios[i],getattr(self,f'block_class_predictor_{i}'),getattr(self,f'block_bbox_offset_predictor_{i}'))
        anchors = torch.cat(anchors,dim=1)
        class_predictors = concat_preds(class_predictors)
        class_predictors = class_predictors.reshape(class_predictors.shape[0],-1,self.num_classes+1)
        bbox_offset_predictors = concat_preds(bbox_offset_predictors)
        return anchors,class_predictors,bbox_offset_predictors

创建一个模型实例，然后使用它对一个 $256 \times 256$ 像素的小批量图像X执行前向传播：第一个模块输出特征图的形状为 $32 \times 32$ ，第二到第四个模块为高和宽减半块，第五个模块为全局汇聚层。由于以特征图的每个单元为中心有 $4$ 个锚框生成，因此在所有五个尺度下，每个图像总共生成 $(32^2 + 16^2 + 8^2 + 4^2 + 1)\times 4 = 5444$ 个锚框。

net = TinySSD(num_classes=1)
X = torch.zeros(size=(32,3,256,256))
anchors,class_predictors,bbox_offset_predictors = net(X)
anchors.shape,class_predictors.shape,bbox_offset_predictors.shape
'''
输出结果：
output anchors: torch.Size([1, 5444, 4])
output class preds: torch.Size([32, 5444, 2])
output bbox preds: torch.Size([32, 21776])
'''

8. 读取数据集和初始化

batch_size = 32
train_iter,_ = d2l.torch.load_data_bananas(batch_size)
#香蕉检测数据集中，目标的类别数为1，定义好模型后，需要初始化其参数并定义优化算法。
device,net = d2l.torch.try_gpu(0),TinySSD(num_classes=1)
optim = torch.optim.SGD(params=net.parameters(),lr=0.2,weight_decay=5e-4)

9 定义损失函数和评价函数

目标检测有两种类型的损失。第一种有关锚框类别的损失：使用之前图像分类问题里一直使用的交叉熵损失函数来计算；第二种有关正类锚框偏移量的损失：预测偏移量是一个回归问题，使用 1 范数损失，即预测值和真实值之差的绝对值，不使用平方损失，防止预测的偏移量与真实labels的偏移量相差过大时，造成平方损失过大。 掩码变量bbox_masks令负类锚框和填充锚框不参与损失的计算，最后，将锚框类别和偏移量的损失相加，以获得模型的最终损失函数。

class_loss = nn.CrossEntropyLoss(reduction='none')
bbox_offset_loss = nn.L1Loss(reduction='none')
def calculate_loss(class_preds,class_labels,bbox_offset_preds,bbox_offset_labels,bbox_mask):
    batch_sizes,num_classes = class_preds.shape[0],class_preds.shape[2]
    cla_ls = class_loss(class_preds.reshape(-1,num_classes),class_labels.reshape(-1)).reshape(batch_sizes,-1).mean(dim=1)
    bbox_offset_ls = bbox_offset_loss(bbox_offset_preds*bbox_mask,bbox_offset_labels*bbox_mask).mean(dim=1)
    return cla_ls+bbox_offset_ls

评价函数沿用图像分类准确率评价分类函数，由于偏移量使用了 1 范数损失，因此使用平均绝对误差来评价边界框的预测结果，这些预测结果是从生成的锚框及其预测偏移量中获得的。

def class_eval(class_preds,class_labels):
    # 由于类别预测结果放在最后一维，argmax需要指定最后一维。
    return float((torch.argmax(class_preds,dim=-1).type(class_labels.dtype) == class_labels).sum())
def offset_eval(bbox_offset_preds,bbox_offset_labels,bbox_mask):
    return float((torch.abs((bbox_offset_labels-bbox_offset_preds)*bbox_mask)).sum())

10. 模型训练

在训练模型时，需要在模型的前向传播过程中生成多尺度锚框（anchors），并预测其类别（cls_preds）和偏移量（bbox_preds），然后根据标签信息Y为生成的锚框标记类别（cls_labels）和偏移量（bbox_labels），最后我们根据类别和偏移量的预测和标注值分别计算损失函数，然后对类别和偏移量的损失求和。

num_epochs,timer = 20,d2l.torch.Timer()
animator = d2l.torch.Animator(xlabel='epoch',xlim=[1,num_epochs],legend=['class error','bbox mae'])
net = net.to(device)
for epoch in range(num_epochs):
    # 批量类别损失和，批量样本数
    # 批量偏移损失和，批量样本数
    accumulator = d2l.torch.Accumulator(4)
    net.train()
    for X,Y in train_iter:
        timer.start()
        X,Y = X.to(device),Y.to(device)
        optim.zero_grad()
        # 生成多尺度的锚框，为每个锚框预测类别和偏移量
        anchors,class_preds,bbox_offset_preds = net(X)
        # 为每个锚框标注类别和偏移量
        bboxes_offset_labels, bboxes_masks, bboxes_class_labels = d2l.torch.multibox_target(anchors,Y)
        # 根据类别和偏移量的预测和标注值计算损失函数
        loss = calculate_loss(class_preds,bboxes_class_labels,bbox_offset_preds,bboxes_offset_labels,bboxes_masks)
        loss.mean().backward()
        optim.step()
        accumulator.add(class_eval(class_preds,bboxes_class_labels),bboxes_class_labels.numel(),offset_eval(bbox_offset_preds,bboxes_offset_labels,bboxes_masks),bboxes_offset_labels.numel())
    class_error,offset_mae = 1-accumulator[0]/accumulator[1],accumulator[2]/accumulator[3]
    animator.add(epoch+1,[class_error,offset_mae])
print('class_error:',class_error,'offset_mae:',offset_mae)
print(f'{len(train_iter.dataset)/timer.stop()}examples/s,on ',str(device))

模型训练结果如下图所示：

11 模型预测

在预测阶段，希望能把图像里面所有我们感兴趣的目标检测出来。下面读取并调整测试图像的大小，然后将其转成卷积层需要的四维格式。

X = torchvision.io.read_image(path='../images/banana.jpg').unsqueeze(0).float()
print('x.shape1',X.shape)
transform = torchvision.transforms.Resize(size=(256,256))
X = transform(X)
img = X.squeeze(0).permute(1,2,0).long()
print('x.shape2',X.shape)

使用下面的multibox_detection（）函数，可以根据锚框及其预测偏移量得到预测边界框，然后通过非极大值抑制来移除相似的预测边界框。

def predict(X):
    net.eval()
    anchors,cls_preds,offset_preds=net(X.to(device))
    print('cls_preds.shape',cls_preds.shape)
    cls_probs = torch.softmax(cls_preds,dim=2).permute(0,2,1)
    output = d2l.torch.multibox_detection(cls_probs,offset_preds,anchors)
    print('output==',output[0])
    idx = [i for i,row in enumerate(output[0]) if row[0] != -1]
    print(idx)
    return output[0,idx]
output = predict(X)

最后筛选所有预测类别置信度不低于0.9的边界框，做为最终输出。

def display(img,output,threshold):
    d2l.torch.set_figsize((5,5))
    fig = d2l.torch.plt.imshow(img)
    for row in output:
        score = float(row[1])
        if score<threshold:
            continue
        h,w = img.shape[0:2]
        box_scale = torch.tensor([w,h,w,h],device=row.device)
        #print('预测框坐标：',row[2:6]*box_scale)
        d2l.torch.show_bboxes(fig.axes,[row[2:6]*box_scale],'%.2f'%score,'w')

display(img,output.cpu(),0.9)

预测结果如下图所示：

11 改进

通过改进损失函数来改进单发多框检测，例如将预测偏移量用到的 $L_1$ 范数损失替换为平滑 $L_1$ 范数损失。它在零点附近使用平方函数从而更加平滑，这是通过一个超参数 $\sigma$ 来控制平滑区域的：
$\begin{cases} (\sigma x)^2/2,& \text{if }|x| < 1/\sigma^2\\ |x|-0.5/\sigma^2,& \text{otherwise} \end{cases}$

当 $\sigma$ 非常大时，这种损失类似于 $L_1$ 范数损失。当它的值较小时，损失函数较平滑。

def smooth_l1(data, scalar):
    out = []
    for i in data:
        if abs(i) < 1 / (scalar ** 2):
            out.append(((scalar * i) ** 2) / 2)
        else:
            out.append(abs(i) - 0.5 / (scalar ** 2))
    return torch.tensor(out)

sigmas = [10, 1, 0.5]
lines = ['-', '--', '-.']
x = torch.arange(-2, 2, 0.1)
d2l.torch.set_figsize()

for l, s in zip(lines, sigmas):
    y = smooth_l1(x, scalar=s)
    d2l.torch.plt.plot(x, y, l, label='sigma=%.1f' % s)
d2l.torch.plt.legend();

在类别预测时，实验中使用了交叉熵损失：设真实类别 $j$ 的预测概率是 $p_j$ ，交叉熵损失为 $log p_j$ ，还可以使用焦点损失如下所示，给定超参数 $\gamma > 0$ 和 $\alpha > 0$ ，此损失的定义为：
$\alpha (1-p_j)^{\gamma} \log p_j.$

可以看到增大 $\gamma$ 可以有效地减少正类预测概率较大时（例如 $p_j > 0.5$ ）的相对损失，因此训练可以更集中在那些错误分类的困难示例上。

def focal_loss(gamma, x):
    return -(1 - x) ** gamma * torch.log(x)

x = torch.arange(0.01, 1, 0.01)
for l, gamma in zip(lines, [0, 1, 5]):
    y = d2l.torch.plt.plot(x, focal_loss(gamma, x), l, label='gamma=%.1f' % gamma)
d2l.torch.plt.legend();

输出结果如下所示：

12 小结

单发多框检测是一种多尺度目标检测模型。基于基础网络块和各个多尺度特征块，单发多框检测生成不同数量和不同大小的锚框，并通过预测这些锚框的类别和偏移量检测不同大小的目标。
在训练单发多框检测模型时，损失函数是根据锚框的类别和偏移量的预测及标注值分别计算loss，然后求和得出的。

13. 全部代码

import torch
import d2l
from torch import nn
import d2l.torch
import torchvision


def class_predictor(num_inputs, num_anchors_per_pixel, num_class):
    return nn.Conv2d(in_channels=num_inputs, out_channels=num_anchors_per_pixel * (num_class + 1), kernel_size=3,
                     padding=1)


def bbox_offset_predictor(num_inputs, num_anchors_per_pixel):
    return nn.Conv2d(in_channels=num_inputs, out_channels=num_anchors_per_pixel * 4, kernel_size=3, padding=1)


def forward(x, block):
    return block(x)


Y1 = forward(torch.zeros(size=(2, 8, 20, 20)), class_predictor(8, 5, 10))
Y2 = forward(torch.zeros(size=(2, 16, 10, 10)), class_predictor(16, 3, 10))
Y1.shape, Y2.shape


def flatten_pred(pred):
    return torch.flatten(pred.permute(0, 2, 3, 1), start_dim=1)


def concat_preds(preds):
    return torch.cat([flatten_pred(pred) for pred in preds], dim=1)


concat_preds([Y1, Y2]).shape


def down_sample_block(in_channels, out_channels):
    blk = []
    for _ in range(2):
        blk.append(nn.Conv2d(in_channels=in_channels, out_channels=out_channels, kernel_size=3, padding=1))
        blk.append(nn.BatchNorm2d(num_features=out_channels))
        blk.append(nn.ReLU())
        in_channels = out_channels
    blk.append(nn.MaxPool2d(kernel_size=2, stride=2))
    return nn.Sequential(*blk)


Y3 = forward(torch.zeros(size=(2, 10, 20, 20)), down_sample_block(10, 50))
Y3.shape


def base_net():
    blk = []
    num_filters = [3, 16, 32, 64]
    for i in range(len(num_filters) - 1):
        blk.append(down_sample_block(in_channels=num_filters[i], out_channels=num_filters[i + 1]))
    return nn.Sequential(*blk)


Y4 = forward(torch.zeros(size=(2, 3, 256, 256)), base_net())
Y4.shape


def get_block(i):
    if i == 0:
        block = base_net()
    elif i == 1:
        block = down_sample_block(in_channels=64, out_channels=128)
    elif i == 4:
        block = nn.AdaptiveAvgPool2d(output_size=(1, 1))
    else:
        block = down_sample_block(in_channels=128, out_channels=128)
    return block


def block_forward(X, block, size, ratio, block_class_predictor, block_bbox_offset_predictor):
    Y = block(X)
    anchors = d2l.torch.multibox_prior(data=Y, sizes=size, ratios=ratio)
    class_predictor = block_class_predictor(Y)
    bbox_offset_predictor = block_bbox_offset_predictor(Y)
    return (Y, anchors, class_predictor, bbox_offset_predictor)


sizes = [[0.2, 0.272], [0.37, 0.447], [0.54, 0.619], [0.71, 0.79],
         [0.88, 0.961]]
ratios = [[1, 2, 0.5]] * 5
num_anchors_per_pixel = len(sizes[0]) + len(ratios[0]) - 1


class TinySSD(nn.Module):
    def __init__(self, num_classes):
        super(TinySSD, self).__init__()
        self.num_classes = num_classes
        idx_to_in_channels = [64, 128, 128, 128, 128]
        for i in range(5):
            # 即赋值语句self.blk_i=get_blk(i)
            setattr(self, f'block_{i}', get_block(i))
            setattr(self, f'block_class_predictor_{i}',
                    class_predictor(num_inputs=idx_to_in_channels[i], num_anchors_per_pixel=num_anchors_per_pixel,
                                    num_class=num_classes))
            setattr(self, f'block_bbox_offset_predictor_{i}', bbox_offset_predictor(num_inputs=idx_to_in_channels[i],
                                                                                    num_anchors_per_pixel=num_anchors_per_pixel))

    def forward(self, X):
        anchors, class_predictors, bbox_offset_predictors = [None] * 5, [None] * 5, [None] * 5
        for i in range(5):
            # getattr(self,'blk_%d'%i)即访问self.blk_i
            X, anchors[i], class_predictors[i], bbox_offset_predictors[i] = block_forward(X,
                                                                                          getattr(self, f'block_{i}'),
                                                                                          sizes[i], ratios[i],
                                                                                          getattr(self,
                                                                                                  f'block_class_predictor_{i}'),
                                                                                          getattr(self,
                                                                                                  f'block_bbox_offset_predictor_{i}'))
        anchors = torch.cat(anchors, dim=1)
        class_predictors = concat_preds(class_predictors)
        class_predictors = class_predictors.reshape(class_predictors.shape[0], -1, self.num_classes + 1)
        bbox_offset_predictors = concat_preds(bbox_offset_predictors)
        return anchors, class_predictors, bbox_offset_predictors


net = TinySSD(num_classes=1)
X = torch.zeros(size=(32, 3, 256, 256))
anchors, class_predictors, bbox_offset_predictors = net(X)
anchors.shape, class_predictors.shape, bbox_offset_predictors.shape
batch_size = 32
train_iter, _ = d2l.torch.load_data_bananas(batch_size)
#香蕉检测数据集中，目标的类别数为1，定义好模型后，需要初始化其参数并定义优化算法。
device, net = d2l.torch.try_gpu(0), TinySSD(num_classes=1)
optim = torch.optim.SGD(params=net.parameters(), lr=0.2, weight_decay=5e-4)
class_loss = nn.CrossEntropyLoss(reduction='none')
bbox_offset_loss = nn.L1Loss(reduction='none')


def calculate_loss(class_preds, class_labels, bbox_offset_preds, bbox_offset_labels, bbox_mask):
    batch_sizes, num_classes = class_preds.shape[0], class_preds.shape[2]
    cla_ls = class_loss(class_preds.reshape(-1, num_classes), class_labels.reshape(-1)).reshape(batch_sizes, -1).mean(
        dim=1)
    bbox_offset_ls = bbox_offset_loss(bbox_offset_preds * bbox_mask, bbox_offset_labels * bbox_mask).mean(dim=1)
    return cla_ls + bbox_offset_ls


def class_eval(class_preds, class_labels):
    # 由于类别预测结果放在最后一维，argmax需要指定最后一维。
    return float((torch.argmax(class_preds, dim=-1).type(class_labels.dtype) == class_labels).sum())


def offset_eval(bbox_offset_preds, bbox_offset_labels, bbox_mask):
    return float((torch.abs((bbox_offset_labels - bbox_offset_preds) * bbox_mask)).sum())


num_epochs, timer = 20, d2l.torch.Timer()
animator = d2l.torch.Animator(xlabel='epoch', xlim=[1, num_epochs], legend=['class error', 'bbox mae'])
net = net.to(device)
for epoch in range(num_epochs):
    # 批量类别损失和，批量样本数
    # 批量偏移损失和，批量样本数
    accumulator = d2l.torch.Accumulator(4)
    net.train()
    for X, Y in train_iter:
        timer.start()
        X, Y = X.to(device), Y.to(device)
        optim.zero_grad()
        # 生成多尺度的锚框，为每个锚框预测类别和偏移量
        anchors, class_preds, bbox_offset_preds = net(X)
        # 为每个锚框标注类别和偏移量
        bboxes_offset_labels, bboxes_masks, bboxes_class_labels = d2l.torch.multibox_target(anchors, Y)
        # 根据类别和偏移量的预测和标注值计算损失函数
        loss = calculate_loss(class_preds, bboxes_class_labels, bbox_offset_preds, bboxes_offset_labels, bboxes_masks)
        loss.mean().backward()
        optim.step()
        accumulator.add(class_eval(class_preds, bboxes_class_labels), bboxes_class_labels.numel(),
                        offset_eval(bbox_offset_preds, bboxes_offset_labels, bboxes_masks),
                        bboxes_offset_labels.numel())
    class_error, offset_mae = 1 - accumulator[0] / accumulator[1], accumulator[2] / accumulator[3]
    animator.add(epoch + 1, [class_error, offset_mae])
print('class_error:', class_error, 'offset_mae:', offset_mae)
print(f'{len(train_iter.dataset) / timer.stop()}examples/s,on ', str(device))
X = torchvision.io.read_image(path='../images/banana.jpg').unsqueeze(0).float()
print('x.shape1', X.shape)
transform = torchvision.transforms.Resize(size=(256, 256))
X = transform(X)
img = X.squeeze(0).permute(1, 2, 0).long()
print('x.shape2', X.shape)


def predict(X):
    net.eval()
    anchors, cls_preds, offset_preds = net(X.to(device))
    print('cls_preds.shape', cls_preds.shape)
    cls_probs = torch.softmax(cls_preds, dim=2).permute(0, 2, 1)
    output = d2l.torch.multibox_detection(cls_probs, offset_preds, anchors)
    print('output==', output[0])
    idx = [i for i, row in enumerate(output[0]) if row[0] != -1]
    print(idx)
    return output[0, idx]


output = predict(X)


def display(img, output, threshold):
    d2l.torch.set_figsize((5, 5))
    fig = d2l.torch.plt.imshow(img)
    for row in output:
        score = float(row[1])
        if score < threshold:
            continue
        h, w = img.shape[0:2]
        box_scale = torch.tensor([w, h, w, h], device=row.device)
        #print('预测框坐标：',row[2:6]*box_scale)
        d2l.torch.show_bboxes(fig.axes, [row[2:6] * box_scale], '%.2f' % score, 'w')


display(img, output.cpu(), 0.9)


def smooth_l1(data, scalar):
    out = []
    for i in data:
        if abs(i) < 1 / (scalar ** 2):
            out.append(((scalar * i) ** 2) / 2)
        else:
            out.append(abs(i) - 0.5 / (scalar ** 2))
    return torch.tensor(out)


sigmas = [10, 1, 0.5]
lines = ['-', '--', '-.']
x = torch.arange(-2, 2, 0.1)
d2l.torch.set_figsize()

for l, s in zip(lines, sigmas):
    y = smooth_l1(x, scalar=s)
    d2l.torch.plt.plot(x, y, l, label='sigma=%.1f' % s)
d2l.torch.plt.legend();


def focal_loss(gamma, x):
    return -(1 - x) ** gamma * torch.log(x)


x = torch.arange(0.01, 1, 0.01)
for l, gamma in zip(lines, [0, 1, 5]):
    y = d2l.torch.plt.plot(x, focal_loss(gamma, x), l, label='gamma=%.1f' % gamma)
d2l.torch.plt.legend();

14 思考

1. 思考1为什么在预测锚框的类别，预测锚框的偏移量的过程中，不需要用到锚框本身而是使用特征图？特征图怎么和锚框联系起来的，根据特征图预测类别和偏移量为什么能够表示这个根据特征图生成的锚框的类别和真实边界框？或者说特征图预测的锚框的类别，以及偏移量，在什么地方来优化锚框？，参考理解如下图问题以及回答所示：

我的理解（仅供参考）：
在模型的前向传播中生成多尺度锚框，在模型训练时为生成的锚框标注类别和到真实边缘框的偏移量，然后与在前向传播过程生成的预测类别和偏移量计算损失，注意前向传播预测时并没有用到生成的锚框的信息，因为在训练阶段中将锚框的大小（类别和偏移量）传入到loss函数中，从而导致在前向传播预测时强迫卷积核（3x3的卷积核）查看它所对应感受野的区域里面查看我们需要有用的信息区域（这个信息区域只是感受野的一部分，比如这个信息区域可能包含狗，猫等物体，根据loss函数反向传播强迫卷积核查看这个信息区域，由于强迫看的信息区域不同，可能查看的信息区域有大有小，有长有宽的，因此强迫看的信息区域大小对应着象征着表示模拟这个以同一个像素为中心生成的锚框的大小。同样预测的偏移量根据loss函数中锚框标注的与真实边界框偏移量的label标签的损失，loss函数反向传播会强迫卷积核（3x3）查看它的感受野中对自己需要的部分信息区域，比如需要这个信息区域包含狗，猫等物体，然后去计算当前这个锚框的预测偏移量，由于这个预测的偏移量的不同，因此强迫卷积核查看这个感受野里面的信息区域野不同，从而体现了这个锚框的不同，由于强迫查看的这个感受野里面的信息区域，即代表象征着这个真实边界框圈住的区域，由于偏移量代表预测的真实边界框，因此偏移量计算出来的预测的真实边界框代表这个强迫看到的信息区域，而物体类别识别也是强迫看这个信息区域，因此对这个信息区域识别的物体和预测的偏移量代表的预测真实边界框就能一一对应起来。锚框的作用只是相当于给标签进行存储，相当于用来对这个识别的类别和偏移量label的一个编号，预测的类别并不是对这个锚框所在区域里面的信息进行识别，只是相当于感官模拟这个锚框而已，并不是对这个锚框所圈住的区域进行识别，因为预测识别的类别区域并不是这个锚框所在的区域，而是相当于这个预测偏移量所框住的区域。由于loss反向传播强迫卷积核识别的是这部分信息区域里面的信息，同时也强迫偏移量预测的也是这部分区域，虽然预测物体和预测偏移量是同时进行的，而不是有先后顺序进行预测，但是预测物体和预测偏移量都是针对这部分信息区域的，因此这个预测物体的值和预测偏移量(对应预测的真实边界框：结合当前编号对应的锚框大小和预测的偏移量计算出这个预测的真实边界框)是一一对应的，都是针对这部分信息区域进行预测的）。
一句话总结：loss函数反向梯度传播强迫3x3的卷积核所对应的感受野（注意：一般这个感受野是足够大了，能够包含所有锚框大小，比如：示例中第一个进行类别和偏移量预测是在经过第一个stage（经过四个卷积层和两个池化层后的base_block）后才开始预测的，因此此时卷积核看到的输入图像的感受野范围很大，包含了本示例中第一个stage使用到的锚框大小）查看里面感兴趣的信息区域，对这个信息区域预测的类别和结合loss函数传入的锚框信息从而对这个信息区域预测出来的偏移量（这个信息区域由这个偏移量结合锚框计算出来的预测的真实边界框来表示（框住），强迫查看的信息区域的大小也就象征着模拟这个以同一像素为中心的多个锚框大小。因此使用预测的偏移量结合对应锚框编号计算出来的预测真实边界框用来表示loss函数反向梯度传播强迫卷积核要查看的这个信息区域，预测识别出来的物体用来表示这个信息区域里面的物体是什么）。

2. 思考2

3. 思考3

你可能感兴趣的:(李沐动手学深度学习笔记,目标检测,深度学习,pytorch,python,计算机视觉)

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
10月|愿你的青春不负梦想-读书笔记-01 Tracy的小书斋
本书的作者是俞敏洪，大家都很熟悉他了吧。俞敏洪老师是我行业的领头羊吧，也是我事业上的偶像。本日摘录他书中第一章中的金句：『一个人如果什么目标都没有，就会浑浑噩噩，感觉生命中缺少能量。能给我们能量的，是对未来的期待。第一件事，我始终为了进步而努力。与其追寻全世界的骏马，不如种植丰美的草原，到时骏马自然会来。第二件事，我始终有阶段性的目标。什么东西能给我能量？答案是对未来的期待。』读到这里的时候，我便
理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
《投行人生》读书笔记小蘑菇的树洞
《投行人生》----作者詹姆斯-A-朗德摩根斯坦利副主席40年的职业洞见-很短小精悍的篇幅，比较适合初入职场的新人。第一部分成功的职业生涯需要规划1.情商归为适应能力分享与协作同理心适应能力，更多的是自我意识，你有能力识别自己的情并分辨这些情绪如何影响你的思想和行为。2.对于初入职场的人的建议，细节，截止日期和数据很重要截止日期，一种有效的方法是请老板为你所有的任务进行优先级排序。和老板喝咖啡的好
我校举行新老教师师徒结对仪式暨名师专业工作室工作交流活动李蕾1229
为促进我校教师专业发展，发挥骨干教师的引领带头作用，11月6日下午，我校举行新老教师师徒结对仪式暨名师专业工作室工作交流活动。图片发自App会议由教师发展处李蕾主任主持，首先，由范校长宣读新老教师结对名单及双方承担职责。随后，两位新调入教师陈玉萍、莫正杰分别和他们的师傅鲍元美、刘召彬老师签订了师徒结对协议书。图片发自App图片发自App师徒拥抱、握手。有了师傅就有了目标有了方向，相信两位新教师在师
【一起学Rust | 设计模式】习惯语法——使用借用类型作为参数、格式化拼接字符串、构造函数广龙宇一起学Rust #Rust设计模式 rust 设计模式开发语言
提示：文章写完后，目录可以自动生成，如何生成可参考右边的帮助文档文章目录前言一、使用借用类型作为参数二、格式化拼接字符串三、使用构造函数总结前言Rust不是传统的面向对象编程语言，它的所有特性，使其独一无二。因此，学习特定于Rust的设计模式是必要的。本系列文章为作者学习《Rust设计模式》的学习笔记以及自己的见解。因此，本系列文章的结构也与此书的结构相同（后续可能会调成结构），基本上分为三个部分
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
git常用命令笔记咩酱-小羊 git 笔记
###用习惯了idea总是不记得git的一些常见命令，需要用到的时候总是担心旁边站了人~~~记个笔记@_@，告诉自己看笔记不丢人初始化初始化一个新的Git仓库gitinit配置配置用户信息gitconfig--globaluser.name"YourName"gitconfig--globaluser.email"[email protected]"基本操作克隆远程仓库gitclone查看
python os.environ 江湖偌大 python 深度学习
os.environ['TF_CPP_MIN_LOG_LEVEL']='0'#默认值，输出所有信息os.environ['TF_CPP_MIN_LOG_LEVEL']='1'#屏蔽通知信息（INFO）os.environ['TF_CPP_MIN_LOG_LEVEL']='2'#屏蔽通知信息和警告信息（INFO\WARNING）os.environ['TF_CPP_MIN_LOG_LEVEL']='
Python中os.environ基本介绍及使用方法鹤冲天Pro #Python python 服务器开发语言
文章目录python中os.environos.environ简介os.environ进行环境变量的增删改查python中os.environ的使用详解1.简介2.key字段详解2.1常见key字段3.os.environ.get()用法4.环境变量的增删改查和判断是否存在4.1新增环境变量4.2更新环境变量4.3获取环境变量4.4删除环境变量4.5判断环境变量是否存在python中os.envi
Pyecharts数据可视化大屏：打造沉浸式数据分析体验我的运维人生信息可视化数据分析数据挖掘运维开发技术共享
Pyecharts数据可视化大屏：打造沉浸式数据分析体验在当今这个数据驱动的时代，如何将海量数据以直观、生动的方式展现出来，成为了数据分析师和企业决策者关注的焦点。Pyecharts，作为一款基于Python的开源数据可视化库，凭借其丰富的图表类型、灵活的配置选项以及高度的定制化能力，成为了构建数据可视化大屏的理想选择。本文将深入探讨如何利用Pyecharts打造数据可视化大屏，并通过实际代码案例
Python教程：一文了解使用Python处理XPath 旦莫 Python进阶 python 开发语言
目录1.环境准备1.1安装lxml1.2验证安装2.XPath基础2.1什么是XPath？2.2XPath语法2.3示例XML文档3.使用lxml解析XML3.1解析XML文档3.2查看解析结果4.XPath查询4.1基本路径查询4.2使用属性查询4.3查询多个节点5.XPath的高级用法5.1使用逻辑运算符5.2使用函数6.实战案例6.1从网页抓取数据6.1.1安装Requests库6.1.2代
python os.environ_python os.environ 读取和设置环境变量 weixin_39605414 python os.environ
>>>importos>>>os.environ.keys()['LC_NUMERIC','GOPATH','GOROOT','GOBIN','LESSOPEN','SSH_CLIENT','LOGNAME','USER','HOME','LC_PAPER','PATH','DISPLAY','LANG','TERM','SHELL','J2REDIR','LC_MONETARY','QT_QPA
将cmd中命令输出保存为txt文本文件落难Coder Windows cmd window
最近深度学习本地的训练中我们常常要在命令行中运行自己的代码，无可厚非，我们有必要保存我们的炼丹结果，但是复制命令行输出到txt是非常麻烦的，其实Windows下的命令行为我们提供了相应的操作。其基本的调用格式就是：运行指令>输出到的文件名称或者具体保存路径测试下，我打开cmd并且ping一下百度：pingwww.baidu.com>./data.txt看下相同目录下data.txt的输出：如果你再
509. 斐波那契数(每日一题) lzyprime
lzyprime博客(github)创建时间：2021.01.04qq及邮箱：2383518170leetcode笔记题目描述斐波那契数，通常用F(n)表示，形成的序列称为斐波那契数列。该数列由0和1开始，后面的每一项数字都是前面两项数字的和。也就是：F(0)=0，F(1)=1F(n)=F(n-1)+F(n-2)，其中n>1给你n，请计算F(n)。示例1：输入：2输出：1解释：F(2)=F(1)+
拥有断舍离的心态，过精简生活--《断舍离》读书笔记爱吃丸子的小樱桃
不知不觉间房间里的东西越来越多，虽然摆放整齐，但也时常会觉得空间逼仄，令人心生烦闷。抱着断舍离的态度，我开始阅读《断舍离》这本书，希望从书中能找到一些有效的方法，帮助我实现空间、物品上的断舍离。《断舍离》是日本作家山下英子通过自己的经历、思考和实践总结而成的，整体内涵也从刚开始的私人生活哲学的“断舍离”升华成了“人生实践哲学”，接着又成为每个人都能实行的“改变人生的断舍离”，从“哲学”逐渐升华成“
四章-32-点要素的聚合彩云飘过
本文基于腾讯课堂老胡的课《跟我学Openlayers--基础实例详解》做的学习笔记，使用的openlayers5.3.xapi。源码见1032.html，对应的官网示例https://openlayers.org/en/latest/examples/cluster.htmlhttps://openlayers.org/en/latest/examples/earthquake-clusters.
高端密码学院笔记285 柚子_b4b4
高端幸福密码学院（高级班）幸福使者：李华第（598）期《幸福》之回归内在深层生命原动力基础篇——揭秘“激励”成长的喜悦心理案例分析主讲：刘莉一，知识扩充:成功=艰苦劳动+正确方法+少说空话。贪图省力的船夫，目标永远下游。智者的梦再美，也不如愚人实干的脚印。幸福早课堂2020.10.16星期五一笔记:1，重视和珍惜的前提是知道它的价值非常重要，当你珍惜了，你就真正定下来，真正的学到身上。2，大家需要
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
python是什么意思中文-在python中%是什么意思编程大乐趣
Python中%有两种：1、数值运算：%代表取模，返回除法的余数。如：>>>7%212、%操作符（字符串格式化，stringformatting），说明如下：%[(name)][flags][width].[precision]typecode(name)为命名flags可以有+，-，''或0。+表示右对齐。-表示左对齐。''为一个空格，表示在正数的左侧填充一个空格，从而与负数对齐。0表示使用0填
Day17笔记-高阶函数 ~在杰难逃~ Python 笔记 python 开发语言 pycharm 数据分析
高阶函数【重点掌握】函数的本质：函数是一个变量，函数名是一个变量名，一个函数可以作为另一个函数的参数或返回值使用如果A函数作为B函数的参数，B函数调用完成之后，会得到一个结果，则B函数被称为高阶函数常用的高阶函数：map(),reduce(),filter(),sorted()1.map()map(func,iterable)，返回值是一个iterator【容器，迭代器】func:函数iterab
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
python八股文面试题分享及解析(1) Shawn________ python
#1.'''a=1b=2不用中间变量交换a和b'''#1.a=1b=2a,b=b,aprint(a)print(b)结果：21#2.ll=[]foriinrange(3):ll.append({'num':i})print(11)结果:#[{'num':0},{'num':1},{'num':2}]#3.kk=[]a={'num':0}foriinrange(3):#0,12#可变类型，不仅仅改变
【目标检测数据集】卡车数据集1073张VOC+YOLO格式熬夜写代码的平头哥∰ 目标检测 YOLO 人工智能
数据集格式：PascalVOC格式+YOLO格式(不包含分割路径的txt文件，仅仅包含jpg图片以及对应的VOC格式xml文件和yolo格式txt文件)图片数量(jpg文件个数)：1073标注数量(xml文件个数)：1073标注数量(txt文件个数)：1073标注类别数：1标注类别名称:["truck"]每个类别标注的框数：truck框数=1120总框数：1120使用标注工具：labelImg标注
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
pyecharts——绘制柱形图折线图 2224070247 信息可视化 python java 数据可视化
一、pyecharts概述自2013年6月百度EFE(ExcellentFrontEnd）数据可视化团队研发的ECharts1.0发布到GitHub网站以来，ECharts一直备受业界权威的关注并获得广泛好评，成为目前成熟且流行的数据可视化图表工具，被应用到诸多数据可视化的开发领域。Python作为数据分析领域最受欢迎的语言，也加入ECharts的使用行列，并研发出方便Python开发者使用的数据
node.js学习小猿L node.js node.js 学习 vim
node.js学习实操及笔记温故node.js，node.js学习实操过程及笔记~node.js学习视频node.js官网node.js中文网实操笔记githubcsdn笔记为什么学node.js可以让别人访问我们编写的网页为后续的框架学习打下基础，三大框架vuereactangular离不开node.jsnode.js是什么官网：node.js是一个开源的、跨平台的运行JavaScript的运行
番茄西红柿叶子病害分类数据集12882张11类别 futureflsl 数据集分类数据挖掘人工智能
数据集类型：图像分类用，不可用于目标检测无标注文件数据集格式：仅仅包含jpg图片，每个类别文件夹下面存放着对应图片图片数量(jpg文件个数)：12882分类类别数：11类别名称:["Bacterial_Spot_Bacteria","Early_Blight_Fungus","Healthy","Late_Blight_Water_Mold","Leaf_Mold_Fungus","Powdery
Python 实现图片裁剪（附代码） | Python工具剑客阿良_ALiang
前言本文提供将图片按照自定义尺寸进行裁剪的工具方法，一如既往的实用主义。环境依赖ffmpeg环境安装，可以参考我的另一篇文章：windowsffmpeg安装部署_阿良的博客-CSDN博客本文主要使用到的不是ffmpeg，而是ffprobe也在上面这篇文章中的zip包中。ffmpy安装：pipinstallffmpy-ihttps://pypi.douban.com/simple代码不废话了，上代码
枚举的构造函数中抛出异常会怎样 bylijinnan java enum 单例
首先从使用enum实现单例说起。为什么要用enum来实现单例？这篇文章（ http://javarevisited.blogspot.sg/2012/07/why-enum-singleton-are-better-in-java.html）阐述了三个理由： 1.enum单例简单、容易，只需几行代码： public enum Singleton { INSTANCE;
CMake 教程 aigo C++
转自：http://xiang.lf.blog.163.com/blog/static/127733322201481114456136/ CMake是一个跨平台的程序构建工具，比如起自己编写Makefile方便很多。介绍：http://baike.baidu.com/view/1126160.htm 本文件不介绍CMake的基本语法，下面是篇不错的入门教程： http:
cvc-complex-type.2.3: Element 'beans' cannot have character Cb123456 spring Webgis
cvc-complex-type.2.3: Element 'beans' cannot have character Line 33 in XML document from ServletContext resource [/WEB-INF/backend-servlet.xml] is i
jquery实例:随页面滚动条滚动而自动加载内容 120153216 jquery
<script language="javascript"> $(function (){ var i = 4;$(window).bind("scroll", function (event){ //滚动条到网页头部的高度，兼容ie,ff,chrome var top = document.documentElement.s
将数据库中的数据转换成dbs文件何必如此 sql dbs
旗正规则引擎通过数据库配置器（DataBuilder）来管理数据库，无论是Oracle，还是其他主流的数据都支持，操作方式是一样的。旗正规则引擎的数据库配置器是用于编辑数据库结构信息以及管理数据库表数据，并且可以执行SQL 语句，主要功能如下。 1)数据库生成表结构信息：主要生成数据库配置文件(.conf文
在IBATIS中配置SQL语句的IN方式 357029540 ibatis
在使用IBATIS进行SQL语句配置查询时，我们一定会遇到通过IN查询的地方，在使用IN查询时我们可以有两种方式进行配置参数：String和List。具体使用方式如下： 1.String:定义一个String的参数userIds，把这个参数传入IBATIS的sql配置文件，sql语句就可以这样写： <select id="getForms" param
Spring3 MVC 笔记（一） 7454103 spring mvc bean REST JSF
自从 MVC 这个概念提出来之后 struts1.X struts2.X jsf 。。。。。这个view 层的技术一个接一个！都用过！不敢说哪个绝对的强悍！要看业务，和整体的设计！最近公司要求开发个新系统！
Timer与Spring Quartz 定时执行程序 darkranger spring bean 工作 quartz
有时候需要定时触发某一项任务。其实在jdk1.3，java sdk就通过java.util.Timer提供相应的功能。一个简单的例子说明如何使用，很简单： 1、第一步，我们需要建立一项任务，我们的任务需要继承java.util.TimerTask package com.test; import java.text.SimpleDateFormat; import java.util.Date;
大端小端转换，le32_to_cpu 和cpu_to_le32 aijuans C语言相关
大端小端转换，le32_to_cpu 和cpu_to_le32 字节序 http://oss.org.cn/kernel-book/ldd3/ch11s04.html 小心不要假设字节序. PC 存储多字节值是低字节为先(小端为先, 因此是小端), 一些高级的平台以另一种方式(大端)
Nginx负载均衡配置实例详解 avords
[导读] 负载均衡是我们大流量网站要做的一个东西，下面我来给大家介绍在Nginx服务器上进行负载均衡配置方法，希望对有需要的同学有所帮助哦。负载均衡先来简单了解一下什么是负载均衡，单从字面上的意思来理解就可以解负载均衡是我们大流量网站要做的一个东西，下面我来给大家介绍在Nginx服务器上进行负载均衡配置方法，希望对有需要的同学有所帮助哦。负载均衡先来简单了解一下什么是负载均衡
乱说的 houxinyou 框架敏捷开发软件测试
从很久以前，大家就研究框架，开发方法，软件工程，好多！反正我是搞不明白！这两天看好多人研究敏捷模型，瀑布模型！也没太搞明白. 不过感觉和程序开发语言差不多，瀑布就是顺序，敏捷就是循环. 瀑布就是需求、分析、设计、编码、测试一步一步走下来。而敏捷就是按摸块或者说迭代做个循环，第个循环中也一样是需求、分析、设计、编码、测试一步一步走下来。也可以把软件开发理
欣赏的价值——一个小故事 bijian1013 有效辅导欣赏欣赏的价值
　　第一次参加家长会，幼儿园的老师说："您的儿子有多动症，在板凳上连三分钟都坐不了，你最好带他去医院看一看。"　　回家的路上，儿子问她老师都说了些什么，她鼻子一酸，差点流下泪来。因为全班30位小朋友，惟有他表现最差；惟有对他，老师表现出不屑，然而她还在告诉她的儿子："老师表扬你了，说宝宝原来在板凳上坐不了一分钟，现在能坐三分钟。其他妈妈都非常羡慕妈妈，因为全班只有宝宝
包冲突问题的解决方法 bingyingao eclipse maven exclusions 包冲突
包冲突是开发过程中很常见的问题：其表现有： 1.明明在eclipse中能够索引到某个类，运行时却报出找不到类。 2.明明在eclipse中能够索引到某个类的方法，运行时却报出找不到方法。 3.类及方法都有，以正确编译成了.class文件，在本机跑的好好的，发到测试或者正式环境就抛如下异常： java.lang.NoClassDefFoundError: Could not in
【Spark七十五】Spark Streaming整合Flume-NG三之接入log4j bit1129 Stream
先来一段废话：实际工作中，业务系统的日志基本上是使用Log4j写入到日志文件中的，问题的关键之处在于业务日志的格式混乱，这给对日志文件中的日志进行统计分析带来了极大的困难，或者说，基本上无法进行分析，每个人写日志的习惯不同，导致日志行的格式五花八门，最后只能通过grep来查找特定的关键词缩小范围，但是在集群环境下，每个机器去grep一遍，分析一遍，这个效率如何可想之二，大好光阴都浪费在这上面了
sudoku solver in Haskell bookjovi sudoku haskell
这几天没太多的事做，想着用函数式语言来写点实用的程序，像fib和prime之类的就不想提了（就一行代码的事），写什么程序呢？在网上闲逛时发现sudoku游戏，sudoku十几年前就知道了，学生生涯时也想过用C/Java来实现个智能求解，但到最后往往没写成，主要是用C/Java写的话会很麻烦。现在写程序，本人总是有一种思维惯性，总是想把程序写的更紧凑，更精致，代码行数最少，所以现
java apache ftpClient bro_feng java
最近使用apache的ftpclient插件实现ftp下载，遇见几个问题，做如下总结。 1. 上传阻塞，一连串的上传，其中一个就阻塞了，或是用storeFile上传时返回false。查了点资料，说是FTP有主动模式和被动模式。将传出模式修改为被动模式ftp.enterLocalPassiveMode();然后就好了。看了网上相关介绍，对主动模式和被动模式区别还是比较的模糊，不太了解被动模
读《研磨设计模式》-代码笔记-工厂方法模式 bylijinnan java 设计模式
声明：本文只为方便我个人查阅和理解，详细的分析以及源代码请移步原作者的博客http://chjavach.iteye.com/ package design.pattern; /* * 工厂方法模式：使一个类的实例化延迟到子类 * 某次，我在工作不知不觉中就用到了工厂方法模式（称为模板方法模式更恰当。2012-10-29）： * 有很多不同的产品，它
面试记录语 chenyu19891124 招聘
或许真的在一个平台上成长成什么样，都必须靠自己去努力。有了好的平台让自己展示，就该好好努力。今天是自己单独一次去面试别人，感觉有点小紧张，说话有点打结。在面试完后写面试情况表，下笔真的好难，尤其是要对面试人的情况说明真的好难。今天面试的是自己同事的同事，现在的这个同事要离职了，介绍了我现在这位同事以前的同事来面试。今天这位求职者面试的是配置管理，期初看了简历觉得应该很适合做配置管理，但是今天面
Fire Workflow 1.0正式版终于发布了 comsci 工作 workflow Google
Fire Workflow 是国内另外一款开源工作流，作者是著名的非也同志，哈哈.... 官方网站是 http://www.fireflow.org 经过大家努力,Fire Workflow 1.0正式版终于发布了正式版主要变化: 1、增加IWorkItem.jumpToEx(...)方法，取消了当前环节和目标环节必须在同一条执行线的限制，使得自由流更加自由 2、增加IT
Python向脚本传参 daizj python 脚本传参
如果想对python脚本传参数，python中对应的argc, argv(c语言的命令行参数)是什么呢？需要模块：sys 参数个数：len(sys.argv) 脚本名： sys.argv[0] 参数1： sys.argv[1] 参数2： sys.argv[
管理用户分组的命令gpasswd dongwei_6688 passwd
NAME： gpasswd - administer the /etc/group file SYNOPSIS： gpasswd group gpasswd -a user group gpasswd -d user group gpasswd -R group gpasswd -r group gpasswd [-A user,...] [-M user,...] g
郝斌老师数据结构课程笔记 dcj3sjt126com 数据结构与算法
<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<
yii2 cgridview加上选择框进行操作 dcj3sjt126com GridView
页面代码 <?=Html::beginForm(['controller/bulk'],'post');?> <?=Html::dropDownList('action','',[''=>'Mark selected as: ','c'=>'Confirmed','nc'=>'No Confirmed'],['class'=>'dropdown',])
linux mysql fypop linux
enquiry mysql version in centos linux yum list installed | grep mysql yum -y remove mysql-libs.x86_64 enquiry mysql version in yum repositoryyum list | grep mysql oryum -y list mysql* install mysq
Scramble String hcx2013 String
Given a string s1, we may represent it as a binary tree by partitioning it to two non-empty substrings recursively. Below is one possible representation of s1 = "great":
跟我学Shiro目录贴 jinnianshilongnian 跟我学shiro
历经三个月左右时间，《跟我学Shiro》系列教程已经完结，暂时没有需要补充的内容，因此生成PDF版供大家下载。最近项目比较紧，没有时间解答一些疑问，暂时无法回复一些问题，很抱歉，不过可以加群（334194438/348194195）一起讨论问题。 ----广告-----------------------------------------------------
nginx日志切割并使用flume-ng收集日志 liyonghui160com
nginx的日志文件没有rotate功能。如果你不处理，日志文件将变得越来越大，还好我们可以写一个nginx日志切割脚本来自动切割日志文件。第一步就是重命名日志文件，不用担心重命名后nginx找不到日志文件而丢失日志。在你未重新打开原名字的日志文件前，nginx还是会向你重命名的文件写日志，linux是靠文件描述符而不是文件名定位文件。第二步向nginx主
Oracle死锁解决方法 pda158 oracle
　select p.spid,c.object_name,b.session_id,b.oracle_username,b.os_user_name from v$process p,v$session a, v$locked_object b,all_objects c where p.addr=a.paddr and a.process=b.process and c.object_id=b.
java之List排序 shiguanghui list排序
在Java Collection Framework中定义的List实现有Vector，ArrayList和LinkedList。这些集合提供了对对象组的索引访问。他们提供了元素的添加与删除支持。然而，它们并没有内置的元素排序支持。　　你能够使用java.util.Collections类中的sort()方法对List元素进行排序。你既可以给方法传递
servlet单例多线程 utopialxw 单例多线程 servlet
转自http://www.cnblogs.com/yjhrem/articles/3160864.html 和 http://blog.chinaunix.net/uid-7374279-id-3687149.html Servlet 单例多线程 Servlet如何处理多个请求访问？Servlet容器默认是采用单实例多线程的方式处理多个请求的：1.当web服务器启动的