anshiquanshu

深度学习PyTorch，TensorFlow中GPU利用率较低，CPU利用率很低，且模型训练速度很慢的问题总结与分析

在深度学习模型训练过程中，在服务器端或者本地pc端，输入nvidia-smi来观察显卡的GPU内存占用率（Memory-Usage），显卡的GPU利用率（GPU-util），然后采用top来查看CPU的线程数（PID数）和利用率（%CPU）。往往会发现很多问题，比如，GPU内存占用率低，显卡利用率低，CPU百分比低等等。接下来仔细分析这些问题和处理办法。

1. GPU内存占用率问题

这往往是由于模型的大小以及batch size的大小，来影响这个指标。当你发下你的GPU占用率很小的时候，比如40%，70%，等等。此时，如果你的网络结构已经固定，此时只需要改变batch size的大小，就可以尽量利用完整个GPU的内存。GPU的内存占用率主要是模型的大小，包括网络的宽度，深度，参数量，中间每一层的缓存，都会在内存中开辟空间来进行保存，所以模型本身会占用很大一部分内存。其次是batch size的大小，也会占用影响内存占用率。batch size设置为128，与设置为256相比，内存占用率是接近于2倍关系。当你batch size设置为128，占用率为40%的话，设置为256时，此时模型的占用率约等于80%，偏差不大。所以在模型结构固定的情况下，尽量将batch size设置大，充分利用GPU的内存。（GPU会很快的算完你给进去的数据，主要瓶颈在CPU的数据吞吐量上面。）

2. GPU利用率问题

这个是Volatile GPU-Util表示，当没有设置好CPU的线程数时，这个参数是在反复的跳动的，0%，20%，70%，95%，0%。这样停息1-2 秒然后又重复起来。其实是GPU在等待数据从CPU传输过来，当从总线传输到GPU之后，GPU逐渐起计算来，利用率会突然升高，但是GPU的算力很强大，0.5秒就基本能处理完数据，所以利用率接下来又会降下去，等待下一个batch的传入。因此，这个GPU利用率瓶颈在内存带宽和内存介质上以及CPU的性能上面。最好当然就是换更好的四代或者更强大的内存条，配合更好的CPU。

另外的一个方法是，在PyTorch这个框架里面，数据加载Dataloader上做更改和优化，包括num_workers（线程数），pin_memory，会提升速度。解决好数据传输的带宽瓶颈和GPU的运算效率低的问题。在TensorFlow下面，也有这个加载数据的设置。

torch.utils.data.DataLoader(image_datasets[x],
                            batch_size=batch_size, 
                            shuffle=True,
                            num_workers=8,
                            pin_memory=True)

为了提高利用率，首先要将num_workers（线程数）设置得体，4,8,16是几个常选的几个参数。本人测试过，将num_workers设置的非常大，例如，24，32,等，其效率反而降低，因为模型需要将数据平均分配到几个子线程去进行预处理，分发等数据操作，设高了反而影响效率。当然，线程数设置为1，是单个CPU来进行数据的预处理和传输给GPU，效率也会低。其次，当你的服务器或者电脑的内存较大，性能较好的时候，建议打开pin_memory打开，就省掉了将数据从CPU传入到缓存RAM里面，再给传输到GPU上；为True时是直接映射到GPU的相关内存块上，省掉了一点数据传输时间。

3. CPU的利用率问题

很多人在模型训练过程中，不只是关注GPU的各种性能参数，往往还需要查看CPU处理的怎么样，利用的好不好。这一点至关重要。但是对于CPU，不能一味追求超高的占用率。如图所示，对于14339这个程序来说，其CPU占用率为2349%（我的服务器是32核的，所以最高为3200%）。这表明用了24核CPU来加载数据和做预处理和后处理等。其实主要的CPU花在加载传输数据上。此时，来测量数据加载的时间发现，即使CPU利用率如此之高，其实际数据加载时间是设置恰当的DataLoader的20倍以上，也就是说这种方法来加载数据慢20倍。当DataLoader的num_workers=0时，或者不设置这个参数，会出现这个情况。

CPU利用率查看结果

下图中可以看出，加载数据的实际是12.8s，模型GPU运算时间是0.16s，loss反传和更新时间是0.48s。此时，即使CPU为2349%，但模型的训练速度还是非常慢，而且，GPU大部分是时间是空闲等待状态。

num_workers=0，模型每个阶段运行时间统计

当我将num_workers=1时，出现的时间统计如下，load data time为6.3，数据加载效率提升1倍。且此时的CPU利用率为170%，用的CPU并不多，性能提升1倍。

num_workers=1时，模型每个阶段运行时间统计

此时，查看GPU的性能状态（我的模型是放在1,2,3号卡上训练），发现，虽然GPU(1,2,3)的内存利用率很高，基本上为98%，但是利用率为0%左右。表面此时网络在等待从CPU传输数据到GPU，此时CPU疯狂加载数据，而GPU处于空闲状态。

1,2,3号GPU的内存占用率和计算效率截图

由此可见，CPU的利用率不一定最大才最好。

对于这个问题，解决办法是，增加DataLoader这个num_wokers的个数，主要是增加子线程的个数，来分担主线程的数据处理压力，多线程协同处理数据和传输数据，不用放在一个线程里负责所有的预处理和传输任务。

我将num_workers=8,16都能取得不错的效果。此时用top查看CPU和线程数，如果我设置为num_workers=8，线程数有了8个连续开辟的线程PID，且大家的占用率都在100%左右，这表明模型的CPU端，是较好的分配了任务，提升数据吞吐效率。效果如下图所示，CPU利用率很平均和高效，每个线程是发挥了最大的性能。

num_workers=8时，CPU利用率和8个连续PID任务

此时，在用nvidia-smi查看GPU的利用率，几块GPU都在满负荷，满GPU内存，满GPU利用率的处理模型，速度得到巨大提升。

优化数据加载num_workers=8，和设置batch size的结果

上图中可以看见，GPU的内存利用率最大化，此时是将batch size设置的较大，占满了GPU的内存，然后将num_workers=8，分配多个子线程，且设置pin_memory=True，直接映射数据到GPU的专用内存，减少数据传输时间。GPU和CPU的数据瓶颈得到解决。整体性能得到权衡。

此时的运行时间在表中做了统计：

处理时间统计
处理阶段	时间
数据加载	0.25s
模型在GPU计算	0.21s
loss反传，参数更新	0.43s

4. 总结

对上面的分析总结一下，第一是增加batch size，增加GPU的内存占用率，尽量用完内存，而不要剩一半，空的内存给另外的程序用，两个任务的效率都会非常低。第二，在数据加载时候，将num_workers线程数设置稍微大一点，推荐是8,16等，且开启pin_memory=True。不要将整个任务放在主进程里面做，这样消耗CPU，且速度和性能极为低下。

Supplementary：看到大家在评论回复的问题比较多，所以再加一些叙述！

开这么多线程。第一个，查看你的数据的batch_size，batchsize小了，主CPU直接就加载，处理，而且没有分配到多GPU里面（如果你使用的是多GPU）；如果是单GPU，那么就是CPU使劲读数据，加载数据，然后GPU一下就处理完了，你的模型应该是很小，或者模型的FLOPs很小。检查一下模型问题。还有就是，现在这个情况下，开8个线程和1个线程，没什么影响，你开一个num_workers都一样的。如果速度快，没必要分配到多个num_workers去。当数据量大的时候，num_workers设置大，会非常降低数据加载阶段的耗时。这个主要还是应该配合过程。

在调试过程，命令：top 实时查看你的CPU的进程利用率，这个参数对应你的num_workers的设置；

命令： watch -n 0.5 nvidia-smi 每0.5秒刷新并显示显卡设置。

实时查看你的GPU的使用情况，这是GPU的设置相关。这两个配合好。包括batch_size的设置。

时间：2019年9月20日

5. 再次补充内容

有很多网友都在讨论一些问题，有时候，我们除了排查代码，每个模块的处理信息之外，其实还可以查一下，你的内存卡，是插到哪一块插槽的。这个插槽的位置，也非常影响代码在GPU上运行的效率。

大家除了看我上面的一些小的建议之外，评论里面也有很多有用的信息。遇到各自问题的网友们，把他们的不同情况，都描述和讨论了一下，经过交流，大家给出了各自在训练中，CPU，GPU效率问题的一些新的发现和解决问题的方法。

针对下面的问题，给出一点补充说明：

问题1. CPU忙碌，GPU清闲。

数据的预处理，和加载到GPU的内存里面，花费时间。平衡一下batch size, num_workers。

问题2. CPU利用率低，GPU跑起来，利用率浮动，先增加，然后降低，然后等待，CPU也是浮动。

2.1 下面是具体的步骤和对策：

在pytorch训练模型时出现以下情况，情况描述：首先环境：2080Ti + I7-10700K， torch1.6, cuda10.2, 驱动440 参数设置：shuffle=True, num_workers=8, pin_memory=True; 现象1：该代码在另外一台电脑上，可以将GPU利用率稳定在96%左右现象2：在个人电脑上，CPU利用率比较低，导致数据加载慢，GPU利用率浮动，训练慢约4倍；有意思的是，偶然开始训练时，CPU利用率高，可以让GPU跑起来，但仅仅几分钟，CPU利用率降下来就上不去了，又回到蜗牛速度。

可以采用的方法：

两边的配置都一样吗。另一台电脑和你的电脑。你看整体，好像设置配置有点不同。包括硬件，CPU的核，内存大小。你对比一下两台设备。这是第一个。第二个，还是代码里面的配置，代码的高效性。你一来，CPU利用率低，你看一下每一步，卡到哪里，哪里是瓶颈，什么步骤最耗时。都记录一下每一个大的步骤的耗时，然后在分析。测试了每一个大的过程的时间，可以看见，耗时在哪里。主要包括，加载数据，前向传播，反向更新，然后下一步。

2.2 经过测试之后，第二次问题分析：

经过测试，发现本机卡的地方在加载图像的地方，有时加载10kb左右的图像需要1s以上，导致整个batch数据加载慢！代码应该没有问题，因为在其他电脑能全速跑起来；硬件上，本机的GPU，CPU都强悍，环境上也看不出差距，唯一差在内存16G，其他测试电脑为32G，请问这种现象和内存直接关系大吗？

情况分析

最多可能就在这边。你可以直接测试batch size为1情况下的整个计算。或者将batch size 开到不同的设置下。看加载数据，计算之间的差值。最有可能就是在这个load data，读取数据这块。电脑的运行内存16g 32g。其实都已经够了，然后加载到GPU上，GPU内存能放下，影响不大。所以估计是你的内存相对小了，导致的问题。试一下。

2.3 问题定位，解决方法：
这台电脑的内存条插的位置不对，4个插槽的主板，1根内存的时候应该插在第2个插槽（以cpu端参考起），而组装电脑的商家不专业，放在了第4个插槽上，影响性能，更换位置后，速度飞起来了！关于插槽详情，有遇到的朋友去网上收，一大堆！

在自己电脑，或者自己配的主机上，跑GPU的时候，记得注意查看你自己的内存卡是插到哪一个槽上的。

问题1：博主您好，我是tensorflow框架，是os.environ["CUDA_DEVICE_ORDER"] = "PCI_BUS_ID" 和os.environ["CUDA_VISIBLE_DEVICES"] = "0"制定了gpu，虽然gpu内存占满，但是利用率忽高忽低，大部分出现的的是0，刷的频繁了也会出现99%的情况，这为啥呀？会对训练结果造成影响么？非常感谢

答：您好，我现在使用Python tensorflow写代码，但现在我的cpu利用率很高，GPU利用率几乎为零，但是我用import os os.environ["CUDA_VISIBLE_DEVICES"] = "0" 来指定了GPU。您之前的博客写了torch如何解决这个问题，拜托您能不能对于使用tensorflow如何解决这个问题给我做歌解答，非常感谢您你的私信开启防打扰模式，回复不过来。在这里做回复：你应该没有将模型load到GPU上面，全在CPU上面跑。

问题2：大佬啊，请教一下啊！这里描述一下我的问题：开始是 CPU 占用高，设置 num_works=16；之后训练过程中GPU占用逐渐增加直到OOM，然后在每个epoch 之后加 torch.cuda.empty_cache()；最后，现在，gpu usage 变化很大 700MB -> 1500MB -> 2300MB -> 700MB 这样变；而 cup 占用也 1000% -> 1700% -> 2400% -> 700% -> 100% -> 400% -> 1100% 这样变，这是什么问题呀？

答：先是CPU在加载数据，从内存load到GPU的内存。CPU占用过程高。然后开始训练，GPU内部的缓存不断增加。前向传播存储中间变量，反传更新权重。更新完之后，你进行了cache的清除，GPU就减少为最初始的状态，这个700MB应该是整个网络结构在GPU里面，以及权重参数的值。然后继续load 数据从CPU到GPU。CPU也不断增加。进入这个循环。你的应该是正常的情况。没问题的。

问题3：楼主，我设置的batch size为128，计算每个模块的时间，然后在每个batch后统一打印，`print(t2-t1,t3-t2,t4-t3,t5-t4)`，结果每次一下子出来将近100个batch，等待一会又打印出来近100行信息。更神奇的是，他会在一个print里面停止，不是打印完整的4个时间后停止。这是什么问题呢？谢谢啦！

答：这样，每一个要测试的点，插入时间点：check1=time.time(), 然后，到这个模块的结束，去print一下 print(time.time()-check1)。分别记录每个模块的耗时，分开print()。试一下这个。到下一个函数，然后 check2=time.time() ，然后到函数完成了，又print(time.time()-check2)。类似这种结果。还没解决。我是把print函数放在一个循环里面——每个iteration打印一次。但是系统在print执行期间卡壳有点不理解。。因为print执行也不需要太多计算资源吧。。我是小白，可能思维比较直。。。解决了吗？应该是循环的问题，循环放置的问题。你主要看一下你的print()函数放置的问题。

问题4：博主请问 4G显存跑Alexnet网络分类花卉数据集CPU占用率大概85%-90%,GPU在20-30%之间是正常的吗主要是我发现CPU占有率总是比GPU高很多而且我这张1650卡跑VGGnet就几乎跑不动了 batch和epoch要设很低才能龟速跑...

答：是不是显存没设置按需求分配, tf这里好像默认是设置占用8g显存, 你的数据集很大么, 我10monkey数据集, 读取处理数据在50秒(282mb), 训练很快, 都卡在读取处理数据上了。对，刚刚这个老哥回复你的，我也觉得是这个原因。基本上卡在数据的传输上了。从CPU到GPU的数据传递。你的显卡很小。显存小，能够放下的数据量和自己网络结构，很有限制。你4G的显存，VGGNet很大的，所以占你很大显存。后面稍微新一点的网络。显存没有这么大了，MobileNet，SqueezeNet这些。

问题5：博主，您好，能否分享一下各个阶段计算时间的代码呢？万分感谢，我想根据这个代码找到数据加载的瓶颈，因为我将数据转为tensor后存储进lmdb中了，速度确实快了，但是gpu利用率还是会隔一段时间变为0.

答：计算时间这个，直接开始一个 time_start=timer.time() time_end = timer.time() processing_time=time_end - time_start. 你GPU利用率变为0，说明此时你GPU在等待，数据传输到GPU的input data的这个tensor过程中，SSD或者你服务器的内存传输至GPU有延迟，或者速度跟不上，所以GPU空闲，然后这个CPU使劲转。

问题6：就是利用GPU运行时打开任务管理器性能看到的，GPU内存使用100%占满了，但是利用率只有2%,我自己找了80多张图进行训练的，多线程加载我不会，一直是2%或者1%，很确定就是利用gpu device 0跑程序的。

答：你的计算资源是不是很小的GPU哦。还有就是，数据加载过程，开启多线程加载没有。你看一下GPU的内存使用情况，2%是计算情况下还是模型加载到GPU上，一直是稳定的2%吗。多个参数都看一下。您说的调整DataLoader这个num_wokers的个数，我找遍了代码没这个numworker,在哪里呢？这个num_workers是pytorch下面的设置，在数据加载里面。你用的是TensorFlow，那个相应的设置也有，但是不是叫num_workers。具体是什么我忘了，查一下。你的GPU内存沾满100%，利用率2%，就是上面的这个，把batch_size增大，或者减少，看一下你的利用率。然后，增加TensorFlow下面的num_workers这个设置，看利用率的上升。主要就是这两个设置。你配合着查看一下。主要是把模型加载到GPU上来。剩下就在上面两个设置上调整。

问题7：请教一下，我在做一个项目数据量大概有几十万和几十个特征，电脑给的内存几乎用到90%，cpu大概是有七八十，不过pycharm中的gpu都是0好像都没有用到，to.device和num_works用过了也没用，有什么办法吗？

答：应该是没有放进去，你自己看一下，gpu的内存开始用起来没有。

问题8：博主你好，你文章中的“不要将整个任务放在主进程里面做，这样消耗CPU，且速度和性能极为低下” 要怎么理解，我目前开启的多进程里只有一个占用了226%,其他都是不到2%，是因为我放主进程里了吗？可是我只有一个GPU，这会和我不是固态有关系吗？

答：ImageNet也是100多G。你在平衡一下，按照步骤来。应该能够充分利用的。pin_memory为true，将model加到多个GPU里面的写明没有。

if torch.cuda.device_count() > 1:
            model = nn.DataParallel(model, device_ids=[0, 1, 2, 3])
        model = model.to(device)

谢谢回复，不过我在将pin_memory设置为true之后，gpu利用率还是很低，我的显存16G，数据一百多G,是因为数据太大没有效果吗？这个没问题的。你已经放进去了，后面再运行中，运行稳定了，查看后面的设备的使用情况，包括CPU的使用率，GPU的占用率，一开始CPU也许有一个主进程使用得比较多。你设置了num_workers，4或者8,16吧。这个后面跑起来，应该有这么多个进程能够看见的。用top查看。后面应该稳定。这是一个。第二，我也发现，TensorFlow有时候存在这个情况。

问题9：博主您好，我目前也是使用pytorch框架做一个任务，数据量非常大，读完数据大概需要100g的内存，然后dataloader我也是设置了num和pinmemory，但这样仍不能提速，我的gpu利用率大概在0～40%浮动，且不稳定，如果再继续调大dataloader里的num会报出memory不足的错误，请问一下您在这种情况下有没有些建议。另外我看到您总结里面有这么一条“不要将整个任务放在主进程里面做，这样消耗CPU，且速度和性能极为低下。”我请问您这个应该怎么理解，我多卡使用的是dataparllel，希望能得到您的回复，谢谢!

答：batch size设置大点，你的GPU最大占比能够用上去。第二个是，来回的浮动，不稳定，那就是你的数据吞吐速度赶不上你的GPU处理速度，GPU把你的batch数据处理完了，等待你数据喂进来。这个时候就没有计算，利用率降低。所以，你在提升num_workers的时候，也要把batch_size加大。主要是配合这两个。DataLoader的pin_memory=True，计算过程中： input = input.to(device) target = target.to(device) 大概试一试，没有效果再说。我再加大batchsize就会让显存爆掉，而且我现在的data吞吐速度已经不支持目前的batchsize，再增大恐怕是更没办法负载。谢谢您的建议。请问您最后怎么优化解决的？我现在也是数据吞吐速度赶不上GPU处理速度，GPU利用率在17%左右，时而跳转为0.。我的batchsize=256，但是因为特征较多，一条样本差不多10w维度的特征，所以传送起来着实慢。不知道有什么解决方法吗？您好，我最后尝试了几种方法都没有得到很好的解决，最后由于时间问题，不得不妥协了，不过我可以和你分享一些我的思路。你如果用的torch并行的话，可以试试distributed dataparallel，我当时用的是dataparallel，通信速度会慢些，换成ddl可能数据分发会快很多，但是我尝试了一些demo出现数据重复读取的问题，所以未果。另外还可以尝试下混合精度计算，可以提高batchsize的大小。这是我的思路，如果您有更好的方法，可以留言跟我分享下，谢谢。最后解决了吗。这个问题，解决了，多方面优化吧。① 训练的时候，定义了一个SequenceData 迭代器，用了多线程，调整了works数量以及max_queue_size。此外还对生成一个batch数据进行了优化，例如使用了np.repeat、np.tile。②预测的时候，把训练好的模型分了3块，用户侧走了一部分模型，item侧走了一部分模型，最后进行交叉预测计算。（例如每个用户对6个item分布进行打分，这样做用户侧只需要计算一次计算，节省了不少时间！）。

问题10：我只有一个gpu,用pin_memory报错： return data.pin_memory() RuntimeError: cannot pin 'torch.cuda.FloatTensor' only dense CPU tensors can be pinned 用num_workers报错： File "D:\ProgramData\Anaconda3\envs\pytorch_gpu\lib\site-packages\torch\multiprocessing\reductions.py", line 242, in reduce_tensor event_sync_required) = storage._share_cuda_() RuntimeError: cuda runtime error (801) : operation not supported at C:\w\1\s\tmp_conda_3.7_104508\conda\conda-bld\pytorch_1572950778684\work\torch/csrc/generic/StorageSharing.cpp:245 两个问题都没成功解决，不知道为什么，如果可以的话，请博主赐教

答：1. CPU tensor才可以pin_memory，你是不是在加载数据之前，对数据进行了处理，导致数据成为了torch.cuda.FloatTensor了。查看一下。 2. 你自己查看一下你的电脑的num_workers数，自己电脑的CPU核数，num_workers不应该超过你的核数。我们用的服务器是64核的，所以设置16,32的num_workers没问题。好的谢谢您，pin_memory的问题明白啦，可是我的电脑是6核12线程，num_worker是设置的12以下

问题11：感谢博主详细解答，我做文字检测任务，使用Pytorch，有3块2080ti，bs设置为16（吃满卡），num_work设置为3的时候速度最快，过高过低都慢，但是此时GPU的利用率大约只有五成，这还有提升的空间吗？

答：bs为16都吃满卡了。你的模型是多大啊，已经中间的层数，缓存的feature map。有这么大吗。看一下你batchsize设置对不对。16就能把你的2080ti占满，是显卡的内存都吃满了吗。这个要注意一下。num_workers差不多。因为你的数据就只有16的batchsize，加载数据只需要3-4额num_workers就能加进去。GPU只跑到5成，那就是你batchsize设置小了，没有将gpu充分发挥使用。后来是不是你的GPU空闲着，等待新的数据，如果是的话，那你的数据加载处，也有点问题。加载慢了，GPU空着等数据来。

问题12：博主你好，我是学校和别人共用一个服务器，服务器有两个gpu，第一个gpu的内存利用率百分之20，第二个没人用，为什么我把batch size从64改为128就显示RuntimeError: CUDA out of memory. Tried to allocate 392.00 MiB (GPU 0; 15.90 GiB total capacity; 11.42 GiB already allocated; 368.88 MiB free; 149.58 MiB cached)呢？求告知，谢谢

答：是还需要在开辟392MB的内存。但是当前的已经被用了，只有368.8MiB了。你要开辟392MiB，当前free的不够用。所以要报错。模型和内存的需求量不是成正比的，batch size越大，内存需要的不只是两倍，应该是大于两倍。3倍左右的需求量。博主你好，谢谢你的回复，有一点不明白他这个内存是怎么算的，因为我batch size为64的时候内存只用3321M，即使改成128按理说最多也只需要6642M啊，内存应该是完全够用的，而且上面为什么显示 Tried to allocate 392M（为啥才需要392M这么少，却说内存不够用呢？困扰很久了，谢谢博主你）。内存不够用了。你加的太大了。96也许就差不多了。加大了GPU的内存不足。才报这个错。

问题13：博主您好~，我出现的问题是，想在模型测试效果好的情况下，保存该模型。使用torch.save(),进行保存，报错cannot serialize a bytes object larger than 4 GiB。您遇到过这个问题么？

答：模型太大了。包括参数太多了，model size太大。中间的weights过多。等等。需要看看这个模型的大小。第二，分模块保存，然后分模块加载。

问题14：我现在是本地3分钟一个step，服务器却要2个多小时才一个step，cpu500%多，单GPU，显存占满，利用率却只有10%，增大批次的确增加至20%，但是这种反差说明哪里还是有问题，不知道博主遇到过这种情况吗？

答：服务器多少个核啊。你用的500%多，那就是相当于用了5个核左右。你自己的电脑，本地，你看你的CPU是几核几线程的，而且，你本地应该是用满了CPU的核。CPU这边的核心数，包括算力，也是一个容易忽视的点。你本地跑，用的GPU和服务器的GPU，是一样的吗，GPU数量相同吗，GPU的性能显存差别大吗。这几个硬件配置弄完了对比清楚了，那剩下就是代码的问题了。刚解决了，是我的模型函数里面，自己写的attention_mask函数估计是使用了两层tf.map_fn函数，导致在GPU上无法运行，但是对于数据尺寸小的，比如【10,30】这种形状的tensor 没有问题，如果大了，就运算不出来，或者非常非常的缓慢，具体原因还在想，不过问题解决了，我把attention_mask函数改了一下，一切正常。

问题15：您好，我想请教一下您文中说的“不要将整个任务放在主进程里面做，这样消耗CPU，且速度和性能极为低下。”具体是什么含义。我是把模型的搭建数据读取都放在main()函数中，然后是在 if __name__ == '__main__': main()调用的。我dataloder的num_work数设置的是8（用的服务器是40核的）但训练时看cpu只有一个核是100%其他占用都很少。使用的是单GPU，GPU的使用率在100%,50%之间跳动，请问是什么情况。望有空时解答谢谢。

答：按照我的方法，处理不好吗。这个情况我有时候也用到。这个一般都是pytorch才有的问题。你用的是pytorch吧。使用率在跳动，就是你的内存数据往gpu里面塞，送数据的时候，在跳动。尽量把那个map给开启。我发现他们，有些，就是不按照这样设置，反而是1700%这样的用，相当于用了17核心。这个你看速度起得来吧。我一般是比如设置为8核心，那么基本上8个核，都是100%或者80-90%这种范围。你设置了之后，只有一个这么高，看你的数据，batchsize设置多大。分配到每个cpu核上的多大。你在试一试，不行效果在交流。

问题16：不要将整个任务放在主进程里面做，这样消耗CPU，且速度和性能极为低下。这句话是什么意思啊，是把number_worker设多一点吗？

答：嗯，要看自己电脑或者服务器的核心数量，是几核的。来设定。太小了，处理慢，太多了，分散的太多。num_workers不能超过电脑的CPU的核心数。设置为8差不多挺好的。

问题17：博主您好,我在实验室和同学共用服务器,总共是40核的cpu,其他同学在跑程序的时候已经占用了大约32核左右,我只能占用1.5以下.训练的速度十分的慢,我想复现别人论文实验结果然后加以提升,他只用2.4小时一轮epochs我需要20+小时.我猜测的就是CPU的占用低导致数据吞吐慢,gpu的利用率也一直在40%以下,请问这种情况怎么去提高自己CPU的占用率.我的batchsize是2,2080的卡,但是因为其他同学在跑程序显存留的不多.我2的batchsize已经占用了近4G的显存了.num_workers设置的为4.我尝试调高bathsize,cpu占用会在一开始高一点点到2~3之间,但马上就下降.请问这个我问题怎么处理.pytorch的网络.谢谢!

答：老铁，你这个电脑，40 核的，都被大家用了，32核，给你的，都没什么资源了。而且，你那边同学，是不是也用了GPU的。GPU同时跑几个计算的任务，需要调度，分配内存，这些都很耗时。你要在这么挤得情况下，想跑的很快，确实是很难。人家一轮2.4小时，你需要24小时。主要原因还是显卡和CPU都被很多任务占用吧。先找空试一试单独的跑一下。如果在电脑空闲情况下，都比较慢，那再优化代码。先真正检查你的电脑，空闲情况下跑。你现在设置，和论文的设置，配置，差不多。如果人家也用相同的卡，相同的batchsize。那就应该是电脑被其他任务用了，占着的原因。找一个空时间段，试一下吧。你好博主, 我想继续请教一下怎么提高cpu的利用率,如何在保持batchsize不变的情况下提高.我目前的batchsize为1,cpu的利用率在200%左右浮动,我猜测数据的吞吐速度很慢,我跑项目的速度远远慢于论文的时间.我尝试调高torch.set_num_threads()的参数,cpu的使用率会上升但是对跑项目的速度没有任何帮助.我是直接从git上下载的原项目,参数也都对照无误,如何提高cpu的利用率呢?好的。明白。pin_memory也开了的吧。提前加载数据到GPU内存上面。就不用让GPU空闲着，等待数据从CPU load 到GPU。batch size为1，本来就不需要用CPU，你的batch size太小，CPU不用调用太多负载，也能给你处理。你即使现在写成4个num_workers，需要处理的数据量这么小，也不用你的CPU进行大负荷的运转。为了测你真正的把CPU利用率用起来，你直接加大你的batch size。变为16,32,64，试一试。这个时候，你的CPU利用率和GPU利用率一下就上来了。先按照我刚刚回复的，直接加大 batch size来测利用率。然后跑完实验之后给我回复一下实际效果和状态。加大的之后耗时明显缩短，cpu利用率变高了，但也还是时高时低的摇摆不定，GPU的利用率则先是0%，然后快速增长到60%-70%，然后又递减至0%，停留一会儿后重复增长降低。

问题18：大佬，你好,我这边用pytorch构建的网络， pin_memory=True, num_workers=4，前面训练最开始GPU利用率在0%，然后训练一个多小时后，GPU利用率跑到了80%左右，但是最近没有修改代码的情况下训练，GPU利用又是0%,top查看了CPU各个线程的利用率也是非常的低，大佬有遇到过类似的情况吗，或者说有啥方法和建议。多谢了！

答：这个代码没有变，应该是没问题的啊。你这个可以把速度打一下出来。每个环节的耗时。你的GPU 和CPU都是0吗，或者接近于0 。用watch -n nvidia-smi 0.5，实时监控一下显卡的应用。看是有冲低到高，然后又降低的过程。0%，然后10%，80%然后又掉到0%。如果是这样的过程，那就是数据加载，返回给CPU处理，没有配合好。CPU后处理，或者前处理，耗时过长。导致GPU等待时间过久。程序运行前一个小时是CPU10%左右，GPU0%,1-1.5小时是0% 10% 30% 然后0%这样往返，然后大概跑两小时后，GPU利用率60%-85%之间往返。还有一个问题是，我程序跑几次之后，整个服务器的GPU都没法调用了，如果我没跑，其他人跑tensorflow是没有出现导致GPU无法调用的情况，我的模型是pytorch构建的，结果就是导致pytorch和tensorflow都无法调用GPU了。重装CUDA后又变好，现在这种情况已经反复搞了好几次了，哎。代码问题了，你装的库，之前是装好的吗。这样一来，你这代码有破坏库文件的bug。好好检查一下代码。还有，前一个小时是CPU10%左右。后面慢慢增加。而且是以小时来计算。你前面有数据加载，模型构建，初始化什么的，耗时一个小时吗。这个不应该。整个流程就是加载数据，处理。返回。然后继续下一轮。你的这个，是不是没有跑起来。你都实时输出你的状态，代码跑到那一步了，实时的输出一下，打印结果。你如果前面GPU利用率为0 。那就是没有在GPU上跑起来。但是你代码一定是显式的设置了，to.device. 都要放到GPU 上哈。

if torch.cuda.device_count() > 1:
            model = nn.DataParallel(model, device_ids=[0, 1, 2, 3])
        model = model.to(device)

你好，我后来查看buff/catch发现，我的数据加载比较慢，在有多人使用服务器时候，会将我加载到服务器中的数据冲洗掉，如果我一个人使用服务器，等第一个epoch跑完后，训练速度就跑起来起来了。我将原始保存为.npy格式的文件保存为.h5，但是第一个epoch的数据加载速度似乎并没有太大变化。我想在又想能否直接将数据文件夹挂载，不知道速度会不会提高。有这个的。将数据转换为h5，或者，md什么的。数据压缩的lmdb。也就是.mdb文件。这样加载到GPU上会很快。这是一个专门的挂载文件。你查一下。我这边的数据，都是lmdb的类型。我这边直接将数据挂载上去，速度跑得飞快，GPU利用率现在基本稳定在99%，当然也也是进行了pin_memory=True, num_workers=4的.发现大部分速度慢都是因为数据准备花费了大量时间。大佬您好，刚刚我又尝试了一下训练，服务器就我一个人使用，在训练大概一个半小时后，GPU和CPU都跑起来了，特别服务器中wa 参数，在最开始时候大概是10，正常运行时候为0，网上查了一下说这个参数越大，IO堵塞层度越大，为啥最开始训练时候IO跟不上呢，你有遇到过这种问题没。

问题19：博主您好，我想请教一下增加num_workers和使用pin_memory对CPU占用的影响会有多大呢，我在跑一个2020年的模型，训练到20%的时候80G的内存就不够用了，后来我把num_workers从4改成了0，把pin_memory改成了False，情况有所缓解，但是还是无法完成整个训练过程，请问有什么办法能让训练过程的内存占用减少呢？

答：你中间绝对保存了什么中间变量的。训练一个阶段，只保存当前epoch的相关loss，梯度这些。然后训练完一个epoch，就会丢掉当前这个epoch的信息。下一个iterative会重新更新，计算，缓存的。你这个中间一定是保存了中间变量，包括checkpoint，以及model.state_dict，以及其他的变量，而且是每一个epoch都在存一下信息的。你要查一下。常规的显卡内存是不变的。跑起来显卡内存不变，CPU这边，应该也不是增量式的，只是会开始占用多少，后面略微增加，不会这种直接一直增加下去的。仔细审查代码，是不是有缓存的东西。

问题20：博主您好！我在pytorch训练模型时出现以下情况，不知您是否遇到，求教？情况描述：首先环境：2080Ti + I7-10700K， torch1.6, cuda10.2, 驱动440 参数设置：shuffle=True, num_workers=8, pin_memory=True; 现象1：该代码在另外一台电脑上，可以将GPU利用率稳定在96%左右现象2：在个人电脑上，CPU利用率比较低，导致数据加载慢，GPU利用率浮动，训练慢约4倍；有意思的是，偶然开始训练时，CPU利用率高，可以让GPU跑起来，但仅仅几分钟，CPU利用率降下来就上不去了，又回到蜗牛速度。

答：两边的配置都一样吗。另一台电脑和你的电脑。你看整体，好像设置配置有点不同。包括硬件，CPU的核，内存大小。你对比一下两台设备。这是第一个。第二个，还是代码里面的配置，代码的高效性。你一来，CPU利用率低，你看一下每一步，卡到哪里，哪里是瓶颈，什么步骤最耗时。都记录一下每一个大的步骤的耗时，然后在分析。测试了每一个大的过程的时间，可以看见，耗时在哪里。主要包括，加载数据，前向传播，反向更新，然后下一步。你可以测一下。您好！经过测试，发现本机卡的地方在加载图像的地方，有时加载10kb左右的图像需要1s以上，导致整个batch数据加载慢！代码应该没有问题，因为在其他电脑能全速跑起来；硬件上，本机的GPU，CPU都强悍，环境上也看不出差距，唯一差在内存16G，其他测试电脑为32G，请问这种现象和内存直接关系大吗？？？最多可能就在这边。你可以直接测试batch size为1情况下的整个计算。或者将batch size 开到不同的设置下。看加载数据，计算之间的差值。最有可能就是在这个load data，读取数据这块。电脑的运行内存16g 32g。其实都已经够了，然后加载到GPU上，GPU内存能放下，影响不大。所以估计是你的内存相对小了，导致的问题。试一下。我怀疑是。我找到问题了，特意回复一下，有遇到同样问题，可参考。主要问题是：这台电脑的内存条插的位置不对，4个插槽的主板，1根内存的时候应该插在第2个插槽（以cpu端参考起），而组装电脑的商家不专业，放在了第4个插槽上，影响性能，更换位置后，速度飞起来了！关于插槽详情，有遇到的朋友去网上收，一大堆！嗯，这个很难让人怀疑到是硬件的问题，能够定位到加载数据很慢了。这个还是很艰难的找出原因了。可以。我放文档里面，补充说明一下

你可能感兴趣的:(深度学习)

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
将cmd中命令输出保存为txt文本文件落难Coder Windows cmd window
最近深度学习本地的训练中我们常常要在命令行中运行自己的代码，无可厚非，我们有必要保存我们的炼丹结果，但是复制命令行输出到txt是非常麻烦的，其实Windows下的命令行为我们提供了相应的操作。其基本的调用格式就是：运行指令>输出到的文件名称或者具体保存路径测试下，我打开cmd并且ping一下百度：pingwww.baidu.com>./data.txt看下相同目录下data.txt的输出：如果你再
推荐3家毕业AI论文可五分钟一键生成！文末附免费教程！小猪包333 写论文人工智能 AI写作深度学习计算机视觉
在当前的学术研究和写作领域，AI论文生成器已经成为许多研究人员和学生的重要工具。这些工具不仅能够帮助用户快速生成高质量的论文内容，还能进行内容优化、查重和排版等操作。以下是三款值得推荐的AI论文生成器：千笔-AIPassPaper、懒人论文以及AIPaperPass。千笔-AIPassPaper千笔-AIPassPaper是一款基于深度学习和自然语言处理技术的AI写作助手，旨在帮助用户快速生成高质
AI大模型的架构演进与最新发展季风泯灭的季节 AI大模型应用技术二人工智能架构
随着深度学习的发展，AI大模型（LargeLanguageModels,LLMs）在自然语言处理、计算机视觉等领域取得了革命性的进展。本文将详细探讨AI大模型的架构演进，包括从Transformer的提出到GPT、BERT、T5等模型的历史演变，并探讨这些模型的技术细节及其在现代人工智能中的核心作用。一、基础模型介绍：Transformer的核心原理Transformer架构的背景在Transfo
[实践应用] 深度学习之模型性能评估指标 YuanDaima2048 深度学习工具使用深度学习人工智能损失函数性能评估 pytorch python 机器学习
文章总览：YuanDaiMa2048博客文章总览深度学习之模型性能评估指标分类任务回归任务排序任务聚类任务生成任务其他介绍在机器学习和深度学习领域，评估模型性能是一项至关重要的任务。不同的学习任务需要不同的性能指标来衡量模型的有效性。以下是对一些常见任务及其相应的性能评估指标的详细解释和总结。分类任务分类任务是指模型需要将输入数据分配到预定义的类别或标签中。以下是分类任务中常用的性能指标：准确率(
[实践应用] 深度学习之优化器 YuanDaima2048 深度学习工具使用 pytorch 深度学习人工智能机器学习 python 优化器
文章总览：YuanDaiMa2048博客文章总览深度学习之优化器1.随机梯度下降（SGD）2.动量优化（Momentum）3.自适应梯度（Adagrad）4.自适应矩估计（Adam）5.RMSprop总结其他介绍在深度学习中，优化器用于更新模型的参数，以最小化损失函数。常见的优化函数有很多种，下面是几种主流的优化器及其特点、原理和PyTorch实现：1.随机梯度下降（SGD）原理:随机梯度下降通过
生成式地图制图 Bwywb_3 深度学习机器学习深度学习生成对抗网络
生成式地图制图（GenerativeCartography）是一种利用生成式算法和人工智能技术自动创建地图的技术。它结合了传统的地理信息系统（GIS）技术与现代生成模型（如深度学习、GANs等），能够根据输入的数据自动生成符合需求的地图。这种方法在城市规划、虚拟环境设计、游戏开发等多个领域具有应用前景。主要特点：自动化生成：通过算法和模型，系统能够根据输入的地理或空间数据自动生成地图，而无需人工逐
吴恩达深度学习笔记(30)-正则化的解释极客Array
正则化（Regularization）深度学习可能存在过拟合问题——高方差，有两个解决方法，一个是正则化，另一个是准备更多的数据，这是非常可靠的方法，但你可能无法时时刻刻准备足够多的训练数据或者获取更多数据的成本很高，但正则化通常有助于避免过拟合或减少你的网络误差。如果你怀疑神经网络过度拟合了数据，即存在高方差问题，那么最先想到的方法可能是正则化，另一个解决高方差的方法就是准备更多数据，这也是非常
个人学习笔记7-6：动手学深度学习pytorch版-李沐浪子L 深度学习深度学习笔记计算机视觉 python 人工智能神经网络 pytorch
#人工智能##深度学习##语义分割##计算机视觉##神经网络#计算机视觉13.11全卷积网络全卷积网络（fullyconvolutionalnetwork，FCN）采用卷积神经网络实现了从图像像素到像素类别的变换。引入l转置卷积（transposedconvolution）实现的，输出的类别预测与输入图像在像素级别上具有一一对应关系：通道维的输出即该位置对应像素的类别预测。13.11.1构造模型下
深度学习-点击率预估-研究论文2024-09-14速读 sp_fyf_2024 深度学习人工智能
深度学习-点击率预估-研究论文2024-09-14速读1.DeepTargetSessionInterestNetworkforClick-ThroughRatePredictionHZhong,JMa,XDuan,SGu,JYao-2024InternationalJointConferenceonNeuralNetworks,2024深度目标会话兴趣网络用于点击率预测摘要：这篇文章提出了一种新
损失函数与反向传播 Star_. PyTorch pytorch 深度学习 python
损失函数定义与作用损失函数(lossfunction)在深度学习领域是用来计算搭建模型预测的输出值和真实值之间的误差。1.损失函数越小越好2.计算实际输出与目标之间的差距3.为更新输出提供依据（反向传播)常见的损失函数回归常见的损失函数有：均方差（MeanSquaredError，MSE）、平均绝对误差（MeanAbsoluteErrorLoss，MAE）、HuberLoss是一种将MSE与MAE
【深度学习】训练过程中一个OOM的问题，太难查了 weixin_40293999 深度学习深度学习人工智能
现象：各位大佬又遇到过ubuntu的这个问题么？现象是在训练过程中，ssh上不去了，能ping通，没死机，但是ubunutu的pc侧的显示器，鼠标啥都不好用了。只能重启。问题原因：OOM了95G，尼玛！！！！pytorch爆内存了，然后journald假死了，在journald被watchdog干掉之后，系统就崩溃了。这种规模的爆内存一般，即使被oomkill了，也要卡半天的，确实会这样，能不能配
云服务业界动态简报-20180128 Captain7
一、青云青云QingCloud推出深度学习平台DeepLearningonQingCloud，包含了主流的深度学习框架及数据科学工具包，通过QingCloudAppCenter一键部署交付，可以让算法工程师和数据科学家快速构建深度学习开发环境，将更多的精力放在模型和算法调优。二、腾讯云1.腾讯云正式发布腾讯专有云TCE(TencentCloudEnterprise)矩阵，涵盖企业版、大数据版、AI
机器学习VS深度学习 nfgo 机器学习
机器学习（MachineLearning,ML）和深度学习（DeepLearning,DL）是人工智能（AI）的两个子领域，它们有许多相似之处，但在技术实现和应用范围上也有显著区别。下面从几个方面对两者进行区分：1.概念层面机器学习：是让计算机通过算法从数据中自动学习和改进的技术。它依赖于手动设计的特征和数学模型来进行学习，常用的模型有决策树、支持向量机、线性回归等。深度学习：是机器学习的一个子领
大数据毕业设计hadoop+spark+hive知识图谱租房数据分析可视化大屏租房推荐系统 58同城租房爬虫房源推荐系统房价预测系统计算机毕业设计机器学习深度学习人工智能 2401_84572577 程序员大数据 hadoop 人工智能
做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。我先来介绍一下这些东西怎么用，文末抱走。（1）Python所有方向的学习路线（
深度学习-13-小语言模型之SmolLM的使用皮皮冰燃深度学习深度学习
文章附录1SmolLM概述1.1SmolLM简介1.2下载模型2运行2.1在CPU/GPU/多GPU上运行模型2.2使用torch.bfloat162.3通过位和字节的量化版本3应用示例4问题及解决4.1attention_mask和pad_token_id报错4.2max_new_tokens=205参考附录1SmolLM概述1.1SmolLM简介SmolLM是一系列尖端小型语言模型，提供三种规
基于深度学习的农作物病害检测 SEU-WYL 深度学习dnn 深度学习人工智能
基于深度学习的农作物病害检测利用卷积神经网络（CNN）、生成对抗网络（GAN）、Transformer等深度学习技术，自动识别和分类农作物的病害，帮助农业工作者提高作物管理效率、减少损失。1.农作物病害检测的挑战病害种类繁多：农作物病害的类型多样，不同病害在同一作物上的表现差异很大，同时同一种病害在不同生长阶段的症状也可能不同。环境影响：天气、光照、湿度等外部环境因素会影响农作物的表现，使得病害检
基于深度学习的文本引导的图像编辑 SEU-WYL 深度学习dnn 深度学习人工智能
基于深度学习的文本引导的图像编辑（Text-GuidedImageEditing）是一种通过自然语言文本指令对图像进行编辑或修改的技术。它结合了图像生成和自然语言处理（NLP）的最新进展，使用户能够通过描述性文本对图像内容进行精确的调整和操控。1.文本引导的图像编辑的挑战文本和图像之间的对齐：如何将文本中的语义信息准确地映射到图像中的特定区域或元素是一个关键挑战。这涉及到多模态数据的对齐和理解。编
深度学习--对抗生成网络（GAN, Generative Adversarial Network） Ambition_LAO 深度学习生成对抗网络
对抗生成网络（GAN,GenerativeAdversarialNetwork）是一种深度学习模型，由IanGoodfellow等人在2014年提出。GAN主要用于生成数据，通过两个神经网络相互对抗，来生成以假乱真的新数据。以下是对GAN的详细阐述，包括其概念、作用、核心要点、实现过程、代码实现和适用场景。1.概念GAN由两个神经网络组成：生成器（Generator）和判别器（Discrimina
深度学习：怎么看pth文件的参数奥利给少年深度学习人工智能
.pth文件是PyTorch模型的权重文件，它通常包含了训练好的模型的参数。要查看或使用这个文件，你可以按照以下步骤操作：1.确保你有模型的定义你需要有创建这个.pth文件时所用的模型的代码。这意味着你需要有模型的类定义和架构。2.加载模型权重使用PyTorch的load_state_dict方法来加载权重。这里是如何操作的：importtorchimporttorch.nnasnn#定义模型结构
chatgpt赋能python：如何在Python中安装Keras库？ turensu ChatGpt python chatgpt keras 计算机
如何在Python中安装Keras库？Keras是一个简单易用的神经网络库，由FrançoisChollet编写。它在Python编程语言中实现了深度学习的功能，可以使您更轻松地构建和试验不同类型的神经网络。如果您是一名Python开发人员，肯定会想知道如何在您的Python项目中安装Keras库。在本文中，我们将向您展示如何安装和配置Keras库。步骤1：安装Python要使用Keras库，您需
如何理解深度学习的训练过程奋斗的草莓熊深度学习人工智能 python scikit-learn virtualenv numpy pandas
文章目录1.训练是干什么？2.预训练模型进行训练，主要更改的是预训练模型的什么东西？1.训练是干什么？以yolov5为例子，训练的目的是把一组输入猫狗图像放到神经网络中，得到一个输出模型，这个模型下次可以直接用来识别哪个是猫，哪个是狗2.预训练模型进行训练，主要更改的是预训练模型的什么东西？超参数（Hyperparameters）：这是模型结构中定义的参数，比如：卷积核大小（kernel_size
Keras深度学习框架入门及实战指南司莹嫣Maude
Keras深度学习框架入门及实战指南keraskeras-team/keras:是一个基于Python的深度学习库，它没有使用数据库。适合用于深度学习任务的开发和实现，特别是对于需要使用Python深度学习库的场景。特点是深度学习库、Python、无数据库。项目地址:https://gitcode.com/gh_mirrors/ke/keras一、项目介绍Keras简介Keras是一款高级神经网络
深度学习驱动的车牌识别：技术演进与未来挑战逼子歌深度学习车牌识别神经网络字符识别 YOLO 卷积神经网络
一、引言1.1研究背景在当今社会，智能交通系统的发展日益重要，而车牌识别作为其关键组成部分，发挥着至关重要的作用。车牌识别技术广泛应用于交通管理、停车场管理、安防监控等领域。在交通管理中，它可以用于车辆识别、交通违法监控和车流统计等，提高交通管理的效率和准确性。在停车场管理中，实现车辆的自动识别和收费，提升管理和服务水平。在安防监控领域，可用于追踪嫌疑人及犯罪行为。深度学习的出现为车牌识别带来了重
每天五分钟玩转深度学习PyTorch：模型参数优化器torch.optim 幻风_huanfeng 深度学习框架pytorch 深度学习 pytorch 人工智能神经网络机器学习优化算法
本文重点在机器学习或者深度学习中，我们需要通过修改参数使得损失函数最小化(或最大化)，优化算法就是一种调整模型参数更新的策略。在pytorch中定义了优化器optim，我们可以使用它调用封装好的优化算法，然后传递给它神经网络模型参数，就可以对模型进行优化。本文是学习第6步(优化器)，参考链接pytorch的学习路线随机梯度下降算法在深度学习和机器学习中，梯度下降算法是最常用的参数更新方法，它的公式
什么是AIGC？有哪些免费工具？ chent_某位 AIGC
AIGC（AIGeneratedContent），即“人工智能生成内容”，是指通过人工智能技术自动生成各种类型的数字内容。AIGC让机器能够根据输入的信息或数据生成符合人类需求的文本、图像、音频、视频等内容，极大提高了内容创作的效率。AIGC的背景与起源随着深度学习和自然语言处理技术的快速发展，人工智能已经不再局限于简单的任务，如分类、预测和数据分析，而是具备了生成内容的能力。生成式AI模型，如O
transformer架构(Transformer Architecture)原理与代码实战案例讲解 AI架构设计之禅大数据AI人工智能 Python入门实战计算科学神经计算深度学习神经网络大数据人工智能大型语言模型 AI AGI LLM Java Python 架构设计 Agent RPA
transformer架构(TransformerArchitecture)原理与代码实战案例讲解关键词：Transformer,自注意力机制,编码器-解码器,预训练,微调,NLP,机器翻译作者：禅与计算机程序设计艺术/ZenandtheArtofComputerProgramming1.背景介绍1.1问题的由来自然语言处理（NLP）领域的发展经历了从规则驱动到统计驱动再到深度学习驱动的三个阶段。
如何有效的学习AI大模型？ Python程序员罗宾学习人工智能语言模型自然语言处理架构
学习AI大模型是一个系统性的过程，涉及到多个学科的知识。以下是一些建议，帮助你更有效地学习AI大模型：基础知识储备：数学基础：学习线性代数、概率论、统计学和微积分等，这些是理解机器学习算法的数学基础。编程技能：掌握至少一种编程语言，如Python，因为大多数AI模型都是用Python实现的。理论学习：机器学习基础：了解监督学习、非监督学习、强化学习等基本概念。深度学习：学习神经网络的基本结构，如卷
【深度学习】【OnnxRuntime】【Python】模型转化、环境搭建以及模型部署的详细教程牙牙要健康深度学习 onnx onnxruntime 深度学习 python 人工智能
【深度学习】【OnnxRuntime】【Python】模型转化、环境搭建以及模型部署的详细教程提示:博主取舍了很多大佬的博文并亲测有效,分享笔记邀大家共同学习讨论文章目录【深度学习】【OnnxRuntime】【Python】模型转化、环境搭建以及模型部署的详细教程前言模型转换--pytorch转onnxWindows平台搭建依赖环境onnxruntime调用onnx模型ONNXRuntime推理核
基于深度学习的多模态信息检索 SEU-WYL 深度学习dnn 深度学习人工智能
基于深度学习的多模态信息检索（MultimodalInformationRetrieval,MMIR）是指利用深度学习技术，从包含多种模态（如文本、图像、视频、音频等）的数据集中检索出满足用户查询意图的相关信息。这种方法不仅可以处理单一模态的数据，还可以在多种模态之间建立关联，从而更准确地满足用户需求。1.多模态信息检索的挑战异构数据表示：多模态数据通常具有不同的特征和表示形式（如文本的词嵌入与图
多线程编程之存钱与取钱周凡杨 java thread 多线程存钱取钱
生活费问题是这样的：学生每月都需要生活费，家长一次预存一段时间的生活费，家长和学生使用统一的一个帐号，在学生每次取帐号中一部分钱，直到帐号中没钱时通知家长存钱，而家长看到帐户还有钱则不存钱，直到帐户没钱时才存钱。问题分析：首先问题中有三个实体，学生、家长、银行账户，所以设计程序时就要设计三个类。其中银行账户只有一个，学生和家长操作的是同一个银行账户，学生的行为是
java中数组与List相互转换的方法征客丶 JavaScript java jsonp
1.List转换成为数组。（这里的List是实体是ArrayList) 　　调用ArrayList的toArray方法。　　toArray 　　public T[] toArray(T[] a)返回一个按照正确的顺序包含此列表中所有元素的数组；返回数组的运行时类型就是指定数组的运行时类型。如果列表能放入指定的数组，则返回放入此列表元素的数组。否则，将根据指定数组的运行时类型和此列表的大小分
Shell 流程控制 daizj 流程控制 if else while case shell
Shell 流程控制和Java、PHP等语言不一样，sh的流程控制不可为空，如(以下为PHP流程控制写法)： <?php if(isset($_GET["q"])){ search(q);}else{// 不做任何事情} 在sh/bash里可不能这么写，如果else分支没有语句执行，就不要写这个else，就像这样 if else if if 语句语
Linux服务器新手操作之二周凡杨 Linux 简单操作
1.利用关键字搜寻Man Pages man -k keyword 其中-k 是选项，keyword是要搜寻的关键字如果现在想使用whoami命令，但是只记住了前3个字符who，就可以使用 man -k who来搜寻关键字who的man命令 [haself@HA5-DZ26 ~]$ man -k
socket聊天室之服务器搭建朱辉辉33 socket
因为我们做的是聊天室，所以会有多个客户端，每个客户端我们用一个线程去实现，通过搭建一个服务器来实现从每个客户端来读取信息和发送信息。我们先写客户端的线程。 public class ChatSocket extends Thread{ Socket socket; public ChatSocket(Socket socket){ this.sock
利用finereport建设保险公司决策分析系统的思路和方法老A不折腾 finereport 金融保险分析系统报表系统项目开发
决策分析系统呈现的是数据页面，也就是俗称的报表，报表与报表间、数据与数据间都按照一定的逻辑设定，是业务人员查看、分析数据的平台，更是辅助领导们运营决策的平台。底层数据决定上层分析，所以建设决策分析系统一般包括数据层处理（数据仓库建设）。项目背景介绍通常，保险公司信息化程度很高，基本上都有业务处理系统（像集团业务处理系统、老业务处理系统、个人代理人系统等）、数据服务系统（通过
始终要页面在ifream的最顶层林鹤霄
index.jsp中有ifream，但是session消失后要让login.jsp始终显示到ifream的最顶层。。。始终没搞定，后来反复琢磨之后，得到了解决办法，在这儿给大家分享下。。 index.jsp--->主要是加了颜色的那一句 <html> <iframe name="top" ></iframe> <ifram
MySQL binlog恢复数据 aigo mysql
1，先确保my.ini已经配置了binlog： # binlog log_bin = D:/mysql-5.6.21-winx64/log/binlog/mysql-bin.log log_bin_index = D:/mysql-5.6.21-winx64/log/binlog/mysql-bin.index log_error = D:/mysql-5.6.21-win
OCX打成CBA包并实现自动安装与自动升级 alxw4616 ocx cab
近来手上有个项目,需要使用ocx控件 (ocx是什么? http://baike.baidu.com/view/393671.htm) 在生产过程中我遇到了如下问题. 1. 如何让 ocx 自动安装? a) 如何签名? b) 如何打包? c) 如何安装到指定目录? 2.
Hashmap队列和PriorityQueue队列的应用百合不是茶 Hashmap队列 PriorityQueue队列
HashMap队列已经是学过了的,但是最近在用的时候不是很熟悉,刚刚重新看以一次, HashMap是K,v键 ,值 put()添加元素 //下面试HashMap去掉重复的 package com.hashMapandPriorityQueue; import java.util.H
JDK1.5 returnvalue实例 bijian1013 java thread java多线程 returnvalue
Callable接口：返回结果并且可能抛出异常的任务。实现者定义了一个不带任何参数的叫做 call 的方法。 Callable 接口类似于 Runnable，两者都是为那些其实例可能被另一个线程执行的类设计的。但是 Runnable 不会返回结果，并且无法抛出经过检查的异常。 ExecutorService接口方
angularjs指令中动态编译的方法(适用于有异步请求的情况) 内嵌指令无效 bijian1013 JavaScript AngularJS
在directive的link中有一个$http请求，当请求完成后根据返回的值动态做element.append('......');这个操作，能显示没问题，可问题是我动态组的HTML里面有ng-click，发现显示出来的内容根本不执行ng-click绑定的方法！
【Java范型二】Java范型详解之extend限定范型参数的类型 bit1129 extend
在第一篇中，定义范型类时，使用如下的方式： public class Generics<M, S, N> { //M,S,N是范型参数 } 这种方式定义的范型类有两个基本的问题： 1. 范型参数定义的实例字段，如private M m = null;由于M的类型在运行时才能确定，那么我们在类的方法中，无法使用m，这跟定义pri
【HBase十三】HBase知识点总结 bit1129 hbase
1. 数据从MemStore flush到磁盘的触发条件有哪些？ a.显式调用flush，比如flush 'mytable' b.MemStore中的数据容量超过flush的指定容量，hbase.hregion.memstore.flush.size,默认值是64M 2. Region的构成是怎么样？ 1个Region由若干个Store组成
服务器被DDOS攻击防御的SHELL脚本 ronin47
mkdir /root/bin vi /root/bin/dropip.sh #!/bin/bash/bin/netstat -na|grep ESTABLISHED|awk ‘{print $5}’|awk -F:‘{print $1}’|sort|uniq -c|sort -rn|head -10|grep -v -E ’192.168|127.0′|awk ‘{if($2!=null&a
java程序员生存手册-craps 游戏-一个简单的游戏 bylijinnan java
import java.util.Random; public class CrapsGame { /** * *一个简单的赌*博游戏，游戏规则如下： *玩家掷两个骰子，点数为1到6，如果第一次点数和为7或11，则玩家胜， *如果点数和为2、3或12，则玩家输， *如果和为其它点数，则记录第一次的点数和，然后继续掷骰，直至点数和等于第一次掷出的点
TOMCAT启动提示NB: JAVA_HOME should point to a JDK not a JRE解决开窍的石头 JAVA_HOME
当tomcat是解压的时候，用eclipse启动正常，点击startup.bat的时候启动报错; 报错如下： The JAVA_HOME environment variable is not defined correctly This environment variable is needed to run this program NB: JAVA_HOME shou
[操作系统内核]操作系统与互联网 comsci 操作系统
我首先申明：我这里所说的问题并不是针对哪个厂商的，仅仅是描述我对操作系统技术的一些看法操作系统是一种与硬件层关系非常密切的系统软件，按理说，这种系统软件应该是由设计CPU和硬件板卡的厂商开发的，和软件公司没有直接的关系，也就是说，操作系统应该由做硬件的厂商来设计和开发
富文本框ckeditor_4.4.7 文本框的简单使用支持IE11 cuityang 富文本框
<html xmlns="http://www.w3.org/1999/xhtml"> <head> <meta http-equiv="Content-Type" content="text/html; charset=UTF-8" /> <title>知识库内容编辑</tit
Property null not found darrenzhu datagrid Flex Advanced propery null
When you got error message like "Property null not found ***", try to fix it by the following way: 1)if you are using AdvancedDatagrid, make sure you only update the data in the data prov
MySQl数据库字符串替换函数使用 dcj3sjt126com mysql 函数替换
需求：需要将数据表中一个字段的值里面的所有的 . 替换成 _ 原来的数据是 site.title site.keywords .... 替换后要为 site_title site_keywords 使用的SQL语句如下： updat
mac上终端起动MySQL的方法 dcj3sjt126com mysql mac
首先去官网下载: http://www.mysql.com/downloads/ 我下载了5.6.11的dmg然后安装,安装完成之后..如果要用终端去玩SQL.那么一开始要输入很长的:/usr/local/mysql/bin/mysql 这不方便啊,好想像windows下的cmd里面一样输入mysql -uroot -p1这样...上网查了下..可以实现滴. 打开终端,输入: 1
Gson使用一（Gson） eksliang json gson
转载请出自出处：http://eksliang.iteye.com/blog/2175401 一.概述从结构上看Json，所有的数据（data）最终都可以分解成三种类型：第一种类型是标量（scalar），也就是一个单独的字符串（string）或数字（numbers），比如"ickes"这个字符串。第二种类型是序列（sequence），又叫做数组（array）
android点滴4 gundumw100 android
Android 47个小知识 http://www.open-open.com/lib/view/open1422676091314.html Android实用代码七段（一） http://www.cnblogs.com/over140/archive/2012/09/26/2611999.html http://www.cnblogs.com/over140/arch
JavaWeb之JSP基本语法 ihuning javaweb
目录 JSP模版元素 JSP表达式 JSP脚本片断 EL表达式 JSP注释特殊字符序列的转义处理如何查找JSP页面中的错误 JSP模版元素 JSP页面中的静态HTML内容称之为JSP模版元素，在静态的HTML内容之中可以嵌套JSP
App Extension编程指南（iOS8/OS X v10.10）中文版啸笑天 ext
当iOS 8.0和OS X v10.10发布后，一个全新的概念出现在我们眼前，那就是应用扩展。顾名思义，应用扩展允许开发者扩展应用的自定义功能和内容，能够让用户在使用其他app时使用该项功能。你可以开发一个应用扩展来执行某些特定的任务，用户使用该扩展后就可以在多个上下文环境中执行该任务。比如说，你提供了一个能让用户把内容分
SQLServer实现无限级树结构 macroli oracle sql SQL Server
表结构如下：数据库id path titlesort 排序 1 0 首页 0 2 0,1 新闻 1 3 0,2 JAVA 2 4 0,3 JSP 3 5 0,2,3 业界动态 2 6 0,2,3 国内新闻 1 创建一个存储过程来实现，如果要在页面上使用可以设置一个返回变量将至传过去 create procedure test as begin decla
Css居中div，Css居中img，Css居中文本，Css垂直居中div qiaolevip 众观千象学习永无止境每天进步一点点 css
/**********Css居中Div**********/ div.center { width: 100px; margin: 0 auto; } /**********Css居中img**********/ img.center { display: block; margin-left: auto; margin-right: auto; }
Oracle 常用操作(实用) 吃猫的鱼 oracle
SQL>select text from all_source where owner=user and name=upper('&plsql_name'); SQL>select * from user_ind_columns where index_name=upper('&index_name'); 将表记录恢复到指定时间段以前
iOS中使用RSA对数据进行加密解密 witcheryne ios rsa iPhone objective c
RSA算法是一种非对称加密算法,常被用于加密数据传输.如果配合上数字摘要算法, 也可以用于文件签名. 本文将讨论如何在iOS中使用RSA传输加密数据. 本文环境 mac os openssl-1.0.1j, openssl需要使用1.x版本, 推荐使用[homebrew](http://brew.sh/)安装. Java 8 RSA基本原理 RS