方法-PC端远程调试分布式训练

本专栏为深度学习的一些技巧,方法和实验测试,偏向于实际应用,后续不断更新,感兴趣童鞋可关,方便后续推送

简介

一些简单的代码我们使用Pycharm本地调试就能运行成功,但在诸如使用GPU进行分布式训练和推断等场景中,由于我们本地的电脑没有GPU或者没有多块GPU而无法运行这些程序。如果此时我们手头恰好有自己/公司/学校的GPU服务器资源,我们就可以使用这些GPU服务器进行远程调试/运行,无需本地运行代码。

方法

root权限下,软链接

 ln -s /home/xxx/anaconda3/envs/xxx/lib/pythonx.x/site-packages/torch/bin/launch.py pathto{'code_mapping'}
 或者
  ln -s /home/xxx/anaconda3/envs/xxx/bin/torchrun pathto{'code_mapping'}

●拷贝到本地映射路径下
在pycharm depolyment选项中把远程路径下载至本地路径
●配置pycharm运行参数
方法-PC端远程调试分布式训练_第1张图片
●注意:单GPU可以远程Debug,多GPU远程调试会有问题

你可能感兴趣的:(深度学习杂谈,分布式,ubuntu,linux,gpu算力,深度学习)