微客导航 » 文章资讯 » 解决pytorch GPU 计算过程中出现内存耗尽的问题

解决pytorch GPU 计算过程中出现内存耗尽的问题

2023-08-16 23:54:04 409

PytorchGPU运算过程中会出现：“cudaruntimeerror(2):outofmemory”这样的错误。通常，这种错误是由于在循环中使用全局变量当做累加器，且累加梯度信息的缘故，用官方的说法就是："accumulatehistoryacrossyourtrainingloop"。在默认情况下，开启梯度计算的Tensor变量是会在GPU保持他的历史数据的，所以在编程或者调试过程中应该尽力避免在循环中累加梯度信息。

下面举个栗子：

上代码：

total_loss=0
foriinrange(10000):
optimizer.zero_grad()
output=model(input)
loss=criterion(output)
loss.backward()
optimizer.step()
total_loss+=loss
#这里total_loss是跨越循环的变量，起着累加的作用，
#loss变量是带有梯度的tensor，会保持历史梯度信息，在循环过程中会不断积累梯度信息到tota_loss，占用内存

以上例子的修正方法是在循环中的最后一句修改为：total_loss+=float(loss)，利用类型变换解除梯度信息，这样，多次累加不会累加梯度信息。

局部变量逗留导致内存泄露

局部变量通常在变量作用域之外会被Python自动销毁，在作用域之内，不需要的临时变量可以使用delx来销毁。

在设计LinearLayers的时候，尽量让其规模小点

对于nn.Linear(m,n)这样规模的线性函数，他的空间规模为O(mn),除此规模的空间来容纳参数意外，还需要同样规模的空间来存储梯度，由此很容易造成GPU空间溢出。

相关的进程管理bashcmd

nvidia-smi监控GPU，

watch-n1nvidia-smi实时监控GPU，

watch-n1lscpu实时监控CPU，

ps-elf进程查看，

ps-elf|greppython查看Python子进程，

kill-9[PID]杀死进程PID。

Referance:

Pytorchdocumentations

以上这篇解决pytorchGPU计算过程中出现内存耗尽的问题就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持毛票票。

返回顶部
3162201930
czq8825@qq.com

解决pytorch GPU 计算过程中出现内存耗尽的问题

热门推荐

随机推荐