pytorch中关于distributedsampler函数的使用

pytorch distributedsampler distributedsampler函数 pytorch使用distributedsampler 2023-02-02 15:02:36 195人浏览安东尼

Python 官方文档：入门教程 => 点击学习

摘要

目录关于distributedsampler函数的使用1.如何使用这个分布式采样器2.关于用不用这个采样器的区别总结关于distributedsampler函数的使用 1.如何使用这

关于distributedsampler函数的使用

1.如何使用这个分布式采样器

在使用distributedsampler函数时，观察loss发现loss收敛有规律，发现是按顺序读取数据，未进行shuffle。

问题的解决方式就是怀疑 seed 有问题，参考源码 DistributedSampler，发现 shuffle 的结果依赖 g.manual_seed(self.epoch) 中的 self.epoch。

    def __iter__(self):
        # deterministically shuffle based on epoch
        g = torch.Generator()
        g.manual_seed(self.epoch)
        if self.shuffle:
            indices = torch.randperm(len(self.dataset), generator=g).tolist()
        else:
            indices = list(range(len(self.dataset)))
 
 
        # add extra samples to make it evenly divisible
        indices += indices[:(self.total_size - len(indices))]
        assert len(indices) == self.total_size
 
        # subsample
        indices = indices[self.rank:self.total_size:self.num_replicas]
        assert len(indices) == self.num_samples
 
        return iter(indices)

而 self.epoch 初始默认是 0

        self.dataset = dataset
        self.num_replicas = num_replicas
        self.rank = rank
        self.epoch = 0
        self.num_samples = int(math.ceil(len(self.dataset) * 1.0 / self.num_replicas))
        self.total_size = self.num_samples * self.num_replicas
        self.shuffle = shuffle

但是 DistributedSampler 也提供了一个 set 函数来改变 self.epoch

def set_epoch(self, epoch):
    self.epoch = epoch

所以在运行的时候要不断调用这个 set_epoch 函数。只要把我的代码中的

# sampler.set_epoch(e)

全部代码如下：

import torch
import torch.nn as nn
from torch.utils.data import Dataset, DataLoader
from torch.utils.data.distributed import DistributedSampler
 
 
torch.distributed.init_process_group(backend="nccl")
 
input_size = 5
output_size = 2
batch_size = 2
data_size = 16
 
local_rank = torch.distributed.get_rank()
torch.cuda.set_device(local_rank)
device = torch.device("cuda", local_rank)
 
class RandomDataset(Dataset):
    def __init__(self, size, length, local_rank):
        self.len = length
        self.data = torch.stack([torch.ones(5), torch.ones(5)*2,
                                 torch.ones(5)*3,torch.ones(5)*4,
                                 torch.ones(5)*5,torch.ones(5)*6,
                                 torch.ones(5)*7,torch.ones(5)*8,
                                 torch.ones(5)*9, torch.ones(5)*10,
                                 torch.ones(5)*11,torch.ones(5)*12,
                                 torch.ones(5)*13,torch.ones(5)*14,
                                 torch.ones(5)*15,torch.ones(5)*16]).to('cuda')
 
        self.local_rank = local_rank
    def __getitem__(self, index):
 
        return self.data[index]
 
    def __len__(self):
        return self.len
    
dataset = RandomDataset(input_size, data_size, local_rank)
sampler = DistributedSampler(dataset)
rand_loader = DataLoader(dataset=dataset,
                         batch_size=batch_size,
                         sampler=sampler)
 
e = 0
while e < 2:
    t = 0
    # sampler.set_epoch(e)
    for data in rand_loader:
        print(data)
    e+=1

运行：

CUDA_VISIBLE_DEVICES=0,1 python -m torch.distributed.launch --nproc_per_node=2 test.py

2.关于用不用这个采样器的区别

多卡去训模型，尝试着用DDP模式，而不是DP模式去加速训练（很容易出现负载不均衡的情况）。

遇到了一点关于DistributedSampler这个采样器的一点疑惑，想试验下在DDP模式下，使用这个采样器和不使用这个采样器有什么区别。

实验代码：

整个数据集大小为8,batch_size 为4，总共跑2个epoch。

import torch
import torch.nn as nn
from torch.utils.data import Dataset, DataLoader
from torch.utils.data.distributed import DistributedSampler
torch.distributed.init_process_group(backend="nccl")
 
batch_size = 4
data_size = 8
 
local_rank = torch.distributed.get_rank()
print(local_rank)
torch.cuda.set_device(local_rank)
device = torch.device("cuda", local_rank)
 
class RandomDataset(Dataset):
        def __init__(self, length, local_rank):
            self.len = length
            self.data = torch.stack([torch.ones(1), torch.ones(1)*2,torch.ones(1)*3,torch.ones(1)*4,torch.ones(1)*5,torch.ones(1)*6,torch.ones(1)*7,torch.ones(1)*8]).to('cuda')
            self.local_rank = local_rank
        def __getitem__(self, index):
            return self.data[index]
        def __len__(self):
            return self.len
 
dataset = RandomDataset(data_size, local_rank)
sampler = DistributedSampler(dataset)
 
#rand_loader =DataLoader(dataset=dataset,batch_size=batch_size,sampler=None,shuffle=True)
rand_loader = DataLoader(dataset=dataset,batch_size=batch_size,sampler=sampler)
epoch = 0
while epoch < 2:
    sampler.set_epoch(epoch)
    for data in rand_loader:
            print(data)
    epoch+=1

运行命令：

CUDA_VISIBLE_DEVICES=0,1 Python -m torch.distributed.launch --nproc_per_node=2 test.py

实验结果：

结论分析：上面的运行结果来看，在一个epoch中，sampler相当于把整个数据集划分成了nproc_per_node份，每个GPU每次得到batch_size的数量，也就是nproc_per_node 个GPU分一整份数据集，总数据量大小就为1个dataset。

如果不用它里面自带的sampler，单纯的还是按照我们一般的形式。Sampler=None,shuffle=True这种，那么结果将会是下面这样的：

结果分析：没用sampler的话，在一个epoch中，每个GPU各自维护着一份数据，每个GPU每次得到的batch_size的数据，总的数据量为2个dataset,

总结

一般的形式的dataset只能在同进程中进行采样分发，也就是为什么图2只能单GPU维护自己的dataset，DDP中的sampler可以对不同进程进行分发数据，图1，可以夸不同进程（GPU）进行分发。

以上为个人经验，希望能给大家一个参考，也希望大家多多支持编程网。

您可能感兴趣的文档:

点击免费下载>>软考高级考试备考技巧/历年真题/备考精华资料

--结束END--

本文标题: pytorch中关于distributedsampler函数的使用

本文链接: https://www.lsjlt.com/news/193995.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑，方便收藏和打印～

下载Word文档

去做题

猜你喜欢

pytorch中关于distributedsampler函数的使用

目录关于distributedsampler函数的使用1.如何使用这个分布式采样器2.关于用不用这个采样器的区别总结关于distributedsampler函数的使用 1.如何使用这...

99+

2023-02-02

pytorch distributedsampler distributedsampler函数 pytorch使用distributedsampler
PyTorch中关于tensor.repeat()的使用

目录关于tensor.repeat()的使用Tensor.repeat()的简单用法关于tensor.repeat()的使用考虑到很多人在学习这个函数，我想在这里提一个建议：强...

99+

2022-11-13

PyTorch tensor.repeat() tensor.repeat()的使用 PyTorch使用tensor.repeat()
关于python中map函数的使用

1. 概念 map函数也是python中的一个内置函数，用法同之前讲过的filter函数类似。map在这里的意思是映射的意思，会根据提供的函数对指定序列做映射。 map函数会返回一个...

99+

2023-05-16

python map python map函数
关于vue3中setup函数的使用

概述一、初识setup函数组件中所用到的：数据、方法等等均要配置在setup中，这也就意味着在Vue2中写的data、methods在这里都不再推荐使...

99+

2024-04-02
pytorch中的squeeze函数、cat函数使用

1 squeeze(): 去除size为1的维度，包括行和列。至于维度大于等于2时，squeeze()不起作用。行、例： >>> torch.rand(4,...

99+

2024-04-02
pytorch中的view()函数怎么使用

这篇文章主要介绍了pytorch中的view()函数怎么使用的相关知识，内容详细易懂，操作简单快捷，具有一定借鉴价值，相信大家阅读完这篇pytorch中的view()函数怎么使用文章都会有所收获，下面我们一起来看看吧。一、普通用法 (手动调...

99+

2023-06-29
pytorch中nn.Flatten()函数如何使用

这篇文章主要介绍了pytorch中nn.Flatten()函数如何使用的相关知识，内容详细易懂，操作简单快捷，具有一定借鉴价值，相信大家阅读完这篇pytorch中nn.Flatten()函数如何使用文章都会有所收获，下面我们一起来看看吧。t...

99+

2023-07-04
PyTorch中torch.matmul()函数怎么使用

这篇文章主要介绍了PyTorch中torch.matmul()函数怎么使用的相关知识，内容详细易懂，操作简单快捷，具有一定借鉴价值，相信大家阅读完这篇PyTorch中torch.matmul()函数怎么使用文章都会有所收获，下面我们一起来看...

99+

2023-07-06
pytorch中Parameter函数怎么使用

这篇文章主要介绍了pytorch中Parameter函数怎么使用的相关知识，内容详细易懂，操作简单快捷，具有一定借鉴价值，相信大家阅读完这篇pytorch中Parameter函数怎么使用文章都会有所收获，下面我们一起来看看吧。用法介绍pyt...

99+

2023-06-29
pytorch中BatchNorm2d函数的参数怎么使用

本篇内容主要讲解“pytorch中BatchNorm2d函数的参数怎么使用”，感兴趣的朋友不妨来看看。本文介绍的方法操作简单快捷，实用性强。下面就让小编来带大家学习“pytorch中BatchNorm2d函数的参数怎么使用”吧!BN原理、作...

99+

2023-07-04
Pytorch关于Dataset 的数据处理

Pytorch系列是了解与使用Pytorch编程来实现卷积神经网络。学习如何对卷积神经网络编程；首先，需要了解Pytorch对数据的使用（也是在我们模型流程中对数据的预处理部分），...

99+

2024-04-02
Pytorch中torch.cat()函数的使用及说明

目录一. torch.cat（）函数解析1. 函数说明2. 代码举例总结一. torch.cat（）函数解析 1. 函数说明 1.1 官网：torch.cat() 函数定义及参数说明...

99+

2023-01-03

Pytorch torch.cat() torch.cat()函数 Pytorch函数
Pytorch中关于model.eval()的作用及分析

目录model.eval()的作用及分析结论Pytorch踩坑之model.eval()问题比较常见的有两方面的原因1） data2）model.state_dict()model....

99+

2023-02-03

Pytorch model.eval model.eval的作用 model.eval()
关于pytorch相关部分矩阵变换函数的问题分析

目录1、tensor 维度顺序变换 BCHW顺序的调整2、矩阵乘法相关函数，矩阵乘，点乘3、求取矩阵对角线元素，或非对角线元素1、tensor 维度顺序变换 BCHW顺序的调整 te...

99+

2024-04-02
关于PyTorch中nn.Module类的简介

目录PyTorch nn.Module类的简介PyTorch中nn.Module理解总结PyTorch nn.Module类的简介 torch.nn.Module类是所有神经网络模块...

99+

2023-02-20

PyTorch中nn.Module nn.Module类的简介 PyTorch nn.Module类
关于scipy.optimize函数使用及说明

目录scipy.optimize函数使用scipy.optimize模块包含什么？使用步骤使用scipy.optimize进行优化总结scipy.optimize函数使用简单使用s...

99+

2022-12-14

scipy.optimize scipy.optimize函数 scipy.optimize函数使用
关于Python中的 oct 函数与 min 函数

一.Python oct 函数简介 oct 函数将一个整数转换成 8 进制字符串，语法如下： ''' 参数： x – 整数; 返回值：返回整数对应的八进制数据; '''...

99+

2024-04-02
如何在pytorch中使用numel函数

本篇文章给大家分享的是有关如何在pytorch中使用numel函数，小编觉得挺实用的，因此分享给大家学习，希望大家阅读完这篇文章后可以有所收获，话不多说，跟着小编一起来看看吧。获取tensor中一共包含多少个元素import to...

99+

2023-06-15
Pytorch中torch.argmax()函数使用及说明

目录torch.argmax()函数解析1. 官网链接2. torch.argmax(input)函数解析3. 代码举例4. torch.argmax(input,dim) 函数解析...

99+

2023-01-03

Pytorch torch.argmax() Pytorch函数使用 Pytorch torch.argmax()函数
Pytorch中torch.repeat_interleave()函数使用及说明

目录torch.repeat_interleave（）函数解析1.函数说明2. 函数原型3. 函数功能4. 输入参数5. 注意6. 代码例子7. 与torch.repeat()函数区...

99+

2023-01-03

Pytorch torch torch.repeat_interleave() pytorch repeat函数