pytorch - 在 PyTorch 中定义批量大小 = 1 的手动排序的 MNIST 数据集
问题描述
[] :这表示一个批次。例如,如果批次大小为 5,那么批次将类似于 [1,4,7,4,2]。[] 的长度表示批量大小。
我想要制作的训练集如下所示:
[1] -> [1] -> [1] -> [1] -> [1] -> [7] -> [7] -> [7] -> [7] -> [7] -> [3] -> [3] -> [3] -> [3] -> [3] -> ... 以此类推
这意味着首先是五个 1(batch size = 1),其次是五个 7s(batch size = 1),第三个是五个 3s(batch size = 1)等等......
有人可以给我一个想法吗?
如果有人可以解释如何用代码实现这一点,那将非常有帮助。
谢谢!:)
解决方案
如果您想要DataLoader
在同一类的一行中返回五个样本,但您不想手动为每个索引定义类,那么您可以创建一个自定义采样器。例如
import torch
import torchvision
import torchvision.transforms as T
from itertools import cycle
class RepeatClassSampler(torch.utils.data.Sampler):
def __init__(self, targets, repeat_count, length, shuffle=False):
if not torch.is_tensor(targets):
targets = torch.tensor(targets)
self.targets = targets
self.repeat_count = repeat_count
self.length = length
self.shuffle = shuffle
self.classes = torch.unique(targets).tolist()
self.class_indices = dict()
for label in self.classes:
self.class_indices[label] = torch.nonzero(targets == label).flatten()
def __iter__(self):
class_index_iters = dict()
for label in self.classes:
if self.shuffle:
class_index_iters[label] = cycle(self.class_indices[label][torch.randperm(len(self.class_indices))].tolist())
else:
class_index_iters[label] = cycle(self.class_indices[label].tolist())
if self.shuffle:
target_iter = cycle(self.targets[torch.randperm(len(self.targets))].tolist())
else:
target_iter = cycle(self.targets.tolist())
def index_generator():
for i in range(self.length):
if i % self.repeat_count == 0:
current_class = next(target_iter)
yield next(class_index_iters[current_class])
return index_generator()
def __len__(self):
return self.length
mnist = torchvision.datasets.MNIST(root='./', train=True, transform=T.ToTensor())
dataloader = torch.utils.data.DataLoader(
mnist,
batch_size=1,
sampler=RepeatClassSampler(
targets=mnist.targets,
repeat_count=5,
length=15, # How many total to pick from your dataset
shuffle=True))
for idx, (x, y) in enumerate(dataloader):
# training loop
print(f'Batch {idx+1} labels: {y.tolist()}')
推荐阅读
- controller - Yii2 控制器触发两次/取决于浏览器
- python - 如果 Xpath 不存在,播放 mp3 - Python
- azure - 触发器主体属性的全局参数和在 @triggerbody().folderpath 上使用拆分功能
- google-cloud-platform - Google OAuth 同意屏幕 - 范围错误
- unicode - Deno:从 Windows 终端提示符阅读时如何处理口音?
- excel - Excel VBA:比较另一列中具有相同标识键的所有其他行的列中的值
- python - 在 Python 中将宽矩阵转换为长矩阵
- c# - 在 Azure Functions 3+ 中,如何更改无效参数绑定的响应消息
- javascript - 有没有办法处理函数中的“未定义”输出?
- reactjs - 当 url 在浏览器中显示数据时,openwheather api 在 react js 中不起作用