如何通过Python利用PyTorch的WeightedRandomSampler处理类别不平衡?
WeightedRandomSampler通过赋予少数类样本更高采样概率解决类别不平衡,比上采样省内存、比下采样保信息。权重按类别分配,同一类样本共享权重值。标准权重计算为总样本数除以类别频次与类别数之积。使用需指定num_samples和replacement=True,且与shuffle互斥,验证集不应使用。
先给一个核心判断:WeightedRandomSampler 之所以能解决类别不平衡,不是靠改模型结构,而是让 DataLoader 在采样时给少数类样本更高的概率——相当于“人为加权重采”。对比一下,它比直接上采样更省内存,比下采样更能保留信息。关键点在于:权重不是按样本逐一算,而是按每个样本所属类别来分配,同一类别的所有样本共享同一个权重值。
常见坑有两个:一是把 weights 算成每个样本的独立值(比如用预测置信度),结果训练不稳定;二是误以为权重要归一化到 [0,1],其实 PyTorch 内部只做相对比较,只要正数就行。

WeightedRandomSampler 为什么能解决类别不平衡
它不改变模型结构,而是让 DataLoader 在采样时对少数类样本赋予更高概率,相当于“人为加权重采”,比直接上采样更省内存、比下采样更保信息。关键点在于:权重不是按样本算,而是按每个样本所属类别来分配——同一类的所有样本共享一个权重值。
常见错误是把 weights 算成每个样本的独立值(比如用预测置信度),结果训练不稳定;或者误以为权重要归一化到 [0,1],其实 PyTorch 内部只做相对比较,只要正数就行。
怎么算每个类别的权重
标准做法是用「总样本数 / (类别频次 × 类别数)」,这样所有类别的权重均值为 1,避免整体 batch size 偏移太大。也可以简化为「1 / 类别频次」,再手动缩放(比如乘个常数)防止权重过大导致梯度爆炸。
- 假设数据集有 3 类,样本数分别是 [100, 300, 600],总样本数 1000,类别数 3 → 权重 = [1000/(100×3), 1000/(300×3), 1000/(600×3)] ≈ [3.33, 1.11, 0.56]
- 用
torch.bincount()快速统计标签频次,注意确保dataset.targets或dataset.labels是一维整数张量 - 权重必须是
torch.Tensor类型,且长度等于数据集长度(不是类别数!),要用torch.tensor([weights[label] for label in labels])广播到每个样本
构建 WeightedRandomSampler 的实操要点
必须传入 num_samples 参数,否则默认只采原始数据集大小,起不到“过采样少数类”的效果。通常设为原始数据集长度,或略大一点(比如 ×1.2),保证每个 epoch 能覆盖足够多的少数类样本。
另一个坑是 replacement=True 必须显式指定 —— 它不是默认值,但 WeightedRandomSampler 要求必须为 True,否则会报错 ValueError: sampler option 'replacement' must be True。
from torch.utils.data import WeightedRandomSampler# weights 是长度为 len(dataset) 的 Tensorsampler = WeightedRandomSampler( weights=weights, num_samples=len(dataset), # 或更大,如 int(1.2 * len(dataset)) replacement=True)
和 DataLoader 配合时容易忽略的细节
sampler 和 shuffle 互斥:一旦用了 sampler,就不能再设 shuffle=True,否则会报错。这是底层机制决定的 —— sampler 已经负责打乱逻辑。
验证集/测试集绝对不要用 WeightedRandomSampler,否则评估指标失真。务必为 train_loader 单独构造 sampler,val_loader 和 test_loader 用普通 SequentialSampler 或不指定 sampler。
如果用了 DistributedSampler(多卡训练),不能和 WeightedRandomSampler 嵌套,得自己实现加权版的分布式采样器,或者改用 loss 层面的加权(如 weight 参数传给 nn.CrossEntropyLoss)。
权重计算依赖标签分布,所以一定要在划分 train/val 之后、构建 dataset 之前确认好训练集的标签直方图,别拿整个数据集的分布去算 train loader 的权重。


































