正样本和未标记(PU)学习旨在仅基于一组正样本数据和未标记数据来训练合适的分类器。现有的PU方法通常遵循判别框架,分类性能有限,因为缺乏明确的负标签在训练判别PU模型时构成很大障碍。为了解决判别PU方法面临的有限监督信息的挑战,本文在传统判别操作的基础上引入了生成操作,并提出了一种新算法,称为“判别生成正样本和未标记学习”(DGPU)。具体而言,我们提出的DGPU由数据生成阶段和判别标注阶段组成,两个阶段可以以迭代的方式相互受益。在数据生成阶段,我们采用定制的扩散模型生成高质量的负样本和正样本,以有效丰富监督信息。在判别标注阶段,分类器在初始和生成的训练数据上进一步精炼。据我们所知,本研究是首次将扩散模型整合到PU学习中,以使生成模型和判别模型以协作的方式相互受益。得益于此,我们提出的DGPU在各种合成和真实世界基准数据集上显著优于现有的PU方法。特别是,我们的DGPU几乎可以与完全监督的对照组相媲美,并在CIFAR-10和CelebA数据集上分别提高了现有最先进方法的测试准确率3.89%和2.56%。
Yuan等人(Thu,)研究了这个问题。