虽然近年来出现了许多过采样策略,但在严重类别不平衡的情况下,合成能够保留内在数据结构同时提高分类器性能的少数类样本仍然具有挑战性。在本研究中,我们提出了HypoGAN,这是一种为不平衡数值表格数据设计的生成过采样框架,集成了少数类模式发现、本地少数类-多数类边界信息、潜噪声驱动的候选样本生成和生成后过滤,以生成对分类有用的少数类样本。为了评估所提框架,我们采用了两阶段的实验策略:(i) 在类别不平衡比率为90:10、95:5和98:2以及特征维度为n=3、5、10、20的情况下进行模拟实验,(ii) 在威斯康星乳腺癌、皮马印第安人糖尿病和信用卡欺诈检测的数据集上进行实际实验。在所有实验中,HypoGAN与SMOTE、ADASYN和Borderline-SMOTE进行比较,采用了嵌套的训练/验证/测试框架,以确保泄露保护。结果表明,HypoGAN在一系列具有挑战性的失衡设置中是一种具有竞争力的过采样框架。在模拟研究中,它在低维和中维场景中表现出特别强的性能,同时在更困难的条件下依然注重精度。在实际实验中,HypoGAN在威斯康星乳腺癌和信用卡欺诈检测数据集中保持了竞争力,F1分数分别达到0.9489和0.9028,而SMOTE的对应值为0.9489和0.9037。其他结果表明,HypoGAN的性能依赖于场景,其有效性受数据集结构和不平衡特征的影响。
Olcay Alpay(Mon,)研究了这个问题。