Key points are not available for this paper at this time.
要旨 データセットにおけるクラス不均衡の存在は、分類器を多数派分類に大きく偏らせる可能性があります。この不一致は、パターンを学習し分類を出力するために膨大かつ多様なデータを必要とする深層学習モデルにとって深刻な問題を引き起こすことがあります。従来、データレベルおよびアルゴリズムレベルの技術は、クラス不均衡の悪影響を軽減する上で重要な役割を果たしてきました。最近の生成対抗ネットワーク(GAN)の発展と普及に伴い、さまざまな分野の研究者がGANのアーキテクチャを適応し、不均衡データセットにおいて過小評価されたクラスのインスタンスを生成するために実装しています。これまでの研究の大部分は、この方法論のコンピュータビジョンタスクへの応用に集中していますが、GANは伝統的な構造データタイプの行と列からなる表形式データにも適用されています。この調査論文では、ネットワークトラフィック分類や金融取引といったドメインにおける表形式データセットに対するこれらの修正方法論と有効性を、過去7年間にわたって評価します。私たちは、最も高い機械学習の有効性をもたらした方法論と実験要素、ならびにGANの表形式データにおける応用の発展に最も影響を与えた研究作品とフレームワークを調査します。特に、CGANアーキテクチャの普及、CNN学習者を使用した新しい方法の最適性、F1スコアのような少数派クラスに敏感な指標、ベースライン技術としてのSMOTEの人気、そして不均衡な表形式データセットにおけるGANの使用が年々改善されていることに注目します。
Sauber-Coleら(Mon)はこの問題を研究しました。