Key points are not available for this paper at this time.
Le succès écrasant des approches d'apprentissage profond ces dernières années est souvent dicté par la disponibilité de grands ensembles de données publics. Cependant, dans certains domaines comme la finance, la création et le partage d'ensembles de données réalistes sont entravés par des préoccupations de secret ou de vie privée. Cela peut conduire à un décalage, où les approches qui ont prouvé leur efficacité sur des ensembles de données publics et orientés vers la recherche finissent par sous-performer lorsqu'elles sont appliquées à des ensembles de données réels (privés). Dans ce travail, nous nous concentrons sur la tâche de détection des valeurs aberrantes (OD) et comblons cette lacune en construisant une approche d'apprentissage profond basée sur un autoencodeur qui peut transformer des échantillons entre deux ensembles de données tabulaires (par exemple, un privé et un public). L'objectif de notre approche est que les échantillons transformés deviennent similaires à l'ensemble de données cible, tandis que les valeurs internes restent des valeurs internes et les valeurs aberrantes restent des valeurs aberrantes. Parmi d'autres, après une transformation réussie, cela permet d'appliquer des méthodes éprouvées sur des ensembles de données publics à des ensembles de données internes, même s'ils ont des dimensions différentes (lignes et colonnes). Pour évaluer notre approche, nous introduisons des métriques pour mesurer la similarité des ensembles de données et la qualité des échantillons transformés. Nos résultats expérimentaux montrent que la combinaison d'ensembles de données publics avec des échantillons transformés d'autres ensembles de données conduit à une plus grande similarité des ensembles de données tout en maintenant des performances par rapport aux algorithmes OD courants.
Herurkar et al. (Sun,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: