Key points are not available for this paper at this time.
许多数据集保持未标记,因为获得机器学习的标记数据通常代价高昂,并需要高水平的领域专业知识。机器学习从业者面临的另一个挑战是类别不平衡。在欺诈检测等领域,克服显著的类别不平衡带来了额外的困难,正如在本文中使用的信用卡欺诈和医疗保险D部分索赔数据集中所见。我们新颖的二元标签方法自动化了标签生成过程,只需最少的专家输入,结合了集成无监督方法与百分位阈值技术。通过迭代最小化过程进一步细化标签,仅选择最高置信度的实例以进行欺诈的最终标记。我们的方法成功克服了为严重不平衡数据生成标签的挑战,在完全无监督框架内将实例标记为欺诈或非欺诈。此外,与传统方法相比,我们的方法通过直接评估生成标签的有效性,提供了更高效的评估,而无需训练监督分类器来评估标签。为了检验标签有效性的影响,我们报告了每个数据集在不同正实例水平下的结果。通过三种评估指标:Jaccard指数(JI)、精确度和马修斯相关系数(MCC)对新生成的类别标签的质量进行了全面评估。我们的实证结果表明,我们的方法在所有正实例水平和指标上均显著优于基准线,即孤立森林(IF)。我们新颖的方法论展示了提供准确和稳健标签的能力,克服了类别不平衡的挑战,这可能导致在高度不平衡领域的更好机器学习应用和对新生成类别标签的更有效评估.
Walauskis等(周二)研究了这个问题。