Key points are not available for this paper at this time.
在本文中,我们提出了一种名为 Opportune Project 的新算法,用于通过投影数据库来生长频繁项集树,从而挖掘频繁项集的完整集合。我们的算法与以往提出的算法有着根本的不同,它能够机会性地在基于数组或基于树这两种不同结构之间进行选择以表示投影事务子集,并根据子集的特征启发式地决定构建未过滤的伪投影还是制作过滤后的副本。更重要的是,我们提出了为投影事务子集构建基于树的伪投影和基于数组的未过滤投影的新方法,这使得我们的算法既节省 CPU 时间又节省内存。基本上,该算法通过深度优先搜索来生长频繁项集树,而在必要时使用广度优先搜索来构建树的上部。我们在真实世界数据集(例如 BMS-POS)和 IBM 人工数据集上测试了我们的算法与其他几种算法。实证结果表明,我们的算法不仅在稀疏和密集数据库上的各个支持度阈值水平下都是最高效的,而且对于超大型数据库也具有高度的可扩展性。
Liu et al. (Tue,) 研究了这个问题。