摘要高性能计算(HPC)系统必须保持稳定和可靠,以持续提供强大的计算能力并确保用户作业的正确执行。异常检测是确保这些系统稳定性和可靠性的关键手段。随着HPC系统的扩展和架构的变化,在动态环境中准确识别异常变得越来越具有挑战性。传统的检测方法依赖于经验和规则,这可能效率低下且不准确。为了应对这些问题,研究人员提出了基于机器学习的方法,自动处理大量复杂数据,提高了异常识别和诊断的效率。在本次调查中,我们对HPC系统中基于机器学习的异常检测方法进行了全面深入的研究。首先,我们总结并介绍了HPC系统中异常检测的背景和挑战。其次,我们详细比较了一系列基于机器学习的异常检测工作,并总结了它们的框架。我们得出了它们的优缺点和应用场景。最后,我们讨论了基于机器学习的HPC系统异常检测的几种有前景的发展趋势。
Lu等(周五)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: