大型语言模型作为自动化测试生成的有希望的工具已出现,但与系统性测试方法相比,它们在数学算法中的有效性仍然没有经过经验验证。本论文研究了大型语言模型是否能够生成与系统枚举同样有效的单元测试,以应对需要容忍度满足和分段最小化的基本算法类别——分段函数逼近算法。我们开发了一个比较测试框架,将七种最先进的语言模型与系统性穷举测试进行评估。该框架采用可证明的最优算法作为真实标准,能够清晰识别算法失败,无论是容忍度违规还是次优解决方案。系统性生成通过有界参数空间枚举产生了750亿个测试案例,而基于大型语言模型的生成在多个现代模型中采用了不同的提示策略。GPU 加速和即时编译实现了计算的可行性,将十亿规模的评估时间从数年减少到数小时。我们评估了14个候选算法,涵盖了分段常数和分段线性逼近问题的不同范式。比较评估揭示系统性测试与基于大型语言模型的测试生成之间在失败检测有效性方面存在显著差异。这些发现为大型语言模型在数学算法领域的单元测试生成能力和局限性提供了实证证据,为关于人工智能辅助测试方法的适当部署提供了实用决策依据。
Riya Manoj Kanabar (星期四) 研究了这个问题。