将高层网络意图翻译为正确的多供应商配置仍然是网络自动化中的一个主要挑战,因为语法上有效的输出可能仍然违反预期的操作状态。尽管大型语言模型(LLMs)最近有所进展,但该领域仍然缺乏可重现的语义基准来进行严格的跨供应商评估。本文提出了一个可重现的DSM到CLI语义基准,涵盖五个云LLMs、三个供应商、五个代表性用例,以及在固定评审和明确失败分类下每个实验单元进行十次重复运行。我们的结果显示,语义质量和操作可靠性是正交的,供应商效应主导用例效应,重复运行的离散度强烈预测投票不稳定性,而华为VRP则揭示了由汇总指标隐藏的失败模式。这些发现表明,多供应商、重复执行的语义基准对于科学地比较基于LLM的网络配置系统至关重要。
Menezes等(Sun)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: