我们研究了基于大型语言模型(LLM)的零-shot立场检测在推特上的表现。利用FlanT5-XXL,这是一种经过指令调优的开源LLM,并使用SemEval 2016 任务6A、6B和P-Stance数据集,我们分析了其表现如何在不同的提示和解码策略下变化,以及潜在的模型偏见。我们显示零-shot方法可以与最先进的方法相匹配或超越,包括微调模型。此外,我们提供了有关其表现的实用见解,包括对指令和提示的敏感性、解码策略、提示困惑度,以及否定和对立的作用。我们确保LLM未在测试数据集上训练,并识别出一种积极性偏见,这可能部分解释了解码策略间表现差异。最后,我们对LLM持续失败的案例进行了定性分析,揭示了可疑的真实标签以及在不存在立场时过于自信的情况。总之,我们提供了一个使用LLM进行立场检测任务的深入案例研究,可以为寻求利用LLM进行类似任务和使用案例的从业者提供指导。
Aiyappa等人(周四)研究了这个问题。