大型视觉语言模型(LVLMs)通过视觉上下文学习(VICL)实现了显著的性能,这一过程在很大程度上依赖于从广泛的注释示例集合(检索数据库)中获取的示范。现有研究通常假设检索数据库包含所有标签的注释示例。然而,在现实场景中,数据库更新延迟或数据注释不完整可能导致检索数据库仅包含部分类别的标记样本。我们将这种现象称为不完整的检索数据库,并将这种条件下的上下文学习定义为不完整的上下文学习(IICL)。为了解决这一挑战,我们提出了迭代判断和集成预测(IJIP)框架,这是一个旨在减轻IICL限制的两阶段框架。迭代判断阶段将一个\ (m\) 类分类问题重新构造为一系列\ (m\) 二分类任务,有效地将IICL设置转化为标准的VICL场景。集成预测阶段通过利用输入图像和迭代判断阶段的预测来进一步优化分类过程,提高整体分类准确性。IJIP在两种LVLM和两个数据集下的三种标签不完整条件下表现出相当出色的性能,达到最高准确率93.9%。值得注意的是,即使在标签完全可用的情况下,IJIP仍在所有六个基准中实现了最佳性能。此外,IJIP可以直接应用于提示学习,并适应文本领域。
Wang 等人 (Mon,) 研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: