将视觉和语言理解结合起来对于教育应用至关重要,尤其是在解释视觉内容和回答相关问题时。教育视觉问答(Edu-VQA)系统的目标是通过提供关于图像、图表、插图和图表的问题的有根据的答案来支持学习者,从而增强学习环境中的互动性。然而,大多数当前模型在视觉区域与文本问题之间未能良好对齐时会遇到挑战,导致答案不完整或错误。许多模型实现了图像的纯全局表示,而没有细粒度的跨模态互动,这对于解释复杂的教育内容是必需的。在本文中,我们开发了一个注意力引导的视觉语言转换器(AG-VLT)框架,以应对这些重大挑战。AG-VLT使用双编码器将图像和文本问题嵌入到共享嵌入空间中,采用跨模态注意力机制以选择性地关注与问题中的标记相关的图像区域。多层转换器模块进一步细化这些嵌入,使模型能够学习视觉理解与语言推理之间的复杂关系。我们的实验结果表明,AG-VLT在准确性和可解释性方面优于当前的方法,弥合了教育应用中视觉理解与语言推理之间的差距。
Khan等人(星期四)研究了这个问题。