Key points are not available for this paper at this time.
本文探讨了使用条件变分自编码器(CVAEs)进行图像标题生成。具有固定高斯先验的标准CVAEs生成的描述缺乏变化。相反,我们提出了两个模型,它们明确地围绕与不同类型的图像内容对应的K个成分来构构相关解空间,并结合这些成分为同时包含多种内容类型的图像创建先验(例如,几种类型的物体)。我们的第一个模型使用高斯混合模型(GMM)先验,而第二个模型定义了一种新的加性高斯(AG)先验,它线性组合了成分均值。我们展示了这两个模型生成的标题在多样性和准确性上均优于强大的LSTM基线或具有固定高斯先验的“普通”CVAEs,其中AG-CVAE显示出特别的潜力。
Wang等人(Sun,)研究了这个问题。