Key points are not available for this paper at this time.
给定一个难以处理的分布p,变分推断(VI)的问题是计算从某个更易处理的家族Q中获得最佳近似q。最常见的近似方法是通过最小化Kullback-Leibler(KL)散度来找到。然而,存在其他有效的散度选择,当Q不包含p时,每种散度支持不同的解决方案。我们分析了散度的选择如何影响在用一个具有稠密协方差矩阵的高斯近似一个具有对角协方差矩阵的高斯时的VI结果。在这种情况下,我们展示了不同的散度可以按它们的变分近似错误估计各种不确定性度量(如方差、精度和熵)的程度进行排序。我们还推导了一个不可能性定理,表明这两种度量中的任何两个都不能被分解的近似同时匹配;因此,散度的选择影响了哪个度量如果有的话被正确估计。我们的分析涵盖了KL散度、R'enyi散度,以及一个比较p和q的基于分数的散度。我们经验性地评估了在使用VI近似非高斯分布时这些排序是否成立。
Margossian等(周三)研究了这个问题。