Key points are not available for this paper at this time.
摘要 对于双变量概率分布或双变量数据,关于依赖性或关联性的度量已有很多研究。这些度量通常假设变量都是连续的或都是分类的。相比之下,关于多变量或条件依赖性的度量研究很少。本文的目的是讨论基于相对熵的多变量依赖性度量和条件依赖性度量。这些度量在概念上非常一般,因为它们可以用于一组可以是连续变量、有序分类变量和名义分类变量混合的变量。对于连续变量或有序分类变量,相对熵经过某种变换到区间0, 1后,得到了相关性、多重相关性和偏相关系数的推广。如果所有变量都是名义分类的,则相对熵被标准化到最大值为1,然后变换使得在双变量情况下,具有相对变异性降低的解释,类似于相关系数。相对熵的依赖性度量与常用的双变量关联度量(如Kendall's τb和Goodman与Kruskal的λ)以及基于Pearson的ϕ2距离的依赖性度量进行了比较。例子表明,这些新的依赖性度量应为非单调或非线性依赖提供有用的额外总结值。假设多变量数据为随机样本,可以渐近地研究带有估计概率密度或质量函数的统计依赖性度量。当所有变量都是分类变量时,可以获得标准误差,并给出了所有变量都为连续变量时必须采取的步骤的概述。
Harry Joe(周三)研究了这个问题。