数据挖掘相似度度量中的对称属性和非对称属性的区别

只有非零属性值才重要的属性称为非对称属性,比如二元属性,当考虑普通人的患癌情况时,健康时属性为0,患癌时为1,这样大部分情况下该属性都为0,因此我们一般只关注属性为1的情况,所以这个就是非对称的二元属性。

■网友
我也是初学数据挖掘,有了和你相同的疑问。
这里有一段解释。
对称的二元变量和不对称的二元变量之间的区别是什么? - 风生水起 - 博客园数据挖掘中的数据的特征,一般有三种类型:名词性的,二值属性,数值属性。对于二值属性有几种近似的测量方法。
【数据挖掘相似度度量中的对称属性和非对称属性的区别】 Proximity Measure for Binary Attributes
1.A contingency table for binary data
数据挖掘相似度度量中的对称属性和非对称属性的区别

2.Distance measure for symmetric binary variables: (对称)
数据挖掘相似度度量中的对称属性和非对称属性的区别

3.Distance measure for asymmetric binary variables: (非对称)
数据挖掘相似度度量中的对称属性和非对称属性的区别

4. Jaccard coefficient (similarity measure for asymmetric binary variables):
数据挖掘相似度度量中的对称属性和非对称属性的区别

Note: Jaccard coefficient is the same as “coherence”:
数据挖掘相似度度量中的对称属性和非对称属性的区别

如果它的两个状态有相同的权重, 那么该二元变量是对称的,也就是两个取值 0或 1 没有优先权。例如,属性“性别”就是这样的一个例子,它有两个值:“女性”和“男性”。基于对称二元变量的相似度称为恒定的相似度,即当一些或者全部二元变量编码改变时,计算结果不会发生变化。对恒定的相似度来说,评价两个对象 i和 j 之间相异度的最著名的系数是简单匹配系数,其定义: 见上方2式。 如果两个状态的输出不是同样重要,那么该二元变量是不对称的。例如一个疾病检查的肯定和否定的结果。根据惯例,我们将比较重要的输出结果,通常也是出现几率较小的结果编码为 1(例如,HIV阳性),而将另一种结果编码为 0(例如 HIV阴性)。给定两个不对称的二元变量,两个都取值 1 的情况(正匹配)被认为比两个都取值 0 的情况(负匹配)更有意义。因此,这样的二元变量经常被认为好像只有一个状态。基于这样变量的相似度被称为非恒定的相似度。对非恒定的相似度,最著名的评价系数是 Jaccard 系数,在它的计算中,负匹配的数目被认为是不重要的,因此被忽略。 见4式。 当对称的和非对称的二元变量出现在同一个数据集中,混合变量方法可以被应用。

■网友
相似度可以用来计算两个物体之间的距离, 比如有两个向量, v1=(x1,y1), v2=(x2,y2), 如果想计算这两个向量之间的相似度,我们可以计算这两个向量之间的夹角,也就是cosine similarity.. 除了用cosine similarity, 也可以用euclidean distance来计算它们之间的距离(要根据具体问题来决定采取什么样的相似算法), 但不管cosine similarity也好,还是Euclidean distance也好,它们都具有对称性也就是 D(v1, v2) = D(v2,v1),可以很容易证明, 比如 sqrt((x1-x2)^2+(y1-y2)^2)=sqrt((x2-x1)^2+(y2-y1)^2)。 但有些similarity measure就不具备这种对称性, 最简单的例子就是KL divergence. 比如想计算两个随机分布之间的相似性,S(p, p\u0026#39;), 我们可以计算它们的KL divergence, 但是这个不对称的,也就是说 KL(p,p\u0026#39;) != KL(p\u0026#39;, p).


推荐阅读