内容概述
统计分析与描述性统计分析
统计分析:从表现数据中得出其规律性的过程
统计分析是整个统计学研究中最核心的一部分,比数据的收集重要也复杂的多,我们的大部分课程内容都属于统计分析范畴
在统计分析发展的过程中 统计学家对如何整理数据的思想方法产生了分歧
因此产生了两个主要的分支 描述性统计分析和推断性统计分析
- 描述性统计分析研究如何整理与描述数据(如常见的离散集中趋势,一些可视化手段)
- 推断性统计分析利用样本去反推总体的情况(如参数估计和假设检验)
两者互相成就 不能偏废
在这里我们着重研究描述性统计分析;作为研究数据形状的分支,描述性统计分析和数据分析中的探索性数据分析联系紧密
一些常用的数据分类方式
测度
根据数据的单位的不同的 我们给出下面的分类方式
- 间隔变量(定量变量):可以连续变化的变量
- 有序变量:没有明确的数量变化 而是等级变化
- 定类变量:变量用一些类来表示 类之间是平等的
数据的来源
根据数据的来源不同,有下面的分类
- 观测数据:对现实世界进行观测收集的数据
- 试验数据:人为控制变量进行试验收集的数据
与时间的联系
- 截面数据:同一个时间观测不同的对象收集的数据(列是特征,行是不同的对象)
- 时间序列数据:对同一个对象在不同时间进行观测收集到的数据(列是特征,行是不同的时间)
- 面板数据:同时含有前两者的特征,多个对象多个时间的多次观测(列是对象与特征,行是不同时间的观测)面板数据进行回归分析一定会涉及到各个观测很强相关性的问题,也就是非I.I.D抽样,这会严重影响分析效果
距离和相似系数
距离
定义
和我们在泛函分析中研究的一样 对于距离有下面的定义要求
参见泛函分析 的“度量空间的定义”一节。
部分情况下 我们可能违背这个基本定义来主观确定距离 如果我们确实需要
在聚类分析中 我们有下面一些比较常用的距离
明考夫斯基(Minkowski)距离
d(x,y)=[i=1∑p∣xi−yi∣q]1/q
明氏距离是使用的最广泛的距离
当q=1的时候 他就是我们学过的绝对值距离
当q=2的时候 他就是欧氏距离
当q=∞ 的时候 d(x,y)=max1⩽i⩽ρ∣xi−yi∣ 称为切比雪夫距离
随着q的增大 明氏距离对异常值就越来越敏感
正如我们在介绍欧氏距离的时候一样 参见多元统计引论 的“欧氏距离”一节。
明氏距离也需要先进行标准化再进行操作
明氏距离适用于有序变量之间的距离计算
兰氏(Lance 和 Williams)距离
当所有的数据均为正的时候 定义兰氏距离
d(x,y)=i=1∑pxi+yi∣xi−yi∣
它在处理较为偏斜并且含有异常值的数据的时候有很好的效果 并且和单位无关
马氏距离
多元统计引论 的“马氏距离”一节
在聚类分析中 我们一般不使用马氏距离 因为类是在动态变化的 我们很难给出一个确定的协方差矩阵
Hamming距离
汉明距离(Hamming Distance) 是一种用于衡量两个等长字符串(或序列)在相同位置上不同元素的个数的度量方法。 其思想非常简单,相同位置上对应的字符(类别)不同,则Hamming距离加一,计算整个字符串(或序列)的每一个位置即可
Levenshtein 距离
Levenshtein 距离,又称编辑距离,是衡量两个字符串之间的差异的一种方法。它通过计算将一个字符串转换成另一个字符串所需的最少操作次数来量化这种差异。他是Hamming距离的拓展,也可以用于多个分类特征
常见的操作有:
- 插入:在字符串中插入一个字符。
- 删除:从字符串中删除一个字符。
- 替换:将字符串中的一个字符替换成另一个字符。
我们根据变换字符串操作的次数,决定Levenshtein 距离,他需要使用动态规划进行求解
VDM距离 (Value Difference Metric)
Value Difference Metric(VDM,值差异度量) 是一种用于分类任务的相似性度量方法,特别适用于处理名义属性(即类别型特征)的数据。
VDM的核心是通过概率差异来衡量两个样本在某个特征上的相似性
- 对于每个类别型特征,VDM计算该特征不同取值在各目标类别下的条件概率。
- 两个样本在该特征上的差异,由它们各自取值对应的条件概率差异决定。
VDM距离衡量的是两个样本在各特征上,其取值对应的目标类别分布差异的累积程度。距离越大,说明两样本的各个特征值对分类结果的贡献差异越显著,属于同一类别的可能性越低。
想要计算VDM距离需要使用下面的步骤,我们研究的特征都是离散的,也就是一个分类的特征
计算条件概率;对于特征A的某个取值a,其在目标类别c下的条件概率为:
P(c∣A=a)=特征取值为a的样本数类别为c,特征取值为a的样本数
计算单特征VDM距离; 样本为x,y 只研究特征 A 两个样本在特征A的取值分别为ax,ay C是目标类别的总数
VDMA(x,y)=c=1∑C[P(c∣A=ax)−P(c∣A=ay)]2
计算多特征的两样本 VDM 距离;
VDM(x,y)=i=1∑mVDMAi(x,y)
通过混合使用VDM距离和欧氏距离就可以实现混合属性上的距离度量,这一般称为HVDM;部分情况下需要对VDM的特征进行加权,来区分更为重要的特征
VDM方法基于条件概率,当样本数量较少的时候这种估计可能相当不准确,甚至存在0概率的问题
VDM设计目标是分类问题,不可用于回归或任务。通过把现有的簇中心作为伪标签,使用动态聚类方法更新新的簇结果,重新计算VDM距离,多次迭代得到最终的结果,可以间接给聚类问题使用
相似系数
定义
和距离不一样的是,相似系数越大,意味着两个样本之间越接近,而距离是越小意味着越接近;我们可以用距离导出相似系数,但是也可以重新定义一些相似系数。相似系数一般情况都在[0,1]中,当然也有少数情况可能违背。
夹角余弦
定义相似系数为
cosθy=[(∑k=1nxkj2)(∑k=1nxkj2)]1/2∑k=1nxkixkj
它就是在计算两个向量之间的夹角的余弦值,此时我们只关注向量的角度而不关注数值的大小,对于存在稀疏的高维数据非常有效
相关系数
用两个向量间相关系数来刻画相似
cor=∑i=1n(ai−Aˉ)2∑i=1n(bi−Bˉ)2∑i=1n(ai−Aˉ)(bi−Bˉ)
其中ai,bi是样本A,B的各个分量,我们已经对其进行了规范化,Aˉ,Bˉ 是向量A,B自己的均值,是样本的均值而不是特征的均值。
特别的,我们非常不支持使用两个向量间相关系数研究样本相似度,在下面的应用场景除外
- 样本特征是时间序列,此时我们可以认为同一样本内近似同分布,因此可以使用相关系数
- 若样本的特征代表某种分布(如某用户的兴趣分布、某图像的像素直方图)如用户A对5个商品类别的兴趣评分 [5,3,1,0,2] 用户B对5个商品类别的兴趣评分 [3,1,2,0,3] 此时相关系数意味着偏好程度的相似性。
Jaccard系数
Jaccard Index(雅卡尔指数)是用于衡量两个集合相似度的一个指标。它主要用于计算两个集合之间的 相似度,特别是适用于 二元特征 或 集合类型的数据
对于二元特征,我们可以如下计算,公式为
J(A,B)=∣A∪B∣∣A∩B∣
- 交集:表示两个样本在相同特征上都为 1 的位置
- 并集:表示两个样本至少在一个样本中该特征为 1 的位置
对于集合类特征,每个样本都是一些无序的集合,计算交集和并集的元素的个数,做比即可,公式仍为
J(A,B)=∣A∪B∣∣A∩B∣
相关分析
相关分析简介
这里我们的目的很简单 通过数据分析来研究几组数据之前是否存在相关关系并且度量这样的关系
相关关系:当一个或几个变量变化时 与之对应的另一个变量虽然值不能确定 但是会按照某种规律进行变化
相关关系不是因果关系 他研究的两个变量之间的地位是均等的
变量之间的相关性分为两种 确定性的函数关系和非确定性的相关关系 很明显在统计学中我们更多的研究后者 前者需要对事件的内在特征有很多的掌握
从相关关系的模糊定义就能看出 他一定广泛存在于现实世界和我们的统计数据中 这就是为什么他值得我们重视并且研究
从被研究的数据的结构上看 相关分析分为数值数据相关分析 定序数据相关分析 定类数据相关分析
三种相关系数
相关系数
两个随机变量的相关系数 刻画了二者的线性的相关性
相关系数刻画线性相关性 哪怕有某种函数关系 但是是非线性的;两个随机变量之间的相关系数还是0 如
X∼N(0,1),Y=cosX,Z=X2 则
Corr(X,Y)=0,Corr(X,Z)=0
我们可以验证这一点
当相关系数在(0,1)的时候 证明存在一定程度的线性相关关系 但并不完全
虽然相关系数只刻画线性相关关系 但是他依然是应用的最广泛的指标 我们提出了很多其他的相关指标并没有替代他 除去其他指标过于复杂以外;还因为 二维正态分布的不线性相关和独立是等价的
也就是 相关系数在总体都是正态的情况下 就是相关性的度量 而不仅仅是线性相关性的度量
复相关系数
我们希望能够研究一个随机变量和一个随机向量的相关性,并且把它刻画成一个数值
根据前面的介绍,一个非常简单的想法是 利用随机向量的一个线性组合描述他的全部信息,然后研究线性组合和随机变量的相关性;我们称线性组合和随机变量之间的最大相关系数为复相关系数
容易有
ρ2(y,l′x)=V(y)⋅V(l′x)Cov2(y,l′x)=σyy⋅l′Σxxl(σxy′l)2⩽σxy⋅l′Σxxl(σxy′Σxx−1σxy)(l′Σxxl)=σxy(σxy′Σxx−1σxy)
当时l=Σxx−1σxy 等号成立 则有
ρy⋅x=l=0maxρ(y,l′x)=ρ(y,σxy′Σxx−1x)=σyyσxy′Σxx−1σxy=ρxy′Rxx−1ρxy
综合可以给出结论
- 当p=1的时候 复相关系数自然退化为普通的相关系数
- 复相关系数为为0意味着不相关
- 复相关系数对单位变化具有不变性
- 当随机向量的分量相互独立 有复相关系数的平方时单个相关系数平方和
在多元正态的假定下 样本复相关系数为(复相关系数的极大似然估计为)
ry.x=syysxy′Sxx−1sxy=rxy′R^xx−1rxy.
偏相关系数
在我们研究最普通的相关系数的时候,我们往往计算Pearson相关系数;事实上,他会被间接的相关性影响,所以我们一般也称它为总相关系数,现在 我们想消除这种间接的影响 研究最普通的相关性
定义
Σ11.2=Σ11−Σ12Σ22−1Σ21=(σij⋅k+1,⋯,p)
为x2给定的时候 x1的偏协方差矩阵 他的对角线元素称为偏协方差 对角线元素称为偏方差
定义
ρij+k+1,⋯,p=σii⋅k+1,⋯,pσjj⋅k+1,⋯,pσij⋅k+1,⋯,p,1⩽i,j⩽k
为x2给定的时候 xi,xj的(p−k)阶偏相关系数 他剔除了xk+1到xp的线性影响
在多元正态的假定下 偏相关系数的极大似然估计(样本偏相关系数为)
ry^⋅k+1,⋯,p=Sp^⋅k+1,⋯,pSjj⋅k+1,⋯,psy⋅k+1,⋯,p
其中
S11.2=S11−S12S22−1S21=(sij.k+1,⋯,p)
定量数据相关性分析(Pearson相关性系数)
相关关系的描述和测度
相关关系描述
在进行相关关系分析之前 我们有一个非常核心的基本假定 我们只研究线性相关性
我们只研究变量之间的线性相关性
我们在概率论 数理统计 很多门课程中都已经强调了这一点
对于只有两个变量的定量相关关系描述
绘制散点图并且拟合就能得到大致的关系
但是我们需要一种更加精确的定量的方法
相关关系测度
这里我们直接温习并且给出概率论中的相关系数r
r=∑(x−x)2⋅∑(y−y)2∑(x−x)(y−y),
复习一下概率论中已经给出的那些性质 毕竟后面还会用到
- 取值范围是[−1,1]
- 具有对称性
- 相关系数大小和x,y的原点和尺度无关
- 只研究线性关系(但是可以对原始数据作非线性变换)
- 不保证两者之间存在因果关系 这点和相关系数大小无关
这样的相关系数r 现在我们称其为Pearson相关系数 他仅仅是衡量相关性的一小部分 后面还有很多的统计学家为相关性研究做出了贡献
一般Pearson相关系数使用的前提是 x,y 都是正态连续的变量 变量样本数据应该成对出现 每一组数据之间应该相互独立 样本数应该大于30
一般这些条件都会假设成立
相关系数的大小与相关性的强弱
传统意义上认为
相关系数判断相关性一般遵照以下规则
- 0.8以上 强相关
- 0.5以上 中度相关
- 0.3以上 弱相关
- 0.3以下 不相关
相关性的假设检验
对于相关系数的显著性检验一般采用t 检验
建立假设
H0:ρ=0;H1:ρ=0。
引入检验统计量
t=∣r∣1−r2n−2∼t(n−2)
执行双侧的t检验就可以了
在大样本的情况下 基本上所有的相关系数假设检验都会被认为是显著的 所以实际操作上有时会省略,我们后面就不再提了
定序数据的相关性分析(Spearman秩相关系数与Kendall秩相关系数)
首先我们需要明确到底什么是定序数据;
Spearman秩相关系数的引出
这里本质上是在补充Pearson相关系数需要样本数据在逻辑上等距的要求 只要求他有大小的关系就可以了
也就是在这里 我们把数值型数据的分析改为了品质型数据
注意:参与分析的变量这里都要进行品质化 哪怕其中有一个原本符合Pearson相关性检验的要求
对于原始数据xi,yi 根据从小到大的顺序对他们分别进行排序 得到每组数据分别的位置序号xi′,yi′ 称为原始数据的秩次 记秩次的差为di 那么能给出Spearman相关系数的公式为
ρs=1−n(n2−1)6∑di2,
对于相关系数和相关性强弱的分析 Spearman和Pearson是一致的
Kendall秩相关系数的引出
肯德尔相关系数,又称肯德尔秩相关系数,它也是一种秩相关系数,不过,它的目标对象是有序的类别变量,比如名次、年龄段、肥胖等级(重度肥胖,中度肥胖、轻度肥胖、不肥胖)等。它可以度量两个有序变量之间单调关系强弱。肯德尔相关系数使用了“成对“这一概念来决定相关系数的强弱。
成对可以分为一致对(Concordant)和分歧对(Discordant)。一致对是指两个变量取值的相对关系一致,可以理解为X2-X1与Y2-Y1有相同的符号;分歧对则是指它们的相对关系不一致,X2-X1与Y2-Y1有着相反的符号。每个对需要涉及两个变量共四个元素
肯德尔系数有两个计算公式,一个是Tau-a,另一个是Tau-b。两者的区别是Tau-b可以处理有相同值的情况,即并列(tied ranks),我们需要分别介绍
对于Tau-a
Tau-a=21n(n−1)c−d
其中n是样本数,分母衡量总共可能的组合数,没有重复的时候为c+d c是一致对数,d是分歧对数
Kendall相关和Spearman相关本质不同,前者是Pearson相关的秩次改进,后者是基于分歧与一致对的研究,其对于本身就是排序的问题更敏感,对异常值和非线性关系不敏感,不属于线性相关系数的范畴。
若两个数据对的秩相同(即重复),它们既不被视为协同对,也不被视为不一致对。但重复值会影响分母的计算(总对数需扣除重复对)。也就是Tau-b
Tau-b=(c+d+tx)(c+d+ty)c−d
其中tx,ty是 X 和 Y 中的重复对数。
以上的Tau-a,Tau-b都仅适用于正方形表格,也就是 两个变量秩数需要是一样的 如果是长方形表格,按照如上公式计算可能最大值小于1,为此引入Tau-1的改进Tau-c
Tau-c=n2(m−1)2m(c−d)
其中m是行数和列数中的较小值,n为样本量。
定性数据的相关性分析(列联表分析)
列联表(contingency table)是对定类数据分析的基础 他是观测数据按照两个以上数据进行分类时列出的频数表
列联表的定义
假定一个总体中的个体按照两个属性A,B进行划分 类别数分别有r种和c种 我们抽取一组样本 fij 是所属类别的观察频数 这样我们就可以构造一个二维的rc列联表
对于更多的属性维度自然可以进行拓展 只是更不容易进行直观的表述 而且使用的也有限
我们这里仅仅是对列联表的最基础的研究 后续我们有对应分析研究更多的关于列联表的分析
多元统计分析 的“对应分析”一节
列联表的独立性检验
对于研究列联表中的两个变量是否相关或者独立 我们不得不引入列联表的独立性检验这一手段
这一点我们在对应分析中有过了介绍
多元统计分析 的“独立性检验”一节
列联表相关系数
采用χ2值的手段研究列联表的相关系数(度量相关程度的大小)是本节的核心
我们介绍三种方法并且给出适用的情况
列联表只有分类,没有大小的概念,所以相关系数应该都是正的,不存在正相关和负相关的区别,他们都是相关的
φ相关系数
用来度量2×2列联表的相关程度
计算公式为
φ=nχ2,
其中
χ2=i=1∑2j=1∑2eij(fij−eij)2
最后化简得到结果
φ=nχ2=(a+b)(c+d)(a+c)(b+d)ad−bc
φ相关系数分析正负没有意义 只需要研究绝对值
其相关程度大小和相关系数大小与相关程度的判断沿用Pearson相关系数
C相关系数
适用于更大的列联表 是φ相关系数的理论拓展
计算公式为
C=χ2+nχ2,
其中
χ2=i=1∑1j=1∑ceij(fij−eij)2
分析系数的大小的含义和Pearson相关系数是一样的
能看到 C相关系数和列联表的行数和列数有联系
因此不要比较多列联表的系数关系 这些列联表之间的行数和列数可能不一样
此时分析会失去意义
V相关系数
V=n⋅min[(r−1),(c−1)]χ2=n(m−1)χ2
需要注意的是,两个不同行数或列数的列联表计算所得的V相关系数不适宜进行比较;
当min(r,c)=2的时候 他就是φ相关系数(的一种推广形式)
列联表分析注意事项
- 对于存在因果关系的量进行列联表分析 自变量应在行处 因变量在列处
- 数据被划分为两类的时候 理论频数不应该小于5
- 当数据被划分为更多类的时候 理论频数小于5的数据划分组不应该超过总数据划分数目的百分之二十
列联表分析不应违背这些注意事项
典型相关分析
典型相关分析是研究两组变量之间的相关关系的一种方法,可以揭示两组变量之间的线性相关关系,他在实际应用中非常的广泛,是我们在前面复相关系数对相关系数推广后的进一步推广。
之所以我们引入典型相关分析,是因为两组变量(分别为p和q维)之间的相关系数有pq个,我们经常使用的矩阵散点图不够好用;
非常自然的,我们会引入类似于主成分分析中的降维思想,用几个尽可能少的数来刻画两组变量的相关性。
总体典型相关
典型相关的导出
设x=(x1,x2,...,xp)′和y=(y1,y2,...,yq)′是两组随机变量,且V(x)=Σ11(>0),V(y) =Σ22(>0),Cov(x,y)=Σ12即有
V(yx)=[Σ11Σ21Σ12Σ22]
我们想要使用一个指标来翻最大限度地反映两组变量之间的相关性 非常自然的 使用两个向量的线性函数u=a′x 和 υ=b′y 把他们压缩成单变量。再计算uv之间的相关系数 让他们达到最大
自然的
Cov(u,v)V(u)V(v)=Cov(a′x,b′y)=a′Cov(x,y)b=a′Σ12b=V(a′x)=a′V(x)a=a′Σ11a=V(b′y)=b′V(y)b=b′Σ22b
所以相关系数为
ρ(u,v)=a′Σ11ab′Σ22ba′Σ12b
为了避免一些毫无意义的结果重复 我们一般要求uv都是标准化的变量 也就是
a′Σ11a=1 , b′Σ22b=1
因此我们希望极大化的相关系数为
ρ(u,v)=a′Σ12b
我们省略一些不必要的证明 给出让这个相关系数达到极大化的系数计算方式
容易知道Σ11−1Σ12Σ22−1Σ21,Σ21−1Σ21−1Σ12,Σ11−1/2Σ12Σ22−1Σ21Σ11−1/2(⩾0)和Σ22−1/2 Σ211−1Σ12Σ221/2(⩾0)都有着相同的非零特征值,可记为 ρ12≥ρ22≥⋯≥ρn2>0,这里 m 为 Σ12 的秩 则
a1,a2,...,am 是
Σ11−1Σ12−1Σ22−1Σ21的相应于
ρ12,ρ22,...,ρm2的特征向量
b1,b2,...,bm 为
Σ22−1Σ21Σ11−1Σ12−1的相应于
ρ12,ρ22,...,ρm2 的特征向量
我们取 a=a1,b=b1的时候 是前面相关系数极大化的时候 我们称
u1=a1′x,v1=b1′y
是第一对典型变量 他们的系数a1,b1是第一对典型相关系数,p1是第一典型相关系数
如果第一对典型变量提取的相关信息数量还不够,我们可以给出第i典型相关 它对应的系数是ai,bi,pi
典型变量的性质
同一组的典型变量互相不相关
ui=ai′x,vi=bi′y
则
ρ(ui,uj)=ρ(vi,vj)=Cov(ui,uj)=a′Σ11aj=0,1⩽i=j⩽mCov(vi,vj)=b′Σ22bj=0,1⩽i=j⩽m
不同组典型向量之间的相关性
ρ(ui,vi)=ρi,i=1,2,⋯,m
ρ(ui,vj)=Cov(ui,vj)=Cov(ai′x,bj′y)=ai′Cov(x,y)bj=αi′Σ11−1/2Σ12Σ22−1/2βj=ρjαi′αj=0,1⩽i=j⩽m
原始变量和典型变量之间的相关系数
记A=(a1,a2,⋯,am),B=(b1,b2,⋯,bm),则u=A′x,v=B′y
Cov(x,u)=Cov(x,A′x)=Σ11ACov(x,ν)=Cov(x,B′y)=Σ12BCov(y,u)=Cov(y,A′x)=Σ21ACov(y,v)=Cov(y,B′y)=Σ22B
典型相关系数和普通相关系数
从定义可以看出 当p=q=1的时候 典型相关就是普通相关系数
当p=1 or q=1的时候 他是复相关系数
可见,复相关是典型相关的一个特例,而简单相关是复相关的一个特例
他们的大小也是有联系的
第一典型相关系数至少同x(或y)的任一分量与y(或x)的复相关系数一样大(可从第一典型相关的定义看出)
即使所有这些复相关系数都较小,第一典型相关系数仍可能很大
复相关系数也不会小于的任一分量之间的相关系数(可从复相关的定义看出)
即使所有这些相关系数都较小,复相关系数仍可能很大。
标准化后的典型相关系数
有时候我们会对各个分量进行标准化后再进行典型相关系数的计算
我们前面的计算并没有标准化,这点和因子分析,主成分分析这两种经典的降维手法完全不一样
标准化后的协方差矩阵就是相关矩阵,我们可以基于相关矩阵计算典型相关系数 经过完全一样的原理的计算
典型相关系数这个概念对标准化的变换具有不变形,但是这不意味着我们的线性组合的系数也对此具有不变性,这点源于普通相关系数和复相关系数的推广
样本典型相关
在实际的应用中,我们使用样本相关矩阵来估计总体的相关矩阵;使用完全一致的计算手法,我们可以计算出典型相关系数 典型变量 还有他们线性组合的系数
在实际操作中,我们一般使用标准化后再计算的方式(使用相关矩阵计算的方式) 这样系数也有分析的价值
典型相关是一种纯数值上的研究方法 虽然确实有得分的概念但是使用起来并没有什么价值
我们需要理解的重点是
如何计算典型相关变量的系数,相关系数;并且尝试根据组合系数来进行合理的解释,这也是使用线性组合后的常用统计分析手法
典型相关系数的检验
全部总体典型相关系数均为零的检验
考虑假设检验问题
H0:ρ1=ρ2=⋅⋅⋅=ρm=0,H1:ρ1,ρ2,⋅⋅⋅,ρm 至少有一个不为零
建立似然比统计量
Λ1=i=1∏m (1-ri2)
对于充分大的n 当原假设成立的时候 统计量
Q1=−[n−21(p+q+3)]lnΛ1
服从自由度为pq的χ2分布
当检验统计量过大的时候 单侧检验拒绝原假设 认为典型变量之间的相关性是显著的 否则认为是不显著
部分总体典型相关系数为零的检验
我们自然的希望尽可能少的使用典型相关变量的对数 因此我们需要对一些较小的典型相关系数进行是否为0的假设检验 思路如下
考虑假设检验问题
H0:ρ2=⋅⋅⋅=ρm=0,H1:ρ2,⋅⋅⋅,ρm 至少有一个不为零
如果原假设被接受 那么就是只有第一对典型变量显著,否则的话我们认为第二对也是显著的 继续执行假设检验
H0:ρ3=⋅⋅⋅=ρm=0,H1:ρ3,⋅⋅⋅,ρm 至少有一个不为零
如此循环 执行序贯检验
检验统计量为
Λk+1=i=k+1∏m (1-ri2)
其中的k对应着此时我们检验顺序 当k=0的时候 是前面的全部总体检验,后续是除去前k个对后续检验
对于足够大的n 原假设成立的时候
Qk+1=−[n−k−21(p+q+3)+i=1∑kri−2]lnΛk+1
服从自由度为(p−k)(q−k)的χ2分布 拒绝原则同上
关联分析
基本概念
关联的基本概念
自然界中某种事物发生时其他事物也会发生的联系称之为关联
关联是两个或多个变量取值之间存在的一类重要的可被发现的某种规律性
关联可分为简单关联、时序关联、因果关联
- 简单关联指的是在不考虑时间顺序的情况下,探索两个或多个变量之间是否存在某种统计上的联系。这种关联通常基于变量的共现频率,即在数据集中这些变量同时出现的次数。
- 时序关联关注的是变量之间随时间变化的关系 他是一种更广的时间序列分析方法,研究多个事件与时间之间的联系
- 因果关联是一种更为深入的关联分析,它不仅探索变量之间的联系,还试图确定一个变量是否导致了另一个变量的变化,即是否存在因果关系,属于因果推断的范畴
关联分析基本概念
关联分析目的是寻找给定数据记录集中数据项之间隐藏的关联关系,描述数据之间的密切度
关联分析的结果常有两种:关联规则 和 序列模式
- 关联规则用于寻找在同一个事件中出现的不同项的相关性
- 序列模式与此类似,但它寻找的是事件之间时间上的相关性
关联规则
关联规则发现的主要对象是交易型数据库
关联规则是描述在一个交易中物品之间同时出现的规律的知识模式,更确切的说,关联规则是通过量化的数字描述物品X的出现对物品Y的出现有多大的影响
他的产生是为了进行购物篮分析 也就是研究哪些商品顾客可能会在一次购物时同时购买 借此来帮助我们的商品的销售 借此更好的销售商品
现在,关联规则也可以被用于其他数据的研究,他的核心是研究若干定性自变量的关联
关联规则的形式化定义
只有严格的数学定义才方便我们后面进行进一步的模型建立,此处我们还是以交易数据库为基础进行相关的定义
关联规则挖掘的交易数据集记为D 其中D= {T1, T2, …, Tk, …,Tn} 其中的 Tk 称为一个交易 每个交易都有单独的编号称为TID;
所有可以购买的商品称为项 用元素 im 来表示 I={i1, i2, …, im} 是D中全体元素的集合 所有的Tk都 I的子集
设两个项集X,Y 他们都是I的子集并且交集非空 形如 X==>Y 的表达式称为关联规则
关联规则的度量
所有的关联规则都有着表达式
X⇒Y[s,c]
也就是 关联都具有置信度c 和支持度 s 他是我们对一个关联规则最关注的度量
- s 表示两者同时出现的概率
- c 表示 X 出现的情况下 Y出现的概率 一种条件概率
计算方法根据定义很容易给出 我们这里不给出公式了
仅仅使用支持度置信度评价关联规则是不足的,因为他们没有考虑非均衡这一广泛存在的问题 因此给出定义
- 期望可信度:描述了对于关联规则X==>Y在没有任何条件影响时,Y在所有交易中出现的频率有多大。即没有X的作用下,Y本身的支持度
- 改善度 :描述X的出现对Y的出现影响多大,是置信度与期望可信度的比值
- 兴趣度:Max{置信度,支持度}置信度-支持度一条规则的兴趣度大于0,实际利用价值越大;小于0则实际利用价值越小。
关联规则挖掘
同时满足最小置信度阈值和最小支持度阈值的关联规则为强关联规则,是有意义有价值。
挖掘关联规则问题就是产生支持度和置信度分别大于用户给定的最小支持度阈值和最小置信度阈值的关联规则
关联规则挖掘
基本概念
- k项集:包含k个项的集合
- 项集的频率是指包含项集的事务数
- 如果项集的频率大于 最小支持度×D中的事务总数,则称该项集为频繁项集
据此 挖掘交易数据库D中所有关联规则的问题可以被划分为两个子问题
- 找出所有具有最小支持度的频繁项集
- 项集) 。使用频繁项集生成期望的关联规则
Apriori算法
Apriori 算法 利 用 频 繁 项 集 性 质 的 先 验 知 识 ( prior knowledge),通过逐层搜索的迭代方法,即将k-项集用于探察(k+1)-项集,来穷尽数据集中的所有频繁项集 他迭代一次就需要扫描一次数据库
他在利用性质 :频繁项集的非空子集也是频繁的 进行搜索
他的基本执行模式为:
- 输入:数据集合D,支持度阈值α
- 输出:最大的频繁k项集
步骤
- 扫描整个数据集,得到所有出现过的数据,作为候选频繁1项集(k=1,频繁0项集为空集)
- 挖掘频繁k项集
- 扫描数据计算候选频繁k项集的支持度
- 去除候选频繁k项集中支持度低于阈值的数据集,得到频繁k项集。如果得到的频繁k项集为空,则直接返回频繁k−1项集的集合作为算法结果,算法结束。如果得到的频繁k项集只有一项,则直接返回频繁k项集的集合作为算法结果,算法结束。
- 基于频繁k项集,连接生成候选频繁k+1项集。
- 令k=k+1,转入步骤2
同时满足最小支持度和最小置信度的才是强关联规则,从频繁项集产生的规则都满足支持度要求 我们需要手工计算置信度来排除一些关联规则 剩下的就是我们可以用的强关联规则了
Apriori算法运算效率非常低下,但是他们后面各种关联规则算法的基础,他们大多在效率方面对Apriori算法进行了很大的改进
多种关联规则
- 简单关联规则:如篮球=>篮球服,只涉及物品
- 量化关联规则:涉及数值类型的 我们改变了关联规则研发初期只用于非类变量的规则
- 多维关联规则:性别=“男”=> 购买=“篮球”,涉及两个维
- 跨层关联规则:
- 同层关联规则:Adidas篮球=> Nike篮球服
- 层间关联规则:篮球=> Nike篮球服
对于涉及数值字段的量化关联规则 我们需要将原始数值离散化才可以用于关联规则的生成;这种离散化可以预定义方法 也可以在关联规则建立的同时生成 后者往往效果更好 毕竟毫无理由的离散化往往会带来负面效果 R Visualization 的“谨慎处理数据”一节
挖掘跨层关联规则需要更加先进的算法和预先的层级设置 这里不介绍了
由关联分析到相关分析
·我们需要一种度量事件间的相关性或者是依赖性的指标
A和
B间的相关性:
corrA,B=(PA∪B)P(A)P(B)=P(B∣A)/P(B)
⋅当项集
A的出现独立于项集B的出现时,
P(A∪B)=P(A)P(B) 即corr
A,B=1,表明
A与B无关,corrA,B>1 表明
A与B正相关,corr
A,B<1 表明
A与B负相关。
·将相关性指标用于前面的例子,可以得出录像带和游戏将的相关性为:
P({game,video})/(P({game})×P({video}))=0.4/(0.75×0.6)=0.89
结论:录像带和游戏之间存在负相关
集中趋势和位置的度量
数理统计中的经典概念
均值
普通的均值定义为
x=n∑i=1nxi
在部分情况下我们使用加权平均数 也就是我们拥有了数据之间重要性的差异
x=∑i=1kwi∑i=1kwix,
我们还可以给出集合平均数
x1⋅x2⋯xn
不过他在传统的统计学中很少出现
中位数
为了规避了部分极端异常值的影响 提升稳健性,我们引入的中位数的概念 ^dd161e
分位数研究的是数据的相对位置 根据各个样本之间的位置来确定
我们可以使用中位数作为集中趋势的度量 当然也可以采用 极差中点
2x1+xn
有序分类的数据只能靠众数和分位数来研究
众数
数据中出现的最多的数,只在有一些特殊情况下被研究
分类数据的集中趋势只能依靠众数研究
EDA中集中趋势的度量
无论是这里还是后面关于离散的部分 EDA中的度量方法的核心目的只有一个 提升估计量的稳健性 也就是
- 统计量对少量的大偏差数据不敏感
- 统计量对大量的小偏差数据不敏感
因此我们对统计量进行了修正
L统计量
我们取 X(i) 是第i个次序统计量 希望通过次序统计量来增加估计量的稳健性 正如我们在中位数中进行的那样 本文“相关段落”一节
L估计量的形式为
T=i=1∑raiX(i)
我们后面介绍各种估计量都是一种L估计量 包括前面介绍的均值 中位数 众数也是 当然加权均值也是如此
在介绍了L统计量以后 我们就可以引出一大类估计量 截尾均值 也就是截掉头尾的若干量后计算均值 (允许只截取一部分,也就是降低他的权重,但是不建议这么做)
- 百分之X 截尾 前后各去掉百分之X
- 中均值:取中间的百分之五十
- 中位数:只要中间的一个到两个
- 三均值:四分位数的三个的均值
集中趋势估计量效果的评估
在对方差研究后我们给出下面的结论 下面的n指样本
- n<6 使用中位数
- n=7 每一侧的尾部去掉两个
- n>8 两侧个截取百分之二十五
离散趋势的度量
下面我们来考虑用一个量研究数据的离散程度
经典数理统计中的经典概念
偏差
我们可以考虑极差
xn−x1
或者考虑平均偏差
i=1∑n(xi−x)/n
方差与标准差
在数理统计中我们已经不止一次研究这个量了
σ2=N∑i=1N(xi−μ)2
它是衡量数据离散程度的最常用的量
对应的有标准差 它和原始数据有着相同的单位 是方差开根
为了处理样本的无偏性问题对样本方差有修正(标准差随之修正)
s2=n−1∑i=1π(xi−xˉ)2
相对偏离程度的度量(变异系数)
下面给出的量是没有单位的 我们可以跨多个样本进行比较
定义变异系数为
V=μσ
EDA中的离散度量
这里我们除去前面的度量方法 一些具有robust性质的度量方法
样本中位数离差
AD=n1i=1∑n∣xi−M∣
其中M 是样本中位数
样本中位绝对离差
MAD=mediani{∣xi−M∣}
我们计算所有离差又计算了中位数
R中样本中位绝对离差和它相差了一个约为1.4的系数 目的是估计样本方差 在实际计算中 我们基本可以无视这个差距
四分位差
我们考虑四分位数的差值
IQR=dF=FU−FL
和它对应的有我们在研究离散程度和异常值检验中非常常用的箱线图和五数概括
几种离散度量效果的评估
在不同的分布中研究这些统计量对离散的概括程度我们可以得到一个非常简单但是重要的结论
四分位差是对样本离散程度概括的最好的量,有着最好的效率
分布形状的度量
他们侧重于研究样本的两个特征,他们的中心是否集中(集中趋势的度量)和偏差是否不均匀(离散趋势的度量) 都是分布形状的体现
他们的特点在于和正态分布比较
偏度系数(skewness)
g1=(n−1)(n−2)s3ni=1∑n(xi−x)3=(n−1)(n−2)s3n2μ3,
对分布是否对称的研究 对称时偏度系数为0
峰度系数(kurtosis)
g2==(n−1)(n−2)(n−3)s4n(n+1)∑i=1n(xi−x)4−3(n−2)(n−3)(n−1)2(n−1)(n−2)(n−3)s4n2(n+1)μ4−3(n−2)(n−3)(n−1)2,
对分布峰值研究 其中峰度大于正态分布的时候比0大 否则比0小 正态分布峰度系数为0
描述性统计可视化
在基本的描述性统计中,我们不需要讨论太多的可视化手段,这里介绍的基本的描述性统计手法都只涉及Excel中的一部分,他们包括
特别的,我们这里补充一个比较不常用但是对于统计学本身重要的图形数理统计 的“经验分布函数”一节