Descriptive Statistics and Visualization: Measurement, Distances, and Statistical Graphics

Hyacehila

内容概述

统计分析与描述性统计分析

统计分析:从表现数据中得出其规律性的过程

统计分析是整个统计学研究中最核心的一部分,比数据的收集重要也复杂的多,我们的大部分课程内容都属于统计分析范畴

在统计分析发展的过程中 统计学家对如何整理数据的思想方法产生了分歧 因此产生了两个主要的分支 描述性统计分析和推断性统计分析

  • 描述性统计分析研究如何整理与描述数据(如常见的离散集中趋势,一些可视化手段)
  • 推断性统计分析利用样本去反推总体的情况(如参数估计和假设检验)

两者互相成就 不能偏废

在这里我们着重研究描述性统计分析;作为研究数据形状的分支,描述性统计分析和数据分析中的探索性数据分析联系紧密

一些常用的数据分类方式

测度

根据数据的单位的不同的 我们给出下面的分类方式

  • 间隔变量(定量变量):可以连续变化的变量
  • 有序变量:没有明确的数量变化 而是等级变化
  • 定类变量:变量用一些类来表示 类之间是平等的

数据的来源

根据数据的来源不同,有下面的分类

  • 观测数据:对现实世界进行观测收集的数据
  • 试验数据:人为控制变量进行试验收集的数据

与时间的联系

  • 截面数据:同一个时间观测不同的对象收集的数据(列是特征,行是不同的对象)
  • 时间序列数据:对同一个对象在不同时间进行观测收集到的数据(列是特征,行是不同的时间)
  • 面板数据:同时含有前两者的特征,多个对象多个时间的多次观测(列是对象与特征,行是不同时间的观测)面板数据进行回归分析一定会涉及到各个观测很强相关性的问题,也就是非I.I.D抽样,这会严重影响分析效果

距离和相似系数

距离

定义

和我们在泛函分析中研究的一样 对于距离有下面的定义要求 参见泛函分析 的“度量空间的定义”一节。

部分情况下 我们可能违背这个基本定义来主观确定距离 如果我们确实需要 在聚类分析中 我们有下面一些比较常用的距离

明考夫斯基(Minkowski)距离

d(x,y)=[i=1pxiyiq]1/qd\left(x,y\right)=\left[\sum_{i=1}^{p}|x_{i}-y_{i}|^{q}\right]^{1/q}

明氏距离是使用的最广泛的距离 当q=1q=1的时候 他就是我们学过的绝对值距离 当q=2q=2的时候 他就是欧氏距离 当q=q=\infty 的时候 d(x,y)=max1iρxiyid\left(x,y\right)=\max_{1\leqslant i\leqslant\rho}\mid x_{i}-y_{i}\mid 称为切比雪夫距离

随着qq的增大 明氏距离对异常值就越来越敏感 正如我们在介绍欧氏距离的时候一样 参见多元统计引论 的“欧氏距离”一节。

明氏距离也需要先进行标准化再进行操作 明氏距离适用于有序变量之间的距离计算

兰氏(Lance 和 Williams)距离

当所有的数据均为正的时候 定义兰氏距离

d(x,y)=i=1pxiyixi+yid(x,y)=\sum_{i=1}^{p}\frac{|x_{i}-y_{i}|}{x_{i}+y_{i}}

它在处理较为偏斜并且含有异常值的数据的时候有很好的效果 并且和单位无关

马氏距离

多元统计引论 的“马氏距离”一节 在聚类分析中 我们一般不使用马氏距离 因为类是在动态变化的 我们很难给出一个确定的协方差矩阵

Hamming距离

汉明距离(Hamming Distance) 是一种用于衡量两个等长字符串(或序列)在相同位置上不同元素的个数的度量方法。 其思想非常简单,相同位置上对应的字符(类别)不同,则Hamming距离加一,计算整个字符串(或序列)的每一个位置即可

Levenshtein 距离

Levenshtein 距离,又称编辑距离,是衡量两个字符串之间的差异的一种方法。它通过计算将一个字符串转换成另一个字符串所需的最少操作次数来量化这种差异。他是Hamming距离的拓展,也可以用于多个分类特征

常见的操作有:

  1. 插入:在字符串中插入一个字符。
  2. 删除:从字符串中删除一个字符。
  3. 替换:将字符串中的一个字符替换成另一个字符。

我们根据变换字符串操作的次数,决定Levenshtein 距离,他需要使用动态规划进行求解

VDM距离 (Value Difference Metric)

Value Difference Metric(VDM,值差异度量) 是一种用于分类任务的相似性度量方法,特别适用于处理名义属性(即类别型特征)的数据。

VDM的核心是通过概率差异来衡量两个样本在某个特征上的相似性

  • 对于每个类别型特征,VDM计算该特征不同取值在各目标类别下的条件概率。
  • 两个样本在该特征上的差异,由它们各自取值对应的条件概率差异决定。

VDM距离衡量的是两个样本在各特征上,其取值对应的目标类别分布差异的累积程度。距离越大,说明两样本的各个特征值对分类结果的贡献差异越显著,属于同一类别的可能性越低。

想要计算VDM距离需要使用下面的步骤,我们研究的特征都是离散的,也就是一个分类的特征

计算条件概率;对于特征AA的某个取值aa,其在目标类别cc下的条件概率为:

P(cA=a)=类别为c,特征取值为a的样本数特征取值为a的样本数P(c\mid A=a)=\frac{\text{类别为}c,\text{特征取值为}a\text{的样本数}}{\text{特征取值为}a\text{的样本数}}

计算单特征VDM距离; 样本为x,yx,y 只研究特征 AA 两个样本在特征AA的取值分别为ax,aya_x,a_y CC是目标类别的总数

VDMA(x,y)=c=1C[P(cA=ax)P(cA=ay)]2\mathrm{VDM}_A(x,y)=\sum_{c=1}^C\left[P(c\mid A=a_x)-P(c\mid A=a_y)\right]^2

计算多特征的两样本 VDM 距离;

VDM(x,y)=i=1mVDMAi(x,y)\mathrm{VDM}(x,y)=\sum_{i=1}^m\mathrm{VDM}_{A_i}(x,y)

通过混合使用VDM距离和欧氏距离就可以实现混合属性上的距离度量,这一般称为HVDM;部分情况下需要对VDM的特征进行加权,来区分更为重要的特征

VDM方法基于条件概率,当样本数量较少的时候这种估计可能相当不准确,甚至存在0概率的问题

VDM设计目标是分类问题,不可用于回归或任务。通过把现有的簇中心作为伪标签,使用动态聚类方法更新新的簇结果,重新计算VDM距离,多次迭代得到最终的结果,可以间接给聚类问题使用

相似系数

定义

和距离不一样的是,相似系数越大,意味着两个样本之间越接近,而距离是越小意味着越接近;我们可以用距离导出相似系数,但是也可以重新定义一些相似系数。相似系数一般情况都在[0,1][0,1]中,当然也有少数情况可能违背。

夹角余弦

定义相似系数为

cosθy=k=1nxkixkj[(k=1nxkj2)(k=1nxkj2)]1/2\mathrm{cos}\theta_{y}=\frac{\sum_{k=1}^{n}x_{ki}x_{kj}}{\left[\left(\sum_{k=1}^{n}x_{kj}^{2}\right)\left(\sum_{k=1}^{n}x_{kj}^{2}\right)\right]^{1/2}}

它就是在计算两个向量之间的夹角的余弦值,此时我们只关注向量的角度而不关注数值的大小,对于存在稀疏的高维数据非常有效

相关系数

用两个向量间相关系数来刻画相似

cor=i=1n(aiAˉ)(biBˉ)i=1n(aiAˉ)2i=1n(biBˉ)2cor=\frac{\sum_{i=1}^n(a_i-\bar{A})(b_i-\bar{B})}{\sqrt{\sum_{i=1}^n(a_i-\bar{A})^2\sum_{i=1}^n(b_i-\bar{B})^2}}

其中ai,bia_i,b_i是样本A,BA,B的各个分量,我们已经对其进行了规范化,Aˉ,Bˉ\bar{A},\bar{B} 是向量A,BA,B自己的均值,是样本的均值而不是特征的均值。

特别的,我们非常不支持使用两个向量间相关系数研究样本相似度,在下面的应用场景除外

  • 样本特征是时间序列,此时我们可以认为同一样本内近似同分布,因此可以使用相关系数
  • 若样本的特征代表某种分布(如某用户的兴趣分布、某图像的像素直方图)如用户A对5个商品类别的兴趣评分 [5,3,1,0,2][5,3,1,0,2] 用户B对5个商品类别的兴趣评分 [3,1,2,0,3][3,1,2,0,3] 此时相关系数意味着偏好程度的相似性。

Jaccard系数

Jaccard Index(雅卡尔指数)是用于衡量两个集合相似度的一个指标。它主要用于计算两个集合之间的 相似度,特别是适用于 二元特征集合类型的数据

对于二元特征,我们可以如下计算,公式为

J(A,B)=ABABJ(A, B)=\frac{|A \cap B|}{|A \cup B|}
  • 交集:表示两个样本在相同特征上都为 1 的位置
  • 并集:表示两个样本至少在一个样本中该特征为 1 的位置

对于集合类特征,每个样本都是一些无序的集合,计算交集和并集的元素的个数,做比即可,公式仍为

J(A,B)=ABABJ(A, B)=\frac{|A \cap B|}{|A \cup B|}

相关分析

相关分析简介

这里我们的目的很简单 通过数据分析来研究几组数据之前是否存在相关关系并且度量这样的关系 相关关系:当一个或几个变量变化时 与之对应的另一个变量虽然值不能确定 但是会按照某种规律进行变化

相关关系不是因果关系 他研究的两个变量之间的地位是均等的

变量之间的相关性分为两种 确定性的函数关系和非确定性的相关关系 很明显在统计学中我们更多的研究后者 前者需要对事件的内在特征有很多的掌握

从相关关系的模糊定义就能看出 他一定广泛存在于现实世界和我们的统计数据中 这就是为什么他值得我们重视并且研究

从被研究的数据的结构上看 相关分析分为数值数据相关分析 定序数据相关分析 定类数据相关分析

三种相关系数

相关系数

两个随机变量的相关系数 刻画了二者的线性的相关性

相关系数刻画线性相关性 哪怕有某种函数关系 但是是非线性的;两个随机变量之间的相关系数还是0 如

XN(0,1),Y=cosX,Z=X2X\sim N(0,1),Y=cosX,Z=X^2Corr(X,Y)=0,Corr(X,Z)=0Corr(X,Y)=0,Corr(X,Z)=0

我们可以验证这一点 当相关系数在(0,1)(0,1)的时候 证明存在一定程度的线性相关关系 但并不完全

虽然相关系数只刻画线性相关关系 但是他依然是应用的最广泛的指标 我们提出了很多其他的相关指标并没有替代他 除去其他指标过于复杂以外;还因为 二维正态分布的不线性相关和独立是等价的

也就是 相关系数在总体都是正态的情况下 就是相关性的度量 而不仅仅是线性相关性的度量

复相关系数

我们希望能够研究一个随机变量和一个随机向量的相关性,并且把它刻画成一个数值 根据前面的介绍,一个非常简单的想法是 利用随机向量的一个线性组合描述他的全部信息,然后研究线性组合和随机变量的相关性;我们称线性组合和随机变量之间的最大相关系数为复相关系数 容易有

ρ2(y,lx)=Cov2(y,lx)V(y)V(lx)=(σxyl)2σyylΣxxl(σxyΣxx1σxy)(lΣxxl)σxylΣxxl=(σxyΣxx1σxy)σxy\begin{aligned} \rho^{2}\left(y,l^{\prime}x\right)& =\frac{Cov^{2}\left(y,l^{\prime}x\right)}{V\left(y\right)\cdot V\left(l^{\prime}x\right)}=\frac{\left(\sigma_{xy}^{\prime}l\right)^{2}}{\sigma_{yy}\cdot l^{\prime}\Sigma_{xx}l} \\ &\leqslant\frac{\left(\boldsymbol{\sigma}_{xy}^{\prime}\boldsymbol{\Sigma}_{xx}^{-1}\boldsymbol{\sigma}_{xy}\right)\left(\boldsymbol{l}^{\prime}\boldsymbol{\Sigma}_{xx}\boldsymbol{l}\right)}{\boldsymbol{\sigma}_{xy}\cdot\boldsymbol{l}^{\prime}\boldsymbol{\Sigma}_{xx}\boldsymbol{l}}=\frac{\left(\boldsymbol{\sigma}_{xy}^{\prime}\boldsymbol{\Sigma}_{xx}^{-1}\boldsymbol{\sigma}_{xy}\right)}{\boldsymbol{\sigma}_{xy}} \end{aligned}

当时l=Σxx1σxyl=\Sigma_{xx}^{-1}\sigma_{xy} 等号成立 则有

ρyx=maxl0ρ(y,lx)=ρ(y,σxyΣxx1x)=σxyΣxx1σxyσyy=ρxyRxx1ρxy\begin{gathered} \rho_{y}\cdot x =\max_{l\neq0}\rho\left(y,l^{\prime}x\right)=\rho\left(y,\sigma^{\prime}_{xy}\boldsymbol{\Sigma}_{xx}^{-1}\boldsymbol{x}\right) \\ =\sqrt{\frac{\sigma_{xy}^{\prime}\Sigma_{xx}^{-1}\sigma_{xy}}{\sigma_{yy}}}=\sqrt{\rho_{xy}^{\prime}R_{xx}^{-1}\rho_{xy}} \end{gathered}

综合可以给出结论

  • p=1p=1的时候 复相关系数自然退化为普通的相关系数
  • 复相关系数为为0意味着不相关
  • 复相关系数对单位变化具有不变性
  • 当随机向量的分量相互独立 有复相关系数的平方时单个相关系数平方和 在多元正态的假定下 样本复相关系数为(复相关系数的极大似然估计为)
ry.x=sxySxx1sxysyy=rxyR^xx1rxy.r_y._x=\sqrt{\frac{s_{xy}^{\prime}\boldsymbol{S}_{xx}^{-1}\boldsymbol{s}_{xy}}{s_{yy}}}=\sqrt{\boldsymbol{r}_{xy}^{\prime}\hat{\boldsymbol{R}}_{xx}^{-1}\boldsymbol{r}_{xy}}.

偏相关系数

在我们研究最普通的相关系数的时候,我们往往计算Pearson相关系数;事实上,他会被间接的相关性影响,所以我们一般也称它为总相关系数,现在 我们想消除这种间接的影响 研究最普通的相关性 定义

Σ11.2=Σ11Σ12Σ221Σ21=(σijk+1,,p)\boldsymbol{\Sigma}_{11}\boldsymbol{.}_2\boldsymbol{=}\boldsymbol{\Sigma}_{11}-\boldsymbol{\Sigma}_{12}\boldsymbol{\Sigma}_{22}^{-1}\boldsymbol{\Sigma}_{21}=(\boldsymbol{\sigma}_{i\boldsymbol{j}}\boldsymbol{\cdot}_{k+1,\cdots,p})

x2x_2给定的时候 x1x_1的偏协方差矩阵 他的对角线元素称为偏协方差 对角线元素称为偏方差 定义

ρij+k+1,,p=σijk+1,,pσiik+1,,pσjjk+1,,p,1i,jk\rho_{ij+k+1,\cdots,p}=\frac{\sigma_{ij}\cdot_{k+1,\cdots,p}}{\sqrt{\sigma_{ii}\cdot k+1,\cdots,p\sigma_{jj}\cdot_{k+1,\cdots,p}}},\quad1\leqslant i,j\leqslant k

x2x_2给定的时候 xi,xjx_i,x_j(pk)(p-k)阶偏相关系数 他剔除了xk+1x_{k+1}xpx_{p}的线性影响 在多元正态的假定下 偏相关系数的极大似然估计(样本偏相关系数为)

ry^k+1,,p=syk+1,,pSp^k+1,,pSjjk+1,,pr_{\hat{y}\cdot k+1,\cdots,p}=\frac{s_{\vec{y}}\cdot k+1,\cdots,p}{\sqrt{S_{\hat{p}}\cdot k+1,\cdots,pS_{jj}\cdot k+1,\cdots,p}}

其中

S11.2=S11S12S221S21=(sij.k+1,,p)S_{11}._{2}=S_{11}-S_{12}S_{22}^{-1}S_{21}=\left(s_{ij}._{k+1},\cdots,p\right)

定量数据相关性分析(Pearson相关性系数)

相关关系的描述和测度

相关关系描述

在进行相关关系分析之前 我们有一个非常核心的基本假定 我们只研究线性相关性 我们只研究变量之间的线性相关性 我们在概率论 数理统计 很多门课程中都已经强调了这一点 对于只有两个变量的定量相关关系描述 绘制散点图并且拟合就能得到大致的关系 但是我们需要一种更加精确的定量的方法

相关关系测度

这里我们直接温习并且给出概率论中的相关系数rr

r=(xx)(yy)(xx)2(yy)2,r=\frac{\sum\left(x-\overline{x}\right)\left(y-\overline{y}\right)}{\sqrt{\sum\left(x-\overline{x}\right)^2}\cdot\sqrt{\sum\left(y-\overline{y}\right)^2}},

复习一下概率论中已经给出的那些性质 毕竟后面还会用到

  • 取值范围是[1,1][-1,1]
  • 具有对称性
  • 相关系数大小和x,yx,y的原点和尺度无关
  • 只研究线性关系(但是可以对原始数据作非线性变换)
  • 不保证两者之间存在因果关系 这点和相关系数大小无关

这样的相关系数rr 现在我们称其为Pearson相关系数 他仅仅是衡量相关性的一小部分 后面还有很多的统计学家为相关性研究做出了贡献

一般Pearson相关系数使用的前提是 x,yx,y 都是正态连续的变量 变量样本数据应该成对出现 每一组数据之间应该相互独立 样本数应该大于30 一般这些条件都会假设成立

相关系数的大小与相关性的强弱

传统意义上认为 相关系数判断相关性一般遵照以下规则

  • 0.8以上 强相关
  • 0.5以上 中度相关
  • 0.3以上 弱相关
  • 0.3以下 不相关

相关性的假设检验

对于相关系数的显著性检验一般采用tt 检验 建立假设

H0:ρ=0;H1:ρ0\begin{aligned}H_{0}:\rho=0;\\H_{1}:\rho\neq0。\end{aligned}

引入检验统计量

t=rn21r2t(n2)t=|r|\sqrt{\frac{n-2}{1-r^{2}}}\sim t\left(n-2\right)

执行双侧的tt检验就可以了

在大样本的情况下 基本上所有的相关系数假设检验都会被认为是显著的 所以实际操作上有时会省略,我们后面就不再提了

定序数据的相关性分析(Spearman秩相关系数与Kendall秩相关系数)

首先我们需要明确到底什么是定序数据;

Spearman秩相关系数的引出

这里本质上是在补充Pearson相关系数需要样本数据在逻辑上等距的要求 只要求他有大小的关系就可以了

也就是在这里 我们把数值型数据的分析改为了品质型数据

注意:参与分析的变量这里都要进行品质化 哪怕其中有一个原本符合Pearson相关性检验的要求

对于原始数据xi,yix_{i},y_{i} 根据从小到大的顺序对他们分别进行排序 得到每组数据分别的位置序号xi,yix_{i}^{'},y_{i}^{'} 称为原始数据的秩次 记秩次的差为did_{i} 那么能给出Spearman相关系数的公式为

ρs=16di2n(n21),\rho_{s}=1-\frac{6\sum d_{i}^{2}}{n\left(n^{2}-1\right)},

对于相关系数和相关性强弱的分析 Spearman和Pearson是一致的

Kendall秩相关系数的引出

肯德尔相关系数,又称肯德尔秩相关系数,它也是一种秩相关系数,不过,它的目标对象是有序的类别变量,比如名次、年龄段、肥胖等级(重度肥胖,中度肥胖、轻度肥胖、不肥胖)等。它可以度量两个有序变量之间单调关系强弱。肯德尔相关系数使用了“成对“这一概念来决定相关系数的强弱。

成对可以分为一致对(Concordant)和分歧对(Discordant)。一致对是指两个变量取值的相对关系一致,可以理解为X2-X1与Y2-Y1有相同的符号;分歧对则是指它们的相对关系不一致,X2-X1与Y2-Y1有着相反的符号。每个对需要涉及两个变量共四个元素

肯德尔系数有两个计算公式,一个是Tau-a,另一个是Tau-b。两者的区别是Tau-b可以处理有相同值的情况,即并列(tied ranks),我们需要分别介绍

对于Tau-a

Tau-a=cd12n(n1)\text{Tau-a}=\frac{c-d}{\frac{1}{2}n(n-1)}

其中nn是样本数,分母衡量总共可能的组合数,没有重复的时候为c+dc+d cc是一致对数,dd是分歧对数

Kendall相关和Spearman相关本质不同,前者是Pearson相关的秩次改进,后者是基于分歧与一致对的研究,其对于本身就是排序的问题更敏感,对异常值和非线性关系不敏感,不属于线性相关系数的范畴。

若两个数据对的秩相同(即重复),它们既不被视为协同对,也不被视为不一致对。但重复值会影响分母的计算(总对数需扣除重复对)。也就是Tau-b

Tau-b=cd(c+d+tx)(c+d+ty)\text{Tau-b}=\frac{c-d}{\sqrt{(c+d+t_x)(c+d+t_y)}}

其中tx,tyt_x,t_y是 XXYY 中的重复对数。

以上的Tau-a,Tau-b都仅适用于正方形表格,也就是 两个变量秩数需要是一样的 如果是长方形表格,按照如上公式计算可能最大值小于1,为此引入Tau-1的改进Tau-c

Tau-c=2m(cd)n2(m1)\text{Tau-c}=\frac{2m(c-d)}{n^2(m-1)}

其中mm是行数和列数中的较小值,nn为样本量。

定性数据的相关性分析(列联表分析)

列联表(contingency table)是对定类数据分析的基础 他是观测数据按照两个以上数据进行分类时列出的频数表

列联表的定义

假定一个总体中的个体按照两个属性A,BA,B进行划分 类别数分别有rr种和cc种 我们抽取一组样本 fijf_{ij} 是所属类别的观察频数 这样我们就可以构造一个二维的rcrc列联表 对于更多的属性维度自然可以进行拓展 只是更不容易进行直观的表述 而且使用的也有限 我们这里仅仅是对列联表的最基础的研究 后续我们有对应分析研究更多的关于列联表的分析 多元统计分析 的“对应分析”一节

列联表的独立性检验

对于研究列联表中的两个变量是否相关或者独立 我们不得不引入列联表的独立性检验这一手段 这一点我们在对应分析中有过了介绍 多元统计分析 的“独立性检验”一节

列联表相关系数

采用χ2\chi^2值的手段研究列联表的相关系数(度量相关程度的大小)是本节的核心 我们介绍三种方法并且给出适用的情况 列联表只有分类,没有大小的概念,所以相关系数应该都是正的,不存在正相关和负相关的区别,他们都是相关的

φ\varphi相关系数

用来度量2×22\times 2列联表的相关程度 计算公式为

φ=χ2n,\varphi=\sqrt{\frac{\chi^{2}}{n}},

其中

χ2=i=12j=12(fijeij)2eij\chi^{2}=\sum_{i=1}^{2}\sum_{j=1}^{2}\frac{\left(f_{ij}-e_{ij}\right)^{2}}{e_{ij}}

最后化简得到结果

φ=χ2n=adbc(a+b)(c+d)(a+c)(b+d)\varphi=\sqrt{\frac{\chi^{2}}{n}}=\frac{ad-bc}{\sqrt{\left(a+b\right)\left(c+d\right)\left(a+c\right)\left(b+d\right)}} φ\varphi相关系数分析正负没有意义 只需要研究绝对值

其相关程度大小和相关系数大小与相关程度的判断沿用Pearson相关系数

CC相关系数

适用于更大的列联表 是φ\varphi相关系数的理论拓展 计算公式为

C=χ2χ2+n,C=\sqrt{\frac{\chi^{2}}{\chi^{2}+n}},

其中

χ2=i=11j=1c(fijeij)2eij\chi^{2}=\sum_{i=1}^{1}\sum_{j=1}^{c}\frac{\left(f_{ij}-e_{ij}\right)^{2}}{e_{ij}}

分析系数的大小的含义和Pearson相关系数是一样的 能看到 CC相关系数和列联表的行数和列数有联系 因此不要比较多列联表的系数关系 这些列联表之间的行数和列数可能不一样 此时分析会失去意义

VV相关系数
V=χ2nmin[(r1),(c1)]=χ2n(m1)V=\sqrt{\frac{\chi^{2}}{n\cdot\min\left[\left(r-1\right),\left(c-1\right)\right]}}=\sqrt{\frac{\chi^{2}}{n\left(m-1\right)}}

需要注意的是,两个不同行数或列数的列联表计算所得的V相关系数不适宜进行比较; 当min(r,c)=2min(r,c)=2的时候 他就是φ\varphi相关系数(的一种推广形式)

列联表分析注意事项

  • 对于存在因果关系的量进行列联表分析 自变量应在行处 因变量在列处
  • 数据被划分为两类的时候 理论频数不应该小于5
  • 当数据被划分为更多类的时候 理论频数小于5的数据划分组不应该超过总数据划分数目的百分之二十 列联表分析不应违背这些注意事项

典型相关分析

典型相关分析是研究两组变量之间的相关关系的一种方法,可以揭示两组变量之间的线性相关关系,他在实际应用中非常的广泛,是我们在前面复相关系数对相关系数推广后的进一步推广。

之所以我们引入典型相关分析,是因为两组变量(分别为ppqq维)之间的相关系数有pqpq个,我们经常使用的矩阵散点图不够好用;

非常自然的,我们会引入类似于主成分分析中的降维思想,用几个尽可能少的数来刻画两组变量的相关性。

总体典型相关

典型相关的导出

x=(x1,x2,...,xp)x=(x_1,x_2,...,x_p)^{\prime}y=(y1,y2,...,yq)y=(y_1,y_2,...,y_q)^{\prime}是两组随机变量,且V(x)=Σ11(>0),V(y)V(x)=\boldsymbol{\Sigma}_{11}(>0),V(y) =Σ22(>0),Cov(x,y)=Σ12= \Sigma_{22}\left ( > 0\right ) , Cov\left ( x, y\right ) = \Sigma_{12}即有

V(xy)=[Σ11Σ12Σ21Σ22]V{\binom xy}=\begin{bmatrix}\boldsymbol{\Sigma}_{11}&\boldsymbol{\Sigma}_{12}\\\boldsymbol{\Sigma}_{21}&\boldsymbol{\Sigma}_{22}\end{bmatrix}

我们想要使用一个指标来翻最大限度地反映两组变量之间的相关性 非常自然的 使用两个向量的线性函数u=ax 和 υ=byu=a^{\prime}x\text{ 和 }\upsilon=b^{\prime}y 把他们压缩成单变量。再计算uvuv之间的相关系数 让他们达到最大

自然的

Cov(u,v)=Cov(ax,by)=aCov(x,y)b=aΣ12bV(u)=V(ax)=aV(x)a=aΣ11aV(v)=V(by)=bV(y)b=bΣ22b\begin{aligned} \operatorname{Cov}(u,v)& =Cov(a^{\prime}x,b^{\prime}y)=a^{\prime}Cov(x,y)\boldsymbol{b}=\boldsymbol{a}^{\prime}\boldsymbol{\Sigma}_{12}\boldsymbol{b} \\ V(u)& =V(a^{\prime}x)=a^{\prime}V(x)a=a^{\prime}\boldsymbol{\Sigma}_{11}\boldsymbol{a} \\ V(v)& =V(\boldsymbol{b}^{\prime}\mathbf{y})=\boldsymbol{b}^{\prime}\boldsymbol{V}(\mathbf{y})\boldsymbol{b}=\boldsymbol{b}^{\prime}\boldsymbol{\Sigma}_{22}\boldsymbol{b} \end{aligned}

所以相关系数为

ρ(u,v)=aΣ12baΣ11abΣ22b\rho(u,v)=\frac{a^{^{\prime}}\boldsymbol{\Sigma}_{12}\boldsymbol{b}}{\sqrt{\boldsymbol{a}^{^{\prime}}\boldsymbol{\Sigma}_{11}\boldsymbol{a}}\sqrt{\boldsymbol{b}^{^{\prime}}\boldsymbol{\Sigma}_{22}\boldsymbol{b}}}

为了避免一些毫无意义的结果重复 我们一般要求uvuv都是标准化的变量 也就是

aΣ11a=1 , bΣ22b=1a^{\prime}\boldsymbol{\Sigma}_{11}\boldsymbol{a}=1\mathrm{~,~}\quad\boldsymbol{b}^{\prime}\boldsymbol{\Sigma}_{22}\boldsymbol{b}=1

因此我们希望极大化的相关系数为

ρ(u,v)=aΣ12b\rho(u,v)=a^{\prime}\boldsymbol{\Sigma}_{12}\boldsymbol{b}

我们省略一些不必要的证明 给出让这个相关系数达到极大化的系数计算方式 容易知道Σ111Σ12Σ221Σ21,Σ211Σ211Σ12,Σ111/2Σ12Σ221Σ21Σ111/2(0)\Sigma_{11}^{-1}\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21},\Sigma_{21}^{-1}\Sigma_{21}^{-1}\Sigma_{12},\Sigma_{11}^{-1/2}\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21}\Sigma_{11}^{-1/2}(\geqslant0)Σ221/2\Sigma_{22}^{-1/2} Σ2111Σ12Σ221/2(0)\boldsymbol{\Sigma}_{211}^{-1}\boldsymbol{\Sigma}_{12}\boldsymbol{\Sigma}_{22}^{1/2}(\geqslant0)都有着相同的非零特征值,可记为 ρ12ρ22ρn2>0\rho_1^2\geq\rho_2^2\geq\cdots\geq\rho_n^2>0,这里 mmΣ12\boldsymbol{\Sigma}_{12} 的秩 则

a1,a2,...,ama_1,a_2,...,a_mΣ111Σ121Σ221Σ21\Sigma_{11}^{-1}\Sigma_{12}^{-1}\Sigma_{22}^{-1}\Sigma_{21}的相应于ρ12,ρ22,...,ρm2\rho_1^2,\rho_2^2,...,\rho_m^2的特征向量 b1,b2,...,bmb_1,b_2,...,b_mΣ221Σ21Σ111Σ121\Sigma_{22}^{-1}\Sigma_{21}\Sigma_{11}^{-1}\Sigma_{12}^{-1}的相应于 ρ12,ρ22,...,ρm2\rho_1^2,\rho_2^2,...,\rho_m^2 的特征向量

我们取 a=a1,b=b1a=a_1,b=b_1的时候 是前面相关系数极大化的时候 我们称

u1=a1x,v1=b1yu_1=\boldsymbol{a}_1^{\prime}\boldsymbol{x},\quad v_1=\boldsymbol{b}_1^{\prime}\boldsymbol{y}

是第一对典型变量 他们的系数a1,b1a_1,b_1是第一对典型相关系数,p1p_1是第一典型相关系数 如果第一对典型变量提取的相关信息数量还不够,我们可以给出第ii典型相关 它对应的系数是ai,bi,pia_i,b_i,p_i

典型变量的性质
同一组的典型变量互相不相关
ui=aix,vi=biyu_i=\boldsymbol{a}_i^{\prime}\boldsymbol{x},\quad v_i=\boldsymbol{b}_i^{\prime}\boldsymbol{y}

ρ(ui,uj)=Cov(ui,uj)=aΣ11aj=0,1ijmρ(vi,vj)=Cov(vi,vj)=bΣ22bj=0,1ijm\begin{aligned}\rho(u_i,u_j)=&\mathrm{Cov}(u_i,u_j)=\boldsymbol{a}^{\prime}\boldsymbol{\Sigma}_{11}\boldsymbol{a}_j=0,\quad1\leqslant i\neq j\leqslant m\\\rho(v_i,v_j)=&\mathrm{Cov}(v_i,v_j)=\boldsymbol{b}^{\prime}\boldsymbol{\Sigma}_{22}\boldsymbol{b}_j=0,\quad1\leqslant i\neq j\leqslant m\end{aligned}
不同组典型向量之间的相关性
ρ(ui,vi)=ρi,i=1,2,,m\rho(u_{i},v_{i})=\rho_{i},\quad i=1,2,\cdots,m ρ(ui,vj)=Cov(ui,vj)=Cov(aix,bjy)=aiCov(x,y)bj=αiΣ111/2Σ12Σ221/2βj=ρjαiαj=0,1ijm\begin{aligned} \rho\left(u_{i},v_{j}\right)& =Cov(u_{i},v_{j})=Cov(a_{i}^{\prime}x,b_{j}^{\prime}y)=a_{i}^{\prime}Cov(x,y)b_{j} \\ &=\boldsymbol{\alpha}_i^{\prime}\boldsymbol{\Sigma}_{11}^{-1/2}\boldsymbol{\Sigma}_{12}\boldsymbol{\Sigma}_{22}^{-1/2}\boldsymbol{\beta}_j=\rho_j\boldsymbol{\alpha}_i^{\prime}\boldsymbol{\alpha}_j=0,\quad1\leqslant i\neq j\leqslant m \end{aligned}
原始变量和典型变量之间的相关系数
A=(a1,a2,,am),B=(b1,b2,,bm),u=Ax,v=By\text{记}A=(a_1,a_2,\cdots,a_m),B=(b_1,b_2,\cdots,b_m),\text{则}\\u=A^{\prime}x,\quad v=B^{\prime}y Cov(x,u)=Cov(x,Ax)=Σ11ACov(x,ν)=Cov(x,By)=Σ12BCov(y,u)=Cov(y,Ax)=Σ21ACov(y,v)=Cov(y,By)=Σ22B\begin{gathered} \operatorname{Cov}(x,u) =Cov(x,A^{\prime}x)=\boldsymbol{\Sigma}_{11}A \\ \operatorname{Cov}\left(x,\nu\right) =\mathrm{Cov}(x,B^{\prime}y)=\boldsymbol{\Sigma}_{12}\boldsymbol{B} \\ Cov\left(y,u\right) =\mathrm{Cov}(y,A^{\prime}x)=\boldsymbol{\Sigma}_{21}A \\ \operatorname{Cov}\left(y,v\right) =\mathrm{Cov}(y,B^{\prime}y)=\boldsymbol{\Sigma}_{22}\boldsymbol{B} \end{gathered}
典型相关系数和普通相关系数

从定义可以看出 当p=q=1p=q=1的时候 典型相关就是普通相关系数 当p=1 or q=1p=1~or~q=1的时候 他是复相关系数 可见,复相关是典型相关的一个特例,而简单相关是复相关的一个特例 他们的大小也是有联系的 第一典型相关系数至少同xx(或yy)的任一分量与yy(或xx)的复相关系数一样大(可从第一典型相关的定义看出) 即使所有这些复相关系数都较小,第一典型相关系数仍可能很大 复相关系数也不会小于的任一分量之间的相关系数(可从复相关的定义看出) 即使所有这些相关系数都较小,复相关系数仍可能很大。

标准化后的典型相关系数

有时候我们会对各个分量进行标准化后再进行典型相关系数的计算 我们前面的计算并没有标准化,这点和因子分析,主成分分析这两种经典的降维手法完全不一样 标准化后的协方差矩阵就是相关矩阵,我们可以基于相关矩阵计算典型相关系数 经过完全一样的原理的计算 典型相关系数这个概念对标准化的变换具有不变形,但是这不意味着我们的线性组合的系数也对此具有不变性,这点源于普通相关系数和复相关系数的推广

样本典型相关

在实际的应用中,我们使用样本相关矩阵来估计总体的相关矩阵;使用完全一致的计算手法,我们可以计算出典型相关系数 典型变量 还有他们线性组合的系数 在实际操作中,我们一般使用标准化后再计算的方式(使用相关矩阵计算的方式) 这样系数也有分析的价值 典型相关是一种纯数值上的研究方法 虽然确实有得分的概念但是使用起来并没有什么价值 我们需要理解的重点是 如何计算典型相关变量的系数,相关系数;并且尝试根据组合系数来进行合理的解释,这也是使用线性组合后的常用统计分析手法

典型相关系数的检验

全部总体典型相关系数均为零的检验

考虑假设检验问题

H0:ρ1=ρ2==ρm=0,H1:ρ1,ρ2,,ρm 至少有一个不为零H_0:\rho_1=\rho_2=\cdotp\cdotp\cdotp=\rho_m=0,\quad H_1:\rho_1,\rho_2,\cdotp\cdotp\cdotp,\rho_m\text{ 至少有一个不为零}

建立似然比统计量

Λ1=i=1m (1-ri2)\Lambda_1=\prod_{i=1}^m\text{ (1-}r_i^2)

对于充分大的nn 当原假设成立的时候 统计量

Q1=[n12(p+q+3)]lnΛ1Q_1=-\left[n-\frac12(p+q+3)\right]\text{ln}\Lambda_1

服从自由度为pqpqχ2\chi^2分布 当检验统计量过大的时候 单侧检验拒绝原假设 认为典型变量之间的相关性是显著的 否则认为是不显著

部分总体典型相关系数为零的检验

我们自然的希望尽可能少的使用典型相关变量的对数 因此我们需要对一些较小的典型相关系数进行是否为0的假设检验 思路如下 考虑假设检验问题

H0:ρ2==ρm=0,H1:ρ2,,ρm 至少有一个不为零H_0:\rho_2=\cdotp\cdotp\cdotp=\rho_m=0,\quad H_1:\rho_2,\cdotp\cdotp\cdotp,\rho_m\text{ 至少有一个不为零}

如果原假设被接受 那么就是只有第一对典型变量显著,否则的话我们认为第二对也是显著的 继续执行假设检验

H0:ρ3==ρm=0,H1:ρ3,,ρm 至少有一个不为零H_0:\rho_3=\cdotp\cdotp\cdotp=\rho_m=0,\quad H_1:\rho_3,\cdotp\cdotp\cdotp,\rho_m\text{ 至少有一个不为零}

如此循环 执行序贯检验 检验统计量为

Λk+1=i=k+1m (1-ri2)\Lambda_{k+1}=\prod_{i=k+1}^m\text{ (1-}r_i^2)

其中的kk对应着此时我们检验顺序 当k=0k=0的时候 是前面的全部总体检验,后续是除去前kk个对后续检验 对于足够大的nn 原假设成立的时候

Qk+1=[nk12(p+q+3)+i=1kri2]lnΛk+1Q_{k+1}=-\left[n-k-\frac12(p+q+3)+\sum_{i=1}^kr_i^{-2}\right]\text{ln}\Lambda_{k+1}

服从自由度为(pk)(qk)(p-k)(q-k)χ2\chi^2分布 拒绝原则同上

关联分析

基本概念

关联的基本概念

自然界中某种事物发生时其他事物也会发生的联系称之为关联

关联是两个或多个变量取值之间存在的一类重要的可被发现的某种规律性

关联可分为简单关联、时序关联、因果关联

  • 简单关联指的是在不考虑时间顺序的情况下,探索两个或多个变量之间是否存在某种统计上的联系。这种关联通常基于变量的共现频率,即在数据集中这些变量同时出现的次数。
  • 时序关联关注的是变量之间随时间变化的关系 他是一种更广的时间序列分析方法,研究多个事件与时间之间的联系
  • 因果关联是一种更为深入的关联分析,它不仅探索变量之间的联系,还试图确定一个变量是否导致了另一个变量的变化,即是否存在因果关系,属于因果推断的范畴

关联分析基本概念

关联分析目的是寻找给定数据记录集中数据项之间隐藏的关联关系,描述数据之间的密切度

关联分析的结果常有两种:关联规则 和 序列模式

  • 关联规则用于寻找在同一个事件中出现的不同项的相关性
  • 序列模式与此类似,但它寻找的是事件之间时间上的相关性

关联规则

关联规则发现的主要对象是交易型数据库

关联规则是描述在一个交易中物品之间同时出现的规律的知识模式,更确切的说,关联规则是通过量化的数字描述物品X的出现对物品Y的出现有多大的影响

他的产生是为了进行购物篮分析 也就是研究哪些商品顾客可能会在一次购物时同时购买 借此来帮助我们的商品的销售 借此更好的销售商品

现在,关联规则也可以被用于其他数据的研究,他的核心是研究若干定性自变量的关联

关联规则的形式化定义

只有严格的数学定义才方便我们后面进行进一步的模型建立,此处我们还是以交易数据库为基础进行相关的定义

关联规则挖掘的交易数据集记为DD 其中D= {T1, T2, , Tk, ,Tn}\mathrm{D=~\{T_{1},~T_{2},~\ldots,~T_{k},~\ldots,T_{n}\}} 其中的 TkT_k 称为一个交易 每个交易都有单独的编号称为TID;

所有可以购买的商品称为项 用元素 imi_m 来表示 I={i1, i2, , im}\mathrm{I=\{i_{1},~i_{2},~\ldots,~i_{m}\}}DD中全体元素的集合 所有的TkT_kII的子集

设两个项集X,YX,Y 他们都是II的子集并且交集非空 形如 X==>YX==>Y 的表达式称为关联规则

关联规则的度量

所有的关联规则都有着表达式

XY[s,c]X\Rightarrow Y[s,c]

也就是 关联都具有置信度cc 和支持度 ss 他是我们对一个关联规则最关注的度量

  • ss 表示两者同时出现的概率
  • cc 表示 XX 出现的情况下 YY出现的概率 一种条件概率

计算方法根据定义很容易给出 我们这里不给出公式了

仅仅使用支持度置信度评价关联规则是不足的,因为他们没有考虑非均衡这一广泛存在的问题 因此给出定义

  • 期望可信度:描述了对于关联规则X==>YX ==> Y在没有任何条件影响时,YY在所有交易中出现的频率有多大。即没有XX的作用下,YY本身的支持度
  • 改善度 :描述XX的出现对YY的出现影响多大,是置信度与期望可信度的比值
  • 兴趣度:置信度-支持度Max{置信度,支持度}\frac{\text{置信度}-\text{支持度}} {Max\{\text{置信度},\text{支持度}\}}一条规则的兴趣度大于0,实际利用价值越大;小于0则实际利用价值越小。

关联规则挖掘

同时满足最小置信度阈值和最小支持度阈值的关联规则为强关联规则,是有意义有价值。

挖掘关联规则问题就是产生支持度和置信度分别大于用户给定的最小支持度阈值和最小置信度阈值的关联规则

关联规则挖掘

基本概念

  • kk项集:包含kk个项的集合
  • 项集的频率是指包含项集的事务数
  • 如果项集的频率大于 最小支持度×D中的事务总数\text{最小支持度}\times D\text{中的事务总数},则称该项集为频繁项集

据此 挖掘交易数据库D中所有关联规则的问题可以被划分为两个子问题

  • 找出所有具有最小支持度的频繁项集
  • 项集) 。使用频繁项集生成期望的关联规则

Apriori算法

Apriori 算法 利 用 频 繁 项 集 性 质 的 先 验 知 识 ( prior knowledge),通过逐层搜索的迭代方法,即将kk-项集用于探察(k+1)(k+1)-项集,来穷尽数据集中的所有频繁项集 他迭代一次就需要扫描一次数据库

他在利用性质 :频繁项集的非空子集也是频繁的 进行搜索

他的基本执行模式为:

  • 输入:数据集合DD,支持度阈值α\alpha
  • 输出:最大的频繁kk项集 步骤
  1. 扫描整个数据集,得到所有出现过的数据,作为候选频繁1项集(k=1k=1,频繁0项集为空集)
  2. 挖掘频繁kk项集
    1. 扫描数据计算候选频繁kk项集的支持度
    2. 去除候选频繁kk项集中支持度低于阈值的数据集,得到频繁k项集。如果得到的频繁kk项集为空,则直接返回频繁k1k-1项集的集合作为算法结果,算法结束。如果得到的频繁kk项集只有一项,则直接返回频繁kk项集的集合作为算法结果,算法结束。
    3. 基于频繁kk项集,连接生成候选频繁k+1k+1项集。
  3. k=k+1,k=k+1,转入步骤2

同时满足最小支持度和最小置信度的才是强关联规则,从频繁项集产生的规则都满足支持度要求 我们需要手工计算置信度来排除一些关联规则 剩下的就是我们可以用的强关联规则了

Apriori算法运算效率非常低下,但是他们后面各种关联规则算法的基础,他们大多在效率方面对Apriori算法进行了很大的改进

多种关联规则

  • 简单关联规则:如篮球=>篮球服,只涉及物品
  • 量化关联规则:涉及数值类型的 我们改变了关联规则研发初期只用于非类变量的规则
  • 多维关联规则:性别=“男”=> 购买=“篮球”,涉及两个维
  • 跨层关联规则:
    • 同层关联规则:Adidas篮球=> Nike篮球服
    • 层间关联规则:篮球=> Nike篮球服

对于涉及数值字段的量化关联规则 我们需要将原始数值离散化才可以用于关联规则的生成;这种离散化可以预定义方法 也可以在关联规则建立的同时生成 后者往往效果更好 毕竟毫无理由的离散化往往会带来负面效果 R Visualization 的“谨慎处理数据”一节

挖掘跨层关联规则需要更加先进的算法和预先的层级设置 这里不介绍了

由关联分析到相关分析

·我们需要一种度量事件间的相关性或者是依赖性的指标

AABB间的相关性:corrA,B=P(AB)P(A)P(B)=P(BA)/P(B)corr_{A,B}=\frac P(A\cup B){\mathrm{P(A)P(B)}}=P(B\mid A)/P(B) \cdot当项集AA的出现独立于项集B的出现时,P(AB)=P(A)P(B)P(A\cup B)=P(A)P(B) 即corrA,B=1_{A,B}=1,表明A与B无关,corrA,B>1A\text{与B无关,corr}_{A,B}>1 表明AA与B正相关,corrA,B<1_{A,B}<1 表明AA与B负相关。

·将相关性指标用于前面的例子,可以得出录像带和游戏将的相关性为:

P({game,video})/(P({game})×P({video}))=0.4/(0.75×0.6)=0.89\mathsf{P}(\{game,video\})/(\mathsf{P}(\{game\})\times\mathsf{P}(\{video\}))=0.4/(0.75\times0.6)=0.89

结论:录像带和游戏之间存在负相关

集中趋势和位置的度量

数理统计中的经典概念

均值

普通的均值定义为

x=i=1nxin\overline{x}=\frac{\sum_{i=1}^{n}x_{i}}{n}

在部分情况下我们使用加权平均数 也就是我们拥有了数据之间重要性的差异

x=i=1kwix,i=1kwi\overline{x}=\frac{\sum_{i=1}^{k}w_{i}x,}{\sum_{i=1}^{k}w_{i}}

我们还可以给出集合平均数

x1x2xn{\sqrt{x_{1}\cdot x_{2}\cdots x_{n}}}

不过他在传统的统计学中很少出现

中位数

为了规避了部分极端异常值的影响 提升稳健性,我们引入的中位数的概念 ^dd161e

分位数研究的是数据的相对位置 根据各个样本之间的位置来确定 我们可以使用中位数作为集中趋势的度量 当然也可以采用 极差中点

x1+xn2\frac{x_{1}+x_{n}}{2}

有序分类的数据只能靠众数和分位数来研究

众数

数据中出现的最多的数,只在有一些特殊情况下被研究

分类数据的集中趋势只能依靠众数研究

EDA中集中趋势的度量

无论是这里还是后面关于离散的部分 EDA中的度量方法的核心目的只有一个 提升估计量的稳健性 也就是

  • 统计量对少量的大偏差数据不敏感
  • 统计量对大量的小偏差数据不敏感

因此我们对统计量进行了修正

LL统计量

我们取 X(i)X_{(i)} 是第ii个次序统计量 希望通过次序统计量来增加估计量的稳健性 正如我们在中位数中进行的那样 本文“相关段落”一节

LL估计量的形式为 T=i=1raiX(i)T=\sum_{i=1}^{r}a_{i}X_{(i)}

我们后面介绍各种估计量都是一种LL估计量 包括前面介绍的均值 中位数 众数也是 当然加权均值也是如此

在介绍了LL统计量以后 我们就可以引出一大类估计量 截尾均值 也就是截掉头尾的若干量后计算均值 (允许只截取一部分,也就是降低他的权重,但是不建议这么做)

  • 百分之XX 截尾 前后各去掉百分之XX
  • 中均值:取中间的百分之五十
  • 中位数:只要中间的一个到两个
  • 三均值:四分位数的三个的均值

集中趋势估计量效果的评估

在对方差研究后我们给出下面的结论 下面的nn指样本

  • n<6n<6 使用中位数
  • n=7n=7 每一侧的尾部去掉两个
  • n>8n>8 两侧个截取百分之二十五

离散趋势的度量

下面我们来考虑用一个量研究数据的离散程度

经典数理统计中的经典概念

偏差

我们可以考虑极差

xnx1x_n-x_1

或者考虑平均偏差

i=1n(xix)/n\sum_{i=1}^{n}(x_{i}-\overline{x})/n

方差与标准差

在数理统计中我们已经不止一次研究这个量了

σ2=i=1N(xiμ)2N\sigma^{2}=\frac{\sum_{i=1}^{N}(x_{i}-\mu)^{2}}{N}

它是衡量数据离散程度的最常用的量

对应的有标准差 它和原始数据有着相同的单位 是方差开根

为了处理样本的无偏性问题对样本方差有修正(标准差随之修正)

s2=i=1π(xixˉ)2n1s^{2}=\frac{\sum_{i=1}^{\pi}(x_{i}-\bar{x})^{2}}{n-1}

相对偏离程度的度量(变异系数)

下面给出的量是没有单位的 我们可以跨多个样本进行比较

定义变异系数为

V=σμV=\frac{\sigma}{\mu}

EDA中的离散度量

这里我们除去前面的度量方法 一些具有robust性质的度量方法

样本中位数离差

AD=1ni=1nxiM{AD}={\frac{1}{n}}\sum_{i=1}^{n}|x_{i}-{M}|

其中MM 是样本中位数

样本中位绝对离差

MAD=mediani{xiM}{MAD}=\mathrm{median}_{i}\{\left|x_{i}-\boldsymbol{M}\right|\}

我们计算所有离差又计算了中位数 R中样本中位绝对离差和它相差了一个约为1.4的系数 目的是估计样本方差 在实际计算中 我们基本可以无视这个差距

四分位差

我们考虑四分位数的差值

IQR=dF=FUFLIQR = d_{F}=F_{U}-F_{L}

和它对应的有我们在研究离散程度和异常值检验中非常常用的箱线图和五数概括

几种离散度量效果的评估

在不同的分布中研究这些统计量对离散的概括程度我们可以得到一个非常简单但是重要的结论

四分位差是对样本离散程度概括的最好的量,有着最好的效率

分布形状的度量

他们侧重于研究样本的两个特征,他们的中心是否集中(集中趋势的度量)和偏差是否不均匀(离散趋势的度量) 都是分布形状的体现 他们的特点在于和正态分布比较

偏度系数(skewness)

g1=n(n1)(n2)s3i=1n(xix)3=n2μ3(n1)(n2)s3,g_1=\frac{n}{(n-1)(n-2)s^3}\sum_{i=1}^{n}(x_i-\overline{x})^3=\frac{n^2\mu_3}{(n-1)(n-2)s^3},

对分布是否对称的研究 对称时偏度系数为0

峰度系数(kurtosis)

g2=n(n+1)(n1)(n2)(n3)s4i=1n(xix)43(n1)2(n2)(n3)=n2(n+1)μ4(n1)(n2)(n3)s43(n1)2(n2)(n3),\begin{array}{rcl}g_2&=&\frac{n(n+1)}{(n-1)(n-2)(n-3)s^4}\sum_{i=1}^n(x_i-\overline{x})^4-3\frac{(n-1)^2}{(n-2)(n-3)}\\&=&\frac{n^2(n+1)\mu_4}{(n-1)(n-2)(n-3)s^4}-3\frac{(n-1)^2}{(n-2)(n-3)},\end{array}

对分布峰值研究 其中峰度大于正态分布的时候比0大 否则比0小 正态分布峰度系数为0

描述性统计可视化

在基本的描述性统计中,我们不需要讨论太多的可视化手段,这里介绍的基本的描述性统计手法都只涉及Excel中的一部分,他们包括

特别的,我们这里补充一个比较不常用但是对于统计学本身重要的图形数理统计 的“经验分布函数”一节

  • Title: Descriptive Statistics and Visualization: Measurement, Distances, and Statistical Graphics
  • Author: Hyacehila
  • Created at : 2023-11-04 16:21:21
  • Link: https://hyacehila.github.io//blog/2023/11/05/descriptive-statistics-and-visualization-notes/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments