Advanced Linear Regression: Goodness of Fit, Model Selection, and Collinearity

Hyacehila

回归方程的评价

拟合优度指标

RSS

模型误差项的方差σ2\sigma^{2} 反映了模型的误差和观察误差的大小

定义:e^=yxβ^\hat{e}=y-x\hat{\beta}是估计的残差向量 他是误差向量的一个估计 定义: RSS=eΛeˊΛ=i1neiΛ2RSS=e^{\Lambda}\acute{e}^{\Lambda}=\sum_{i\cdots1}^{n}e_{i}^{\Lambda2} 是残差的平方和 RSS反映了模型拟合数据的能力 RSS越小 模型对数据拟合的就越好

由于RSSRSS纳入越多自变量就会越小,因此我们只可以把RSS用于相同自变量数量的选模型之间的比较,其余的比较无意义(在多个回归方程中比较RSS也没有意义)

定理:

  • RSS=y(IX(XX)1X)y;RSS=y^{\prime}(I-X(X^{\prime}X)^{-1}X^{\prime})y;
  • σ^2=RSSnp\hat{\sigma}^2=\frac{RSS}{n-p}σ2\sigma^{2}的一个无偏估计
  • RSS=yyβ^XyRSS = y'y-\hat{\beta}'X'y 也就是残差平方和等于总平方和减去回归平方和

R2R^{2}

定义 :回归平方和 SS=β^Xcy=yXc(XcXc)1XcySS_{\text{回}}=\hat{\beta}^{\prime}X_{c}^{\prime}y=y^{\prime}X_{c}(X_{c}^{\prime}X_{c})^{-1}X_{c}^{\prime}y 定义:修正总平方和为 SS=(yα^1)(yα^1)=(yyˉ1)(yyˉ1)SS_{\text{总}}=(y-\hat{\alpha}^{\wedge}\mathbf{1})^{\prime}(y-\hat{\alpha}^{\wedge}\mathbf{1})=(y-\bar{y}\mathbf{1})^{\prime}(y-\bar{y}\mathbf{1}) 注意 我们这里需要先进性中心化 才开始了这里的研究 所以标记全是中心化后的标记格式

定义:判定系数R2R^{2}

R2=SSSS,R^2=\frac{\mathrm{SS}_\text{回}}{\mathrm{SS}_\text{总}},

事实上 我们前面用RSSRSS解释模型拟合的程度 这里的判定系数R2R^{2}也是一样 只是R2R^{2}越大 拟合程度越好

能看出 R2R^2的最大值就是1 越接近1就意味着拟合的程度越好 当然他的大小也不会低于0

也存在修正R2R^2 因为我们目前考虑的R2R^2 会随着样本容量的变化而变化(正相关) 修正R2R^2 就是修正这个影响 我们在统计分析中一般同时参考两个量

在本质上,它和RSS没有区别,但是能够在多个模型中互相比较,这就是相对RSS的优点,我们现在基本不用残差平方和评估拟合的程度了

R2R^2在回归方程没有截距项的时候没有应用价值

R2R^2定量描述了被解释变量的变化由回归变量说明或解释的程度,所以在应用中经常使用R2R^2

但是过分依赖于R2R^2 可能会使人陷入困境,在实际应用中,“最大化R2R^2 几乎没有任何经济学或统计学上的意义。相反地,是否要在多元回归中加入某个变量,取决于加入这个变量后能否更好地估计感兴趣的因果效应,也就是参考后面的线性回归基础 的“选模型指标”一节 线性回归基础 的“信息量指标”一节

回归标准误SER

回归标准误差(Standard Error of the Regression, SER)是回归误差的标准差估计量,SER和回归结果的误差相同,因此我们用SER还衡量回归误差的离散程度;

我们使用残差来估计SER 公式为

SER=su^,其中 su^2=1n2i=1nu^i2=SSRn2SER=s_{\hat{u}}\text{,其中 }s_{\hat{u}}^2=\frac{1}{n-2}\sum_{i=1}^{n}\hat{u}_{i}^2=\frac{\mathrm{SS}R}{n-2}

SER度量了与回归线偏差的大小,即回归误差的大小 过大的SER非常不好

系数标准误SE

对一个总体多次抽样,每次样本大小都为nn,那么每个样本都有自己的平均值,这些平均值的标准差叫做标准误

对于回归系数而言,SE以相同单位形式反映了我们系数的估计效果,过大的SE意味着系数的估计根本不准确,因此没有意义

标准误本身就是一个名词,使用在系数和回归上有了不同的解释,标准误就是一个估计的标准差,用于衡量估计的效果

选模型指标

我们在这一章中会使用MSEP均方预测误差来代替一般的均方误差作为衡量预测的标准 仅仅是为了进行一定的区分 在实际的定义上没有本质的变化

全模型与选模型

全模型 就是我们原本考虑要设计的回归模型

yi=β0+β1xi1++βp1xi,p1+eiy_{i}=\beta_{0}+\beta_{1}x_{i1}+\cdots+\beta_{p-1}x_{i,p-1}+e_{i}

选模型 也是字面意思 我们只选择其中的一部分自变量 构成新的模型

Y=β0+β1X1++βq1Xq1+eY=\beta_0+\beta_1X_1+\cdots+\beta_{q-1}X_{q-1}+e

非常正常的 当我们从全模型转换为选模型的时候 预测偏差的相关变量都会发生变化 而我们需要重点考虑分别是 均值E 方差Var 均方预测误差MSEP 和前面导出RSS用来评估误差一样

MSEP(y^)=E(yy^)2=E(e^2)MSEP(\hat{y})=E(y-\hat{y})^2=E(\hat{e}^2)

我们进行关于全模型和选模型均方误差的推导可以得到

  • 即使全模型是正确的,构造的选模型也可以得到更小的MSEP 以及 更小的回归系数方差 但是这使用无偏性作为代价的
  • 即使全模型是正确的,选模型有时候也会提高预测的精度 这往往是因为某个回归系数难以准确估计 因此 在回归方程中丢掉一部分对因变量影响不大 或者难以观测的自变量对于我们的实际研究是有利的 因此对不同自变量子集进行分析,挑选出最优子集是我们后面要做的 现在我们来开始研究具体的评价回归方程的标准

RMSqRMS_q准则

RMSqRMS_q准则的思想是使用残差平方和RSS 因为RSS反映了实际数据和理论预测的偏离程度 更小的RSS意味着更好的拟合程度

我们记选模型的RSS为RSSqRSS_q 根据公式 下面是两个选模型的RSSqRSS_q

RSSq=y(IXq(XqXq)1Xq)yRSS_q=y^{\prime}(I-X_q(X_q^{\prime}X_q)^{-1}X_q^{\prime})y RSSq+1=y(IXq+1(Xq+1Xq+1)1Xq+1)yRSS_{q+1}=y^{\prime}(I-X_{q+1}(X_{q+1}^{\prime}X_{q+1})^{-1}X_{q+1}^{\prime})y

直接作差推导可以得到

RSSq+1RSSqRSS_{q+1}\leq RSS_q

模型越扩大越好? 这显然和我们进行选模型的意义相反了 因此我们往往习惯引入一个惩罚因子

RMSq=1nqRSSqRMS_q\overset{}{\operatorname*{=}}\frac1{n-q}\overset{}{\operatorname*{RSS}}_q

此时就可以按照RMSqRMS_q最小的准则来选取我们想要的选模型来 这也被称为平均残差平方和准则

CpC_p准则

CpC_p 准则从对因变量预测精度来考虑 MSEP(y^)=E(y^y)2=Var(xqφ^q)+(Ee^)2MSEP(\hat{y})=E(\hat{y}-y)^2=Var(x_q^{\prime}\hat{\varphi}_q)+(E\hat{e})^2

从其中可以导出我们想要使用的统计量

Cp=RSSqσ^2(n2q)C_p=\frac{RSS_q}{\hat{\sigma}^2}-(n-2q) CpC_p 越小的模型越值得选择

信息量指标

AICAIC准则

我们这里直接给出AICAIC准则的公式 他是基于似然的最优模型准则

AIC=2ln(模型似然度)+2(模型自由参数个数)AIC=-2\ln(\text{模型似然度})+2(\text{模型自由参数个数})

由日本统计学家Akaike提出 称为Akaike信息量准则 得到最小的AICAIC的那一组参数是最优的 他是使用的非常广泛的统计准则 非常多的领域都是用这个准则研究最优模型 对于选模型

Y=β0+β1X1++βq1Xq1+e, eN(0,σ2I)Y=\beta_0+\beta_1X_1+\cdots+\beta_{q-1}X_{q-1}+e,~e\sim N(0,\sigma^2I)

似然函数为

L(φq,σq2y)=(2πσq2)n2exp{12σq2i=1n(yij=0q1βjxij)2}L(\varphi_q,\sigma_q^2|y)=(2\pi\sigma_q^2)^{-\frac n2}\exp\left\{-\frac1{2\sigma_q^2}\sum_{i=1}^n(y_i-\sum_{j=0}^{q-1}\beta_jx_{ij})^2\right\}

对数似然函数为

lnL(φq,σq2y)=n2ln(2πσq2)12σq2(yXqφq)(yXqφq)\ln L(\varphi_q,\sigma_q^2|y)=-\frac{n}{2}\ln(2\pi\sigma_q^2)-\frac{1}{2\sigma_q^2}(y-X_q\varphi_q)'(y-X_q\varphi_q)

代入

φ^q=(XqXq)1Xqyσ^q2=RSSqn\begin{aligned}\hat{\varphi}_q&=(X_q^{\prime}X_q)^{-1}X_qy\\\hat{\sigma}_q^2&=\frac{RSS_q}n\end{aligned}

得到

lnL(φ^q,σ^q2y)=[n2+n2ln(n2π)]n2ln(RSSq)\ln L(\hat{\varphi}_{q},\hat{\sigma}_{q}^{2}\left|y\right)=\left[-\frac{n}{2}+\frac{n}{2}\ln(\frac{n}{2\pi})\right]-\frac{n}{2}\ln(RSS_{q})

因此

AIC=nln(RSSq)+2qAIC=n\ln(RSS_{q})+2q

以后我们直接使用这个推导出来的AICAIC准则公式就可以了 Akaike信息量我们并没有学习过 所以很难完全理解他的思想

BIC准则

贝叶斯信息准则 计算公式为

BIC=2ln(L^)+kln(n)\mathrm{BIC}=-2\cdot\ln(\hat{L})+k\cdot\ln(n)

我们在这里不多做介绍 以后再进行补充

假设检验

本章的目的是研究在线性统计模型中,或者说最核心的在最小二乘估计的方法中 假设检验是如何使用的 最后我们会介绍一点关于线性统计模型中因变量的预测问题 这也是常见的编排方式 我们在这一章还是研究最为基础的最小二乘估计得到的经验回归方程 事实上 由于假设检验的特殊性 其他情况我们很难进行对应的研究 本章主要研究的问题如下

  • 回归方程的显著性检验
  • 回归系数的显著性检验
  • 异常点检验 之所以引入假设检验 是因为所得到的经验回归方程还不能真正的刻画变量之间的关系 我们要对这点进行检验

一般线性假设

基本思想

我们从我们最核心的正态线性回归模型出发

y=Xβ+e,eN(0,σ2I)y=X\beta+e,e\sim N(0,\sigma^2I)

其中XXn×pn\times p的矩阵 也就是nn次观测 pp个参数 对于一般线性假设 我们补充关于待估计参数的线性假设

H:Aβ=b\boldsymbol{H}{:}\boldsymbol{A\beta}=\boldsymbol{b}

构成了一个约束最小二乘估计 其中AAm×pm\times p的矩阵 mm是约束方程的数量 对于增加约束前我们容易给出残差的平方和

RSS=(yAβ^)(yAβ^)=y(IX(XX)1X)yRSS=(y-A\hat{\beta})^{\prime}(y-A\hat{\beta})=y^{\prime}(I-X(X^{\prime}X)^{-1}X^{\prime})y

当然我们也可以给出约束后的残差平方和

β^H=β^(XX)1A(A(XX)1A)1(Aβ^b)\hat{\beta}_{H}=\hat{\beta}-(X^{\prime}X)^{-1}A^{\prime}(A(X^{\prime}X)^{-1}A^{\prime})^{-1}(A\hat{\beta}-b) RSSH=(yAβ^H)(yAβ^H).RSS_H=(y-A\hat{\beta}_H)^{\prime}(y-A\hat{\beta}_H).

增加了约束条件后 非常明显的会增大残差的平方和 也就是

RSSHRSSRSS_{H}\ge RSS

如果模型的参数确实满足约束条件 那么增加了约束条件后残差的平凡和应该增加的有限 因此当残差的平方和增大了一定程度的时候 我们就可以拒绝原假设了

核心定理

对于正态线性回归模型y=Xβ+e,eN(0,σ2I)y=X\beta+e,e\sim N(0,\sigma^2I)

  • RSS/σ2χnp2{RSS}/\sigma^{2}\sim\chi_{n-p}^{2}
  • 给定假设Aβ=b{A\beta}={b}(RSSHRSS)/σ2χm2;(RSS_{_H}-RSS_{}^{})/\sigma^2 \sim \chi_{_m}^2;
  • RSSRSSRSSRSSHRSS-RSS_H 相互独立
  • 给定假设Aβ=b{A\beta}={b} FH=(RSSHRSS)/mRSS/(np)Fm,npF_{_H}=\frac{(RSS_{_H}-RSS)/m}{RSS/(n-p)}\sim F_{_{m,n-p}}

约简形式

我们给出过RSS的简单计算方式 也就是残差平方和等于总平方和减去回归平方和

RSS=yyβ^XyRSS = y'y-\hat{\beta}'X'y

使用类似的手法还是可以计算RSSHRSS_H 带入前面的FHF_H

FH=(Aβ^b)(A(XX)1A)1(Aβ^b)/mRSS/(np)F_{H}=\frac{(A\hat{\boldsymbol{\beta}}-b)^{\prime}(A(X^{\prime}X)^{-1}A^{\prime})^{-1}(A\hat{\boldsymbol{\beta}}-b)/m}{RSS/(n-p)}

拒绝域的确定

我们前面的基本思想叙述了:当残差的平方和增大了一定程度的时候 我们就可以拒绝原假设了 这对应到检验统计量上就是:检验统计量的值大到某种程度 我们就可以拒绝原假设了 因此我们应该选择单侧假设检验 拒绝域选定为

FH>Fm,np(α)F_{H}>\mathbf{F}_{m,n-p}(\alpha)

结语

为什么称为一般线性假设? 这是因为我们后面的很多假设都会转换为这个一般线性假设的某种特殊情况 然后套用这里的公式进行求解 比如:

y1=β1+e1y2=2β1β2+e2y3=β1+2β2+e3\begin{aligned}y_1&=\beta_1+e_1\\y_2&=2\beta_1-\beta_2+e_2\\y_3&=\beta_1+2\beta_2+e_3\end{aligned}

检验

H:β1=β2{H:\beta_1=\beta_2}

变形就可以得到 β1β2=0\beta_1-\beta_2=0 也就是n=3,p=2,m=1n=3,p=2,m=1的一般线性假设问题

或者他的推广形式

y1=X1β1+e1,e1N(θ,σ2In1)y2=X2β2+e2,e2N(θ,σ2In2)\begin{aligned}y_1&=X_1\beta_1+e_1,e_1\sim N(\theta,\sigma^2I_{\mathrm{n}_1})\\y_2&=X_2\beta_2+e_2,e_2\sim N(\theta,\sigma^2I_{\mathrm{n}_2})\end{aligned}

检验

H:β1=β2\boldsymbol{H}:\boldsymbol{\beta}_1=\boldsymbol{\beta}_2

能看出参数这里等价于

Ipβ1Ipβ2=0I_{p}\beta_{1}-I_{p}\beta_{2}=0

因此这是n=n1+n2;p=2p;m=pn=n_1+n_2;p=2p;m=p的一般线性假设

回归方程的显著性检验

基本思想和检验统计量

我们想要证明什么? 当然是证明回归方程确实是显著的;因此根据假设检验的思想 我们的原假设应该是:所有的回归系数都为0 (β0\beta_0是常数项不要加入这里的为0检验) 也就是

H:β1==βp1=0H:\beta_{1}=\cdots=\beta_{_{p-1}}=0

如果我们同意了原假设 就意味着所有自变量的影响都不重要 此时我们的约束可以看作如下的形式

A=(0,Ip1),b=0(Aβ=b)A=(0,I_{p-1}),b=0\quad(A\beta=\mathbf{b})

这就化简成我们上一节研究的一般线性假设问题了 通过一系列化简运算我们得到原本的检验FF统计量变形为如下

F=SS/(p1)RSS/(np)F_\text{回}=\frac{SS_\text{回}/(p-1)}{RSS/(n-p)}

按照公式计算就可以判断是否拒绝原假设了

方差分解视角的分析

在本节的原假设下

RSSH=yyβ01y=i=1n(yiy)2RSS_{_H}=y^{\prime}y-\beta_{0}^{^{\star}}\mathbf{1}^{\prime}y=\sum_{i=1}^{\mathrm{n}}(y_{i}-\overline{y})^{2}

也就是在本节中

RSSH=TSSRSS_H=TSS

TSS=RSS+SSTSS=RSS+SS_{|\text{回}}

因此本节的检验统计量可以看作 检验统计量把两部分作比较 当回归平方和较试验误差较大的时候 拒绝原假设 认为回归方程是显著的

如果我们选择接受原假设 这意味着 相对于模型的误差 各个自变量对YY的影响可以忽略不计 可能性如下

  • 模型误差较大 可能漏掉了一些自变量 一些回归自变量并不线性
  • 回归自变量确实对YY的影响很小

回归系数的显著性检验

在回归方程的显著性检验上 我们可以确定YY依赖于我们选定的一系列自变量 但是不能排除部分自变量实际上并不被YY依赖 也就是假设

Hi:βi=0,{H}_{{i}}:{\beta}_{i}={0},

这里我们就来研究这种假设的假设检验问题

基本思想

我们还是可以选择把这个问题看成一般线性假设的一种特殊情况

βi=0Aβ=0,A=(0,...,0,1,0,..,0)\beta_i=0\Leftrightarrow A\beta=\mathbf{0},A=(0,...,0,1,0,..,0)

然后带入我们在第一节使用的公式就可以了

FH=(Aβ^b)(A(XX)1A)1(Aβ^b)/mRSS/(np)F_{H}=\frac{(A\hat{\boldsymbol{\beta}}-b)^{\prime}(A(X^{\prime}X)^{-1}A^{\prime})^{-1}(A\hat{\boldsymbol{\beta}}-b)/m}{RSS/(n-p)}

核心思想

前面的计算思想还是太复杂了 我们来做一些简化的工作;换一个角度来研究关于回归系数的显著性检验问题 我们知道未知参数的最小二乘估计满足

β^N(β,σ2(XX)1).\hat{\beta}\sim N(\beta,\sigma^2(X^{\prime}X)^{-1}).

残差简单正态的时候,可以回去翻性质 如果记

Cp×p=(cij)=(XX)1C_{p\times p}=(c_{ij})=(X^{\prime}X)^{-1}

那么就是

β^iN(βi,σ2cii).\hat{\beta}_i\sim N(\beta_i,\sigma^2c_{ii}).

因此当假设Hi:βi=0H_i:\beta_i=0成立的时候有

β^iσcii=N(0,1)\frac{\hat{\beta}_i}{\sigma{\sqrt{c_{ii}}}}={N}(0,1)

又因为我们知道

RSS/σ2χnp2{RSS}/\sigma^{2}\sim\chi_{n-p}^{2}

因此有

ti=β^iσ^ciitnpt_i=\frac{\hat{\beta}_i}{\hat{\sigma}\sqrt{c_{ii}}}\sim t_{n-p}

其中σ^2=RSS/(np)\hat{\sigma}^2=RSS/(n-p) 非常自然的 我们应该使用双侧拒绝域的tt检验 选择的拒绝域为

titnp(α/2).|t_i|\geq t_{n-p}(\alpha/2).

特殊的分析

我们知道

Var(β^i)=σ2cii\mathrm{Var}(\hat{\beta}_i)=\sigma^2c_{ii}

所以可以给出标准误差

σcii{\sigma}\sqrt{c_{ii}}

想要估计值只需要换为σ^\hat{\sigma} 也就是我们的tt检验统计量是 最小二乘估计与其标准误差的商 非常自然的思想是:如果自变量XX对回归因变量YY没有显著影响 就可以从回归方程中剔除 然后可以使用剩下的的回归自变量进行回归 得到更新后的系数 这就是第五章的思想 回归自变量的选择(回归方程的选择)

异常点检验

异常点的集合意义是 :偏离主体数据的点 这一节我们来研究如何研究并且判断异常点的存在 这里我们使用的是回归方程的思路来研究异常 也就是使用残差的思想 使用和整个模型的估计值差距的大小来判断这个点是否异常 和数据的预处理中的异常点检验思路并不一样

均值漂移线性回归模型

正常的线性回归模型形式如下

yi=xiβ+ei,eiN(0,σ2)y_{i}=x_{i}^{\prime}\beta+e_{i},e_{i}\sim N(0,\sigma^{2})

如果有一组数据是异常的 那么他一定会偏离这个方程很厉害 也就是

yj=xjβ+η+ejy_{j}=x_{j}^{\prime}\beta+\eta+e_{j}

他的矩阵形式是

y=Xiβ+djη+ey=X_i\beta+d_j^{\prime}\eta+e

我们把这样的模型称为均值漂移线性回归模型 直接给出均值漂移线性回归模型的最小二乘估计为

β=β^(j),η=11hjje^j\beta^{*}=\hat{\beta}_{(j)},\eta^{*}=\frac1{1-h_{jj}}\hat{e}_{j}

其中的β^(j)\hat{\beta}_{(j)} 为从原回归模型中剔除第jj组数据得到的最小二乘估计

hjjh_{jj}H=X(XX)1XH=X(X^{\prime}X)^{-1}X^{\prime} 的第jj个对角元 eje_j是从原回归模型中导出的第jj个残差

检验统计量

我们省略复杂推导的过程 直接给出检验统计量 如果假设H:η=0H:\eta=0 则有

Fj=(np1)rj2nprj2F1,np1F_j=\frac{(n-p-1)r_j^2}{n-p-r_j^2}\sim F_{1,n-p-1}

其中的rjr_j是我们想要检验的统计量的学生化残差

nn是观测的个数 pp是回归自变量的个数

对于任意的α\alpha 我们使用单侧的假设检验 也就是拒绝域为

Fj=(np1)rj2npri2>F1,np1(α)F_{j}=\frac{(n-p-1)r_{j}^{2}}{n-p-r_{i}^{2}}>F_{_{1,n-p-1}}(\alpha)

这是因为我们非常自然的思想 学生化残差越大越偏离越应该拒绝 因此我们选择单侧假设检验 由于tt分布和FF分布的关系 可以给出等价的检验统计量(双侧的)

tj=(Fj)1/2t_j=\left(F_j\right)^{1/2}

拒绝域为

titnp1(α/2).\left|t_i\right|\geq t_{n-p-1}(\alpha^{}/2).

一些注解

我们前面的方法只能处理一个异常点的情况 但是在现实中异常点的个数是不确定的 如果假设的个数过少 则会导致一些点没有被怀疑而错误的引入 如果假设的过多就会导致去除正常点 关于异常点的检验 这里只是一个引子 还需要后续很多的学习

因变量的预测

回归模型的预测是一个非常简单的问题 正如我们在贝叶斯统计中类似的介绍方式一样 把他放在假设检验后面进行简单的介绍

简单的理论介绍与点预测

在理论上我们会有两种预测 一种是预测的均值

Ey0=x0βEy_0=x_0^{\prime}\beta

此时不需要考虑随机误差 被均值消掉了 另一种是预测值

y^0=x0β^\hat{y}_0=x_0^{\prime}\hat{\beta}

很遗憾 我们不可能知道误差是多少 基于无偏行原则我们直接给出预测的具体值 这也是我们在应用中的实际操作 他们形式相同 但是含义不同 我们直接给出结论 这样的预测值是 最小方差线性无偏估计(UMVUE)

区间预测

给出定理

y^0y0N(0,σ2(1+x0(XX)1x0))\hat{y}_0-y_0\sim N(0,\sigma^2(1+x_0^{\prime}(X^{\prime}X)^{-1}x_0))

他的前提是随机误差服从均值为零的同方差估计 因此导出枢轴量

y^0y0σ^1+x0(XX)1x0tnp\frac{\hat{y}_0-y_0}{\hat{\sigma}\sqrt{1+x_0^{\prime}(X^{\prime}X)^{-1}x_0}}\sim t_{n-p}

所以对于给定的显著性水平 可以给出预测区间

[y^0tnp(α2)σ^1+x0(XX)1x0,y^0+tnp(α2)σ^1+x0(XX)1x0]\left[\hat{y}_0-t_{n-p}(\frac\alpha2)\hat{\sigma}\sqrt{1+x_0^{\prime}(X^{\prime}X)^{-1}x_0},\hat{y}_0+t_{n-p}(\frac\alpha2)\hat{\sigma}\sqrt{1+x_0^{\prime}(X^{\prime}X)^{-1}x_0}\right]

其实就是数理统计中的区间估计的一种情况 原理完全一样

回归方程的选择

在原本的回归方程选择问题中 还应该有回归模型的线性性检验 来确实是否要考虑非线性回归模型 但是我们在线性统计模型中不研究这一点 默认为线性模型 只进行回归自变量的选择工作

我们在第三章介绍了通过去除复共线性变量实现优化复共线性情况下MSE的逐步回归方法 这一章我们来介绍如何判断并消除复共线性的变量 最终实现得到逐步回归方程 我们需要使用一整章来介绍这个问题 需要研究多个小问题才能给出我们最终的逐步回归方法

计算所有可能的回归

对于一个有p1p-1个自变量的线性回归模型 自变量的任何一个子集都可以和因变量yy构成一个线性回归模型 那么我们实际上可以得到2p112^{p-1}-1个线性回归模型 寻找合理的计算次序和计算方法 控制计算量指数增加和控制误差是我们这一节要研究的内容

SpS_p序列法

我们把pp个自变量的子集用一个pp维向量(u1,u2,...,up)(u_1,u_2,...,u_p)来表示 其中ui=01u_i=0\text{或}1 分别意味着子集不含 含有这个变量 现在计算所有可能的回归就是从原点出发 : 沿着高维正方体的边 不重复的通过每一个顶点 能看出SpS_p序列的特点是: 每个回归子集恰好出现一次 相邻的回归子集只有一个变量不同 下面我们来介绍SpS_p序列的构造方法 首先 我们做以下的定义 SpS_p序列中 ii表示引入变量xix_i i-i表示剔除变量xix_i

S2={1,2,1}S_{2}=\{1,2,-1\}

意味着 第一次计算只有变量x1x_1的回归 第二次再这个基础上引入x2x_2 第三次剔除x1x_1 做只有x2x_2的回归 下面我们来介绍如果从0开始构造需要使用的SpS_p序列 首先定义 TiT_iSiS_i反序并改变符号的序列 也就是

S2={1,2,1}S_{2}=\{1,2,-1\} T2={1,2,1}T_{2}=\{1,-2,-1\}

现在我们给出迭代规则

S1={1}S_1 =\{1\} S2={S1 2 T1}S_2=\{S_{1}~2~T_{1}\} S3={S2,3,T2}S_{3}=\{S_{2},3,T_{2}\}

以此类推就可以了

矩阵消去变换

为了计算所有可能的回归 我们需要给出行之有效的算法 对于方阵

Ann=(aij)A_{n^*n}=(a_{ij})

引入新的方阵B=(bij)B=(b_{ij})

{bii=1/aiibij=aij/aii,ij,j=1,...,nbji=aji/aii,ji,j=1,...,nbkl=aklailaki/aii,ki,li\begin{cases}b_{ii}=1/a_{ii}\\b_{ij}=a_{ij}/a_{ii},i\neq j,j=1,...,n\\b_{ji}=-a_{ji}/a_{ii},j\neq i,j=1,...,n\\b_{kl}=a_{kl}-a_{il}a_{ki}/a_{ii},k\neq i,l\neq i\end{cases}

这称为以aiia_{ii}为枢轴的消去变换 记作B=TiAB=T_iA 对于矩阵的消去变换我们给出下面的性质

  • TiTiA=AT_iT_iA=A
  • TiTjA=TjTiAT_iT_jA=T_jT_iA
  • A=[A11A12A21A22]A=\begin{bmatrix}A_{11}&A_{12}\\A_{21}&A_{22}\end{bmatrix}qq阶方阵 T1T2...Tq=[A111A111A12A21A111A22A21A111A12]T_{1}T_{2}...T_{q}=\begin{bmatrix}A_{11}^{-1}&A_{11}^{-1}A_{12}\\-A_{21}A_{11}^{-1}&A_{22}-A_{21}A_{11}^{-1}A_{12}\end{bmatrix}

现在我们来使用矩阵的消去变换来研究线性回归模型有

y=Xβ+e,E(e)=0,Coν(e)=c2Iy=X\beta+e,E(e)=0,Co\nu(e)=c^2I

XX分块有X=(Xq,Xr)β=(φq,φr)X=(X_q,X_r)\quad\beta=(\varphi_q^\prime,\varphi_r^\prime)

B=XX=(XqXq)(Xq,Xr)=(XXqXXrXrXqXXr)=(B11B12B21B22)B=X'X=\begin{pmatrix}X'_q\\X'_q\end{pmatrix}(X_q,X_r)=\begin{pmatrix}X'X_q&X'X_r\\X_r'X_q&X'X_r\end{pmatrix}=\begin{pmatrix}B_{11}&B_{12}\\B_{21}&B_{22}\end{pmatrix}

则有

A=(BXyyXyy)=(B11B12XqyB21B22XryyXqyXryy)A=\begin{pmatrix}B&X^{\prime}y\\y^{\prime}X&y^{\prime}y\end{pmatrix}=\begin{pmatrix}B_{11}&B_{12}&X_q^{\prime}y\\B_{21}&B_{22}&X_r^{\prime}y\\y^{\prime}X_q&y^{\prime}X_r&y^{\prime}y\end{pmatrix}

那么就有

T1T2TqA=(B111B111XqyyyyXqB111Xqy)\left.T_{1}T_{2}\cdots T_{q}\boldsymbol{A}=\left(\begin{array}{ccc}{\boldsymbol{B}_{11}^{-1}}&{\star}&{{\boldsymbol{B}_{11}^{-1}\boldsymbol{X}_{q}^{\prime}\boldsymbol{y}}}\\{\star}&{\star}&{\star}\\{\star}&{\star}&{{\boldsymbol{y}^{\prime}\boldsymbol{y}-\boldsymbol{y}^{\prime}\boldsymbol{X}_{q}\boldsymbol{B}_{11}^{-1}\boldsymbol{X}_{q}^{\prime}\boldsymbol{y}}}\end{array}\right.\right)

能看出

B111XqyB_{11}^{-1}X_{q}^{\prime}\mathbf{y} 就是选模型的最小二乘估计 yyyXqB111Xqyy^{\prime}y-y^{\prime}X_{q}B_{11}^{-1}X_{q}^{\prime}y 就是选模型的残差平方和

因此我们可以看出 计算新的最小二乘估计变量为进行矩阵的消去变换的问题 想要引入新的变量 就对矩阵进行一次新的矩阵消去变换 想要剔除某个变量只需要再对他进行一次引入的时候做的消去变换 这样就可以避免每次计算新的回归模型 而是可以使用上一次变换的结果 这样的迭代方法对计算选模型有着重要的作用

计算最优子集回归

非常自然的思想就是我们要结合前面两节来进行研究 一节为我们选定了全部了子集 一节给出了评估最优的方法 两者不就可以了嘛

回归自变量子集的秩

对于每个包含q1q-1个自变量子集计算统计量Uq1U_{q-1}的值 这个值评估的是 在所使用的准则下 这个子集的好坏 其实就是用我们前面计算的准则 评估一堆包含着q1q-1个自变量的选模型 如果Uq1U_{q-1} 愈小愈好 则把最小的子集称为秩为1 如果Uq1U_{q-1} 愈大愈好 则把最大的子集称为秩为1 现在秩就反映了在所使用的准则下 这个子集的好坏 我们把所有的秩为1的Uq1U_{q-1} 做成一张图 就称为Uq1U_{q-1}

实际操作

事实上我们在实际研究中使用的方法就是前面在思想是使用的方法 只是结合前面介绍的Uq1U_{q-1} 图 针对每一种评价准则 我们都可以给出他们自己的Uq1U_{q-1} 图 然后可以人工比对多个模型Uq1U_{q-1} 图来找到自己认为最适合的最优子集 事实上就是一种主观的Voting

逐步回归

计算最优子集回归当然很好 但是当自变量的个数很多(一般认为是10以上) 虽然矩阵消去变换能节约大量的计算开销 但是这样的回归方式计算开销还是过大 因此我们提出了不计算所有子集的回归方法 其中逐步回归是应用的最普遍的一个 最优子集回归也无法处理复共线性的问题,逐步回归可以处理一定的复共线性,但是在复共线性严重的情况下 逐步回归不能直接作用于自变量的高度相关性 因此不能很好的发挥作用

逐步回归的思想

将变量一个一个引入,引入变量的条件是其偏回归平方和(PRSS)经检验是显著的 然后对旧变量逐个检验 剔除不够显著的变量 最后实现的效果是所有被选中的变量都是显著的 不在回归方程中的变量经过检验都是不显著的

偏回归平方和

偏回归平方和衡量了自变量中某个特定变量对因变量变化的解释程度。在多元回归模型中,偏回归平方和是该自变量在控制了其他自变量影响后,对因变量变异的解释程度 对于原模型

y=Xq+1φq+1+e{y=X_{q+1}\varphi_{q+1}+e}

剔除某个变量后的模型

y=Xqφq+e{y=X_q\varphi_q+e}

偏回归平方和PRSS=RSSqRSSq+1=β^q2(xqNqxq)PRSS=RSS_q-RSS_{q+1}=\hat{\beta}_q^2(x_q^{\prime}N_qx_q)

自变量的剔除

对于已有的模型的考察是否有要被剔除的 我们使用在假设检验一节中的回归系数显著性检验 检验

H:βq=0{H_\text{剔}{ : \beta _ q }=0}

那么就可以使用

β^iσ^ciitnp\frac{\hat{\beta}_i}{\hat{\sigma}\sqrt{c_{ii}}}\sim t_{n-p}

当然也可以使用他的FF检验形式

事实上 这样的假设的检验统计量也有一个等价的形式 这个等价形式是使用偏回归平方和进行推导的

F(q)=(nq1)β^q2(xqNqxq)RSSq+1\left.F_\text{剔}(q)=\left(\begin{matrix}n-q-1\end{matrix}\right.\right)\frac{\hat{\beta}_q^2(\boldsymbol{x}_q^{\prime}N_q\boldsymbol{x}_q)}{R\mathrm{SS}_{q+1}}

在一般的习惯上 我们会计算所有变量的FF_\text{剔} 找到其中最小的 如果最小的也足够显著 (大于临界值) 那么剔除结束 不能继续剔除了

自变量的引入

还是完全一样的思想 我们来做检验 看看假设

H:βq=0{H}_\text{引}{ : }\boldsymbol{\beta}_q=\boldsymbol{0}

是否会被拒绝 我们还是使用刚才导出的那个检验统计量

F(q)=(nq1)β^q2(xqNqxq)RSSq+1\left.F_\text{引}(q)=\left(\begin{matrix}n-q-1\end{matrix}\right.\right)\frac{\hat{\beta}_q^2(\boldsymbol{x}_q^{\prime}N_q\boldsymbol{x}_q)}{R\mathrm{SS}_{q+1}}

还是像刚才一样 我们去计算所有的没有引入的变量 得到一系列检验统计量

偏回归平方和那里一定是大减小 否则负数没法FF检验 分子是偏回归平方和形式 这次是去找到其中最大的 如果最大的小于选定的显著性 那就是所有变量都不够显著(引入结束) 否则选中一个变量 剩下的重做这样的过程

其他的逐步回归思路

向前法

从少到多只引入不剔除 知道所有量都被检验量一遍

向后法

将全部自变量都直接纳入回归模型 然后逐个剔除对RSS贡献比较小的自变量 直到没有量可以被去除

再谈回归假设与异方差问题

前面的回归方程假设直接从Gauss Markov 假设开始进行讨论,这里我们解释一下我们是怎么得出来这个假设了,他实际上并不是我们最初的回归假设形式

回归方程基本假设

一个回归问题,我们希望从一些自变量去预测一些因变量特征,其问题形式我们在线性回归基础 的“线性回归模型”一节里面介绍了。

那么我们给出四个最基本的回归问题假设,如果违背他们那么回归问题就无法实现回归的目标(解释与预测)

  • 给定x的时候,残差的条件期望为0 也就是我们要求残差和自变量不相关 如果残差和自变量相关,意味着它根本不随机,也就是没有捕捉到需要被用于预测的特征
  • 抽样i.i.d(时间序列数据一般是不满足i.i,d的) 这是统计学估计的基本假设
  • 没有极大的异常值 OLS是不robust的,所以要小心异常值
  • 不存在完全复共线性 我们求解OLS的时候需要作矩阵QR分解,如果完全复共线性则无法进行系数的求解

能够看出,这里的假设没有满足Gauss Markov 假设的要求,残差的方差此时我们没有假设相等

特别的,如果我们违背第一条假设,也就是内生性假设,线性回归基础中介绍的各种回归分析方法都会出现问题;我们需要考虑 广义线性回归 的“固定效应回归”一节 广义线性回归 的“工具变量回归”一节 来进行分析

如果我们违背Gauss Markov 假设对同方差的假设,就需要考虑异方差的问题本文“同方差与异方差”一节

如果我们违背抽样i.i.d的第二条假设,就会导致时间序列分析与自回归模型的产生线性时间序列分析 广义线性回归 的“残差自相关的回归模型”一节

如果我们违背第三条假设 就产生了 广义线性回归 的“稳健Robust回归技术”一节

如果我们违背了第四条假设,那么就引出了 本文“回归参数的估计2(复共线性下的估计)”一节

同方差与异方差

在给定 XX 时,关于ee分布唯一的假设是均值零(第一个最小二乘假设)更进一步,如果该条件分布的方差不依赖于XX,则称误差是同方差的。

这一章我们来讨论同方差的理论含义,我们在前面基于同方差假设进行的估计的理论风险

若对于任意i=1,2,...,ni=1,2,...,n,给定XiX_iuiu_i条件分布的方差 var(uiXi=x)var(u_i|X_i=x)为常数 且不依赖于xx,则称误差项uiu_i是同方差的;否则,称误差项是异方差的。

满足同方差假设,就是满足Guass - Markov 假设 估计量效果如下

  • OLS 估计量是无偏且近似正态的 这点对于异方差模型也是成立的
  • 误差同方差时OIS估计量的有效性 也就是BLUE
  • 同方差适用方差公式 也就是估计量方差的公式 特别的,我们目前应用的标准误差SE公式都是有异方差稳健性的,因此软件给出的结果无论是否异方差都可以直接信任

异方差性与应用

在实际模型中,能够确定同方差的模型少之又少;因此我们尽可能使用异方差稳健的各种分析方法。

遗憾的是,方差分析是完全不能异方差稳健的,因此我们进行方差分析的时候需要格外小心 试验设计方法

是否具有同方差需要具体问题具体分析,在不能判断的时候,尽可能采用异方差模型。在已知方差形式的时候有专门的GLS模型 线性回归基础 的“广义最小二乘估计(加权OLS)”一节 或者我们考虑使用前面指出的异方差稳健的标准误差

异方差检验

我们知道异方差模型会带来问题,当然也需要知道什么时候有异方差效应,从而注意到这个问题

在回归诊断进行残差分析的时候,有直观的图形方法可以观察异方差的问题

形式化的检验方法有 Breusch-Pagan (BP) 检验 White检验

回归分析的本质

关于本质是什么(寻找最佳预测器)

所有的回归分析都想研究随机变量之间的依存关系,当然我们也明确的知道,依存关系和因果关系并没有任何联系,因果推断是单独的一门统计学课程

通过概率分布来描述,即已知X=xX=x下,YY的条件概率密度fYX(yx)f_Y|X(y|x)它描述了XX多大程度决定YY但是比起概率密度,我们更关心的是其条件期望:E(YX=x)E( Y| X= x) 这种条件期望就是随机变量YYXX的回归函数。

我们为什么关注条件期望,这是因为:因为在均方误差MSE判定准则下,均方误差最小的函数就是条件期望 也就是说

g(X)=E(YX) 是 argmingFE[Yg(X)]2 的最优解g(X)=E(Y|X)\text{ 是 }\underset{g\in\mathbb{F}}{\operatorname*{\arg\min}}E[Y-g(X)]^2\text{ 的最优解}

事实上,在不同的准则下,有不同的最优解函数,他们在其他不同的回归模型中也应用广泛:比如MAE准则下的最优解是中位数,在Logit回归中,最大熵准则下,最优解就是SigmoidSigmoid函数

至此,如果我们使用MAE作为评判拟合好坏的指标,那么回归分析的本质就是它就是用各种已知的参数模型F\mathbb{F}来对 E(YX)E( Y| X)近似拟合。而我们一般用线性函数作为E(YX)E(Y|X)的近似,这就是线性回归模型

定理的证明(关于最佳预测器的证明)

命题 设 X=(X1,,Xp)X = (X_1, \dots, X_p)'pp 维随机向量,YY 为随机变量。对任意函数 f:RpRf: \mathbb{R}^p \to \mathbb{R},有: E(YE(YX))2E(Yf(X))2E(Y - E(Y|X))^2 \leq E(Y - f(X))^2 即条件期望 E(YX)E(Y|X)YY 的最佳预测器(在均方误差意义下)。

证明 : 通过展开平方项并利用条件期望的性质推导:

拆分差值 将 Yf(X)Y - f(X) 拆分为 (YE(YX))+(E(YX)f(X))(Y - E(Y|X)) + (E(Y|X) - f(X)),则: E(Yf(X))2=E[(YE(YX))+(E(YX)f(X))]2E(Y - f(X))^2 = E\left[(Y - E(Y|X)) + (E(Y|X) - f(X))\right]^2 展开平方和 根据平方展开公式 (a+b)2=a2+b2+2ab(a+b)^2 = a^2 + b^2 + 2ab,得: =E(YE(YX))2+E(E(YX)f(X))2+2E[(YE(YX))(E(YX)f(X))]= E(Y - E(Y|X))^2 + E(E(Y|X) - f(X))^2 + 2E\left[(Y - E(Y|X))(E(Y|X) - f(X))\right] 处理交叉项 利用条件期望的”迭代期望法则”(Law of Iterated Expectations),将交叉项的条件期望提取出来: E[(YE(YX))(E(YX)f(X))]=E[E[(YE(YX))(E(YX)f(X))X]]E\left[(Y - E(Y|X))(E(Y|X) - f(X))\right] = E\left[ E\left[(Y - E(Y|X))(E(Y|X) - f(X)) \mid X\right] \right] 由于 E(YX)f(X)E(Y|X) - f(X) 是关于 XX 的函数(记为 g(X)g(X)),可将其从条件期望中提出: =E[(E(YX)f(X))E[YE(YX)X]]= E\left[ (E(Y|X) - f(X)) \cdot E\left[Y - E(Y|X) \mid X\right] \right] 简化条件期望 注意到 E(YX)E(Y|X) 是给定 XXYY 的条件均值,因此: E[YE(YX)X]=E(YX)E(YX)=0E\left[Y - E(Y|X) \mid X\right] = E(Y|X) - E(Y|X) = 0 代入后交叉项变为: E[(E(YX)f(X))0]=0E\left[ (E(Y|X) - f(X)) \cdot 0 \right] = 0 合并结果 将交叉项为零代入原式,得: E(Yf(X))2=E(YE(YX))2+E(E(YX)f(X))2E(Y - f(X))^2 = E(Y - E(Y|X))^2 + E(E(Y|X) - f(X))^2 由于 E(E(YX)f(X))20E(E(Y|X) - f(X))^2 \geq 0(平方项的非负性),故: E(Yf(X))2E(YE(YX))2E(Y - f(X))^2 \geq E(Y - E(Y|X))^2 等号成立条件 当且仅当 E(E(YX)f(X))2=0E(E(Y|X) - f(X))^2 = 0 时,等号成立。由于平方项非负,这等价于: E(YX)f(X)=0几乎必然(almost surely)E(Y|X) - f(X) = 0 \quad \text{几乎必然(almost surely)}f(X)=E(YX)f(X) = E(Y|X)

结论 条件期望 E(YX)E(Y|X) 在均方误差最小化的意义下,是 YY 的最优预测器。任何其他基于 XX 的预测函数 f(X)f(X) 都会导致更大的均方误差,除非 f(X)f(X)E(YX)E(Y|X) 几乎处处相等。

最佳线性预测器

设随机向量 (YX)\begin{pmatrix} Y \\ X \end{pmatrix} 的期望为:

E(YX)=(μyμx)E\begin{pmatrix} Y \\ X \end{pmatrix} = \begin{pmatrix} \mu_y \\ \mu_x \end{pmatrix}

协方差矩阵为:

D(YX)=Σ=(ΣyyΣyxΣxyΣxx)>0D\begin{pmatrix} Y \\ X \end{pmatrix} = \Sigma = \begin{pmatrix} \Sigma_{yy} & \Sigma_{yx} \\ \Sigma_{xy} & \Sigma_{xx} \end{pmatrix} > 0

(正定阵)

对任意 αR\alpha \in \mathbb{R}βRp\beta \in \mathbb{R}^p,有:

E(Y(μyΣyxΣxx1μx+ΣyxΣxx1X))2E(Y(α+βX))2E\left(Y - \left( \mu_y - \Sigma_{yx}\Sigma_{xx}^{-1}\mu_x + \Sigma_{yx}\Sigma_{xx}^{-1}X \right)\right)^2 \leq E\left(Y - (\alpha + \beta'X)\right)^2

最佳线性预测器为:

Y^=α+βX=μyΣyxΣxx1μx+ΣyxΣxx1X\hat{Y} = \alpha^* + \beta^{*\prime}X = \mu_y - \Sigma_{yx}\Sigma_{xx}^{-1}\mu_x + \Sigma_{yx}\Sigma_{xx}^{-1}X

若随机向量 (YX)\begin{pmatrix} Y \\ X \end{pmatrix} 服从多元正态分布: N((μyμx),(ΣyyΣyxΣxyΣxx))N\left( \begin{pmatrix} \mu_y \\ \mu_x \end{pmatrix}, \begin{pmatrix} \Sigma_{yy} & \Sigma_{yx} \\ \Sigma_{xy} & \Sigma_{xx} \end{pmatrix} \right) 则对任意函数 f:RpRf: \mathbb{R}^p \to \mathbb{R},有: E(Y(μyΣyxΣxx1μx+ΣyxΣxx1X))2E(Yf(X))2E(Y - (\mu_y - \Sigma_{yx} \Sigma_{xx}^{-1} \mu_x + \Sigma_{yx} \Sigma_{xx}^{-1} X))^2 \leq E(Y - f(X))^2结论 在多元正态分布下,最佳线性预测器就是最佳预测器

回归平方和分解问题

在多元回归中,总平方和可以分解为: YY=YMY+Y(IM)Y=SSR(X)+SSEY'Y = Y'MY + Y'(I - M)Y = SSR(X) + SSE 其中:

  • SSR(X)=YMYSSR(X) = Y'MY 是回归平方和
  • SSE=Y(IM)YSSE = Y'(I - M)Y 是误差平方和

回归平方和可以进一步分解为: SSR(X)=SSR(X1)+SSR(X2X1)++SSR(XpX1,,Xp1)SSR(X) = SSR(X_1) + SSR(X_2|X_1) + \ldots + SSR(X_p|X_1, \ldots, X_{p-1})条件平方和的定义 其中 SSR(XjX1,,Xj1)SSR(X_j|X_1, \ldots, X_{j-1}) 表示:

  • 在模型中已包含 X1,,Xj1X_1, \ldots, X_{j-1} 的情况下
  • 加入 XjX_j 所带来的平方和增加

这种分解体现了多元回归中各个自变量的贡献层次:

  1. SSR(X1)SSR(X_1):第一个变量的独立贡献
  2. SSR(X2X1)SSR(X_2|X_1):在控制 X1X_1 后,X2X_2 的附加贡献
  3. 以此类推,每个变量的条件贡献都排除了前面变量的影响
  • Title: Advanced Linear Regression: Goodness of Fit, Model Selection, and Collinearity
  • Author: Hyacehila
  • Created at : 2025-09-23 04:02:07
  • Link: https://hyacehila.github.io//blog/2025/09/23/advanced-linear-regression-notes/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments