Generalized Linear Regression: Categorical Predictors, Dummy Variables, and Fixed Effects
概述
在广义线性回归一章中,我们不局限于研究传统的GLM模型,还会引入很多线性模型的变形,他们都会在广义线性回归一章中进行介绍。
特别的,使用定类自变量的 Logit 系列模型将单独介绍 Logistic 回归
本章的内容包括
- 分类自变量的回归模型
- 固定效应回归于工具变量回归
- 稳健的回归技术
- 等等
分类自变量与虚拟变量问题
分类变量,取值是有限的类别值,如性别:男、女。分类变量是不能直接用到回归模型中的,即使用 1 表示男,用 0 表示女,这个 1 和 0 仍然只能是起类别区分的作用,如果不加处理让它们当数值 1 和 0 使用了,那么整个模型的逻辑和结果都是不正确的
在R语言等各种编程的工具中 分类变量的类型是因子而不是数值 当我们把因子变量纳入回归模型的时候 R语言会自动帮我们处理并且得到最后的回归分析结果 现在我们想要介绍的是 他的内部是怎么处理这个因子变量的
one-hot 编码
one-hot 编码是一种非常自然的思想,使用一个bit来表示一种可能的类别,变量一般不能同时属于多个类别,因此每次只有一个bit为1 其他均为0 表示不属于此类别
使用 one-of-K 或者 one-hot 编码(独热编码one-hot encoding)。它可以把每一个有种类别的特征转化成种二值特征
我们可以把这些01特征正确的纳入回归模型或者那些更加复杂的机器学习模型来
虚拟编码(dummy coding)
所谓的虚拟变量(dummy variables) 其实原理上类似于独热编码 他仅仅表示是或者否 只有0 和 1 两种取值
虚拟编码于独热编码的最大差别就是参照类的选取与减少的一个自由度,把每一个有种类别的特征转化成种二值特征 剩下的那一个分类特征将作为参照,其他特征的意义是和参照类对比而产生的,其系数更加具有可解释性
分类变量用于回归模型 所起到的作用就是就是分组之间做比较,也只能是起分组比较的作用。
对于一个水平的分类变量 如果回归模型存在截距项 intercept 的情况下 我们必须建立 的分类变量 其他的项将以这一个项作为基准表示自己的含义 这是因为 如果我们对这种存在截距项的回归模型添加dummy variable 并且添加因子水平个 将会导致复共线性问题 导致最后无法求解
在模型原本没有截距项的时候 设置水平数个虚拟变量 但是模型不存在截距项是基本不可能的 这点不用考虑
此时 我们随机选择一个量(任意选取)作为基准 其他的虚拟变量都可以看作那些变量在以这个量为基准的时候 因变量随他们变化的结果
虚拟变量的不同会同时影响所有的回归系数与截距项
效果编码
效果编码也是选取参照类的编码方式,只是他把参照类的特征编码为
此时,截距项体现了整体均值,各个变量的系数体现了他和整体均值之前的差,在效果编码中,没有单独的特征被表示为参照类,我们需要单独计算参照,他是所有其他类别特征的系数的相反数之和
由于大规模系数矩阵带来的计算优势,我们使用效果编码的频率并不高
顺序性哑变量
我们还有顺序性哑变量 在编码的同时保留数据的顺序性关系 其思想和独热编码没有区别 一个简单的例子如下
| 特征 | 编码 |
|---|---|
| bad | |
| normal | |
| good |
为了更细的颗粒度,我们还有靶值率编码的方法,以后再学
固定效应回归
多元回归技术非常强大,但是遗漏变量问题一直是回归技术上非常重要的问题,他会大大影响我们估计的效果。
这一章我们介绍面板数据回归技术,凭借面板数据类型,我们可以控制那些实际没有观测到的变量,解释遗漏变量效应
前提是:遗漏变量不随时间变化(是类别的固定量),或者遗漏变量只随时间变化,我们有面板数据可以用于回归;
面板数据
面板数据回归,需要同时有横截面的数据和时间序列的数据 比如多年间美国多个州的酒驾导致的交通事故数量与酒精税等政府政策数据集。 也是一种非常常见的数据类型 描述性统计与可视化 的“测度”一节
在描述截面数据时,我们用下标表示个体,例如表示变量Y的第 个个体。在进行面板数据的描述时,我们需要额外的符号来同时追踪个体和时期。为此我们使用了双下标而不是单下标:首先, 表示个体;其次, 表示观测值的时期。因此表示 个个体中的第个个体在个时期中的第期时观测到的变量的值。
其他一些关于面板数据的术语描述了是否存在观测值的缺失。平衡面板(Balanced Panel)指的是具备所有观测值;即对于每个个体和每一时期,变量都被观测到了。如果存在至少一个时期或至少一个个体的数据缺失,那么面板被称为非平衡面板
两时期面板回归
通过比较两个时期的面板数据,我们就可以处理一些遗漏变量参与回归的问题,固定了那些在个体与个体之间变化而不随时间改变的不可观测变量的效应。
令是第个个体独有的,不随时间变换的不可观测变量引起的变动,我们可以构建回归方程为
因为我们提到了 效应是不随时间变化的,而我们有两阶段的面板数据,因此作差有
差分设定形式消除了不随时间变化的不可观测变量的影响,此时对差分后的方程进行回归分析的估计就可以使用常规的估计方法。其分析方式也可以直接使用常规的模型解释方法进行
当数据在两个不同年份被观测到时,可以使用这种“事前事后”分析。然而,我们的数据集包含了7个不同年份的观测值,而丢弃这些可能有用的额外数据实在不明智。这就引出了后面的固定效应回归
固定效应回归模型
固定效应回归是一种控制面板数据中随着个体(州)而改变但不随时间变化的遗漏变量的方法。不同于“事前事后”比较,固定效应回归可以用在每个个体具有两个或两个以上时期观测值的情形
固定效应回归模型具有个不同截距,一个截距与一个个体对应。这些截距可以用一个二元(或指示)变量的集合来表示。这些二元变量吸收了所有在个体之间不同但不随时间变化的遗漏变量的影响。
回归方程的基本形式是 其中是各个个体观测的固定量,不随时间变化而变化
如果我们把每个个体都构建有着自己的截距的模型 如下
当然我们还是要求回归系数项是在各个个体的回归方程中一致的,这就是固定效应回归模型(Fixed Effects Regression Model)
此时这样的模型肯定是没法使用OLS拟合的,我们还需要更多的变换
固定效应回归模型中特定个体的截距也可以用对应单独个体的二元变量来表示,也就是我们可以引入虚拟变量来将回归方程相统一,模型的形式如下
此时引入虚拟变量也会考虑导致多重共线性的问题,不要忘记考虑本文“分类自变量与虚拟变量问题”一节 此时模型就重新归类为传统的回归模型可以处理的问题
非常容易的,我们可以把这种回归类型引入多元回归的问题
时间固定效应回归
对每一个个体,固定效应表示那些不随时间变化但随个体变化的变量所产生的影响,同理,时间固定效应则表示那些不随个体变化但随时间变化的变量所产生的影响。如果遗漏时间回归效应也一定会带来模型效果的不合适
我们可以非常自然的给出一个只含有时间效应的模型,还是用一元举例
其中的 被称为时间固定效应(Time Fixed Effects)
正如个体固定效应回归模型可以用,一1个二元指示变量来表示一样,同理,也可以用 个二元指示变量来表示时间固定效应回归模型:
我们忽略了一个量避免复共线性的问题
时间固定效应设定让我们能够消去诸如全国性引入安全标准等随时间变化但对特定年的所有州都保持一致的遗漏变量带来的偏差。
对于时间效应的问题,可以参考线性时间序列分析 金融时间序列分析(一元) 能给我们提供更好的时间效应分析工具
混合时间固定效应和固定效应
如果某些遗漏变量对时间固定但是随个体变化(如文化规范),同时其他变量对个体固定但是随时间变化(如国家安全标准),那么同时引人个体和时间效应就是合适的。
整合的个体和时间固定效应回归模型(Entity and Time Fixed Effects RegressionModel)为
我们还是可以拆分成大量的虚拟变量来解决表示的问题
面板回归系数估计
我们知道,前面的方程可以使用传统的OLS估计实现系数的确定,但是实际中这种 OLS 回归是冗繁的,或者当个体数目非常多时某些软件包无法执行。
因此,计量经济学软件有着针对固定效应回归模型OLS估计的特殊处理方法。这些特殊处理方法等价于使用全体二元变量回归的 OLS 估计,但是由于使用了一些适用于固定效应回归的代数上的数学简化,因此运算速度更快。
在此,我们不解释这种运算上的技巧问题,仅仅作为一种提示,我们在进行面板数据回归的时候可以考虑专用的包实现运算加速
一种特别的面板回归估计方法为 在平衡面板中,系数的计算可以首先用和 减去它们个体及时间的均值,再估计出中心化后的对中心化后的 的多元回归方程。这种通常应用于回归软件中的算法避免了构造全体二元指示变量的集合
面板回归的标准误差
由于面板回归包含时间序列数据,因此其一定是自相关的,这是时间序列数据普遍特征;因此,回归误差对应的遗漏因素也很可能含有时间变动因素,他们也是自相关的 总体而言,只要遗漏因素是自相关的 那么误差也将是自相关的
如果回归误差是自相关的,那么原本的异方差稳健标准误差就不再适用,正如原本的同方差SE不再适用是一样的。
对于存在潜在异方差性与个体自相关的误差,那么应该采用集群标准误差,他专用与面板数据回归,仍旧假设个体之间不相关,他同样可以用于异方差与同方差的的问题
最后,面板数据回归需要面板数据,这不好取得,因此我们需要考虑其他方式处理不可观测变量,也就是下一章的工具变量回归
工具变量回归
工具变量回归介绍
面板数据回归只能解决一部分残差和自变量相关的问题,而且有时候我们也无法收集面板数据。同样的,固定效应回归也对双向因果的偏差没有作用,此时我们就需要新的方法来解决这个问题了。
我们还是希望解决回归变量与残差相关的问题,不过此时我们不再考虑这种相关是怎么产生的,直接用一个变量来衡量他,这就是工具变量回归(Instrumental Variables Regression)
工具变量回归(IVR)是一种当自变量和误差项相关的时候一种获取一致估计的回归函数的一种一般性方法。我们把的变动视为两个部分组成的,一个与残差无关的变动,另一个是与残差相关的变动;我们用分离出的工具变量(IV)分离那些和残差相关的变动,从而让回归方程的系数估计有一致性
工具变量回归本质上是引入了新的变量,但是没有和以前一样,直接把变量用于估计
单回归变量和单工具变量的工具变量估计量
我们从单个回归自变量开始研究这个问题
工具变量回归模型与内生性
一个标准的总体回归模型的形式为
现在自变量和残差相关 我们需要想办法解决这个问题
工具变量回归有着特定术语来区分与总体误差项相关或无关的变量。与误差项相关的变量称为内生变量(Endogenous Variables),而与误差项无关的变量称为外生变量(Exogenous Variables)。
有效的工具变量必须满足两个条件,即工具相关条件 (Instrument Relevance Condition) 和工具外生条件 (Instrument Exogeneity Condition):
- 工具变量相关:corr
- 工具变量外生:corr
如果工具是相关的,则工具的变化与的变化相关。此外,如果工具是外生的, 那么工具变量所捕捉到的的这部分变化也是外生的。
因此,相关且外生的工具能够捕捉到的外生变化。这一外生变化可以反过来用于估计总体系数
两阶段最小二乘法TSLS(一元)
如果工具满足了相关性和外生性的条件,那么系数可以通过一种称为两阶段最小二乘法(Two Stage Least Squares, TSLS) 的工具变量估计量进行估计。
正如其名,两阶段最小二乘估计量通过两个阶段计算得出。第一阶段将分解为两个部分: 一个是与回归误差相关且引起问题的部分,另一个是与误差无关从而不会引起问题的部分。第二阶段使用不会引起问题的部分去估计
第一阶段从联系 X 和 的总体回归开始:
这个回归的作用是将原始的自变量进行分解。其中截距项和 是外生的,这一部分与误差项是无关的。后一部分则是与残差项相关的,引起问题的那一部分原始自变量
最小二乘法背后的思想是使用不会引起问题的那部分,即,同时忽略。唯一的复杂之处就在于和的取值未知,故无法被计算出来。
因此, 最小二乘法的第一阶段将 OLS 应用于前一个方程,同时使用了 OLS 回归中的预测值, 即,其中和为OLS估计量。 最小二乘法的第二阶段非常简单:使用 OLS 进行对的回归。第二阶段回归得到的估计量即为最小二乘估计量,和。
TSLS的抽样分布
在小样本下,TSLS估计量的精确分布非常复杂。然而,如同 OLS估计量一样,其分布在大样本下较为简单:TSLS 估计量为一致的且服从正态分布。
尽管 TSLS 的两阶段使得估计量看上去较为复杂,但当仅考虑一个回归变量 和一个工具变量时,即如同我们本章的假设时,TSLS 估计量有一个较简单的公式。令 为 和之间的样本协方差,而 为 和 之间的样本协方差。含有一元工具变量的 TSLS估计量为
更多的推断工作交给软件使用专门的命令完成,这里不再继续叙述
一般工具变量回归
一般工具变量回归模型形式
一般工具变量回归模型含有四种形式的变量:被解释变量 ;引起问题的内生回归变量记为;其他回归变量,称为包含外生变量(Included Exogenous Variables),记作; 以及工具变量。
一般地,可能存在多个内生回归变量()、多个包含外生变量(),以及多个工具变量()。
为了使工具变量回归可行,工具变量()的个数至少要和内生回归变量()一样多。在前一节只考虑了一元内生回归变量和一元工具变量的情形。对一元内生回归变量而言,则需要(至少)一个工具变量。如果没有该工具,我们将无法计算出工具变量估计量:即 TSLS 中不存在第一阶段回归。
工具变量个数和内生回归变量个数的关系有其自身的专业术语。如果工具的个数()等于内生回归变量的个数(),即,则称回归系数是恰好识别(Exactly Identified)的。如果工具的个数大于内生回归变量的个数,即,则称系数是过度识别 (Overidentified) 的。如果工具的个数小于内生回归变量的个数,即,则为不可识别 (Underidentified)的。
如果想要估计工具变量回归,那么系数必须是恰好识别或过度识别的。
据此 我们应该把模型表示为
两阶段最小二乘(一般)
如果只有一个自变量 那么其形式应该为
对应的第一阶段最小二乘应该为
第二阶段我们只需要使用第一阶段的预测值进行估计
扩展到多元回归问题,我们只需要在第一阶段进行多个自变量的第一阶段最小二乘,第二阶段不变。
更多的关于假设检验 误差估计的内容这里不再介绍,软件会为我们解决需要的问题
工具变量有效性检验
工具变量回归是否在给定的应用中发挥作用取决于这些工具是否有效,无效的工具变量得出的是无意义的结果。因此在特定应用中去评价一个工具集合是否有效就显得尤为重要了。
工具变量相关性与弱工具
工具相关性条件在工具变量回归中起着非常微妙的作用。一种看待工具相关性的角度是将它的作用类比于样本容量:工具变量越相关——即越多的的变化是由工具所解释——意味着工具变量回归中可以使用越多的信息。
解释较少变化的工具称为弱工具(Weak Instruments)。在香烟一例中,州和香烟产地间的距离可被证明是一个弱工具:尽管距离越远越会增加运输成本(从而使供给曲线向左移动,均衡价格上升),但是由于香烟重量很轻,所以运输成本在香烟价格中只占很小的一部分。因此,价格变化中被运输成本即和产地间的距离所解释的那部分可能非常小。
这一节我们来讨论相关性和弱工具的问题
如果是弱工具,那么用正态分布去近似 ISLS估计量的抽样分布效果不理想。因此尽管为大样本,但使用通常的统计推断方法也缺乏理论依据。实际上,如果工具是弱的,则 TSLS 估计量会严重地偏向 OLS 估计量的方向。
此外,使用±1.96 倍 TSLS 估计量标准误差构建的 95%置信区间所包含系数真实值的概率可能远远小于 95%。简言之,如果工具是弱的,那么 TSLS不再可靠。
工具变量完全不相关的情况很少遇到,但是多大的工具变量相关程度可以认为是可以进行的工具变量回归,我们有经验法则: 对第一阶段最小二乘回归进行回归方程为0的假设检验,如果F统计量大于10则可以认为无需担心弱工具的问题
如果我们有很少的强工具和很多的弱工具,我们最好忽略那些比较弱的工具变量;虽然这种操作会带来TSLS的标准误差增大,但是含有弱工具的SE本身就没什么作用
如果系数是恰好识别的,哪怕是过度识别的也可能找不到那么多可用的强工具,那么我们不能忽略那些弱工具。寻找一些新的工具变量或者使用弱工具文件的IVR方法是可选的做法
工具变量外生性
如果工具非外生,则 TSLS是非一致的:即 TSLS估计量依概率收敛到非总体回归系数的其他数值。毕竟,工具变量回归的思想是工具中包含了与误差项无关的变动的信息。
可以从统计上检验工具外生性假设吗?可以,但同时也有可能不可以。一方面,当系数为恰好识别时,无法检验工具为外生的假设。另一方面,如果系数是过度识别的, 那么可以去检验过度识别约束,即假设存在足够多的有效工具以识别感兴趣的系数,从而检验“额外”的工具是外生的。
首先考虑恰好识别的情形,此时你拥有的工具变量个数同内生回归变量个数一样多。在该种情况下无法进行工具在事实上为外生的假设的统计检验。这也就是说,经验证据无法用来回答工具变量是否满足外生性约束的问题。
在这种情形下,评价工具为外生的唯一方法是采取专家的建议以及你对该问题的经验认识。
评价工具变量是否外生必须要基于个人对实践应用的知识来做出专业化判断。然而,如果存在比内生回归变量更多的工具时,则存在着对这一过程能够起帮助的统计学工具:即过度识别约束检验。
过度识别检验的思想是使用多个工具变量分别进行多次TSLS,如果他们都是外生的,估计的结果一定很接近,如果并不接近,那意味着至少一个变量出现了外生性的问题。我们有专门的假设检验可以解决这个问题,一般是统计量
寻找有效的工具变量
在实践中,工具变量估计中最困难的部分就是找到既相关又外生的工具变量。这里主要介绍两种方法,其反映了两种不同的计量经济学和统计学建模观点。
第一种方法是基于经济理论找到工具。例如,菲利普·莱特对农业市场经济的了解促使他寻找一个移动供给曲线但不移动需求曲线的工具;而这也引领他去考虑农业区域的天气状况。然而,经济理论是抽象的,常常没有考虑到具体分析的数据集中微小和细节性的差别,因此该方法并不总是有效。
第二种构造工具变量的方法是去寻找变化的某些外生根源,而这些根源实际上是由一种导致内生回归变量移动的随机现象所带来的。这种方法往往需要对研究的问题充分了解,同时对数据细节仔细发掘,最好通过具体的案例加以解释。
我们用三个案例来看看其他学者是怎么找到合适IV的
将罪犯关入监狱能抑制犯罪吗
这是一个只有经济学家才会问的问题。毕竟,罪犯在服刑期间无法在监狱以外犯罪,同时将一些罪犯抓捕人狱也有助于阻止他人犯罪。但是综合效应的大小——即人狱人数增加 1%所引起的犯罪率变化——却是一个实证问题。
对这种效应进行估计的一种策略是基于适当管辖权水平上(如美国的州)的数据将犯罪率(总人口中每 100 000 人的犯罪人数)对人狱率(每 100 0000 人中的囚犯数进行回归。
这一回归可能包括了某些度量经济条件(当总体经济形势恶化时犯罪增加). 人口统计(年轻人比年长者更容易犯罪)等因素的控制变量。然而,这里可能存在着由潜在的双向因果偏差所带来的严重问题:如果犯罪率上升而警察秉公行事,那么将会出现更多的囚犯。一方面,囚犯增加会导致犯罪率下降;由于双向因果性,建立犯罪率对人狱率的 OLS 回归将会估计出这两种效应的复杂混合。而这一问题无法通过寻找更好的控制变量解决
然而,我们可以通过找到合适的工具变量并使用 TSLS 的途径来克服双向因果关系偏差。该工具必须与入狱率相关(必须满足相关条件),但同时又与感兴趣的犯罪率方程中的误差项无关(必须满足外生条件)。也就是说,工具必须能够影响到入狱率,但同时又与任何不可观测的犯罪率的决定因素无关。
如何寻找工具变量呢? 首要的便是现存监狱容量的外生变化。因为修建监狱需要耗费时间,故短期内容量的限制可能迫使各州提前释放囚犯或减少入狱率。基于这一原因,莱维特(Levitt,1966)认为针对缓解监狱拥挤程度的法律诉讼可以作为工具变量,同时他基于 1972一1993 年美国各州的面板数据进行了实证分析。
我们能感觉到,这种针对监狱拥挤程度的观测量和犯罪率无关,但是确实和入狱率有关系。同时满足相关性和外生性。如果我们针对这个侧面继续挖掘更多的研究监狱拥挤程度的观测量,就能得到多个工具变量。
缩减班级规模能增加考试分数吗
正如我们在曾经做出的实证分析,小班编制的学校较为富有,同时它们的学生能够获得更多的校内外强化学习机会。
我们通过控制关于学生富裕程度、英语口语能力等各种变量并利用多元回归的方法克服了遗漏变量偏误的威胁。然而怀疑者会好奇我们是否做到位了:如果我们仍遗漏了重要的东西,那么我们对于班级规模效应的估计将依然是有偏的。
这种潜在的遗漏变量偏误可以通过引人正确控制变量的方法加以克服,但是假如这些变量是不可用的(例如难以度量的校外学习机会),则应该使用工具变量回归作为替代方法。该回归需要一个与班级规模相关(相关性),但同时与构成误差项的测试成绩决定因素(如家长的学习兴趣、校外学习机会、教师水平和学校设施等等)无关(外生性)的工具变量。
霍克斯比(Hoxby,2000)提出使用生物学理论。由于出生时间的随机波动,每年前往幼儿园报到的新生人数都不同。尽管进入幼儿园的实际儿童人数可能是内生的(最近有报道曾指出学校可能会影响父母是否将子女送人私立学校), 但她指出进人幼儿园的潜在儿童人数——即学区内 4 岁的儿童人数——主要是由于孩子出生日期随机波动所导致的。
对心脏病采取积极作用能延长寿命吗
对心脏病(专业角度称为急性心肌梗塞,AMI) 患者进行积极治疗有助于延长生命。在新型治疗手段推广到一般应用之前,必须首先进行临床实验,即一系列旨在度量其效果和副作用的随机对照实验。然而临床实验效果良好是一回事,在实际应用中的效果又是另一回事。
研究实际功效的一个自然出发点便是对比接受该治疗和没有接受该治疗的患者的情况。这就需要建立患者寿命对二元治疗变量(患者是否接受了心导管插人术)和其他影响死亡率的控制变量(如年龄、体重、其他健康条件情况等等)的回归。
指示变量的总体系数则为接受该治疗所增加的患者期望寿命。不幸的是,OLS 估计存在偏差:手术并非“随机”对患者实施的;相反,它是在医生和患者认为其可能有效时才被实施的。如果其决定部分取决于不在数据集中但与健康结果相关的不可观测因素,那么治疗决定将会同回归误差项相关。如果最健康的患者接受了治疗,那么OLS 估计量将是有偏的 (治疗与遗漏变量相关),而此时该治疗将会看上去比其真实效果更加具有功效。
我们需要一种与治疗相关但是与影响寿命的健康因素无关的工具变量来处理这个问题。
麦克莱伦、麦克尼尔和纽豪斯(McClellan, McNeil, and Newhouse,1994)认为应当使用地理位置。在他们的数据集里大部分医院都并非是心导管插人术专科医院,所以许多患者前往不提供这种治疗的“常规”医院的距离要近于去心导管插人术医院的距离。因此麦克莱伦、麦克尼尔和纽豪斯将心脏病患者的住宅到最近的心导管插人术医院的距离同住宅到最近的普通医院的距离之差作为工具变量;而如果最近的医院为心导管插人术医院则距离为零,否则为正。如果上述的相对距离影响了接受治疗的概率,那么它就是相关的。而如果相对距离在心脏病患者中随机分布,则其是外生的。
一些关于IV的经验总结
- 不要手动进行两步回归
- 第一阶段必须包含所有外生变量
- 谨慎使用滞后项作为工具变量 通常不满足外生性假设
- 工具变量并非越多越好
- 工具变量不是万能药 找到同时满足强相关性和严格外生性的工具变量非常困难.外生性无法被直接检验,必须依赖强有力的理论论证.
Robust回归与Influential Observations
Influential Observations的来源
有影响的观测值指那些对回归估计结果有足够大影响的观测点,以至于将其移除会导致参数估计值和研究结论发生实质性变化,从而使结论变得不可靠。
它可能有两个来源
- 杠杆值 (Leverage) 解释变量不同寻常
- 异常值特性 (Outlier nature) 因变量不同寻常
我们不能忽视Influential Observations 因此需要研究他的检验以及Robust的回归技术.
学生化残差
其介绍参考 线性回归基础 的“最小二乘估计下的残差”一节 学生化残差是最基础的研究异常值的工具,一般和残差图结合使用.
杠杆Leverage
我们知道,构建OLS回归方程中的各个观测实际上对方程系数估计量的影响大小是不同的。 杠杆Leverage就是希望研究各个观测对回归方程系数估计量的影响大小。
OLS回归中各个观测的Leverage定义为
对于杠杆较大的点,回归线的斜率更倾向于从该点到均值的斜率,即杠杆较大的点在确定回归线的斜率方面最为重要。杠杆率小的点不算那么多,我们可以在不改变回归线的情况下删除它们。
库克距离 Cook’s distance
杠杆还是不够直观,我们需要给出通用在各个回归模型中的统计量 也就是库克距离(统计量)
是回归变量的数量。它给出了估计参数与删除这个观测组后它们之间的差异的度量经验法则是考虑那些库克统计量大于1的观测组;研究他们是否是影响过大的
库克距离只适用于单个的大影响点排出,从理论上我们能看出这一点,只要有不止一个大影响点,他无法被库克距离识别
击穿值 Breakdown Value
击穿值用来衡量一个估计量 的 鲁棒性 robust;他表明了估计量安全所需要的最多异常值
举个例子,均值作为集中趋势的一个度量,他的击穿值是0,任何一个极端影响样本都会破坏掉我们的估计效果
很明显,任何合理的估计器的击穿点都不能超过50%(因为如果超过一半的观测值被污染,则无法区分潜在分布和污染分布
鲁棒的OLS回归
当误差分布呈正态时,最小二乘法 (LS) 是最有效的回归估计器。但是,LS对高杠杆点的异常值非常敏感。因此,OLS 往往会在存在此类异常值时崩溃。
虽然通常可以通过敏感度分析检测到单个异常值,但如果存在一组异常值,它们可以“掩盖”问题。这种情况会导致重尾误差分布。因此,我们需要一些Robust的回归技术
最小绝对偏差回归 Least Absolute Deviation
最优化方法更改为
LAD是可能出现问题的,他对于的较为敏感; 在某些情况下,如果仅存在一个具有损坏 y 值的异常值,它可能会崩溃。
中位数回归 Least Median Squares
LMS 估计器是寻找最小化 中位数的β(即它最小化有序平方残差的中位数)。LMS 估计器具有很高的击穿值,但计算很困难。
广义线性模型GLM
什么是GLM
广义线性模型(Generalized Linear Model)是常见正态线性模型的直接推广,它可以直接适用于连续和离散的数据;广义线性模型要求 相应变量以线性形式依赖于处变量 保持了线性变量的思想;它进行了两个方面的推广
- 通过一个连接函数ψ,即对响应变量期望的变换, 将响应变量的期望与解释变量建立线性关系(对y进行线性变换)
- 通过一个误差函数, 说明广义线性模型的最后一部分随机项;(残差自然也有了不同的形式)
在推广之后 我们可以概括GLM的三个要点
- 线性依赖关系
- 连接函数
- 误差函数
模型如下: 我们原始的线性回归模型可以表示为
在传统的线性回归模型中, 就是观测因变量的条件均值,并且我们要求 服从正态分布
在GLM广义线性模型中,拟合形式变为
其中 是条件均值的函数,我们称为连接函数;另外,你可放松为正态分布的假设,改为服从指数分布族中的一种分布即可。设定好连接函数和概率分布后,便可以通过最大似然估计的多次迭代推导出各参数值。
连接函数和分布族的选取
我们能发现,目前对于GLM问题我们有两个重要的超参数需要选取
- 概率分布类型(因变量的概率分布)
- 连接函数类型(进行什么变换)
实际上,不同的概率分布都有自己默认的连接函数,如下表
| 分布类型 | 连接函数 | 回归的名字 |
|---|---|---|
binomial |
(link = "logit") |
Logit回归 |
gaussian |
(link = "identity") |
普通线性回归 |
gamma |
(link = "inverse") |
GLM回归 |
inverse.gaussian |
(link = "1/mu^2") |
GLM回归 |
poisson |
(link = "log") |
泊松回归 |
quasi |
(link = "identity", variance = "constant") |
准分布GLM |
quasibinomial |
(link = "logit") |
准分布Logit |
quasipoisson |
(link = "log") |
准分布泊松 |
^d089b1
我们需要根据因变量的分布情况进行合适的模型选择,至于怎么检查分布类型,这里不需要研究
经典的GLM
我们在Logistic 回归里面详细的介绍了GLM回归中的最经典形式,可以让我们理解我们究竟在做什么,也可以让我们类比理解其他的GLM回归
- Title: Generalized Linear Regression: Categorical Predictors, Dummy Variables, and Fixed Effects
- Author: Hyacehila
- Created at : 2024-05-24 09:32:12
- Link: https://hyacehila.github.io//blog/2024/05/24/generalized-linear-regression-notes/
- License: This work is licensed under CC BY-NC-SA 4.0.