Nonlinear Regression: Intrinsic Nonlinearity, Polynomial Models, and Nonlinear Least Squares
非线性回归
我们知道 有的非线性模型可以靠一些变换转换成线性回归模型 这种模型我们称为内在线性的;有的模型无法被化为线性模型,无论怎么变换都不可以 这种模型我们称为内在非线性模型上 我们分别介绍他们
内在线性模型
多项式回归
多项式回归是最经典的内在非线性模型了;除去那些可以直接在多元线性回归中修正出来的内在非线性模型,我们只额外介绍一元多项式回归模型 模型的形式如下
容易知道 只用进行简单的变换就可以转化为前面的线性回归模型进行运算
正交多项式回归
多项式回归存在一个问题 当次数比较大的时候 接近线性相关 这会为正则方程的求解带来很大的困难 导致计算误差比较大;对应的 我们估计出来的参数的方差就比较大 因此我们引入了正交多项式回归 模型形式为
其中
具体的推导公式我们就不给出了 R中会提供对应的算法
内在非线性回归
我们只用介绍 非线性最小二乘和极大似然模型 模型形式为
我们可以使用极大似然的方法实现残差平方和最小化 也就是
具体的计算方法这里不进行推到了 R提供了相应的函数 涉及最优化的问题
非线性回归模型中系数解释没有线性回归中那么直观,我们最好通过绘图或者列表表示自变量变动的时候目标变量的变化情况来解释一个回归模型,无论是多项式,对数等变换回归模型都应该这么解释
残差分析的一些思路
现在我们已经大概理解了残差的意义 可以使用残差来尝试处理实际问题了
根据前面的提议 如果我们建立一个横坐标为拟合值向量 纵轴是学生化残差的残差图 平面上的点应该大致均匀的落在一个水平带内
这张图就意味着我们假设 是基本合理的


这三张残差图都意味着误差等方差是不成立的 我们要处理模型的拟合了
两张图都意味着我们的假设有问题 可能是这是非线性模型 自变量缺损 误差相关性等 残差分析的果可能有非常多的导致原因 这需要经验才能处理
当然我们也可以建立其他的残差分析图 比如跟随时间变化研究残差 根据某个自变量研究残差等等 残差分析是回归诊断非常重要的一个部分 我们这里的介绍是完全不足的
残差分析遇到的问题需要逐步的被我们进行处理
比如认为缺少回归项时进行适当的增补 认为非线性时展开变形来修正为线性
遇到误差方差不等的情况 可以使用Box-Cox变换等变换(选择变换是高自由度的) 应用加权最小二乘估计等方式
残差分析并不只我们在这里介绍的很少的一部分,我们以后会学到更多的关于残差分析的知识,但是并不是现在
很常见的残差分析还有:直方图分析残差正态性,QQ图分析残差正态性 SW检验分析正态性 游程检验分析独立性 异常点检验等
残差自相关的判断 有DW检验 处理方法有GLS techniques like Cochrane Orcutt and Prais-Winsten
Add lags to the model for example we could specify an autoregressive distributed lag (ARDL) model
Leave model alone but fix the standard errors using Newey-West/HAC standard error
这里不叙述细节 有机会再进行补充
1. Hartley 检验 (Hartley’s F-max Test)
公式:
- 含义:计算各组样本方差中最大值与最小值的比值。
- 适用条件:要求各组样本量相等(平衡设计)。
- 原假设 (H₀):所有组的总体方差相等()。
- 拒绝域:当 超过临界值时,拒绝原假设,认为方差不齐。
2. Cochran 检验 (Cochran’s C Test)
公式:
- 含义:计算最大样本方差占所有样本方差总和的比例。
- 适用条件:同样要求各组样本量相等。
- 原假设 (H₀):所有组的总体方差相等。
- 拒绝域:当 超过临界值时,拒绝原假设,认为存在一个显著偏大的方差。
3. Bartlett 检验 (Bartlett’s Test)
公式:
- 含义:基于对数似然比构造的卡方统计量,用于检验多个正态分布总体的方差是否相等。
- 适用条件:数据需近似服从正态分布;对非正态性敏感。
- 其中:
- 是第 组的自由度( 为第 组样本量)
- 是第 组的样本方差
- 是总自由度
- 是合并方差(加权平均方差)
- 是修正因子(用于小样本校正)
- 原假设 (H₀):所有组的总体方差相等。
- 拒绝域:当 值大于 分布的上侧分位数时,拒绝原假设。
00:43 残差是拟合数据和真实数据的差值 适当的展示和研究残差可以让我们注意数据中某些前面被忽视的系统性行为
研究残差
数据是拟合和残差的叠加,我们希望对残差不断进行分析,修正我们的拟合
回归函数的形式可能也会选择错误,我们从残差分析不断思考迭代生成我们的模型 一些非正式的标准有:残差中不存在规律,都是随机误差导致的,较小的残差平方和,较好的拟合优度r方
在数理统计中我们往往是对残差进行假设,用这种设定好的残差分布实现最好拟合,再反过来研究拟合的残差是否符合假设,其中最为主要的是研究残差图
一种比较经典的残差分析是离群点检验
只要我们使用耐极端值的稳健方法,模型会基本忽视离群点的存在进行拟合,那么残差分析将会很好的暴露离群点的存在
计算得到的残差就是一批完整的数据,我们可以把他们继续投入到eda的分析中去,进行我们在描述统计里做过的那些,研究分布,集中离散,形状等等等等
我们大部分拟合的手法往往都是让残差的某个函数最小化 比如les,在研究出残差的规律后,我们可以变化这样的函数 比如加权残差平方和
限制性立方样条 RCS
在科学研究中,我们经常构建回归模型来分析自变量和因变量之间的关系。大多数的回归模型有一个重要的假设就是自变量和因变量呈线性关联。
当存在非线性的关系的时候,我们需要采用一些非线性回归的手段。比如多项式回归方法或者将连续型变量转化为离散型变量再进行分类问题。
遗憾的是直接构建多项式回归可能存在过度拟合、共线性等问题。离散化因变量会损失部分信息,而且节点的位置与类别数目的选择比较复杂。
综上,「限制性立方样条」(Restricted cubic spline,RCS)就是分析非线性关系的最常见的方法之一。
样条(spline)原本是指是一种灵活的细木条或金属条,用来绘制平滑曲线。样条曲线本质是一个分段多项式函数,此函数受限于某些控制点,称为 “节点”,节点放置在数据范围内的多个位置,多项式的类型以及节点的数量和位置决定了样条曲线的类型。立方则指的是 函数为3次多项式。限制是在回归样条的基础上附加要求:样条函数在自变量数据范围两端的两个区间 [X1,X2) 和 (Xn-1,Xn] 内是线性函数。
上面的介绍就可以让我们理解到底什么是限制立方样条RCS,他只是一种非线性的回归方法。
RCS节点的数量比位置更重要。由于节点个数的选择和自由度有关, 所以当样本量比较大的时候可以取较多的节点。但是节点越多, 自由度越大, 模型越复杂, 越难解在。
建议节点数为4,模型的拟合效果较好,即同时可以兼顾曲线的平滑程度以及避免过拟合造成的精确度降低。当样本量较大时,5个节点是更好的选择。小样本()可以选择3个节点。当节点的个数为2时,得到的拟合曲线就是一条直线。大多数研究者推荐的节点为3-5个。
在绘制RCS的时候,我们往往还会绘制百分之九十五的CI,RCS只能处理一对一的回归问题,局限性很大,不过在很多领域非常实用。
Cox 回归简介
Cox回归,也称为Cox比例风险模型(Cox Proportional-Hazards Model)或生存分析模型,我们也可以简称为Cox模型,是由英国统计学家D.R. Cox于1972年首次提出的一种半参数回归模型,是一种广泛用于生存分析领域的统计方法。它用于研究事件相关时间,这个事件可以是任何类型的时间相关事件,如生存时间、失业时间、疾病复发时间等。Cox回归的主要目标是分析事件发生的危险或风险,并探讨与这些风险相关的因素。
也就是说,作为一种回归模型,我们的因变量是生存时间,疾病复发时间等时间指标,这种事件发生时间意味着事件发生的风险。我们希望研究这种风险,以及影响风险的相关因素(自变量) 二分类结局变量也可以作为Cox回归因变量,只是用的没有那么广泛
生存时间的最大特点就是一般不符合正态分布(通常为右偏分布)并且可能包含截尾数据(因为有些个体在研究结束时仍然存活),传统的回归方法不能处理这种数据,这就是 Cox 回归的意义。
Cox模型建立在比例风险假设的基础上,这一假设认为在不同个体之间,风险的比例是恒定的,即风险不会随时间改变。这个假设使得模型能够估计不同因素的相对风险,而不需要知道风险函数的具体形式。
Cox回归的原理
基本概念
我们先来了解几个基本概念:
- 生存时间(Survival Time):表示从某个特定起始点(例如治疗开始、诊断时间等)到发生事件(如死亡、复发)之间的时间间隔。
- 生存函数 (Survival Function) : 表示在某一时间点之前生存下来的概率,通常用表示。
- 危险函数 (Hazard Function): 这是Cox模型的核心概念,表示在某一时间点附近单位时间内发生事件的概率,也就是给定时间点的瞬时风险,通常用表示。风险(Hazard)表示在一段时间内发生事件的概率。
- 协变量(Covariates):可能影响生存时间或事件发生率的自变量,如年龄、性别、治疗方式等。
- Cox比例风险假设:Cox模型的核心假设是危险函数是时间的函数,但危险函数的比率在不同个体之间是恒定的。
Cox回归模型的基本形式如下:
其中 是时间 的危险函数, 是基准危险函数,通常是整个样本的平均危险函数。 是常规的回归自变量和对应的系数
Cox回归的特点 :
- Cox回归是半参数模型,它不需要对基准风险函数进行特定的假设,因此非常灵活。
- 可以处理右偏分布的生存数据,不需要满足正态分布假设。
- 允许分析多个协变量对生存时间的影响,并估计它们的相对风险。
- 可以处理被审查数据和截尾数据。
- Title: Nonlinear Regression: Intrinsic Nonlinearity, Polynomial Models, and Nonlinear Least Squares
- Author: Hyacehila
- Created at : 2025-09-23 04:00:46
- Link: https://hyacehila.github.io//blog/2025/09/23/nonlinear-regression-notes/
- License: This work is licensed under CC BY-NC-SA 4.0.