母函数与矩母函数
在高等概率论开始之前,我们将初等概率论中的一些比较复杂的内容进行一些回顾,事实上概率的生成函数理论允许我们把概率问题转化为分析问题思考 对某些问题的证明将起到很好的简化作用
母函数的定义与性质
母函数是为了引入概率分布的另一种表示方法 来简化一些研究
对于那些只取非负整值的随机变量(比如二项分布,伯努利分布,泊松分布等)我们称为整值随机变量 对于这一类随机变量 母函数可以起到一定的辅助研究的作用(他的核心是一种形式幂级数,每一项的系数体现了序列的全部信息)
母函数的定义为
G(t)=k=0∑∞pktk=p0+p1t+…+pntn+…
容易看出来 G(t)=E(tpk)
根据级数的性质我们知道 母函数有下列性质
- 母函数和分布列相互唯一确定
- G(1)=1
- E(X)=G′(1)
- Var(X)=G′′(1)+G′(1)(1−G′(1))
- 对于两个独立随机变量 设他们的母函数为GX1(t),GX2(t) 则根据离散卷积公式有 他们的和的母函数满足GX(t)=GX1+X2(t)=GX1(t)×GX2(t)
矩母函数定义和性质
母函数只能用于离散型随机变量,特征函数涉及复积分不方便操作(他的优点就是永远存在)
这里我们介绍矩母函数(Moment Generating Function)理论 他在处理很多和随机变量相关的问题上有不少的优点 所谓的矩母 意味着他可以生成矩
随机变量X的矩母函数定义如下
MX(t)=E[etX]=⎩⎨⎧∫−∞+∞etxf(x)dx,X 具有密度函数 f(x);∑i=0∞etxiρ(xi),X 具有分布律 p(x).
我们给出一些常用的性质
- 矩母函数MX(t)和随机变量X 唯一确定
- 如果随机变量X,Y相互独立 那么MX+Y(t)=MX(t)MY(t)
- 如果Y=aX+b 那么MY(t)=ebtMX(at)
- 矩母函数可以用来求原点矩 E(Xn)=MX(n)(0)
- M(1)=1 这一点和母函数一样
简单的应用
这里会介绍一些应用和他们的值得学习的证明技巧
正态分布的矩母函数
MX(t)=E[etX]=∫−∞∞etx2πσ1e−2σ2(x−μ)2dx=e(μt+21σ2t2)∫−∞∞2πσ1e−2σ2[x−(μ+σ2t)]2dx=e(μt+21σ2t2),
这里面涉及的积分技巧是通过构造了一个概率密度函数(无关常数放外面),他的积分是1 这样简化了积分问题 这个思路非常的常见 以后还会再次用到
根据前面给出的性质四 我们知道E(X)=μ E(X2)=μ2+σ2,Var(X)=σ2
Gamma分布的矩母函数
f(x)=Γ(α)βαxα−1e−βx,x>0, Γ(α)=∫0∞yα−1e−ydy易知Γ(21)=π,Γ(1)=1,Γ(α+1)=αΓ(α),Γ(n+1)=n!
这是Gamma分布的形式表示 还有一些比较重要的性质叙述
M(t)=∫0∞Γ(α)βαxα−1e−βxetxdx=(β−tβ)α
还是前面的构造了概率密度函数的思路
借助他我们很容易确定E[X]=M′(0)=βα,进而Var(X)=β2α
注意α=1的时候,他就是指数分布f(x)=ke−kx
二项分布的矩母函数与母函数
M(t)=E[etX]=k=0∑netkCnkpk(1−p)n−k=k=0∑nCnk(pet)k(1−p)n−k=(pet+1−p)n
思路没变,也可以说这里使用的经典的二项展开式 容易计算得到
E[X]=np,E[X2]=M′′(0)=n(n−1)p2+np,Var(X)=np(1−p)
对应有母函数为
MX(t)=E(etX)=(1−p+pet)n
泊松分布的矩母函数与母函数
M(t)=E[etX]=k=0∑∞k!etke−λλk=e−λk=0∑∞k!(λet)k=e−λeλet=e[λ(et−1)]
也可以说我们使用的经典的幂级数展开式
容易计算得到
E[X]=λ,E[X2]=M′′(0)=λ+λ2,Var(X)=λ
对应有母函数为
MX(t)=E(etX)=eλ(et−1)
卡方分布的矩母函数
令Z1,Z2,⋯,Zn 以及Z 是独立同分布的标准正态分布随机变量,且X=Z12+Z22+⋯+Zn2,则我们称X服从卡方分布
容易知道
MX(t)=[MZ2(t)]n=(E[etZ2])n
进行如下计算
E[etZ2]=2π1∫−∞∞etz2e−2z2dz=2π1∫−∞∞e−2σ2z2dz(σ2=(1−2t)−1)=(1−2t)−21
还是经典的构造手段,我们得到了一阶矩母函数 再进行求n次方就是需要求的矩母函数
E[X]=n,E[X2]=n(n+2),Var(X)=2n
我们直接带入正态分布的密度函数就能完成这部分的计算
一个例子
计算积分
(1)∫−∞∞(2x2+2x+3)e−(x2+2x+3)dx,(2)∫0∞(4x2+5x+6)e−(2x+1)dx.
两个问题的思路是一样的,都是需要构造分布 借助矩表示原有的积分,然后用简单的方法得到矩 来进行表示 其核心还是在于构造分布
(1) =e−2∫−∞+∞(2x2+2x+3)e−2(21)2(x+1)2dx
现构造出我们需要的密度函数
=πe−2(2E(x2)+2E(x)+3)
这是根据原点矩的定义得到的
带入原点矩就可以得到最后的答案
第二题是完全一模一样的思路,只是换成构造Gamma分布函数 或者说 指数分布函数
多元矩母函数
多元矩母函数定义:假设 X=(X1,…,Xn)′ 是一个具有 n 维密度 f(x1,…,xn) 的 n×1 随机向量。X 的多元矩母函数定义为:
ψX1,…,Xn(t1,…,tn)=E(et1X1+…+tnXn)=∫−∞∞⋯∫−∞∞et1x1+…+tnxnf(x1,…,xn)dx1…dxn=E(et′X)
其中 t=(t1,…,tn)′ 且 X=(X1,…,Xn)′
多元矩母函数的性质
设 X=(X1,…,Xn)′ 且 t=(t1,…,tn)′,多元矩母函数 ψX(t) 具有以下性质:
- ψX(0)=1
- 如果 X1,…,Xn 是独立的,则:ψX(t)=i=1∏nψXi(ti)其中 ψXi(ti) 是 Xi 的一元矩母函数。
- 可以通过对多元矩母函数求导获得矩:∂t1k1⋯∂tnkn∂k1+⋯+knψX(t1,…,tn)t1=⋯=tn=0=E(X1k1⋯Xnkn)例如,当 n=2 时,X=(X1,X2)′,我们有:∂t12∂t23∂5ψX(t1,t2)t1=t2=0=E(X12X23)
- 通过将不在边际分布中的 Xj 对应的 tj 设为 0,可获得 X 的任何边际分布的矩母函数。例如,当 n=4 时,X=(X1,X2,X3,X4)′,ψX(t1,t2,t3,t4) 是 X 的多元矩母函数。则 ψX1,X3(t1,t3)=ψX(t1,0,t3,0),ψX1(t1)=ψX(t1,0,0,0) 等。
- 多元特征函数定义为 ϕX(t)=E(eit′X),其中 i=−1。特征函数总是对任何随机变量或向量存在,但矩母函数对某些随机变量可能不存在。因此,特征函数在证明某些结果时比矩母函数更有用。特征函数与矩母函数的关系为:ϕX(t1,…,tn)=ψX(it1,…,itn)
特征函数
正如前面研究的,我们需要找一个对任何随机变量或向量存在的函数来刻画随机变量与随机向量.
引入
我们在数学分析中介绍过函数傅立叶变化 形式为
φ(t)=∫−∞∞eitxp(x)dx
如果p(x)是一个密度函数 那么我们知道 φ(t)=E(eitX)
这就是我们这里要研究的特征函数的问题 它是非常多概率问题的优秀处理工具 可以简化运算和思考
特征函数的定义
复随机变量的定义形式为 Z=Z(w)=X(w)+iY(w) 他有着和普通的实值随机变量接近的性质 只是所有的运算结果范围变成了复数
定义:设X是一个随机变量 称
ϕ(t)=E(eitX)=∫−∞∞eitxdF(x)
是X的特征函数, 我们知道 X的特征函数总是存在 无论随机变量的形式如何.并且分布函数由其特征函数唯一确定。
离散型随机变量的特征函数为
φ(t)=k=1∑∞eitxkpk
连续型随机变量的特征函数为
φ(t)=∫−∞∞eitxp(x)dx
特征函数也唯一的依赖与分布函数 我们也可以称其为分布的特征函数
特征函数本质上是概率测度的Fourier变换,即
Φμ(θ):=∫Rneiθxμ( dx)=∫Rcos(θx)μ(dx)+i∫Rnsin(θx)μ(dx)
根据我们在前面介绍的关于期望与积分的基础能看出,这和我们的初等定义不矛盾。
常用分布的特征函数
单点分布
φ(t)=eita
其中的a是密度函数取1的点
0-1分布
φ(t)=peit+q
二项分布
φ(t)=(pejt+q)n
泊松分布
φ(t)=k=0∑∞eiktk!λke−λ=e−λeλeit=eλ(eit−1).
均匀分布
φ(t)=∫abb−aeitxdx=it(b−a)eibt−eiat.
标准正态分布
φ(t)=e−2t2
指数分布
φ(t)=(1−λit)−1
正态分布
φ(t)=eiμt−2σ2t2
Gamma分布
φ(t)=(λ−jtλ)r
特征函数的性质
- φ(0)=1,∣φ(t)∣≤φ(0)
- φ(−t)=φˉ(t)
- Y=aX+b 则φY(t)=eibtφX(at)
- Z=X+Y 且相互独立 则 φZ(t)=φX(t)φY(t)
- φ(k)(0)=ikE[Xk] 如果矩存在 并且特征函数可导
定理(逆转公式):F(x) 是分布函数 φ(t) 是特征函数 则有
F(x2)−F(x1)=r→∞lim2π1∫−rrite−ix1−e−ix2φ(t)dt.
根据逆转公式 我们可以从特征函数唯一的导出分布函数
这意味着 特征函数和分布函数相互唯一确定
多元特征函数
多元特征函数定义 : 若随机向量 (ξ1,…,ξn) 的分布函数为 F(x1,…,xn),其特征函数定义为:
ϕ(t1,…,tn)=E(ei(t1ξ1+…+tnξn))=∫−∞∞⋯∫−∞∞ei(t1x1+…+tnxn)dF(x1,…,xn)
唯一性定理:分布函数 F(x1,…,xn) 由其特征函数唯一决定。
多元特征函数的性质:
- ϕ(t1,…,tn) 在 Rn 中一致连续,且 ∣ϕ(t1,…,tn)∣≤ϕ(0,…,0)=1
- 如果 (ξ1,…,ξn) 的特征函数为 ϕ(t1,…,tn),则 η=a1ξ1+…+anξn=a′ξ 的特征函数为:ϕη(t)=ϕ(a1t,…,ant)=ϕ(ta)
- 若 E(ξ1k1⋯ξnkn) 存在,则:∂t1k1⋯∂tnkn∂k1+⋯+knϕ(t1,…,tn)t1=…=tn=0=ik1+⋯+knE(ξ1k1⋯ξnkn)
- 若 ξj 的特征函数为 ϕξj(tj),j=1,2,…,n,则随机变量 ξ1,…,ξn 相互独立的充要条件为:ϕ(t1,…,tn)=ϕξ1(t1)⋯ϕξn(tn)
- 若以 ϕ(t1,…,tn,u1,…,um),ϕ(t1,…,tn) 及 ϕ(u1,…,um) 分别记随机向量 (ξ1,…,ξn),(η1,…,ηm) 和 (ξ1,…,ξn,η1,…,ηm) 的特征函数,则 (ξ1,…,ξn) 与 (η1,…,ηm) 独立的充要条件是:对一切实数 t1,…,tn 及 u1,…,um 有:ϕ(t1,…,tn,u1,…,um)=ϕ(t1,…,tn)ϕ(u1,…,um)
- 若 Y=AX+b,则随机向量 Y 的特征函数为:ϕY(t)=E(eit′(AX+b))=eit′bϕX(A′t)
特征函数视角下的多元正态分布
多元正态分布定义
定义:假设 X=(X1,…,Xn)′。若 X 具有密度函数:
f(x)=(2π)−n/2∣Σ∣−1/2exp{−21(x−μ)′Σ−1(x−μ)}
则称 X 具有均值为 μ、协方差矩阵为 Σ 的 n 维多元正态分布。
等价定义:假设 X=(X1,…,Xn)′。若 X 具有矩母函数:
ψX(t)=exp{t′μ+21t′Σt}
或者特征函数:
ϕX(t)=exp{it′μ−21t′Σt}
则称 X 具有均值为 μ、协方差矩阵为 Σ 的 n 维多元正态分布,记作 X∼Nn(μ,Σ)。 想要证明这个问题,需要从Y∼Nn(0,I) 的特征函数出发,使用变换X=Σ1/2Y+μ 变形特征函数,就可以得到上面的形式.
多元正态分布的性质
线性变换:若 X∼Nn(μ,Σ),则 Y=AX+b∼Nn(Aμ+b,AΣA′)
证明:Y 的特征函数为:
ϕY(t)=E(eit′(AX+b))=eit′bϕX(A′t)=eit′bexp{i(A′t)′μ−21(A′t)′Σ(A′t)}=exp{it′(Aμ+b)−21t′(AΣA′)t}
因此 Y∼Nn(Aμ+b,AΣA′)。
独立正态变量的线性组合:假设 X1,…,Xk 是独立的,且每个 Xi∼Nn(μi,Σi),i=1,…,k。假设 a1,…,ak 是标量,定义:
Y=a1X1+…+akXk
则 Y∼Nn(μ∗,Σ∗),其中 μ∗=∑i=1kaiμi 且 Σ∗=∑i=1kai2Σi。这可以通过使用矩母函数来证明。
边际分布:若 X∼Nn(μ,Σ),将 X 分块为 X=(X1X2),其中 X1 是 r×1,X2 是 (n−r)×1。将 μ 分块为 μ=(μ1μ2),其中 μ1 是 r×1,μ2 是 (n−r)×1。类似地将 Σ 分块为:
Σ=(Σ11Σ21Σ12Σ22)
其中 Σ11 是 r×r,Σ12 是 r×(n−r),Σ21=Σ12′ 是 (n−r)×r,Σ22 是 (n−r)×(n−r)。X1 的边际分布为 X1∼Nr(μ1,Σ11)。这可以通过在 X2 对应的 tj 处放入零来使用矩母函数证明。
条件分布:若 X∼Nn(μ,Σ),使用 3) 中的分块,则:
X1∣X2=x2∼Nr(μ1+Σ12Σ22−1(x2−μ2),Σ11.2)
其中 Σ11.2=Σ11−Σ12Σ22−1Σ21。
独立性条件:若 X∼Nn(μ,Σ),将 X 分块为 X=(X1X2),其中 X1 是 r×1,X2 是 (n−r)×1。将 μ 分块为 μ=(μ1μ2),其中 μ1 是 r×1,μ2 是 (n−r)×1。类似地将 Σ 分块为:
Σ=(Σ11Σ21Σ12Σ22)
其中 Σ11 是 r×r,Σ12 是 r×(n−r),Σ21=Σ12′ 是 (n−r)×r,Σ22 是 (n−r)×(n−r)。则 X1 和 X2 独立当且仅当 Σ12=0。
完整特征:如果 X∼Nn(μ,Σ),则 X 的所有边际分布、条件分布以及 X 的分量的线性组合都是多元正态分布。
注意:上述定理的逆命题不成立。例如,如果所有边际分布都是多元正态分布,这并不意味着联合分布是多元正态分布。
唯一性:多元正态分布完全由其均值向量和协方差矩阵表征。这意味着一旦指定了均值向量和协方差矩阵,MVN 的密度和矩母函数就完全确定了。
对称性:如果 X∼Nn(μx,Σx) 且 Y∼Nm(μy,Σy),X 和 Y 独立,则:
(XY)∼Nn+m(μ,Σ)
其中 μ=(μxμy) 且 Σ=(Σx0′0Σy)。
中心性:如果 X∼Nn(μ,Σ),则 E(X)=mode(X)=median(X)=μ。
识别多元正态分布
定理:假设 X=(X1,…,Xn)′ 具有形式为:
f(x)=cexp{−Q/2}
的密度,其中 exp{−Q/2}∝exp{−21(x−μ)′Σ−1(x−μ)} 且 c 是归一化常数。则 X∼Nn(μ,Σ)。
示例:假设 X=(X1,X2)′ 具有形式为 f(x)=cexp{−Q/2} 的密度,其中 Q=x12+2x1x2+4x22+2x1。X 的分布是什么?
我们知道 X 必须是多元正态分布。要找到 E(X),我们有:
∂x1∂Q∂x2∂Q=2x1+2x2+2=0=2x1+8x2=0
解这些方程得到 x1=−4/3 和 x2=1/3。因此 μ=(−4/3,1/3)′。
要找到 Σ−1 的元素,我们查看 Q 中的二次项。令:
Σ−1=(σ(11)σ(12)σ(12)σ(22))
因此:
x′Σ−1x=(x1,x2)(σ(11)σ(12)σ(12)σ(22))(x1,x2)′=σ(11)x12+2σ(12)x1x2+σ(22)x22
对于我们的问题,σ(11)=1,2σ(12)=2 且 σ(22)=4。因此:
Σ−1=(1114)
对 Σ−1 求逆得到:
Σ=(4/3−1/3−1/31/3)
检查线性项,我们有:
−2Σ−1μ=−2(1114)(−4/31/3)=−2(−10)=(20)
所以 −2x′Σ−1μ=2x1,这是 Q 中的线性项。因此:
X∼N2((−4/31/3),(4/3−1/3−1/31/3))
特征函数视角下的三大分布
卡方分布
定义:随机变量 X 被称为具有 n 个自由度的中心卡方分布(写作 X∼χ2(n)),如果 X 具有密度:
f(x)=Γ(n/2)1(21)n/2xn/2−1e−x/2
其中 Γ(α)=∫0∞yα−1e−ydy。
随机变量 X 的矩母函数 (MGF) ψX(t) 定义为:
ψX(t)=E(etX)=∫−∞∞etxf(x)dx
如果 X 是离散的,则积分被求和替代。
定理:如果 X∼χ2(n),则 ψX(t)=(1−2t)−n/2。
定理:假设 Z1,…,Zn 是独立同分布的 N(0,1) 随机变量。定义:
X=i=1∑nZi2
则 X∼χ2(n)。
非中心卡方分布
定义:设 Z1,…,Zn 是独立的,Zi∼N(μi,1)。则 W=∑i=1nZi2 具有 n 个自由度、非中心参数 γ=21∑i=1nμi2 的非中心卡方分布。我们写作 W∼χ2(n,γ)。
非中心卡方分布在假设检验中出现,特别是在对线性模型中备择假设下检验统计量分布感兴趣的情况下。
定理:假设 Y1,…,Yn 是独立的,Yi∼N(μi,σ2),i=1,…,n。定义:
X=σ21i=1∑nYi2
则 X∼χ2(n,γ),其中 γ=2σ21∑i=1nμi2。
非中心卡方分布的性质:
如果 X∼χ2(n,γ),则:
ψX(t)=(1−2t)−n/2exp{1−2t2γt}
这可以通过使用非中心卡方密度的定义并交换积分和求和的顺序来证明。
如果 X∼χ2(n,γ),则 E(X)=n+2γ 且 Var(X)=2n+8γ。这可以使用 1) 中的矩母函数证明。
如果 X∼χ2(n,γ) 且 γ=0,则这对应于具有 n 个自由度的中心卡方随机变量。即,X∼χ2(n,0)=χ2(n)。
t分布
定义:假设 X∼N(0,1),Y∼χ2(n),且 X 和 Y 独立。定义随机变量:
T=Y/nX
则 T 被称为具有 n 个自由度的 t 分布。我们写作 T∼t(n)。
非中心 t 分布:假设 X∼N(μ,1) 且 Y∼χ2(n),且 X 和 Y 独立。定义随机变量:
W=Y/nX
则 W 被称为具有 n 个自由度、非中心参数 μ 的非中心 t 分布。我们写作 W∼t(n,μ)。如果 μ=0,则 W 简化为具有 n 个自由度的中心 t 分布。
F分布
定义:假设 X1∼χ2(n1,γ1) 且 X2∼χ2(n2,γ2),且 X1 和 X2 独立。定义随机变量:
F=X2/n2X1/n1
则 F 被称为具有 (n1,n2) 个自由度、非中心参数 (γ1,γ2) 的双重非中心 F 分布。我们写作 F∼F(n1,n2,γ1,γ2)。
a) 如果 γ2=0,则 F 被称为非中心 F 分布。我们表示为F∼F(n1,n2,γ1)
b) 如果 γ1=0 且 γ2=0,则 F 被称为中心 F 分布。我们表示为 F∼F(n1,n2)。
中心 F 分布在嵌套线性模型的假设检验中出现。在这种情况下,原假设下检验统计量的分布通常具有中心 F 分布。非中心 F 分布来自备择假设下检验统计量的分布。备择假设下检验统计量的分布对于功效计算很重要。
F 分布的性质:如果 F∼F(n1,n2,γ),则:
a) E(F)=n1(n2−2)n2(n1+2γ),n2>2
b) Var(F)=2(n1n2)2(n2−2)2(n2−4)(n1+2γ)2+(n1+4γ)(n2−2),n2>4
通过在 a) 和 b) 中设置 γ=0,可获得中心 F 的均值和方差公式。