古典概型的经典例子
抛硬币
甲有n+1个硬币 乙有n个硬币 求甲的正面比乙多的概率?
从样本点的角度研究绝对是非常复杂的,需要进行复杂的概率运算,这个题目给了我们一个有趣的思路
记A是我们的目标事件的概率 那么Aˉ 就是甲的正面比乙少的概率 明显的 他也是甲反面比乙多的概率 借助对称性 P(A)=P(Aˉ)且P(A)+P(Aˉ)=1 得到结论 答案为0.5
投球入格(生日问题,Maxwell-Boltzman统计的抽象形式)
n个求N个格子N>n各个球落入各个格子的概率均等,求
- 指定的n个格子各有一个球 P=n!/Nn
- 任意的n个格子各有一个球 P=N!/Nn(N−n)!
本质上的运算并不复杂,这里只是给 出一些叙述
抽签与顺序无关的概率解释
a个黑球b个白球,求第k次摸出黑球的概率
认定球之前是不同的情况 需要分别讨论认定球之前是相同的情况
总数m=Ca+bk样本点数量n=Ca+b−1k−1
这两个结果是一样的
(这是研究古典概型很重要的一点,你要保证在前后的认定一致)
概率论中的数理统计例子
在实际问题的研究中,我们不应该知道次品的数量或者次品率,我们需要从样的情况来研究他,这是一个例子;
从池子中捕捞1200条鱼,标记后放回,然后再次进行1000个捕捞,发现有100个有标记,推算总体的数目;
明显的,这属于一个超几何分布问题,因为他是不放回的抽样,设出总数为N;我们能知道以上事件发生的概率应该是
P=(n1k)∗(n−n1r−k)/(nr)
其中n1特殊的总数,n是总数,k是本次捕捞特殊的数目,r是本次捕捞的数目
根据极大似然估计的理论 我们研究P达到max的情况 得到 n=n1∗r/k 是我们的答案
数理统计抽样分布例子
1
设母体ξ∼b(1,p)(二点分布),(ξ1,ξ2,⋯,ξn)为取自此母体的一个子样,ξˉ为子样均值. 如果p=0.2 那么样本容量n 需要取多大才能满足
P(∣ξˉ−p∣≤0.1)≥0.75;
如果我们做正态相关的问题还能把分布求出来 但是这样的就不行了 只能用基础的变形来做 然后查表来做
能看出∑Xi 是二项分布 这是我们后面查表的基础
P(∣ξˉ−p∣≤0.1)=P(0.1≤ξˉ≤0.3)=P(0.1n≤i=1∑nXi≤0.3n)≥0.75
直接查表能得到n=10
2
子样(ξ1,ξ2,ξ3)来自正态母体N(0,1),又η1=0.8ξ1+0.6ξ2, η2=2(0.3ξ1−0.4ξ2−0.5ξ3),η3=2(0.3ξ1−0.4ξ2+0.5ξ3),求(η1,η2, η3)的联合分布密度及η1,η2,η3 的边际分布
这是一个需要眼力的题目
首先我们能看出来 η1,η2,η3 还是服从N(0,1) 的正态分布
子样(ξ1,ξ2,ξ3)来自正态母体 确保了他们是一个正态向量并且相互独立
新的η1,η2,η3 是一个原本的线性组合
我们知道如果原本是独立正态向量 那么乘上正交矩阵还是独立的正态向量
我们确实可以验证 这个变换的系数矩阵是正交矩阵
因此η1,η2,η3 相互独立 联合密度是各个密度函数的积 (各个密度函数都是变形后的正态 但是还是服从N(0,1) )
3
设母体ξ的分布函数为F(x),(ξ1,ξ2,...,ξn)是取自此母体的一个子样.若F(x)的二阶矩存在,ξ为子样均值,试证(ξi−ξˉ) 与(ξj−ξˉ) 的相关系数为
ρ=−n−11
这个题目还是需要我们用基础的定义来求解
相关系数的计算公式有
Corr(X,Y)=Var(X)Var(Y)Cov(X,Y)=σXσYCov(X,Y)
而 Cov(X,Y)=E(XY)−E(X)E(Y)
因此我们的问题还是转化为了期望的求解问题
由于抽取和样本和样本均值一定不是独立的 我们需要拆开均值 对小项求期望 然后化简就可以得到题目中的相关系数结果
数理统计矩估计例子
1
设总体 x 的均值和方差分别为 μ 与 σ2,X1,X2,⋅⋅,Xn是总体X 的样本,若总体的一、二阶原点矩都存在, 求 μ与 σ2 的矩估计量.
根据矩估计法我们知道 需要两个方程
μ=EX,E(X2)=DX+E2X=μ2+σ2
令总体矩等于样本矩
⎩⎨⎧μ=n1∑i=1nXi,μ2+σ2=n1∑i=1nXi2,
经典处理手法化简方差的表达式能得到(方差等于二阶矩减去期望的平方)
{μ=X,σ2=n1∑i=1k(Xi−X)2
这个例子告诉我们 无论分布情况如下
总体均值的矩估计量是样本均值,总体方差的矩估计量是样本方差
这是会是以后非常常用的定理
注意,矩估计这里对方差的估计是有偏的,这点我们在后面才会详细介绍
2
设总体的概率密度为f(x)=2σ1e−σ∣x∣ 求解参数的矩估计
一个参数只需要一个矩法方程 计算总体的均值
E(X)=∫−∞+∞x⋅2σ1e−σ∣x∣dx=0
涉及奇函数的积分 不用计算就能得到结果
明显这种情况下 我们靠这个方程得不到矩估计的结果 所以计算二阶矩
E(X2)=∫−∞+∞x2⋅2σ1e−σ∣x∣dx=∫0+∞x2⋅σ1e−σxdx=∫0+∞(−x2)de−σx=(−x2)e−σx∣0+∞+∫0+∞2xe−σxdx=2∫0+∞(−x)dσe−σx=2σ∫0+∞e−σxdx=2σ2
还是涉及了一些对称性的简化和分部积分 后面建立参数估计方程就很简单了
数理统计极大似然估计例子
1
总体X的密度是
f(x;λ)={λe−λx,0,x>0其它,;
其中 λ>0为未知参数,X1,X2,...,Xn 是取自总体X的一组样本, 求λ的极大似然估计量与矩估计量
计算似然函数
L(λ)=i=1∏nf(xi;λ)={λn∏i=1ne−λxi,0,xi>0,i=1,2,⋯,n;其他.
明显如果取等于0的时候没法计算估计量 所以找全部大于0 的样本 计算对数似然函数
lnL(λ)=nlnλ−λi=1∑nxi
求导计算得到似然方程
dλdlnL(λ)=λn−i=1∑nxi=0
得到极大似然估计量
λ^=X1
使用上一节的手段的计算矩估计量
EX=∫−∞+∞xf(x;λ)dx=1/λ
λ^=X1
能看出这个问题中矩估计量和极大似然估计量结果一致
2
设总体x∼N(μ,σ2), 其中 μ,σ2 均未知,设X1,X2,...Xn 是取自X的一个样本. 求 μ与 σ2 的极大似然估计量
多参数的问题的处理思路是完全一样的 还是数学分析中介绍的极大化方法
计算似然函数
L(μ,σ2)=i=1∏nf(xi;μ,σ2)=i=1∏n2πσ1e−2σ2(xi−μ)2
对数似然函数
lnL(μ,σ2)=−2nln2πσ2−2σ21i=1∑n(xi−μ)2
两个参数 得到似然方程组 分别做两个偏导就好了
∂μ∂lnL(μ,σ2)=σ21i=1∑n(xi−μ)=0,∂σ∂lnL(μ,σ2)=−σn+σ31i=1∑n(xi−μ)2=0,
解方程得到
{μ^=n1∑i=1nXi=X,σ^2=n1∑i=1n(Xi−μ)2
也就是正态分布的极大似然估计量 也等于矩估计量
3
设总体x服从均匀分布U[0,θ],为θ未知参数, X1,X2,...,Xn 是总体X的一组样本,求θ的极大似然估计量
样本似然函数为
L(θ)=i=1∏nf(xi;θ)={θn10,其他.0≤xi≤θ,i=1,2,⋯,n;
明显的 无论是直接对似然函数求导还是建立对数似然函数求导都不能做到极大化这个函数 这是数学分析中介绍的这个方法的缺点 他并不是万能的 我们只能直接使用极大似然原则来进行求解
明显的 似然函数是单调减少的 我们需要尽可能让θ 变小
不过我们一定需要满足 0≤xi≤θ(i=1,2,⋯,n)这个的话 我们可以取 极大似然估计量为
θ^=1≤i≤nmax{Xi}
4
设ξ1,ξ2,⋯,ξn 是取自对数正态分布母体ξ 的一个子样,即 In ξ - N(μ,σ2),−∞<μ<+∞ ,0<σ<+∞.试求 ξ 的期望值 Eξ 和方差 Dξ 的极大似然估计
这里不是在问我们参数μ,σ2的极大似然估计而是分布特征数的极大似然估计,事实上,分布的特征数就是一个含有分布参数的表达式,我们需要求出这个表达式,然后带入参数的极大似然估计,就是特征数的极大似然估计
明显的 需要研究的分布ξ 是一个正态分布的函数 需要用这个思路来简化期望和方差的计算
记η=lnξ 则η∼N(μ,σ2) ξ=eη 使用期望和方差的函数公式进行计算有
Eξ=exp{21(2μ+σ2)}
Dξ=e2μ+σ2[eσ2−1].
使用概率论中定理计算ξ的分布有
pξ(y)={2πσ1exp{−2σ21(lnx−μ)2}y1,0,y>0,else
他的极大似然估计前面已经计算过了
{μ^=n1∑i=1nXi=X,σ^2=n1∑i=1n(Xi−μ)2
将Xi 变化为 lnξi 把他们的结果带入到
Eξ=exp{21(2μ+σ2)}
Dξ=e2μ+σ2[eσ2−1].
就是特征数的极大似然估计量
数理统计估计量的评估准则
无偏性
1
设总体x∼N(μ,σ2), 其中 μ,σ2 均未知,设X1,X2,...Xn 是取自X的一个样本. 求 μ与 σ2 的极大似然估计量和矩估计量的无偏性
对于矩估计
θ^M=2Xˉ
则有
E(θ^M)=2E(Xˉ)=2E(X)=2⋅2θ=θ
对于极大似然估计量
θ^=1≤i≤nmax{Xi}
如何研究E[θ^]
能看出来 实际上θ^ 是一个顺序统计量 因此我们是能够给出他的密度函数的 所以我们可以从此计算其期望
密度函数为
fmax(z)=⎩⎨⎧nθ1(∫0zθ1dz)n−1,0<z<θ0,其它=⎩⎨⎧nθ1(θz)n−1,0<z<θ0,其它
计算期望有
E(θ^L)=∫−∞∞z⋅fmax(z)dz=∫0θz⋅nθ1(θz)n−1dz=n+1nθ<θ
实际上这是一个有偏估计量 可以通过修正系数的方法转换为无偏估计量
2
前面都只解释了如何判断一个量是否是无偏估计量 现在解释如何构造一个无偏估计量
设随机变量ξ服从二项分布
P(ξ=x)=(nx)θx(1−θ)n−x,x=0,1,⋯
试求 θ2 的无偏估计量
我们不可能凭空想到一个无偏的估计量,所以所有类似的问题都是从一些我们知道的估计量出发 使用一些计算性质去凑出无偏估计的估计量
我们知道
Eξˉ=Eξ=nθ,ES∗2=Dξ=nθ(1−θ)=nθ−nθ2
这是最基础的估计量了 如何去凑θ2的形式呢? 靠观察
Enξ−S∗2=nEξ−ES∗2=nnθ−(nθ−nθ2)=θ2
因此θ2的无偏估计量为
nξ−S∗2
其他类似的问题我们也是使用这个思路进行求解 有时候题目里会给出一些估计量供我们参考
均方误差
求正态总体N(μ,σ2)均值μ和方差σ2的MLE的均方误差研究均值 明显的我们知道MLE估计均值是无偏的 所以bias=0 MSE=var(μ^)=nσ2
研究方差的MLE估计
b(θ,σ^2)=E(σ^2)−σ2=−nσ2,Var(σ^2)=Var(n(n−1)Sn∗2)=Var(σ2(n−1)Sn∗2nσ2)=n2σ4Var(σ2(n−1)Sn∗2)=n2σ42(n−1)
所以
MSE=Var(σ^2)+b2(θ,σ^2)=n2σ4(2n−1).
研究无偏的修正估计
MSE=Var(σ2(n−1)Sn∗2n−1σ2)−0=(n−1)2σ42(n−1)
能看出 有偏的MLE估计有着更小的MSE
数理统计Fisher信息量例题
计算指数分布的Fisher信息量
p(x;θ)=θ1exp{−θx},x>0,θ>0
没说就按照只抽取一个样本进行计算
∂θ∂lnp(x;θ)=−θ1+θ2x=θ2x−θ
则有
I(θ)=E(θ2x−θ)2=θ4Var(x)=θ21
数理统计CR不等式例题
设ξ1,ξ2,⋯,ξn为取自正态母体N(μ,σ2)的一个子样. 试证
(1)μ^=ξ是
μ的一个有效估计;
(2)若μ已知,则S12=n1∑i=1n(ξi−μ)2是σ2的有效估计
若μ未知,则S22=n−11∑i=1n(ξi−ξ)2不是σ2的有效估计
对于均值估计 以前学习过的推论知
Dξ=nσ2
使用推论计算Fisher信息量有
I(μ)=σ21
因此有效性容易证明
对于方差的估计
若μ已知 研究无偏性
S12=n1i=1∑n(ξi−μ)2
ES12=n1E(ξi−Eξi)2=n1i=1∑nDξi=σ2
确实无偏 有讨论有效估计的前提
根据推广的结论计算Fisher信息量最后计算CR下界得到
我们计算的是关于σ2 的信息量 求导要把σ2 看作整体
I(μ)=2σ41 容易知道
σ21i=1∑n(ξi−μ)2∼χ2(n)
其方差为2n
则有
D(S12)=n2σ4=nI(σ2)1
是有效估计
若μ未知 我们知道是无偏的
Fisher信息量沿用上问的不变 但是S2 的分布发生了变化
σ21i=1∑n(ξi−ξ)2=σ2(n−1)S22∼χ2(n−1)
所以有
D(S22)=n−12σ4=nI(σ2)1
不是有效估计 但是是渐进有效估计
数理统计充分统计量例题
设总体 x 服从两点分布B(1,p),即P(X=x)=px(1−p)1−x,x=0,1,其中 0<p<1 (X1,X2,...,Xn) 为来自总体X一个样本, 研究统计量X=n1∑i=1nXi 的充分性
这里采用的最基础的定义进行验证
先着手研究一下统计量分布 容易知道
nX=i=1∑nXi−B(n,p),
所以条件可以取为 X=nk 这就是统计量取某个特定值
研究样本的条件分布
P(X1=x1,X2=x2,⋯,Xn=xnX=nk)=P(X=nk)P(X1=x1,X2=x2,⋯,Xn=xn,X=nk)
=⎩⎨⎧P(nX=k)P(X1=x1,X2=x2,⋯,Xn=xn),如果∑i=1nxi=k,0,如果∑i=1nxi=k,
带入分布的定义进行化简得到
=⎩⎨⎧Cnk1,如果i=1∑nxi=k,0,如果i=1∑nxi=k,
明显的 我们最后的结果和分布中的参数p 无关 所以X 是参数p 的充分统计量
数理统计完备统计量例题
设X1,X2,...,Xn是来自两点分布B(1,p)的样本。由前面的例题知X=n1∑i=1nXi 是的p 充分统计量。下面验证X 也是完备统计量
容易给出X 的分布律
P{X=nk}=Cnkpk(1−p)n−k
假设存在g(X) 满足前面的要求(使用了期望的函数结论)
Ep[g(X)]=k=0∑ng(nk)Cnkpk(1−p)n−k=0
等价于
(1−p)nk=0∑ng(nk)Cnk(1−pp)k=0
等价于
k=0∑ng(nk)Cnk(1−pp)k=0
能看出 想要满足这个等式成立 就需要
g(nk)=0
这就是满足了前面的要求
数理统计UMVUE
1
设两点分布总体为p(x;θ)=px(1−p)1−x,x=0,1求p的UMVUE
容易知道
X=n1i=1∑nXi.
是参数p的充分完备统计量
X=n1i=1∑nXi,
是参数p 的一个无偏估计
因此这个估计是唯一的UMVUE
2
求泊松分布总体参数λ的UMVUE
p(k,λ)=k!λke−λ
容易知道
T(X1,X2,⋯,Xn)=i=1∑nXi.
是参数λ的充分完备统计量
并且我们知道
Xˉ=n1i=1∑nXi
是参数λ的无偏估计量
能看出这个无偏估计量是充分完备统计量的函数 所以他是UMVUE
3
总体X 的密度函数为
p(x)={λe−λx,0,x≥0, 其他.
求λ1的UMVUE
根据指数分布族的理论我们知道 ∑Xi 是一个充分完备统计量
又因为 X 是一个待求参数的无偏估计 因此他就是一个UMVUE
4
设二项分布总体为X∼B(n,p), 求p(1−p) 的UMVUE
根据指数分布族的相关理论 我们知道X=∑Xi 是一个充分完备统计量
记X=n1∑i=1nXi=n1X, 则X服从二项分布B(n,p). 并且
为什么要这么想?我们知道X是p的无偏估计量,所以希望从这里构造出新的估计量
E(\frac Xn(1-\frac Xn))\color{}{=\frac{n-1}np(1-p)}
所以
φ(Xˉ)=n−1nnX(1−nX)=n−1nXˉ(1−Xˉ)
是一个p(1−p)的无偏估计量
能看出它是充分统计量X (两点分布的均值)的函数 因此是UMVUE
5
设总体X在[0,θ]上服从均匀分布,其中θ是未知参数,X1,X2,⋯,Xn是来自总体的样本, 求参数θ的UMVUE
p(x1,x2,⋯,xn;θ)={θn1,0,0≤x(1)≤x(n)≤θ,otherwise.=θn1I(X(n)≤θ)I(X(1)≥0)
根据因子分解定理知
X(n)=max{x1,x2,⋯,xn}
是一个参数的充分统计量 能证明它也是完备的,证明方法是用定义;从函数期望为0去推导g(X) 为0 就可以了 需要一步对积分上限函数求导
∫0θ[g(X)]⋅nθnxn−1dx=0
所以
[g(X)]θn−1=0
因此
g(X)=0
是完备统计量 证毕
能得到它的无偏估计
θ^=n(n+1)X(n)
是充分完备统计量的函数 所以是UMVUE
6
设总体X服从正态分布N(μ,σ2), θ=(μ,σ2)未知,X1,X2,⋯,Xn是来自总体的样本. 求参数μ和σ2的UMVUE. 并且验证参数的UMVUE的方差是否达到了C-R下界
实际上没有达到CR下界