Elementary Probability: Random Events, Probability Models, and Random Variables

Hyacehila

随机事件与概率

随机现象与统计规律

从概率论开始,我们着手开始研究哪些随机的问题,他不同于以往学习的各个数学分支(无论是分析还是代数) 当然,我们会在这里用到许多的分析学工具和代数学知识来便于对随机问题的研究

随机现象

必然事件一定发生,不可能事件在一定条件下绝对不发生;在他们中间的,基本条件不变时,可能发生也可能不发生的就是随机事件;

频率稳定性

在大规模实验中 有时候频率

FN(A)=n/NF_{N}(A)=n/N

趋近于一个稳定的数(比如高尔顿板) 这意味着随机事件并不是没有规律的,他也具有 统计规律性 并且 我们有了概率的概念 一个无关实验,系统固有的值

频率与概率

他们具有一些性质和联系

  • 非负性 FN(A)0F_{N}(A)\ge 0
  • 必然与不可能性 FN(A)=0不可能事件,FN(A)=1必然事件F_{N}(A)=0 不可能事件,F_{N}(A)=1必然事件
  • 频率的可加性 FN(A+B)=FN(A)+FN(B)对于不同时发生的AB成立F_{N}(A+B) = F_{N}(A)+F_{N}(B) 对于不同时发生的AB成立
  • 大数定理保证的性质 N FN(A)PN(A)N\longrightarrow \infty~F_{N}(A)\longrightarrow P_{N}(A) 概率是事件发生可能性大小的度量 频率是实验产生的结果

样本空间和事件

这里我们继续解释一些概率论中的基本概念

样本空间

实验 trail 是研究随机现象的必要调查 样本点 sample point 是实验可能的结果 样本空间 sample space 是样本点的全体 Eg 地震的震源 样本点 (x,y,z)(x,y,z) 样本空间 三维区域 样本空间中样本点的数量无所谓 非常明显的 研究什么样的样本空间取决于我们的问题,同时概率论中有一些重要的样本空间,但是在研究实际问题的时候就是数学建模的过程了

事件

事件 event 是一些样本点的集合 此时 对于每一个事件(集合) 我们都可以判断某个样本点是否在这个事件中 明显的 Ω整个样本空间是一个必然事件;是一个不可能事件\Omega 整个样本空间 是一个必然事件;\emptyset 是一个不可能事件

事件的运算

如何通过事件的运算 用简单事件的概率研究复杂事件的概率 是概率论经久不衰的问题

ABA\subset B A的所有样本点都在B中 AB and BAA\subset B~and~B\subset A 两个事件等价 Aˉ\bar{A} A的对立事件 所有不在A中的样本点构成的集合 AB  ABA\cup B~~A\cap B 事件的交和并 意味着两者同时发生和两者中有大于一个发生 AB=AB=A\cap B=AB=\emptyset AB不能同时发生 也就是AB互不相容 此时 记AB=A+BA\cup B=A+B ABA-B 在A但是不在B中

Demorgen 定律(i=1nAi)c=i=1nAic   (i=1nAi)c=i=1nAic(\bigcup_{i=1}^n A_i)^c = \bigcap_{i=1}^n A_i^c~~~(\bigcap_{i=1}^n A_i)^c = \bigcup_{i=1}^n A_i^c 运算规律

AB=BA   AB=BA   (AB)C=A(BC)   (AB)C=ACBCA\cup B=B\cup A~~~AB=BA~~~(A\cup B)\cup C=A\cup (B\cup C)~~~(A\cup B)\cap C=AC\cup BC

很明显的 这个集合理论非常接近 我们会在以后的学习中对他给出更加详细的解释 这和概率论的高等形式 测度理论密切联系 定义:P(w1)+P(w2)+...+P(wn)=1P(w_{1})+P(w_{2})+...+P(w_{n})=1 定义:事件的概率是各个样本点的概率的和 有限样本空间:样本点数量有限的样本空间 离散样本空间:样本点数量可数的样本空间 反之为连续样本空间

古典概型

我们先从这一类比较简单的概率问题入手 这里我们研究的问题满足以下基础条件

  • 实验的结果有限并且两两不相交
  • 所有的事件等概率 这类随机现象称为古典概型 和我们在高中阶段学习的古典概型理论是完全一致的 概率的古典定义,也就是古典概型理论的概率定义P(A)=m/n其中m是利场合数,n是样本点总数P(A)=m/n其中m是利场合数,n是样本点总数 事实上,古典概型之所以古典,是因为他确实应用的非常广泛,我们一般使用摸球来研究,但是其应用远不止摸球,为了计算各种形式的古典概型,我们会给出非常多的公式和理论

基本组合分析公式

核心原理

乘法原理 :串行 n=n1n2n=n_{1}*n_{2} 加法原理 :并行 n=n1+n2n=n_{1}+n_{2}

排列问题

在n个元素中,选出r个元素进行排列,不仅要考虑取出的元素,也要考虑取出的顺序

  • 有放回的场合 nrn^{r}
  • 无放回的场合 Anr=n(n1)(n2)...(nr+1)A_{n}^{r}=n(n-1)(n-2)...(n-r+1) 排列原理还是很好理解的 当 n=rn=r的时候 就是全排列,个数是n!n!
组合问题

在n个元素中,选出r个元素进行组合,要考虑取出的元素,不考虑取出的顺序

  • n个元素中选出r个 Cnm=Anr/r!C_{n}^{m}=A_{n}^{r}/r! 也被记作以下形式 这样记的时候可以不是整数 也被称为二项系数 他是二项式展开的系数
(nv)\left(\begin{array}{l} n \\ v \end{array}\right)
  • n个元素分为k组 每组的数量已经给出 分法数量为 n!/r1!r2!...rk!n!/r_{1}!r_{2}!...r_{k}! 他也被称为多项式系数 是多项式展开的系数 其实是多个CnmC_{n}^{m}的积

事实上 绝大多数组合问题都是最基础问题的变形 向最经典的组合问题考虑就可以了

一些辅助的公式和定义
0!=10!=1 n>k时    (nk)=0n>k时 ~~~~\left(\begin{array}{l} n \\ k \end{array}\right) =0 (nk)=(nnk)\left(\begin{array}{l} n \\ k \end{array}\right)=\left(\begin{array}{l} n \\ n-k \end{array}\right)
推广到非整数的形式

[数学分析1 极限与连续理论]]

古典概型的经典例子

本部分例题 的“古典概型的经典例子”一节

二项分布和超几何分布

a件次品,b件合格品,抽n件,研究k件不合格的概率a件次品,b件合格品,抽n件,研究k件不合格的概率

我们认为产品之间存在差异,这样考虑容易一些;

在有放回的情况下 总排列 (a+b)!(a+b)!种 有利的场合 CnkakbnkC_{n}^{k}*a^{k}*b^{n-k} 概率为 P=Cnk(a/(a+b))k(b/(a+b))nkP=C_{n}^{k}*(a/(a+b))^{k}*(b/(a+b))^{n-k} 他是一个二项式的展开的部分 所有这个分布被称为二项分布

在不放回的情况下

总数(a+bn)合适的样本点数目(ak)(bnk)总数\left(\begin{array}{l} a+b \\ n \end{array}\right) 合适的样本点数目\left(\begin{array}{l} a \\ k \end{array}\right)*\left(\begin{array}{l} b \\ n-k \end{array}\right)

这就是超几何分布的形式

事实上,在总数非常大但是抽样的数目不高的情况下,两个概型的结果是接近的

一个数理统计的例子

本部分例题 的“概率论中的数理统计例子”一节

一些性质

P(AB)=P(A)+P(B)P(AB)P(A\cup B)=P(A)+P(B)-P(AB) P(A)=1P(Aˉ)P(A)=1-P(\bar{A}) AB=    P(A1+A2+...+An)=P(A1)+P(A2)+...+P(An)AB=\emptyset ~~~~P(A_{1}+A_{2}+...+A_{n})=P(A_{1})+P(A_{2})+...+P(A_{n})

几何概型

在几何概型部分,我们发现了古典概型样本点数量有限这一明显的局限性,决定利用几何知识来处理这种情况; 几何概型的核心是测度的比

几何概型告诉我们概率为0和事件不会发生是不等价的,0概率事件可能发生

简单的几何概型的例子

在正方形中放置等直径的圆形;随机的向正方形内投点,落在圆形内的概率就是两者面积的比 也就是π4\frac{\pi}{4}

蒲丰投针

平面上,有相距aa的平行线,任一投一长ll的针,求针和平行线相交的概率 很明显的,如果用xx表示针的中点和平行线的距离,θ\theta表示夹角,那么最后我们的相交表示为 x<l/2sin(θ)x <l/2*sin(\theta),此时的P=2lπaP=\frac{2l}{\pi a} 如果我们进行计算机模拟实验 ,就可以通过这个概率来计算π\pi的值,这随后发展为统计的随机模拟法

积分的蒙特卡洛计算方法

普通的黎曼本质上就是一种测度,我们可以用求面积的方法研究他,同时求面积的方法可以通过随机模拟实验来实现,进行类蒲丰投针,这就是积分的蒙特卡洛计算方法; 虽然方法效率非常低下,但是误差稳定,目前依旧应用广泛 我们在概率论的研究中不再详细讨论这个方法,而是在偏向实践的地方讲授

Bertrand奇论

几何概型的核心就是构造了等可能性的测度;这引发了一定的问题和后续数学家的思考;Bertrand奇论就是因为等可能性口径产生的一个矛盾的几何概型问题,我们在高等概率论中会更多的研究他

条件概率

条件概率理论,研究的是在事件B发生的情况下,事件A此时发生的概率,记作P(AB)P(A|B)他也是概率理论的重要部分,我们在这里研究它 定义:在确定的某一个概率空间之下 P(AB)=P(AB)P(B)P(A|B)=\frac {P(AB)}{P(B)} 这就是条件概率公式 明显的,无论是古典概型还是几何概型都可以容易的使用这个公式

条件概率的性质

推论看似只是一个移项,但是很重要,称为乘法公式

P(AB)P(B)=P(AB)P(A|B)*P(B)=P(AB) 非负性:P(AB)0非负性:P(A|B)\ge 0 规范性:P(ΩB)=0规范性:P(\Omega|B)= 0 可列可加性:AB=    P(A1+A2+...+AnB)=P(A1B)+P(A2B)+...+P(AnB)可列可加性:AB=\emptyset ~~~~P(A_{1}+A_{2}+...+A_{n}|B)=P(A_{1}|B)+P(A_{2}|B)+...+P(A_{n}|B)

推论:推广的乘法公式

P(A1A2...An)=P(A1)P(A2A1)P(A3A1A2)...P(AnA1...An1)P(A_{1}A_{2}...A_{n})=P(A_{1})*P(A_{2}|A_{1})*P(A_{3}|A_{1}A_{2})...P(A_{n}|A_{1}...A_{n-1})

全概率公式

全概率公式是借助一些事情的概率来研究另一个事情的概率,他和条件概率问题密切联系;

P(B)=P(AB)+P(AˉB)=P(A)P(BA)+P(Aˉ)P(BAˉ)P(B)=P(AB)+P(\bar{A} B)=P(A)P(B|A)+P(\bar{A})P(B|\bar{A})

对于某些直接求很不好处理的问题,有一个前一次实验可以参考的实验,全概率公式是很好的选择,也就是他的核心应该是,分步 全概率公式可以自由的向更多元进行推广

P(A)=P(ABi)=P(Bi)P(ABi)P(A)=\sum\limits P(AB_{i})=\sum P(B_{i})P(A|B{i})

Bayes公式

Bayes公式的意义是研究两个事件之间的联系,Bayes决策和判别都以他作为基础 如果BB只和互不相容的AiA_{i} 同时发生 则有 B=P(BAi)B=\sum P(BA_{i})

P(AiB)=P(AiB)P(B)=P(Ai)P(BAi)P(A_{i}B)=P(A_{i}|B)*P(B)=P(A_{i})*P(B|A_{i})

P(AiB)=P(Ai)P(BAi)/P(B)P(A_{i}|B)=P(A_{i})*P(B|A_{i})/P(B)

所以

P(AiB)=P(Ai)P(BAi)P(Ai) P(BAi)P(A_{i}|B)=\frac{P(A_{i})*P(B|A_{i})}{\sum\limits P(A_{i} )~P(B|A_{i})}

这就是Bayes公式,他的意义是在指标 BB 发生的情况下 AiA_{i} 事件发生的概率;

P(Ai)P(A_{i}) 是对以前经验的总结 是我们一般称为先验概率的数据,他在进行试验前就已经了解了; P(AiB)P(A_{i}|B) 是我们想要研究的 一般称为后验概率;

Bayes公式广泛的用于疾病的判断上 这时候B意味着指标值 A意味着疾病值;在某种指标下出现疾病的概率就可以用Bayes公式计算,计算结果得到的置信程度可以供医生进行参考

事件独立性

正如我们研究条件概率,这里我们研究两个事情无关

两个事件的独立性

定义:P(AB)=P(A)P(B)P(AB)=P(A)P(B) 结合乘法公式 也就是条件概率的条件没有作用了 推论 :独立事件满足 P(AB)=P(A)P(A|B)=P(A) 推论:A B独立,则A Bˉ,Aˉ Bˉ,A Bˉ独立A~B独立,则{A~\bar{B}},{\bar{A}~\bar{B}},{A~\bar{B}}独立

多个事件的独立性

要同时满足以下的条件

P(AB)=P(A)P(B)  P(AC)=P(A)P(C)  P(BC)=P(C)P(B)  P(ABC)=P(A)P(B)P(C)P(AB)=P(A)P(B)~~P(AC)=P(A)P(C)~~P(BC)=P(C)P(B)~~P(ABC)=P(A)P(B)P(C)

相互独立是一个条件很高的事情,比恩斯坦反例说明了这一点 两两独立不能推出多者独立

非常自然的 多个事件的独立性的推广形式这里不用给出也很清楚了

实验的独立性

从事件到实验,实验是概率科学的核心部分

假设有n次实验,他们有着各自独立的样本空间,那么总样本空间就是样本空间的笛卡尔积

此时如果P(A1A2...An)=P(A1)P(A2)...P(An)P(A^{1}A^{2}...A^{n})=P(A^{1})P(A^{2})...P(A^{n}) 我们就称这些实验是独立的;

实验的独立性就解释了我们曾经学过但是不清楚的,重复独立实验的概念 重复的独立实验,将会是我们后面学习的一个非常常见的概念

伯努利概型

在某些时候,我们只关注合格与不合格的两类结果,这就是伯努利概型的研究对象; 考虑重复nn次的伯努利实验 要求

  • 每次实验至多两个结果A AˉA~\bar{A} 概率和为1
  • P(A)P(A) 稳定
  • 实验相互独立
  • 进行nn次实验 这样的实验样本点数总计2n2^{n}事实上,随着实验次数趋近于无穷,样本点的数目成为第一类无穷大 这是一个非常广泛存在的概型,诸如机票超售,遗传问题等等都是符合多次重复01结果的实验的。因此我们在这里会给出更加详细的分析

伯努利分布

仅仅进行一次实验,分布列是非常容易写出来的

二项分布

我们在前面就对二项分布进行了介绍。事实上,抽取不合格品并且放回的情况下,就是进行等概率的01实验,那就是一个伯努利实验吗,所以我们在这里不想过多的继续介绍;至于二项分布的各个概率,其实是一个非常好算的事情

b(k;n,p)=Cnkpkqnkb(k;n,p)=C_{n}^{k}p^{k}q^{n-k}

几何分布

这并不是超几何分布,所谓的几何分布是想研究,第一次成功的实验出现在第kk次的概率 我们也非常容易的就能计算到几何分布的分布列

g(k;p)=qk1pg(k;p)=q^{k-1}p

几何分布的无记忆性 这是几何分布一个非常重要的特征;它表示为P(X>(m+n)X>m)=P(X>n)P(X>(m+n)|X>m)=P(X>n) 他意味着 前面无论进行了多少次实验 对后面的概率都没有影响

帕斯卡分布/负二项分布

我们是想拓展几何分布的边界,研究第kk次成功出现在第rr次实验 事实上并不难以计算,我们还是前面那老一套分析方式

f(k;r,p)=Cr1k1pk1qkrp=Cr1k1pkqkrf(k;r,p)=C_{r-1}^{k-1}p^{k-1}q^{k-r}p=C_{r-1}^{k-1}p^{k}q^{k-r}

二项分布与泊松分布

在这里我们研究几个例子和一个新的分布,他和前面研究的二项分布联系密切

补充的一点内容

b(k;n,p)b(k+i,r,b)=1+(n+1)pkkq\begin{aligned} &\frac{b(k;n,p)}{b(k+i,r,b)}=1+\frac{(n+1)p-k}{kq} \\ \end{aligned}

这告诉我们k=(n+1)p=mk=(n+1)p=m的时候 二项分布的概率取到最大值; 当然由于必须取整数的限制 所以我们只能去一个接近的值 这个点被我们称为二项分布的中心 这个值是最可能成功次数 不解释的给出结论:P(m)=(2πnpq)12P(m)=(2\pi npq)^{-\frac{1}{2}}

一个简单的例子

假设车间一共200台机床 每台开启时耗电为1kw 开机概率为百分之六十且相互独立 要求车间稳定性高于千分之九九九 我们应该提供多少供电 这很明显的是一个概率问题 计算b(k,200,0.6)>0.999\sum\limits b(k,200,0.6)>0.999 研究找到的kk值就好了 现在的问题就是这个巨大的二项分布难以计算

二项分布的泊松逼近

在相当多的伯努利实验中,如果nnpp小 他们的积λ\lambda大小比较适中,对于这种情况,泊松找到了一个更加容易计算的形式 (适中往往指个位数)

np接近λ,则在n时有b(k;n,p)=p(k,λ)=λkk!eλ当np接近\lambda,则在n\to \infty 时有 b(k;n,p)=p(k,\lambda)=\frac{\lambda^{k}}{k!}e^{-\lambda}

这被称为泊松定理

事实上,泊松分布后续也找到了很多自己的用处

  • 网络访问(单位时间的计数过程都是它)
  • 热电子发射和微生物分布
  • 其他随机现象的构成 这已经成为了一个独立的重要分布,而不是二项分布的计算方法;

随机变量及其分布

到现在我们结束了一个小阶段的研究,从现在来看我们前面的研究好零散呀,定量的统一的研究概率问题是一个非常重要的事情,这就是随机变量,我们在这一章会细致的研究一维的情况,

随机变量及其分布

我们称随机变量是用来表示随机现象结果的变量,如何让变量描述随机现象的结果,如何进一步借助随机变量研究实际问题,这是我们这一章要搞明白的;

随机变量的概念

很多样本点就是用一个数字来表示的,由于样本点出现的随机性,他们就是一个随机变量了;

定义:定义在样本空间上的实值函数X=X(w)X=X(w) 称为随机变量,一般用大写字母表示,取值用小写字母表示;

如果一个随机变量的取值有限或者可列,则称为离散型随机变量,如果取值是充满数轴上某一空间,则称为连续随机变量;

随机变量的分布函数

为了掌握一个随机变量的统计规律性,我们需要掌握他去各种值的概率,而随机变量的概率明显具有累积性,因此我们只需要掌握F(x)=P{Xx}F(x)=P\{X\le x\} 就可以了 这个F(x)F(x) 是一个定义在(,)(-\infty,\infty) 上的函数;

定义: 设X是一个随机变量 则对于任何实数xxF(x)=P{Xx}F(x)=P\{X\le x\} 是随机变量XX的分布函数 称XX服从于F(x)F(x)

无论是连续还是离散的随机变量都具有分布函数

定理:任何的分布函数F(X)F(X) 都具有以下性质:

  • F(X)F(X)是单调非减函数
  • F(X)F(X)的值域是闭区间0到1 并且他的两端的极限也是 0 和 1
  • F(X)F(X)是右连续的函数 limxx0+0F(x)=F(x0)\lim_{x \to x_{0}+0}F(x)=F(x_{0})

满足这三个性质的函数就一定是一个分布函数

离散型随机变量的分布列

对于离散型随机变量,我们往往使用如下形式的分布列来准确的表示它

定义:设 XX 是一个离散随机变量, 如果XX 的所有可能取值是 x1,x2,,xnx_{1}, x_{2}, \cdots , x_{n} ,则称XXxix_{i} 的概率pi=p(xi)=P(X=xi),i=1,2,,np_{i}=p\left(x_{i}\right)=P\left(X=x_{i}\right), i=1,2, \cdots, nXX 的概率分布列或简称为分布列,记为 X{pi}X \sim\left\{p_{i}\right\}

分布列也可用如下列表方式来表示:

Xx1x2xnPp(x1)p(x2)p(xn) \begin{array}{c|ccccc} X & x_{1} & x_{2} & \ldots & x_{n} & \cdots \\ \hline P & p\left(x_{1}\right) & p\left(x_{2}\right) & \cdots & p\left(x_{n}\right) & \cdots \end{array}

或者

(x1x2xnp(x1)p(x2)p(xn)) \left(\begin{array}{ccccc} x_{1} & x_{2} & \cdots & x_{n} & \cdots \\ p\left(x_{1}\right) & p\left(x_{2}\right) & \cdots & p\left(x_{n}\right) & \cdots \end{array}\right)

分布列很明显具有两个基本的性质

  • 非负性p(xi)0p(x_{i})\le 0
  • 正则性p(xi)=1\sum p(x_{i})=1

连续型随机变量的概率密度函数

对于一个值域充满一个区间的随机变量,分布列肯定无法进行研究了,但是想想,分布列是为了描述某个单点的概率,而对应到连续型中,分布函数F(X)F(X)的导数就是起到类似的作用的,故

定义:设随机变量XX分布函数F(X)F(X) 则存在一个非负可积函数p(x)p(x) 满足xp(t)dt=F(X)\int_{-\infty}^{x} p(t)dt=F(X)p(t)p(t)XX的概率密度函数

概率密度函数具有两个基本的性质

  • 非负性p(x)0p(x)\ge 0
  • 正则性p(xi)dx=1\int_{-\infty}^{\infty} p(x_{i})dx=1 为了从密度函数来计算概率 我们要从积分的角度研究 他不可以避免的采用NLN-L公式 此时我们一定要注意

如果有密度为00的区间 使用NLN-L公式进行积分的时候一定要去掉这个区间 因为出现00一定意味着不连续点的存在 使用NLN-L积分进行研究是一定出错的

两种随机变量的比较

概率密度函数和分布列基本起到接近的作用,但是仍然具有一定的差别,这里我们简单的描述

  • 离散型随机变量的分布函数是右连续的,但是连续型随机变量的分布函数是完全连续的
  • 离散型随机变量在一部分点概率为0 但是连续型随机变量的任何一个单点的概率都是0 这是积分的性质保证的 也告诉了我们概率为0 并不一定是不可能事件
  • 由于连续型随机变量的单点概率为0 所以剔除掉若干个点应该不会影响;离散型随机变量则不然,必须计较每一个点才能保证最终结果是正确的

随机变量的数学期望

研究随机变量的特征,用几个简单的量来描述整体的随机变量的特征是我们一直想做到的事情,这就是随机变量的数字特征,我们介绍最重要的一个随机变量的特征,数学期望;

数学期望的概念

我们很希望知道这个随机变量整体会趋向于什么位置,这就是数学期望或者说均值希望回答的事情;

算术平均:直接计算平均 加权平均:根据出现的频率来考虑不同数字出现数量不同对整体趋势的影响 非常明显的,在随机变量中,借助概率来作为权值是非常自然的一个事情;

数学期望的定义

对于离散型随机变量,我们称E(X)=p(xi)xiE(X)=\sum p(x_{i})x_{i} 是离散型随机变量的数学期望,如果他收敛的话;

之所以要求级数收敛是因为想要避免不收敛造成的期望不唯一,我们在数学分析无穷级数部分提到这个情况;对于有限项的随机变量,期望一定是存在的;事实上,Cauchy分布的期望不存在,我们给这个补充要求是合理的

对于连续型随机变量,我们称E(X)=xip(xi)dxE(X)=\int_{-\infty}^{\infty} x_{i}p(x_{i})dx 是连续型随机变量的数学期望 如果它收敛的话

数学期望的性质

随机变量的函数的数学期望

我们知道 随机变量的数学期望E(X)E(X) 被分布唯一确定,而且非常明显的是,随机变量的函数也是一个随机变量,为了求解随机变量函数的数学期望,我们需要进行以下的研究 在最基础的场合中,我们可以通过先计算出新随机变量的分布列 概率密度函数来进行进一步研究,为了方便下一步的计算,我们给出如下定理 对于离散型随机变量 我们有分布列p(xi)p(x_{i})和函数g(X)g(X) 数学期望E{g(X)}=g(xi)p(xi)E\{g(X)\}=\sum g(x_{i})p(x_{i}) 对于连续型随机变量 我们有概率密度函数p(x)p(x)和函数g(X)g(X) 数学期望E{g(X)}=g(x)p(x)dxE\{g(X)\}=\int g(x)p(x)dx 这个定理直接从直观的角度来考虑也是非常自然的

几个导出的性质
  • E(x)=cE(x)=c
  • E(aX)=aE(X)E(aX)=aE(X)
  • E(g(x1)+g(x2))=E(g(x1))+E(g(x2))E(g(x_{1})+g(x_{2}))=E(g(x_{1}))+E(g(x_{2}))
  • X,YX,Y独立的时候E(XY)=E(X)E(Y)E(XY)=E(X)E(Y)
  • E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y)

随机变量的方差

随机变量的方差被提出的意义是为了研究随机变量波动的大小;

方差和标准差的定义

随便变量当然不可能一定恰好是均值,肯定会出现偏离的情况;而XE(X)X-E(X)也是一个随机变量,为了抹除正负不同的影响并且不要使用烦人的绝对值 我们选择(XE(X))2(X-E(X))^{2} 作为对波动的刻画 而E((XE(X))2)E((X-E(X))^{2}) 就可以反应波动的整体情况 定义 如果随机变量XX的数学期望存在 则称E((XE(X))2)E((X-E(X))^{2})是随机变量的方法 记为Var(X)Var(X) 对于方差的计算,容易看出他就是一个随机变量的函数的期望,计算起来是非常容易的 标准差是从方差导出的量 他的量纲和初始的随机变量一致 这是他存在的意义 在数学期望存在的时候 方差不一定存在 但是反之是一定的

方差的性质

  • Var(X)=E(X2)(E(X))2Var(X)=E(X^{2})-(E(X))^{2}用这个性质来计算方差更加的实用
  • Var(c)=0Var(c)=0
  • Var(aX+b)=a2Var(X)Var(aX+b)=a^{2}Var(X)
  • Var(X)=E(X(X1))μX(μX1)\mathrm{Var}(X)=E(X(X-1))-\mu_X(\mu_X-1)
  • X,YX,Y独立的时候 Var(X+Y)=Var(X)+Var(Y)Var(X+-Y)=Var(X)+Var(Y)

切比雪夫不等式

当随机变量的期望和方差存在的时候,对于任意的常数ε\varepsilon

P(ξE(ε)ε)D(ξ)ε2P\left(\left|\xi- E(\varepsilon)\right|\geqslant\varepsilon\right)\leqslant\frac{D\left(\xi\right)}{\varepsilon^{2}}

切比雪夫不等式的核心就是给出了大偏差发生概率的上界

定理:随机变量XX的方差Var(X)=0Var(X)=0意味着XX几乎处处等于一个常数cc

常用离散分布

二项分布

b(k;n,p)=Cnkpkqnkb(k;n,p)=C_{n}^{k}p^{k}q^{n-k}

是二项分布的概率表示,它诞生是为了研究抽样并且放回的问题,我们这里补充关于均值和方差的内容

  • E(X)=npE(X)=np
  • Var(X)=np(1p)Var(X)=np(1-p)

伯努利分布

他是退化的二项分布 退化为一次实验

泊松分布

p(k,λ)=λkk!eλp(k,\lambda)=\frac{\lambda^{k}}{k!}e^{-\lambda}

泊松分布在前面通过二项分布的近似进行了导出

  • E(X)=λE(X)=\lambda
  • Var(X)=λVar(X)=\lambda 这是非常神奇的一个特征 他的均值和方差一致

超几何分布

也是在二项分布实验中导出

总数(a+bn)合适的样本点数目(ak)(bnk)总数\left(\begin{array}{l} a+b \\ n \end{array}\right) 合适的样本点数目\left(\begin{array}{l} a \\ k \end{array}\right)*\left(\begin{array}{l} b \\ n-k \end{array}\right)

超几何分布的表示比较复杂,我们在这里不研究他的均值和方差的表示了,在需要的时候可以去计算 借助级数理论就可以了

几何分布

研究抽样的另一种问题

g(k;p)=qk1pg(k;p)=q^{k-1}p
  • E(X)=1pE(X)=\frac{1}{p}
  • Var(X)=1pp2Var(X)=\frac{1-p}{p^{2}}

帕斯卡分布

几何分布的一种推广 也叫做负二项分布

f(k;r,p)=Cr1k1pk1qkrp=Cr1k1pkqkrf(k;r,p)=C_{r-1}^{k-1}p^{k-1}q^{k-r}p=C_{r-1}^{k-1}p^{k}q^{k-r}
  • E(X)=rpE(X)=\frac{r}{p}
  • Var(X)=r(1p)p2Var(X)=\frac{r(1-p)}{p^{2}} 这个概率是从几何分布中导出的

常用连续分布

连续分布的密度函数和分布函数可以相互导出,但是人们更加重视概率密度函数 我们在后面的叙述也会体现这一点

正态分布

这是概率论和数理统计中最重要的连续分布;我们在后面非常多的学习中都会无数次重复到它;

正态分布的密度函数和分布函数

如果随机变量X的密度函数为p(x)=12πσe(xμ)22σ2p(x)=\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu )^{2}}{2\sigma^{2}}} 则称XX服从正态分布 XN(μ,σ)X\sim N(\mu,\sigma) 他的分布函数一般直接用积分的形式表示 其中μ\mu称为位置参数 决定正态分布的中心 σ\sigma称为尺度参数 决定了分散的程度

标准正态分布

位置参数为0和尺度参数为1的正态分布称为标准正态分布 也就是N(0,1)N(0,1) 他的密度函数形式是 φ(x)=12πeμ22\varphi (x)=\frac{1}{\sqrt{2\pi}}e^-{\frac{\mu^{2}}{2}}
由于标准正态分布不含有任何参数 我们能够直接给出 Φ(X)\Phi(X)的值 他会被广泛的用于各种概率数值的计算 对于这个分布函数 我们有容易推断的性质

  • Φ(u)=1Φ(u)\Phi(-u)=1-\Phi(u)
  • P(X>u)=1Φ(u)P(X>u)=1-\Phi(u)
  • P(a<X<b)=Φ(b)Φ(a)P(a<X<b)=\Phi(b)-\Phi(a)
  • P(X<c)=2Φ(c)1P(|X|<c)=2\Phi(c)-1 这些公式都是非常容易推测出来的 都是前面的性质的使用
正态分布的标准化

定理 :若XN(μ,σ)X\sim N(\mu,\sigma)U=XμσN(0,1)U=\frac{X-\mu}{\sigma}\sim N(0,1) 根据这个定理 我们知道 计算一个不标准的正态分布的概率的时候 可以选择直接把它化为标准形式 再进行下一步的计算 比如

P(X<c)=Φ(cμσ)P(X<c)=\Phi(\frac{c-\mu}{\sigma})

这是计算任何正态分布的值的通用手段 函数Φ(x)\Phi(x)的值可以靠查表获得

正态分布的期望和方差

事实上 我们在高中就学习过 对于正态分布

  • E(X)=μE(X)=\mu
  • Var(X)=σ2Var(X)=\sigma^{2}
正态分布的3σ3\sigma 原则

这个理论有两种重要的解释

  • 如果严重偏离3σ3\sigma 原则 则分布不是正态分布
  • 如果生产过程中严重偏离3σ3\sigma 则意味着生产不受控

均匀分布

我们称分布函数满足以下条件的分布是均匀分布 记为U(a,b)U(a,b)

p(x)={1ba,a<x<b,0, 其他. p(x)=\left\{\begin{array}{ll} \frac{1}{b-a}, & a<x<b, \\ 0, & \text { 其他. } \end{array}\right.
  • E(X)=a+b2E(X)=\frac{a+b}{2}
  • Var(X)=(ba)212Var(X)=\frac{(b-a)^{2}}{12}

指数分布

我们称分布函数满足以下条件的分布是指数分布 记为EXP(λ)EXP(\lambda)

p(x)={λeλx,x0,0, 其他. p(x)=\left\{\begin{array}{ll} \lambda e^{-\lambda x}, & x\ge0, \\ 0, & \text { 其他. } \end{array}\right.

指数分布作为一种偏态的分布 他经常被用于描述寿命

  • E(X)=1λE(X)=\frac{1}{\lambda}
  • Var(X)=1λ2Var(X)=\frac{1}{\lambda^{2}} 指数分布也具有无记忆性 这点和几何分布一样

Gamma分布

再次给出Gamma函数

Γ(α)=0tα1etdt\Gamma(\alpha)=\int_0^\infty t^{\alpha-1}e^{-t}dt

自然的给出Gamma分布的概率密度函数

Γ(α,β)fX(x)={βaxa1eβxΓ(α)x>00otherwise\Gamma(\alpha,\beta)的f_X(x)=\left\{\begin{array}{ll}\frac{\beta^ax^{a-1}e^{-\beta x}}{\Gamma(\alpha)}&x>0\\0&\text{otherwise}\end{array}\right. E[X]=αβ,,Var(X)=αβ2E[X]=\frac\alpha\beta,\quad\text{,}Var(X)=\frac\alpha{\beta^2}

很自然的 如果退化α=1\alpha = 1 他就是指数分布的概率密度函数 如果α=n2;β=12\alpha=\frac{n}{2};\beta=\frac{1}{2} 则是自由度为nn的卡方分布 Gamma分布是从指数分布中导出的;他是多个独立且同分布的指数分布变量的和的分布 想要证明这个理论可以使用矩母函数的相关理论(Moment Generating Function(MGF))

逆Gamma分布

也叫做 inv Gamma分布 给出概率密度函数为

{βαΓ(α)xα1exp(βx),x00,x<0\left.\left\{\begin{array}{l}\frac{\beta^\alpha}{\Gamma(\alpha)}x^{-\alpha-1}\exp(-\frac{\beta}{x}),x\geq0\\0,x<0\end{array}\right.\right.

计算他的期望和方差有

E(x)=λαΓ(α)0+xαeλxdx=Γ(α1)Γ(α)λ=βα1E(x2)=λαΓ(α)0+xα+1eλxdx=Γ(α2)Γ(α)λ2=β2(α1)(α2)Var(x)=E(x2)[E(x)]2=λ2(α1)(α2)λ2(α1)2=β2(α1)2(α2)\begin{aligned} &E(x)=\frac{\lambda^{\alpha}}{\Gamma(\alpha)}\int_{0}^{+\infty}x^{-\alpha}e^{-\frac{\lambda}{x}}dx=\frac{\Gamma(\alpha-1)}{\Gamma(\alpha)}\lambda=\frac{\beta}{\alpha-1} \\ &E(x^{2})=\frac{\lambda^{\alpha}}{\Gamma(\alpha)}\int_{0}^{+\infty}x^{-\alpha+1}e^{-\frac{\lambda}{x}}dx=\frac{\Gamma(\alpha-2)}{\Gamma(\alpha)}\lambda^{2}=\frac{\beta^{2}}{(\alpha-1)(\alpha-2)} \\ &Var(x)=E(x^{2})-[E(x)]^{2}=\frac{\lambda^{2}}{(\alpha-1)(\alpha-2)}-\frac{\lambda^{2}}{(\alpha-1)^{2}}=\frac{\beta^{2}}{(\alpha-1)^{2}(\alpha-2)} \end{aligned}

在贝叶斯统计中比较常用 经典统计学少见逆Gamma分布的身影

Beta分布

Beta分布也是一个非常常用的连续型分布 他在形式上和二项分布有一些接近

f(x;α,β)=1B(α,β)xα1(1x)β1f(x;\alpha,\beta)=\frac{1}{B(\alpha,\beta)}x^{\alpha-1}(1-x)^{\beta-1}

注意 这里的参数取值范围是α β>0\alpha~\beta>0 其中的B(α,β)B(\alpha,\beta) 是数学分析中介绍的Beta函数的值

B(p,q)=01xp1(1x)q1dxB(p,q)=\int_{0}^{1}x^{p-1}(1-x)^{q-1}dx

其期望和方差为

E(X)=αα+βE(X)=\frac{\alpha}{\alpha+\beta} Var(X)=αβ(α+β+1)(α+β)2Var(X)=\frac{\alpha\beta}{(\alpha+\beta+1)(\alpha+\beta)^2}

随机变量函数的分布

从一个分布 借助一个函数研究另一个分布g(X)g(X) 是概率论和数理统计中非常核心的问题

离散型随机变量函数的分布

事实上 离散型随机变量的函数一定是一个离散型随机变量 因此问题就非常的简单了 由于有限性质的存在 我们可以逐个计算函数值被映射为了什么新的函数值 再把相同的概率相加 就能够实现了

连续型随机变量的函数的分布

变为离散

如果这个函数导致新的变为离散型分布 我们只能通过前面的计算方法来进行计算了 还是逐渐计算每个离散点的概率

严格单调的g(x)g(x)

我们能够给出一个非常有效的定理 来处理这一类的问题 定理XX是连续随机变量 其密度函数是p(x)p(x) Y=g(X)Y=g(X) 是另一个连续随机变量 若g(x)g(x)是严格单调的函数 其反函数h(y)h(y)有连续导数 则YY的密度函数满足

p(y)={px[h(y)]h(y),a<y<b,0, 其他. p(y)=\left\{\begin{array}{ll} p_{x}[h(y)]|h^{'}(y)|, & a<y<b, \\ 0, & \text { 其他. } \end{array}\right.

其中a=min{g(),g()}b=max{g(),g()}a=min\{g(-\infty),g(\infty)\} b=max\{g(-\infty),g(\infty)\} 这个定理非常的重要 其中关于新的密度函数的非零定义区间 应该代入的是原本密度函数的定义域两端到变换函数 才是新的区间

推导出的常用定理和性质

设随机变量XX服从正态分布N(μ,σ2)N(\mu,\sigma^2) 则有Y=aX+bN(aμ+b,a2σ2)Y=aX+b\sim N(a\mu+b,a^2\sigma^2) 这是正态分布的一个非常基本的性质 设随机变量XX服从正态分布N(μ,σ2)N(\mu,\sigma^2) 则有Y=eXY=e^X 的概率密度函数为

Py(y)={12πyσexp{(lnyμ)22σ2},y>0,0,\left.P_{y}(y)=\left\{\begin{aligned}&\frac{1}{\sqrt{2\pi}y\sigma}\exp\left\{-\frac{\left(\ln y-\mu\right)^{2}}{2\sigma^{2}}\right\},y>0,\\&0,\end{aligned}\right.\right.

我们称之为对数正态分布 也是非常常用的一种分布 设随机变量XX服从Gamma分布Ga(α,β)Ga(\alpha,\beta) 则有Y=kXGa(α,βk)Y=kX\sim Ga(\alpha,\frac{\beta}{k})

其他的g(x)g(x)情况

最基本的 我们可以采用定义进行研究 这也是前文定理证明的核心 为了研究Y=g(X)Y=g(X)的分布函数 我们有FY(y)=P(g(X)y)F_{Y}(y)=P(g(X)\le y) 转化为关于xxyy限制的概率形式 根据不同的特点进行不同的研究

分布的其他特征

原点矩

kk阶原点矩:μk=E(Xk)\mu_k=E(X^{k})

中心矩

kk阶中心矩:vk=E(XE(X))kv_k=E(X-E(X))^{k}

变异系数

下面给出的量是没有单位的 我们可以跨多个样本进行比较 定义变异系数为

V=σμV=\frac{\sigma}{\mu}

分位数

满足下面条件的xpx_p称为pp分位数 也叫做下pp分位数 我们规避上分位数的概念 用处不大

F(xp)=xpp(x)dx=pF\left(x_{p}\right)=\int_{-\infty}^{x_{p}}p\left(x\right)dx=p p=0.5p=0.5的情况下的分位数 称为中位数

偏度系数

如果随机变量XX的前三阶矩存在 则称

βS=ν3ν23/2=E(XE(X))3[Var(X)]3/2\beta_{S}=\frac{\nu_{3}}{\nu_{2}^{3/2}}=\frac{E\left(X-E\left(X\right)\right)^{3}}{\left[\mathrm{Var}\left(X\right)\right]^{3/2}}

为偏度系数 他反映了分布偏离对称性的程度 负数意味着向左偏 正数意味着向右偏 正态分布这种对称分布的偏度系数为0

峰度系数

如果随机变量XX的前四阶矩存在 则称

βk=ν4ν223=E(XE(X))4[Var(X)]23\beta_{k}=\frac{\nu_{4}}{\nu_{2}^{2}}-3=\frac{E\left(X-E\left(X\right)\right)^{4}}{\left[Var\left(X\right)\right]^{2}}-3

为峰度系数 他反映了尖峰的陡峭程度或者尾部的粗细 他表示的是和正态分布相比超出的部分 也就是正态的峰度系数为0

随机向量及其分布

在某些随机现象中 样本点只使用一个随机变量去描述是不够的,这就引出了随机向量的概念 我们不能把这几个随机变量分开考虑 他们一定存在关系 这就是这一章要回答的问题

随机向量和联合分布

多维随机变量

定义 :如果Xi(w)X_{i}(w) 是定义在同一个样本空间上的nn个随机变量 则称X(w)=(X1(w),X2(w),X3(w)....)X(w)=(X_{1}(w),X_{2}(w),X_{3}(w)....) 是一个nn维的随机向量

核心一定是要在同一个样本空间上

联合分布函数

定义:对于nn个事件X1<x1,X2<x2,X3<x3...{X_{1}<x_{1}},{X_{2}<x_{2}},{X_{3}<x_{3}}...同时发生的概率F(x1,x2...xn)=P(X1<x1...Xn<xn)F(x_{1},x_{2}...x_{n})=P(X_{1}<x_{1}...X_{n}<x_{n}) 就是nn维随机变量的分布函数 我们在后面的研究中 以二元的联合分布为主 更多维数的可以自然的推广 多元联合分布函数的基本性质

  • 单调性 F(x,y)F(x,y) 单独对两个变量都是单调的
  • 有界性 F(x,y)F(x,y) 取值范围是0 1之间的 并且只要有一个量逼近负无穷就是0 全逼近正无穷才是1
  • 右连续性 对于单独的变量都是右连续的
  • 非负性 P(a<X<b,c<Y<d)=F(b,d)F(a,d)F(b,c)+F(a,c)0P(a<X<b,c<Y<d)=F(b,d)-F(a,d)-F(b,c)+F(a,c)\ge0 我也也可以证明 所有满足这个性质的函数都是一个分布函数

联合分布列

对于离散型的二元分布 我们可以借助矩阵的形式 描述事件发生的概率 如下所示 联合分布列示意矩阵 以后有空再说 联合分布列的性质

  • 非负性p(xi)0p(x_{i})\ge 0
  • 正则性pij=1\sum \sum p_{ij}=1 研究联合分布列的核心还是研究概率 这些问题都是前面研究过的基本问题 这里就不重复了

联合密度函数

现在来处理连续型的多元分布函数 定义:如果存在p(x,y)p(x,y) 让二元的随机变量的分布函数F(x,y)F(x,y)满足F(x,y)=x,yp(x,y)dxdyF(x,y)=\iint\limits_{-\infty}^{x,y}p(x,y)dxdy也就是用累次积分来计算 则称p(x,y)p(x,y)是联合密度函数 并且分布函数的偏导数一定就是密度函数

  • 非负性p(x,y)0p(x,y)\ge 0
  • 正则性p(x,y)dxdy=1\iint\limits_{-\infty}^{\infty}p(x,y)dxdy=1 对于多元的情况 我们着重强调一下 我们使用积分来计算概率的时候 积分范围是题目要求范围和非零区域的交集 然后才能化为累次积分进行计算 至于累次积分的问题 数学分析中研究的很清楚了 这里也不会出现非常困难的累次积分运算

一些常用的多维随机变量

多项分布

其实在高中阶段就有过一定的研究,意思是我们的选项不止一个了,其概率的计算是非常自然的一个事情

P=Cnk1Cnk2...Cnknp1k1p2k2...pnknP=C_{n}^{k_{1}}C_{n}^{k_{2}}...C_{n}^{k_{n}}p_{1}^{k_{1}}p_{2}^{k_{2}}...p_{n}^{k_{n}}

多项分布是一个离散的分布 使用分布列就可以很容易的研究

多维的超几何分布

还是不放回进行抽样 公式如下

P(X1=n1,X2=n2,,X,=nr)=(N1n1)(N2n2)(Nrnr)(Nn)P(X_{1}=n_{1},X_{2}=n_{2},\cdots,X,=n_{r})=\frac{\binom{N_{1}}{n_{1}}\binom{N_{2}}{n_{2}}\cdots\binom{N_{r}}{n_{r}}}{\binom{N}{n}}
多维的均匀分布
p(x)={1S,xS,0, 其他. p(x)=\left\{\begin{array}{ll} \frac{1}{S}, & x\in S, \\ 0, & \text { 其他. } \end{array}\right.
二元正态分布

二元正态分布的核心有是五个量(X,Y)N(μ1,μ2,σ1,σ2,p)(X,Y)\sim N(\mu_{1},\mu_{2},\sigma_{1},\sigma_{2},p) 联合密度函数为

f(x1,x2)=12πσ1σ21ρ2e12(1ρ2)((x1μ1)2σ122ρx1μ1σ1x2μ2σ2+(x2μ2)2σ22)f(x_1,x_2)=\frac1{2\pi\sigma_1\sigma_2\sqrt{1-\rho^2}}e^{-\frac1{2(1-\rho^2)}\left(\frac{(x_1-\mu_1)^2}{\sigma_1^2}-2\rho\cdot\frac{x_1-\mu_1}{\sigma_1}\cdot\frac{x_2-\mu_2}{\sigma_2}+\frac{(x_2-\mu_2)^2}{\sigma_2^2}\right)}

对应的 他们拥有边缘密度函数 他们都是正态变量 我们在联合密度函数中见到的pp代表着相关程度 他就是相关系数

边际分布与独立性

多元的分布有非常多值得我们研究的性质 主要是以下几点

  • 单独某一个变量的密度函数——边际密度函数
  • 两个量之间的关联程度——相关系数
  • 给定一个量的时候,另一个量的分布——条件分布 我们后面都会逐渐研究 注意 分布函数和密度函数都已经包括了分布的一切信息

边际分布函数

这并不是一个困难的问题 所谓的边际分布只是在忽视某一个量的分布 也就是此时他一定发生 故 F(x,y)F(x,y) 关于xxyy的边际分布分别为

limyF(x,y)\lim_{y \to \infty} F(x,y) limxF(x,y)\lim_{x \to \infty} F(x,y)

边缘分布是向量中某一个分量或者某几个的分布 它缺少了对分量之间关系的刻画

边际分布列

对于离散的场景 边际分布列只需要把每一行和每一列加起来就好了

边际密度函数

我们能给出这样的计算公式 他非常好理解

pX(x)=p(x,y)dyp_{X}(x)=\int\limits_{-\infty }^{\infty } p(x,y)dy pY(y)=p(x,y)dxp_{Y}(y)=\int\limits_{-\infty }^{\infty } p(x,y)dx

公式本身也是非常好理解的 还是老问题 所有的这类型问题都需要考虑积分的问题 划分被积分的区间 密度为0的区间千万不要考虑

随机变量独立性

有时候 多元随机向量之间的各个分量之间会相互影响 但是有时候他们又彼此独立,这点需要我们的研究

定义:如果 F(x1,x2...,xn)=F(x1)F(x2)...F(xn)F(x_{1},x_{2}...,x_{n})=F(x_{1})F(x_{2})...F(x_{n}) 就称这几个随机变量相互独立

对于相互独立的随机变量 :

  • 离散型可以用过每个小事情发生的概率的积来确定大事件发生的概率
  • 连续型的联合概率密度就是边际概率密度的积

为了确定随机变量之间是否独立 核心就是判断联合概率密度是不是边际概率密度的积

随机向量的函数

经典分布列离散场景

我们往往还是选择把YY的取值一一列出 挨个计算组成和最后的概率就可以了 我们给出一个简单的例子 他的思想在后面会重复的使用 证明泊松分布的可加性 也就是XP(λ1) YP(λ2) 则X\sim P(\lambda_{1})~Y\sim P(\lambda_{2})~\text{则} Z=X+YP(λ1+λ2)Z=X+Y\sim P(\lambda_1+\lambda_2) 容易知道 ZZ 能去所有的非负整数 是一个离散型分布 并且Z=kZ=k

{X=i,Y=ki}\left\{X=i,Y=k-i\right\}

这一组不相容时间的并 考虑到独立性有

P(Z=k)=i=0kP(X=i)P(Y=ki).P\left(Z=k\right)=\sum_{i=0}^{k}P\left(X=i\right)P\left(Y=k-i\right).

我们称为离散卷积公式 据此我们可以计算得到

X+YP(λ1+λ2)X+Y\sim P(\lambda_1+\lambda_2)

其中的卷积 是指求两个随机变量的和的操作

最值的分布

借助定义研究 通过概率的性质消除最大值最小值符号 如下 设X1,X2,...XnX_1,X_2,...X_n 是相互独立的nn个随机变量 研究max{X1,X2,...Xn};min{X1,X2,...Xn}max\{X_1,X_2,...X_n\};min\{X_1,X_2,...X_n\} 的分布

Fy(y)=P(max{X1,X2,,Xn}y)=P(X1y,X2y,,Xny)=P(X1y)P(X2y)P(Xny)=i=1nFi(y).\begin{aligned}F_y(y)&=P(\max\{X_1,X_2,\cdots,X_n\}\leqslant y)=P(X_1\leqslant y,X_2\leqslant y,\cdots,X_n\leqslant y)\\&=P(X_1\leqslant y)P(X_2\leqslant y)\cdots P(X_n\leqslant y)=\prod_{i=1}^nF_i(y).\end{aligned} Fz(z)=P(min{X1,X2,,Xn}z)=1P(min{X1,X2,,Xn}>z)=1P(X1>z,X2>z,,Xn>z)=1P(X1>z)P(X2>z)P(Xn>z)=1i=1n[1Fi(z)].\begin{aligned} F_{z}\left(z\right)& =P\left(\min\left\{X_{1},X_{2},\cdots,X_{n}\right\}\leq z\right) \\ &=1-P\left(\min\left\{X_{1},X_{2},\cdots,X_{n}\right\}>z\right) \\ &=1-P\left(X_{1}>z,X_{2}>z,\cdots,X_{n}>z\right) \\ &=1-P\left(X_{1}>z\right)P\left(X_{2}>z\right)\cdots P\left(X_{n}>z\right) \\ &=1-\prod_{i=1}^{n}\left[1-F_{i}\left(z\right)\right]. \end{aligned}

这是非常常用的处理方法 以后我们还会再其他地方遇到

连续卷积公式

适用于连续的Z=X+YZ=X+Y 要求两个随机变量是无关的 定理:pZ(z)=PX(zy)PY(y)dy=PX(x)PY(zx)dxp_{Z}(z)=\int\limits_{-\infty }^{\infty} P_{X}(z-y)P_{Y}(y)dy=\int\limits_{-\infty }^{\infty} P_{X}(x)P_{Y}(z-x)dx 本身卷积公式还是容易记忆并且理解的 他在形式上和离散卷积公式没什么区别 核心点在于积分区间 我们要保证两个概率密度都不为0 所以积分区间需要处理不等式才能给出 卷积公式也可以用于不独立的两个随机变量 我们只需要把边际密度改写为联合密度就可以了

变量变换法

我们在随机变量的时候研究过随机变量的函数 这里可以重提一下 设二维随机变量(X,Y)(X,Y) 的联合密度函数为p(x,y)p(x,y) 如果有

{u=g1(x,y)v=g2(x,y)\begin{cases}u=g_{1}\left(x,y\right)\\v=g_{2}\left(x,y\right)\end{cases}

有连续偏导数 并且存在唯一的反函数

{x=x(u,v)y=y(u,v)\left.\left\{\begin{matrix}x=x\left(u,v\right)\\y=y\left(u,v\right)\end{matrix}\right.\right.

变换的雅可比行列式

J=(x,y)(u,v)=xuxvyuyv=((u,v)(x,y))1=(uxuyvxvy10\left.\left.J=\frac{\partial\left(x,y\right)}{\partial\left(u,v\right)}=\left|\begin{matrix}\frac{\partial x}{\partial u}&\frac{\partial x}{\partial v}\\\frac{\partial y}{\partial u}&\frac{\partial y}{\partial v}\end{matrix}\right.\right|=\left(\frac{\partial\left(u,v\right)}{\partial\left(x,y\right)}\right)^{-1}=\left(\left|\begin{matrix}\frac{\partial u}{\partial x}&\frac{\partial u}{\partial y}\\\frac{\partial v}{\partial x}&\frac{\partial v}{\partial y}\end{matrix}\right.\right|\right|^{-1}\neq0

如果

{U=g1(X,Y)V=g2(X,Y)\left.\left\{\begin{matrix}U=g_{1}\left(X,Y\right)\\V=g_{2}\left(X,Y\right)\end{matrix}\right.\right.

(U,,V)(U,,V) 的联合密度为

p(u,v)=p(x(u,v),y(u,v))Jp\left(u,v\right)=p\left(x\left(u,v\right),y\left(u,v\right)\right)|J|

积与商

设随机变量X,YX,Y相互独立 密度函数为pX(x),pY(y)p_X(x),p_Y(y)

U=XYU=XY的密度函数为 PU(u)=pX(uv)pY(v)1vdv.P_{U}\left(u\right)=\int_{-\infty}^{\infty}p_{X}\left(\frac{u}{v}\right)p_{Y}\left(v\right)\frac{1}{\left|v\right|}dv. U=XYU=\frac{X}{Y} 的密度函数为 PU(u)=pX(uv)pY(v)vdv.P_{U}\left(u\right)=\int_{-\infty}^{\infty}p_{X}\left(uv\right)p_{Y}\left(v\right)\mid v\mid dv.

公式的使用还是老规矩 需要限制积分区间保证可积性

多维数字特征

多维随机向量期望

我们希望能给出二维随机变量的函数的期望的计算公式 这也是多维情况下多出来的新情况 只有多维随机变量的函数是一个新的随机变量可以研究期望 设二维随机变量(X,Y)(X,Y) 的分布用联合分布列表示为P(X=x,Y=y)P(X=x,Y=y) 联合密度函数为p(x,y)p(x,y)Z=g(X,Y)Z=g(X,Y) 的数学期望是

E(Z)={ijg(xi,yj)P(X=xi,Y=yj)g(x,y)p(x,y)dxdy,\left.E\left(Z\right)=\left\{\begin{matrix}\sum_{i}\sum_{j}g\left(x_{i},y_{j}\right)P\left(X=x_{i},Y=y_{j}\right)\\\\\int_{-\infty}^{\infty}\int_{-\infty}^{\infty}g\left(x,y\right)p\left(x,y\right)\mathrm{d}x\mathrm{d}y,\end{matrix}\right.\right.

协方差

协方差又名相关中心矩 刻画随机变量之间的相关性 如果对于二维随机变量(X,Y)(X,Y)E[(XE(X))(YE(Y))]E\left[\left(X-E\left(X\right)\right)\left(Y-E\left(Y\right)\right)\right] 存在 则称其为协方差 记作

Cov(X,Y)=E[(XE(X))(YE(Y))]\mathrm{Cov}\left(X,Y\right)=E\left[\left(X-E\left(X\right)\right)\left(Y-E\left(Y\right)\right)\right]

特别的有 Cov(X,X)=Var(X)Cov\left(X,X\right)=Var\left(X\right) 能看出 协方差是两种偏差乘积的数学期望 由于偏差本身可正可负 所以协方差也一样; 当协方差为正数的时候 称为正相关 负数的时候称为负相关 当协方差为0的时候 要么两个随机变量不相关 要么他们存在非线性的关系

下面给出一些常用的性质

  • Cov(X,Y)=E(XY)E(X)E(Y)Cov(X,Y)=E(XY)-E(X)E(Y)
  • 独立可以推出协方差为0 反之不然
  • Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)
  • Cov(X,Y)=Cov(Y,X)Cov(X,Y)=Cov(Y,X)
  • Cov(X,c)=0Cov(X,c)=0
  • Cov(aX,bY)=abCov(X,Y)Cov(aX,bY)=abCov(X,Y)
  • Cov(X+Y,Z)=Cov(X,Z)+Cov(Z,Y)Cov(X+Y,Z)=Cov(X,Z)+Cov(Z,Y)

相关系数

如果对于二维随机变量(X,Y)(X,Y) Var(X),Var(Y)>0Var(X),Var(Y)>0 则称

Corr(X,Y)=Cov(X,Y)Var(X)Var(Y)=Cov(X,Y)σXσYCorr\left(X,Y\right)=\frac{Cov\left(X,Y\right)}{\sqrt{Var\left(X\right)}\sqrt{Var\left(Y\right)}}=\frac{Cov\left(X,Y\right)}{\sigma_{X}\sigma_{Y}}

为两个随机变量的(线性)相关系数 刻画了二者的线性的相关性 相关系数还有另一种解释 它是进行了标准化后的随机变量的协方差

还是给出一些性质

  • 1Corr(X,Y)1,Corr(X,Y)1-1\leqslant Corr\left(X,Y\right)\leqslant1,或\left|Corr\left(X,Y\right)\right|\leqslant1
  • Corr(X,Y)=1|Corr(X,Y)|=1 的充要条件是X,YX,Y几乎处处有线性相关关系 也就是P(Y=aX+b)=1P\left(Y=aX+b\right)=1 相关系数在[1,1][-1,1]之间取值的证明如下
0Var(XσX+YσY)=Var[X]σX2+Var[Y]σX2+2Cov(XσX,YσY)=2+2pxy0\leq\mathrm{Var}(\frac X{\sigma _X}+\frac Y{\sigma_Y})=\frac{\mathrm{Var}[X]}{\sigma _X^{2}}+\frac{\mathrm{Var}[Y]}{\sigma _X^{2}}+2\mathrm{Cov}(\frac X{\sigma _X},\frac Y{\sigma _Y})=2+2p_{xy} 0Var(xσXyσY)=Var[X]σX2+Var[Y]σY22Cov(xσX,yσY)=22pxy0\leq Var(\frac x{\sigma _X}-\frac y{\sigma _Y})=\frac{\mathrm{Var}\left[X\right]}{\sigma _X^{2}}+\frac{\mathrm{Var}\left[Y\right]}{\sigma _Y^{2}}-2Cov(\frac x{\sigma _X},\frac y{\sigma _Y})=2-2p_{xy}

综合两个不等式就可以证明原始命题了

数学期望矩阵和协方差矩阵

我们用矩阵的形式来表示nn维随机向量的数学期望 协方差;有协方差自然就能导出相关系数了 数学期望矩阵

E(X)=(E(X1),E(X2),,E(Xn))E\left(X\right)=\left(E\left(X_{1}\right),E\left(X_{2}\right),\cdots,E\left(X_{n}\right)\right)^{\prime}

协方差矩阵(一个非负定矩阵)

=(Var(X1)Cov(X1,X2)Cov(X1,Xn)Cov(X2,X1)Var(X2)Cov(X2,Xn)Cov(Xn,X1)Cov(Xn,X2)Var(Xn))=\begin{pmatrix}\operatorname{Var}(X_1)&\operatorname{Cov}(X_1,X_2)&\cdots&\operatorname{Cov}(X_1,X_n)\\\operatorname{Cov}(X_2,X_1)&\operatorname{Var}(X_2)&\cdots&\operatorname{Cov}(X_2,X_n)\\\vdots&\vdots&&\vdots\\\operatorname{Cov}(X_n,X_1)&\operatorname{Cov}(X_n,X_2)&\cdots&\operatorname{Var}(X_n)\end{pmatrix}

条件分布和条件期望

整个条件分布理论和我们在第一章研究的条件分布理论的形式基本一致 二元初始分布的条件分布一定是一个一元的分布 这是我们用一次积分就计算出条件期望的基础

离散型的条件分布

还是同时发生的概率除以条件发生的概率 此时条件发生的概率是边际分布 首先给出二维离散型随机变量的分布列

pij=P(X=xi,Y=yj)p_{ij}=P\left(X=x_{i},Y=y_{j}\right)

那么条件分布列为

Pij=P(X=xiY=yj)=P(X=xi,Y=yj)P(Y=yj)=PijP.jP_{ij}=P\left(X=x_{i}\mid Y=y_{j}\right)=\frac{P\left(X=x_{i},Y=y_{j}\right)}{P\left(Y=y_{j}\right)}=\frac{P_{ij}}{P_{.j}}

连续型的条件分布

还是同时发生的概率除以条件发生的概率 此时条件发生的概率是边际分布

P(XxY=y)=xp(u,y)pr(y)duP\left(X\leq x\mid Y=y\right)=\int_{-\infty}^{x}\frac{p\left(u,y\right)}{p_{r}\left(y\right)}du

条件数学期望

条件数学期望研究是某种条件分布的数学期望 定义如下

E(XY=y)={ixiP(X=xiY=y)axp(xy)dx,\left.E\left(X\mid Y=y\right)=\left\{\begin{matrix}\sum_{i}x_{i}P\left(X=x_{i}\mid Y=y\right)\\\int_{-a}^{\infty}xp\left(x\mid y\right)dx,\end{matrix}\right.\right.

条件数学期望是期望 但也是一个yy的函数 因此我们往往给出另一种常用的记法 E(XY)E(X|Y)

全期望公式

E(X)=E(E(XY))E\left(X\right)=E\left(E\left(X|Y\right)\right)

大数定理和中心极限定理

收敛性

依概率收敛

我们在很早的时候就已经提出了理论 概率是频率的稳定值 现在我们来解释他的具体意义

  • 频率vv对概率pp的绝对偏差pv|p-v|趋近于稳定值
  • 由于随机性的存在 我们不能排除大偏差发生的可能性 但是大偏差发生的概率的可能性会越来越小

现在我们给出一般性的定义 定义:设{Xn}\{X_{n}\}是一随机变量序列 XX是一随机变量 若对于任意的ε\varepsilon

limnP(XnX<ε)=1\lim_{n\to\infty}P(|X_n-X|<\varepsilon)=1

就称随机变量依概率收敛记作XnX(P)X_{n}\longrightarrow X(P)

依分布收敛、弱收敛

分布函数也是概率问题的重要刻画 他也应该具有收敛的性质;

我们在数学分析中介绍过函数的点态收敛 可惜这个条件太强了 很容易导致分布函数不再满足分布函数的规范性,因此这里暂且放下不表

定义:设分布函数列{Fn(x)}\{F_{n}(x)\} 如果对于F(x)F(x)的任意连续点 都有

limnFn(x)=F(x)\lim_{n \to \infty} F_{n}(x)=F(x)

则称分布函数列{Fn(x)}\{F_{n}(x)\}弱收敛于F(x)F(x) 或者称为随机变量序列{Xn}\{X_{n}\}按照分布收敛于X 记作XnX(L)X_{n}\longrightarrow X(L) 或者 Fn(x)F(x)(W)F_{n}(x)\longrightarrow F(x)(W)

定理:依概率收敛推出依分布收敛 定理:依分布收敛于常数是依概率收敛(于常数)的充要条件

几乎处处收敛,概率1收敛

几乎处处收敛的符号表达为

P(limnXn=X)=1P(\lim_{n\to\infty}X_n=X)=1

大致看起来,这和依概率收敛的区别仅仅是改变了极限符号的位置

实际上,几乎处处收敛在数学含义上远远强于依概率收敛,他类似与数学分析中函数的点态收敛的概念,是点态收敛的概率论版本

几乎处处收敛要求在每一个点上,随机变量序列都收敛与随机变量。而依概率收敛仅仅要求先计算概率,要求概率的极限为1,而不是每个点都收敛

大数定律

在实践中,  人们认识到大量测量值的算术平均值也具有稳定性.  大数定律就是用于研究大量随机现象中平均结果的稳定性的理论.

伯努利大数定律

他描述了频率和概率的关系 是对前面的内容的一个回扣 定理:SnS_{n}nn重伯努利实验中事件AA发生的次数pp为每次实验中AA出现的概率 则有对任意的ε>0\varepsilon >0

limn(Snnp<ε)=1\lim_{n \to \infty}(|\frac{S_{n}}{n}-p|<\varepsilon)=1

伯努利大数定律给了我们用频率来确定概率的理论依据

切比雪夫大数定律

定理:设Xn{X_{n}} 是一列两两不相关的随机变量序列 若每个XiX_{i} 的方差存在 且有共同的上界 则对于对于任意的ε>0\varepsilon>0

lim<P(1ni=1nXi1ni=1nE(Xi)<ε=1.\lim_{<\to\infty}P\left(\left|\frac{1}{n}\sum_{i=1}^{n}X_{i}-\frac{1}{n}\sum_{i=1}^{n}E\left(X_{i}\right)\right|<\varepsilon\right|=1.

我们弱化掉了同分布的要求

马尔可夫大数定律

Xn{X_{n}} 是的随机变量序列 如果1n2D(Xi)0\frac{1}{n^{2}}D(\sum\limits X{i})\longrightarrow0 则对于对于任意的ε>0\varepsilon>0

lim<P(1ni=1nXi1ni=1nE(Xi)<ε=1.\lim_{<\to\infty}P\left(\left|\frac{1}{n}\sum_{i=1}^{n}X_{i}-\frac{1}{n}\sum_{i=1}^{n}E\left(X_{i}\right)\right|<\varepsilon\right|=1.

马尔可夫大数定律是给出了另一个大数定律重复的条件 ,他比起切比雪夫大数定律的条件更加的弱化了

辛钦大数定律

定理:设Xn{X_{n}} 是一列两两不相关且服从相同分布的随机变量序列 且都具有数学期望μ\mu则对于对于任意的ε>0\varepsilon>0 都有

limnP(1nXiμε)=0\lim_{n \to \infty}P(|\frac{1}{n}\sum\limits X_{i}-\mu|\ge\varepsilon)=0

辛钦大数定理是后续矩估计理论的基础

中心极限定理

某种偏差是大量微小的偶然因素造成的微小误差的总和, 所有这些不同因素所引起的微小误差是相互独立的, 并且它们中每一个对总和产生的影响不大.

此时利用卷积公式进行计算是非常困难的 但是我们在绘制图形的时候发现 随着nn的增大 和函数的接近于正态分布 这就是中心极限定理

林德贝格-列维中心极限定理

定理:设随机变量X1,X2,,XnX1, X2,…, Xn相互独立, 服从同一分布,且具有相同的有限的数学期望与方差 如果记

Yn=X1+X2++XnnμσnY_{n}^{*}=\frac{X_{1}+X_{2}+\cdots+X_{n}-n\mu}{\sigma\sqrt{n}}

limxP(Yny)=Φ(y)=12πyet22dt.\lim_{x\to\infty}P\left(Y_{n}^{*}\leqslant y\right)=\Phi\left(y\right)=\frac{1}{\sqrt{2\pi}}\int_{-\infty}^{y}e^{\frac{t^{2}}{2}}dt.

也就是一切独立同分布的随机变量的和 都可以用正态分布进行近似

在一定条件下,大量独立随机变量之和的分布趋于正态分布。

枥莫佛-拉普拉斯中心极限定理

他是前面定理在二项分布的狭义形式 是把二项分布视为多次伯努利分布的和

定理:设YnY_{n}, 服从二项分布,且具有数学期望与方差 则随机变量 Yˉ=Ynpnp(1p)\bar{Y}=\frac{ Y-np}{\sqrt{np(1-p)}} 的概率密度函数是12πet22\frac{1}{\sqrt{2\pi}}e^{\frac{-t^{2}}{2}}

这个定理意味着正态分布是二项分布的极限 可以用正态分布来做近似计算

强弱大数定律与他们的收敛性

大数定律是现代概率理论中重要的理论,也是连接概率理论与统计理论的重要桥梁。

数学中的大多数理论都以定理命名,依次体现他们是经由严谨的推导得到的结果。而定律通常用于描述自然界中的规律性现象,基于观察得出。在数学中引入这一个定律,他的应用的紧密联系与重要性可见一斑。

基本的大数定律

大数定律描述了这样一种现象:对于一个随机变量序列{Xn}\left \{ X_n\right \} (可以理解为无数个样本),它的前nn项平均值

An=X1+X2++XnnA_n=\frac{X_1+X_2+\cdots+X_n}n

对于满足若干条件的{Xn}\{X_n\},当随机变量数量nn非常大时,它们的平均值将极有可能趋于定值μ\mu

AnμA_{n}\to\mu

这个定值μ\mu通常是XiX_i数学期望。按收敛方式不同,大数定律分为强大数定律和弱大数定律。

本质上我们研究得还是大量随机现象中平均结果的稳定性

强大数定律

其数学形式为

P{limnAnμ=0}=1P\left\{\lim_{n\to\infty}A_n-\mu=0\right\}=1

含义为当随机变量序列的长度为无穷大时,它们的平均值必然趋于定值。我们称这样的随机变量序列符合强大数定律。

弱大数定律

数学形式为

ε>0:limnP{Anμ<ε}=1\forall\varepsilon>0:\lim_{n\to\infty}P\{|A_n-\mu|<\varepsilon\}=1

含义为当随机变量的序列的长度为无穷大时,它们的平均值逼近定值的概率为将趋近于1。称这样的随机变量序列符合弱大数定律。

区别和联系

强大数定律是容易理解的,类似于数列的收敛。而弱大数定律相对来说不容易理解,而且乍一看似乎跟强大数定律没有什么区别。实际上,这里面涉及到对极限的理解。

强大数定律是点态收敛,或者说他的含义是几乎处处收敛。而弱大数定律只要求收敛的概率为1,也就是依概率测度收敛。也就是说如果一个随机变量序列符合强大数定律,那么他一定也符合弱大数定律。

特别的,如果我们回望本文“林德贝格-列维中心极限定理”一节,能发现其中的收敛形式恰好为依分布收敛,因此我们可以给出总结

  • 强大数定律:几乎处处收敛
  • 弱大数定律:依概率收敛
  • 中心极限定理:依分布收敛

实际应用中大部分服从弱大数定律的随机变量序列也服从强大数定律,故后文再提“大数定律”均指强大数定律

注意:大数定律本质上实在无穷大的试验次数上才会成立,而我们不可能进行无穷大次实验,因此在有限次数实验的情况下,出现任何大偏差都和大数定律本身不违背。大数定律也不会影响实验的独立性。

  • Title: Elementary Probability: Random Events, Probability Models, and Random Variables
  • Author: Hyacehila
  • Created at : 2023-03-18 13:28:02
  • Link: https://hyacehila.github.io//blog/2023/03/18/elementary-probability-notes/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments