Advanced Probability: Probability Spaces, Random Variables, and Measure-Theoretic Foundations

Hyacehila

概率空间与随机变量

高等概率论研究公理化的概率体系,这也是概率走向现代的重要一步,概率体系的基本发展情况如下

  1. 概率的古典定义(两大概型)
  2. 集合与测度理论的引入
  3. 公理化结构的建立

这一章补充完整概率理论中的基础数学知识,以及建立我们基本的概率体系,将会包括一些基础的数学知识,以及对概率论中最基础的概念,概率空间和随机变量的精确数学定义

σ\sigma代数

为了引入公理化的概率理论,我们首先补充关于代数的知识

定义:集类也称集合类,是集合构成的集合

定义:在空间全Ω\Omega上对交运算封闭的集合类称为 π\pi

定义:如果集类A\mathcal{A} 满足

  • ΩA\Omega \in \mathcal{A} (ϕA\phi \in \mathcal{A})
  • AAAcA\text{若}A\in \mathcal{A}\text{则}A^{c}\in \mathcal{A}
  • A1,A2,,AnA,i=1nAiA\text{若}A_1,A_2,\ldots,A_n\in \mathcal{A},\text{则}\sum_{i=1}^nA_i\in \mathcal{A} 则称 集类A\mathcal{A} 是一个代数

从定义能看出 : 代数是 π\pi 类,而 π\pi 类不一定是代数

定义:设FF是集类 且满足

  • ΩF\Omega \in F (ϕF\phi \in F)
  • AFAcF\text{若}A\in F\text{则}A^{c}\in F
  • A1,A2,F,i=1AiA\text{若}A_1,A_2,\ldots\in F,\text{则}\sum_{i=1}^{\infty} A_i\in \mathcal{A} 则称FF 是一个σ\sigma代数

我们把定义从有限并封闭改为了可列并封闭,因此σ\sigma代数一定是一个代数

我们可以给出σ\sigma代数的两个性质,他们可以结合定义进行证明

  • σ\sigma代数的交是σ\sigma代数
  • σ\sigma代数的并不一定是σ\sigma代数代数

定义:设A\mathcal{A}Ω\Omega的一个子集,FFσ\sigma代数 如果

  • AF\mathcal{A}\in\mathcal{F}
  • 任意包含Aσ代数F,均有FF任意包含A的\sigma 代数F^{\prime},均有F\subset F^{\prime} 则称FFAA生成的σ\sigma代数 记作F=σ(A)F=\sigma(A)

对于理解生成σ\sigma代数的概念,我们可以给出两条性质

  • σ(A)\sigma(A)是包含 AA 的最小σ\sigma代数
  • σ(A)\sigma(A)是所有包含 AAσ\sigma代数的交

由全体闭区间生成的σ\sigma代数称为Borel代数,他将是我们后面研究随机变量的时候最常用的σ\sigma代数

πλ\pi - \lambda 类定理

定义:称集类FFλ\lambda类 如果有

  • ΩF\Omega\in F
  • 对任意A,BFAB,B/AF对任意A,B\in F 且A\subset B,则 B/A\in F
  • A1A1,A2,FAnA=i=1Ai,AFA_{1}A_{1},A_{2},\ldots\in F A_{n}\uparrow A=\cup_{i=1}^{\infty}A_{i},则A\in F

明显的

  • σ\sigma代数是λ\lambda
  • λ\lambda类对补运算封闭

定理:我们容易给出定理

集类Fσ代数Fπ类且是λ集类F是\sigma代数\Longleftrightarrow F是\pi类且是\lambda类

给出本节最重要的 πλ\pi - \lambda 类定理

如果有两个集合类PPLL,其中PP是一个π\pi系统(即在有限交运算下封闭的集合族),LL是一个λ\lambda-系统(包含空集,对补集和可数不相交并运算封闭的集合族),并且PPLL 的子集,那么由PP 生成的σ\sigma-代数σ(P)\sigma(P)LL的子集。

概率测度

从本节开始我们开始研究公理化的概率理论,首先我们来研究概率测度和概率空间

定义:集函数是从集合到实数的映射

PP 是定义在 σ\sigma代数 F\mathcal{F} 上的概率测度, 如果它是一个集函数 P:F[0,1]P: \mathcal{F} \rightarrow[0,1] , 并满足以下三个公理:
  1. 非负性:对于任意事件 AFA \in \mathcal{F} ,有 P(A)0P(A) \geq 0
  2. 单位性:整个样本空间的概率为 1 , 即 P(Ω)=1P(\Omega)=1
  3. 可列加性:对于任意可数个两两不相交的事件 A1,A2,F,P(i=1Ai)=i=1P(Ai)A_{1}, A_{2}, \ldots \in \mathcal{F} , 有 P\left(\bigcup_{i=1}^{\infty} A_{i}\right)= \sum_{i=1}^{\infty} P\left(A_{i}\right)

概率测度是一种特殊的测度,是我们在概率论中主要研究的对象,测度这个概念最早在实变函数中进行了介绍

自然的,我们可以给出一些概率测度的性质

  • 单调性:ABA \subset BP(A)P(B)P(A) \le P(B)
  • 补集规则 : P(Ac)=1P(A)P(A^{c}) = 1-P(A)
  • 有限可加性 :任意事件A1,A2,FA_{1}, A_{2}, \ldots \in \mathcal{F}P(i=1Ai)i=1P(Ai)P\left(\bigcup_{i=1}^{\infty} A_{i}\right) \le\sum_{i=1}^{\infty} P\left(A_{i}\right)
  • 连续性:如果A1A2是一个递增的事件序列,i=1Ai=A,limnP(An)=P(A)如果 A_{1} \subseteq A_{2} \subseteq \ldots 是一个递增的事件序列, 且 \bigcup_{i=1}^{\infty} A_{i}=A , 则 \lim _{n \rightarrow \infty} P\left(A_{n}\right)=P(A)递减情况同理
  • 容斥原理:P(AB)=P(A)+P(B)P(AB)P(A\cup B) = P(A)+P(B)-P(AB)

在明确了概率测度的概念之后,我们可以给出概率空间的准确定义:

一个概率空间由三元组 (Ω,F,P)(\Omega,F,P) 组成,其中:

  • 样本空间Ω\Omega 非空并且包含了所有的实验结果(样本点)
  • 事件域FF是样本空间Ω\Omega 上的一个σ\sigma代数
  • 概率测度PP满足我们刚才给出的定义,是一个σ\sigma代数的集函数

它们为随机事件的分析和概率的计算提供了必要的结构和规则,也就是样本全体,可测的事件域以及事件的概率

现在我们来介绍概率空间的完备化理论,他是后面的一些问题的基础

定义:在概率空间 (Ω,F,P)(\Omega, \mathcal{F}, P) 中,如果有AFA \in \mathcal{F} 并且 P(A)=0P(A) = 0 则称AA为一个零事件,我们一般用N\mathcal{N}表示概率空间上零事件的全体

特别的,并不是所有的概率空间上,零事件的子集都是零事件,但是我们把满足这一条性质的概率空间称为完备的概率空间(和泛函分析中的完备性不是一个概念)

尽管任意概率空间不一定完备,但是一定可以把他们延拓成完备的概率空间,思路如下

定理:设存在概率空间 (Ω,F,P)(\Omega, \mathcal{F}, P) ,则一定存在一个完备的概率空间 (Ω,F,P)(\Omega, \overline{\mathcal{F}}, \overline{P}) 满足 FF,P=P\mathcal{F} \subset \overline{\mathcal{F}},P = \overline{P}

随机变量

有了前面这么多的讨论基础,我们可以开始讨论随机变量这一个概率论中最重要的概念了,这里我们给出他的公理化解释

定义 设(Ω,F,P)\left(\Omega,\mathcal{F},\mathbb{P}\right)为一个概率空间和(S,S)(S,\mathcal{S})是任意可测空间(即S\mathcal{S}SS 中某些子集所形成的 σ\sigma-代数),称定义在样本空间上的函数 X(ω)X(\omega): ΩS\Omega\to S是一个(Ω,F,P)(\Omega,\mathcal{F},\mathbb{P})上的SS-值随机变量 (r.v.),如果对任意 BSB\in S

X1(B):={ωΩ;X(ω)B}F.X^{-1}\left(B\right):=\left\{\omega\in\Omega;X\left(\omega\right)\in B\right\}\in\mathcal{F}.

从定义可以自然的看出 事件域的大小决定了可测函数是否是随机变量

我们在初等概率论中一般研究实值的随机变量,此时就是将(S,S)(S,\mathcal{S}) 换成 (Rd,BRd)(R^d,B_{R^d}) d=1d = 1是随机变量 否则为随机向量

我们可以将原本的问题反过来,给出下面的定理

X:ΩS(S,S)是可测空间.J={X1(B)BS}σ代数.\begin{aligned}&\text{设}X:\Omega\to S\quad\text{且}(S,\mathcal{S})\quad\text{是可测空间}.\quad\text{则}J=\{X^{-1}(B)|B\in S\}\text{是}\sigma \text{代数}.\end{aligned}

因此,我们记σ(X)={X1(B)BS}\sigma(X) = \{X^{-1}(B)|B\in S\} 为映射XX生成的σ\sigma代数,他也是让样本空间上的函数XX构成随机变量的最小事件域

下面我们简单刻画一下多维随机变量所生成的σ\sigma代数 设X=(X1,,Xn):(Ω,F)(Rn,BRn)X=\left(X_1,\cdots,X_n\right):\left(\Omega,\mathcal{F}\right)\to\left(\mathbb{R}^n,B_{\mathbb{R}^n}\right)是一个Rd\mathbb{R}^d值随机变量,则有

σ(X)=σ(i=1nσ(Xi)).\sigma\left(X\right)=\sigma\left(\bigcup_{i=1}^{n}\sigma\left(X_{i}\right)\right).

也就是说,多维随机变量所生成的σ\sigma代数 是他各个分量的生成的σ\sigma代数的并所生成的σ\sigma代数

由于可测函数复合后可测,我们可以容易的给出下面定理 设f:(Rn,BRn)(R,BR)f:\left(\mathbb{R}^n,B_{\mathbb{R}^n}\right)\to (R,B_{R})可测 XiX_i(Ω,F,P)\left(\Omega,\mathcal{F},\mathbb{P}\right)的随机变量 则有f(X1,X2...Xn)f(X_1,X_2...X_n)(Ω,F,P)(R,BR)\left(\Omega,\mathcal{F},\mathbb{P}\right) \to (R,B_R) 上的随机变量

其证明思路非常简单,仅仅是因为ff是两层可测函数的复合,因此他可测,所以构成随机变量

分布与积分

随机变量的分布

随机变量是从概率空间这个三元对到可测空间这个二元对上的可测映射,从三元映射到二元是一件很奇怪的事情,实际上这是因为我们在前面少介绍了一个概念,他就是随机变量的分布,他将把二元对补充为三元对

定义 设 X:(Ω,F)(S,S)X:(\Omega, \mathcal{F}) \rightarrow(S, \mathcal{S}) 为概率空间 (Ω,F,P)(\Omega, \mathcal{F}, \mathbb{P}) 上的一个随机变量. 对任意 BSB \in \mathcal{S} ,定义:

PX(B):=P(X1(B))\mathcal{P}_{X}(B):=\mathbb{P}\left(X^{-1}(B)\right)

则称 PX\mathcal{P}_{X} 为随机变量 XX 的分布

这里定义的是随机变量的分布而不是分布函数

我们很容易验证 (S,S,PX)(S, \mathcal{S},\mathbb{P}_X) 也是一个概率空间,也就是我们从原本的事件概率空间,来到了更加抽象的分布概率空间,从而简化一些研究

如果 (S,S)=(R,BR)(S, \mathcal{S})=\left(\mathbb{R}, \mathcal{B}_{\mathbb{R}}\right) , 则称如下函数:

FX(x):=PX((,x])xRF_{X}(x):=\mathcal{P}_{X}((-\infty, x]) \quad x \in \mathbb{R}

为实值随机变量 XX 的分布函数 ^ac85f9

现在我们可以明确了,所谓的分布函数只是使用随机变量的分布构造出的一种函数形式,也就是分布函数是从随机变量的分布诱导的。

这里我们终于对分布做出了一个准确定义,在初等概率论中我们只研究了分布函数,对分布仅有一个只进行了感觉上的定义。

下面我们来给出随机变量同分布的定义

定义:设X,YX,Y是取值于同一个空间SSSS值随机变量,并且有PX=PY\mathcal{P}_{X}=\mathcal{P}_{Y} 也就是任意BSB\in SPX(B)=PY(B)\mathcal{P}_{X}(B)=\mathcal{P}_{Y}(B) 则称 XXYY 同分布 写作 X=dYX \overset{d}{=} Y

特别的 同分布可以不定义在同一概率空间上,分布是比概率空间更加抽象的概念,只研究随机变量的取值空间而不研究原本的概率空间

下面我们再补充一个定理,研究随机变量相等的证明

定理:设X,YX,Y是取值于同一个空间SS的随机变量,满足S=σ(A)\mathcal{S} = \sigma(\mathcal{A}) 并且 A\mathcal{A} 是一个π\pi 类 如果对任意BAB\in \mathcal{A}PX(B)=PY(B)\mathcal{P}_{X}(B)=\mathcal{P}_{Y}(B)X=dYX \overset{d}{=} Y

推论:取(S,S)=(R,BR)(S, \mathcal{S})=\left(\mathbb{R}, \mathcal{B}_{\mathbb{R}}\right) A={(,x]xR}\mathcal{A} = \{(-\infty,x]|x\in R\} 并且σ(A)=BR\sigma(A) = B_R 则根据上面的定理有 任意xRx\in RFX(x)=FY(x)F_X(x)= F_Y(x)X=dYX \overset{d}{=} Y

继续推论:几乎处处相等的分布函数也导出相同的分布

随机变量的这样的抽象过程是可能导致信息压缩的,与此同时这也意味着问题的简化,合适的设置随机变量是重要的

分布函数的性质

前面我们给出了随机变量分布函数的定义

参见本文“相关段落”一节。

实际上,结合在初等概率论中对随机变量的介绍,我们容易给出他的三条性质

  • F()=0,F()=1F(-\infty) = 0,F(\infty) = 1
  • F(x)F(x) 是单调增函数
  • F(x)F(x) 在每个点都右连续

事实上,我们也可以给出这个问题的另一个角度:所有满足前述三个性质的函数都是分布函数,都可以反向诱导出分布

分布函数的分类与分解

离散部分与连续部分

前面给予了足够的证明,保证了一个分布函数的间断点至多可列,我们不妨记为{an}\{a_n\} 据此,我们可以定义跃度 对于任意的nn

bn=ΔF(an)=F(an)F(an)b_{n}=\Delta F\left(a_{n}\right)=F\left(a_{n}\right)-F\left(a_{n}-\right)

其中bnb_n称为 跃度 其中 F(an)F\left(a_{n}-\right) 是因为函数的右连续性质而给出的

进一步的,我们可以定义

Fd(x):=nZbnl[an,)(x),xRF_{d}\left(x\right):=\sum_{n\in\mathbb{Z}}b_{n}l_{\left[a_{n},\infty\right)}\left(x\right),x\in\mathbb{R}

其中ll是示性部分,函数的含义是跃度的和,我们将Fd(x)F_d(x)称为分布函数的离散部分

容易验证,Fd(x)F_d(x)满足如下的性质

  • Fd()=0,Fd()1F_d(-\infty) = 0,F_d(\infty) \le 1
  • Fd(x)F_d(x) 是单调增函数
  • Fd(x)F_d(x) 在每个点都右连续

如果 nZbn=1\sum_{n\in\mathbb{Z}}b_{n} = 1Fd(x)F_d(x)也是一个分布函数(Fd()=1F_d(\infty) = 1),此时我们称为离散型分布函数

特别的,我们可以给出分布函数的连续部分的的定义有

Fc(x)=F(x)Fd(x)F_{c(x)}= F(x) - F_d(x)

容易验证,他也满足

  • Fc()=0,Fc()1F_c(-\infty) = 0,F_c(\infty) \le 1
  • Fc(x)F_c(x) 是单调增函数
  • Fc(x)F_c(x) 在每个点都右连续

同样的,如果他也构成分布函数,我们称为连续性分布函数

Jordan分解

定理 (分布函数的 Jordan 分解) 设F(x),xRF(x),x\in\mathbb{R}是任意一个分布函数,则存在且唯一存在α[0,1]\alpha\in[0,1]使得

F(x)=αF1(x)+(1α)F2(x),xR,F\left(x\right)=\alpha F_{1}\left(x\right)+\left(1-\alpha\right)F_{2}\left(x\right),x\in\mathbb{R},

其中F1F_1为离散型分布函数和F2F_2为连续型分布函数

绝对连续与奇异连续

我们已经有连续和离散的概念了,这足够了吗? 这里我们需要结合初等概率论的思想来思考

我们前面介绍的 离散部分对应了初等概率论中的离散型分布,那连续部分呢?

如果我们想让他有对应的连续型分布,那需要找到对应的密度函数,而仅仅满足前面的性质是不能保证这一点的,因此我们定义绝对连续型分布函数

定义(绝对连续型分布函数) 设F(x),xRF(x),x\in\mathbb{R}为一个分布函数。如果 FF还是绝对连续的(AC)(AC),即对任意<x1<y1<x2<y2<<xm<ym<+-\infty<x_1<y_1<x_2<y_2<\cdots<x_m<y_m<+\infty 和任意ε>0,存在δ>0使得\varepsilon>0,存在\delta>0使得

i=1myixi<δi=1mF(yi)F(xi)<ε,\sum_{i=1}^{m}\left|y_{i}-x_{i}\right|<\delta\Longrightarrow\sum_{i=1}^{m}\left|F\left(y_{i}\right)-F\left(x_{i}\right)\right|<\varepsilon,

则称FF是一个绝对连续型分布函数

根据绝对连续函数的性质,我们还有:如果FF是一个绝对连续分布函数,则 存在一个非负函数fL1(R)f\in L^1(\mathbb{R})使得,对任意x1<x2x_1<x_2满足

F(x2)F(x1)=x1x2p(x)dx,F\left(x_{2}\right)-F\left(x_{1}\right)=\int_{x_{1}}^{x_{2}}p\left(x\right)dx,

其中fL1:=Pp(x)\|f\|_{L^1}:=\int_{\mathbb{P}}|p(x)|dx=1.x=1.于是F=p0F^\prime=p\geqslant0, a.e. (因为分布函数FF是单增的),以后我们称xp(x)x\to p(x)为绝对连续型分布函数FF的概率密度函数.

我们可以提出对等的概念,也就是奇异型分布函数

定义:如果F(x)F(x)是一个分布函数 并且F=0F^{'}=0 a.e. 则称FF是奇异型分布函数,进一步的,如果FF是连续的,则称为连续奇异型分布函数

任何离散型分布函数都是奇异型分布函数,连续奇异型分布函数需要使用Contor三分集构造

Lebesgue分解

FF是任意一个分布函数,那么存在α,β[0,1]\alpha,\beta \in [0,1] 使得

F=αF1+β(1α)F2+(1α)(1β)F3F=\alpha F_{1}+\beta(1-\alpha)F_{2}+(1-\alpha)(1-\beta)F_{3}

其中F1F_1是离散部分 也可以写作FdF_d F2F_2是绝对连续部分 也写作Fa.cF_{a.c} F3F_3是奇异连续部分 也写作Fc.s.F_{c.s.}

这样的分解一定存在且唯一

积分(数学期望)

这一节我们来讨论随机变量XX的积分,也就是随机变量的数学期望,我们研究期望的定义,性质,以及一些推广定理

积分的定义

我们在随机变量上引入了概率测度的概念,非常自然,我们在公理化体系中应该考虑Lebesgue积分,而所谓的随机变量恰好就是一个可测函数,因此他的Lebesgue积分的定义也就非常自然了,我们分下面四步来介绍

关于随机变量与可测函数:随机变量的每个取值(或者是BRB_{R}) 根据相关的定理,最能找到对应的一个Ω\Omega上的子集AA与他对应,对应的概率测度P(A)P(A)就是随机变量的可测函数的取值对应的测度

有了这些叙述,我们就能模仿经典的四步定义给出随机变量的Lebesgue积分的定义了

STEP1 对于示性随机变量

IA(w)={1,wA0,wAI_{A}(w)=\begin{cases}1,w\in A\\0,w \notin A\end{cases}

他的期望有

E(IA)=1×P(A)+0×P(Ac)E(I_{A})= 1 \times P(A)+0 \times P(A^c)

STEP2 对于非负简单随机变量 存在Ω\Omega的不相交划分AiA_i 和对应权重 bib_i 随机变量满足

X(ω)=i=1nbiIAi(ω)X\left(\omega\right)=\sum_{i=1}^{n}b_{i}I_{A_{i}}\left(\omega\right)

我们可以自然定义XX关于PP的积分

E[X]=ΩX(ω)P(dω):=i=1nbiP(Ai).\mathbb{E}\left[X\right]=\int_{\Omega}X\left(\omega\right)\mathbb{P}\left(d\omega\right):=\sum_{i=1}^{n}b_{i}\mathbb{P}\left(A_{i}\right).

STEP3 对于任何非负随机变量XX,我们能找到一列 单增 非负 简单 随机变量列 XmX^{m} 满足

0X(ω)X(m)(ω)2m,ωΩ.0\leqslant\left|X\left(\omega\right)-X^{\left(m\right)}\left(\omega\right)\right|\leqslant2^{-m},\forall\omega\in\Omega.

这样我们就可以用极限来定义积分 有

E[X]:=sup{E[ξ];ξ 是非负简单随机变量且 ξX}[0,+].\mathbb{E}[X]:=\sup\left\{\mathbb{E}[\xi];\xi\text{ 是非负简单随机变量且 }\xi\leqslant X\right\}\in[0,+\infty].

如果E[X]E[X] \to \infty 则称为积分不存在

STEP4 对于任何实值随机变量 拆分为 X=X++XX = X^{+}+X^{-} 定义积分有

E[X]=ΩX(ω)P(dω):=E[X+]E[X].\mathbb{E}[X]=\int_{\Omega}X\left(\omega\right)\mathbb{P}\left(d\omega\right):=\mathbb{E}\left[X^{+}\right]-\mathbb{E}\left[X^{-}\right].

综上,我们的积分,或者说数学期望的定义就结束了,一般情况下我们会用下面的符号来表示

E[X]=ΩX(ω)P(dω)=ΩX(ω)dP(ω)=xXdP\begin{aligned} E[X]& =\int_{\Omega}X(\omega)P(d\omega)=\int_{\Omega}X(\omega)dP(\omega) \\ &=\int_{x}XdP \end{aligned}

期望的性质

  1. 线性可加性E[aX+bY]=aE[X]+bE[Y]\mathbb{E}[aX+bY]=a\mathbb{E}[X]+b\mathbb{E}[Y]
  2. XX为可积随机变量且X0X\geqslant0,a.e.(即P(X0)=1)\mathbb{P}(X\geqslant0)=1),则E[X]0.\mathbb{E}[X]\geqslant0.特别地,如果X=0X=0, a.e.,则E[X]=0.\mathbb{E}[X]=0.
  3. X,YX,Y为两个可积随机变量和XYX\leqslant Y, a.e.,则E[X]E[Y]\mathbb{E}[X]\leqslant\mathbb{E}[Y]
  4. 设 X,Y为两个可积随机变量,那么X+Y也是可积的,以及\text{设 }X,Y\text{为两个可积随机变量,那么}|X+Y|\text{也是可积的,以及} E[X+Y]E[X]+E[Y].\mathbb{E}[|X+Y|]\leqslant\mathbb{E}[|X|]+\mathbb{E}[|Y|].
  5. 设随机变量XX可积 则E[X]E[X]|\mathbb{E}[X]|\leq\mathbb{E}[|X|]
  6. 设随机变量XX可积 和 AFA\in F 如果存在常数 aX(w)ba \le X(w) \le b 任意点都成立 那么aP(A)E[X11A]bP(A).a\mathbb{P}\left(A\right)\leqslant\mathbb{E}\left[X11_{A}\right]\leqslant b\mathbb{P}\left(A\right).

期望的重要定理

本节我们研究随机变量序列的收敛问题,本节我们讨论的收敛属于 初等概率论 的“收敛性 / 几乎处处收敛,概率1收敛”一节

(单调收敛定理){Xn}n1\{X_n\}_{n\geqslant1}为概率空间(Ω,F,P)(\Omega,\mathcal{F},\mathbb{P})非负、单增和可积随机变量,那么有

E[limnXn]=limnE[Xn].E\left[\lim_{n\to\infty}X_{n}\right]=\lim_{n\to\infty}E[X_{n}].

(Fatou 引理){Xn}n1\{X_n\}_{n\geqslant1}是概率空间(Ω,F,P)(\Omega,\mathcal{F},\mathbb{P})上的一列非负可积随机变量,则

E[limnXn]limnE[Xn].\mathbb{E}\left[\lim_{n\to\infty}X_{n}\right]\leqslant\lim_{n\to\infty}\mathbb{E}\left[X_{n}\right].

(控制收敛定理){Xn}n1\{X_n\}_{n\geqslant1}是概率空间(Ω,F,P)(\Omega,\mathcal{F},\mathbb{P})上的一列随机变量且满足

XnY,n1,\left|X_{n}\right|\leqslant Y,\forall n\geqslant1,

其中YY是一个独立于nn 的非负可积随机变量.进一步,如果

P(limnXn=X)=1(我们记为 Xna.e.X,n),\mathbb{P}\left(\lim_{n\to\infty}X_{n}=X\right)=1\left(\text{我们记为 }X_{n}\xrightarrow{\mathrm{a.e.}}X,n\to\infty\right),

那么有

E[limnXn]=limnE[Xn].\mathbb{E}\left[\lim_{n\to\infty}X_{n}\right]=\lim_{n\to\infty}\mathbb{E}[X_{n}].

(有界收敛定理){Xn}n1\left\{X_{n}\right\}_{n \geqslant 1}XX 是概率空间 (Ω,F,P)(\Omega, \mathcal{F}, \mathbb{P}) 上的一列有界随机变量且满足 Xn a.e. X,nX_{n} \xrightarrow{\text { a.e. }} X, n \rightarrow \infty, 则

limnE[Xn]=E[limnXn].\lim _{n \rightarrow \infty} \mathbb{E}\left[X_{n}\right]=\mathbb{E}\left[\lim _{n \rightarrow \infty} X_{n}\right] .

我们给出两个非常自然的推论

  • XX是非负可积实值随机变量,则P(A)=0P(A)=0 推出 E[X;A]=0E[X;A]=0
  • XX是处处正值可积实值随机变量,则E[X;A]=0E[X;A]=0 推出 P(A)=0P(A)=0 他们都是非常自然的性质

概率不等式

Hölder不等式1<p,q<+1<p,q<+\inftyp1+q1=1p^{-1}+q^{-1}=1,则有

E[XY]E[XY]{E[Xp]}p1{E[Yq]}q1.|\mathbb{E}[XY]|\leqslant\mathbb{E}[|XY|]\leqslant\{\mathbb{E}[|X|^{p}]\}^{p^{-1}}\{\mathbb{E}[|Y|^{q}]\}^{q^{-1}}.

Minkovski 不等式 对任意 p>0p>0,则有

{E[X+Yp]}p1{E[Xp]}p1+{E[Yp]}p1.\left\{\mathbb{E}[|X+Y|^{p}]\right\}^{p^{-1}}\leqslant\left\{\mathbb{E}[|X|^{p}]\right\}^{p^{-1}}+\left\{\mathbb{E}[|Y|^{p}]\right\}^{p^{-1}}.

Lyapunov 不等式 对任意 1<p<q<+1<p<q<+\infty , 则有

{E[Xp]}p1{E[Xq]}q1.\left\{\mathbb{E}\left[|X|^{p}\right]\right\}^{p^{-1}} \leqslant\left\{\mathbb{E}\left[|X|^{q}\right]\right\}^{q^{-1}} .

Jensen 不等式φ(x):RdR\varphi(x): \mathbb{R}^{d} \rightarrow \mathbb{R} 为一个凸函数, 则有

φ(E[X])E[φ(X)]\varphi(\mathbb{E}[X]) \leqslant \mathbb{E}[\varphi(X)]

Cr 不等式 对于任意p>0p > 0

X1+X2+...XnpCr(X1p+X2p+...Xnp)|X_{1}+X_{2}+...X_{n}|^{p}\le Cr(|X_{1}|^{p}+|X_{2}|^{p}+...|X_{n}|^{p})

其中 Cr=1 if p1 else Cr=np1Cr = 1 ~if~ p\le 1~else~Cr = n^{p-1}

变量变换公式(积分的计算)

欧式空间值的随机变量关于概率测度的积分不容易计算,这里介绍定理将这样的概率测度积分转换为Riemann - Stieltjes 积分来方便计算,变量变换公式有其更加广义的形式,但这里我们仅仅介绍关于概率测度的类型

定理 (变量变换公式)X:(Ω,F)(S,S)X:(\Omega, \mathcal{F}) \rightarrow(S, \mathcal{S}) 为概率空间 (Ω,F,P)(\Omega, \mathcal{F}, \mathbb{P}) 上的一个随机变量和 hh 为定义在 SS 上的一个实值可测函数, 使得 h(X)h(X) 是可积的,那么

E[h(X)]=Ωh(X(ω))P(dω)=Sh(x)PX( dx)\mathbb{E}[h(X)]=\int_{\Omega} h(X(\omega)) \mathbb{P}(\mathrm{d} \omega)=\int_{S} h(x) \mathcal{P}_{X}(\mathrm{~d} x)

如果 S=RdS=\mathbb{R}^{d} ,则有

E[h(X)]=Ωh(X(ω))P(dω)=Sh(x)PX( dx)=Rdh(x)F(dx),\mathbb{E}[h(X)]=\int_{\Omega} h(X(\omega)) \mathbb{P}({d} \omega)=\int_{S} h(x) \mathcal{P}_{X}({~d} x)=\int_{\mathbb{R}^{d}} h(x) F({d} x),

其中 PX\mathcal{P}_{X} 表示随机变量 XX 的分布,而当 S=RdS=\mathbb{R}^{d} 时, F(x),xRF(x), x \in \mathbb{R} 则表示其分布函数.

经由这个公式,我们把可以把测度积分转换为RS积分计算

如果FF是绝对连续的,那么最后的F(dx)F(dx)就是d(F(x))d(F(x)) 原本的问题可以转换为Riemann积分进行计算

如果他是离散的,则

F(x):=nZbnl[an,)(x),xRF\left(x\right):=\sum_{n\in\mathbb{Z}}b_{n}l_{\left[a_{n},\infty\right)}\left(x\right),x\in\mathbb{R}

原始的问题就转换为一个离散型分布的函数的期望问题,我们在初等概率论 的“随机变量的函数的数学期望”一节 积分变求和,仍旧可以计算。

如果存在奇异连续的情况,不属于目前可以解决的范畴,放弃计算。

如果原始分布函数情况过于复杂,使用本文“Lebesgue分解”一节来分解分布函数,分别进行计算。

关于Riemann - Stieltjes 积分的定义,参考金融随机分析 的“Riemann - Stieltjes 积分”一节

独立性

我们在初等概率论中研究了事件的独立性和随机变量的独立性,但是他们的定义总是让我们感觉少了数学的严谨,这里就是为了弥合这个缺点。

两个事件的独立性

我们参考初等概率论的介绍 参见初等概率论 的“两个事件的独立性”一节。

两个σ\sigma 代数的独立性

定义(平凡σ\sigma代数 ):以后称H\mathcal{H}是一个平凡 σ\sigma代数,如果

P(H)=01,HH.\mathbb{P}\left(H\right)=0或1,\forall H\in H.

定义(σ\sigma 代数的独立性):设(Ω,F,P)(Ω,\mathcal{F},\mathbb{P})是一个概率空间.假设H,GF\mathcal{H},\mathcal{G}\subset\mathcal{F} 为两个σ\sigma代数 .如果对任意HHH\in\mathcal{H}GGG\in\mathcal{G},我们有

P(GH)=P(G)P(H),\mathbb{P}(G\cap H)=\mathbb{P}(G)\mathbb{P}(H),

则称σ\sigma 代数H,G\mathcal{H},\mathcal{G}是相互独立的

容易看出:平凡σ\sigma代数和其他这个空间上的σ\sigma代数都是独立的,我们在后面的证明里会用到这一点

两个随机变量的独立性

定义 (随机变量的独立性)设X,YX,Y为概率空间(Ω,F,P)(\Omega,\mathcal{F},\mathbb{P})上的两个随机变量。如果σ(X)\sigma\left(X\right)σ(Y)\sigma\left(Y\right)是相互独立的,那么称XXYY是相互独立的。

这个定义是非常自然的,我们用随机变量生成的σ\sigma代数的独立性来研究随机变量的独立性。

多个独立性

类比两个随机变量的独立性的研究,我们可以自然的给出下面的推理 参见初等概率论 的“多个事件的独立性”一节。

σ\sigma代数是一个集类,因此我们可以先根据事件独立性的定义引出集类独立性的定义有:

定义(一族集类的独立性):设(Ω,F,P)(\Omega,\mathcal{F},\mathbb{P})是一个概率空间和{Aα}αIF\{\mathcal{A}_\alpha\}_{\alpha\in I}\subset\mathcal{F}为一族集类 (其中II可以不可数).如果对任意的正整数L>0L>0和互不相同的α1,,αLI\alpha_{1},\cdots,\alpha_{L}\in I,

P(k=1LAk)=k=1LP(Ak),AkAαk,k=1,,L,\mathbb{P}\left(\bigcap_{k=1}^{L}A_{k}\right)=\prod_{k=1}^{L}\mathbb{P}\left(A_{k}\right),\forall A_{k}\in\mathcal{A}_{\alpha_{k}},k=1,\cdots,L,

则称{Aα}αI\{\mathcal{A}_\alpha\}_{\alpha\in I}是相互独立的。

定义(σ\sigma代数的独立性):我们允许将nnσ\sigma代数独立性的定义优化为

P(k=1nAk)=k=1nP(Ak)\mathbb{P}\left(\bigcap_{k=1}^{n}A_{k}\right)=\prod_{k=1}^{n}\mathbb{P}\left(A_{k}\right)

也就是不再要求任意组合独立,整体独立就是相互独立。

定义:一族随机变量{Xα}αI\{X_\alpha\}_{\alpha\in I}是相互独立的如果{σ(Xα)}αI\left\{\sigma\left(X_{\alpha}\right)\right\}_{\alpha\in I}是相互独立的

初等概率论与高等概率论中独立性的差异

我们在初等概率论中研究随机变量的独立性的内容为 参见初等概率论 的“随机变量独立性”一节。

这和高等概率论中独立性的差别在哪,等价吗?

高等概率论允许非实值的随机变量,分布函数只允许实值随机变量。从这点看定义是不等价的。

哪怕我们将高等概率论中的随机变量限制到实数范围,定义在表面上还不是等价的

  • 初等概率中研究分布函数,只要求[,x][-\infty,x]范围上原像的独立
  • 高等概率论在限制到实数取值后,研究BRB_R 范围明显比[,x][-\infty,x]但是,我们不假证明的给出结论,这两个定义本质上是等价了,可以使用πλ\pi-\lambda定义实现证明

乘积测度

定义 (乘积σ\sigma-代数):设F1F2F_1和F_2是两个σ\sigma-代数。定义如下矩阵集

R:={A×B;AF1,BF2},R:=\left\{A\times B;A\in\mathcal{F}_{1},B\in\mathcal{F}_{2}\right\},

那 么 称 F1F2:=σ(R)\mathcal{F} _1\otimes \mathcal{F} _2: = \sigma \left ( \mathcal{R} \right )σ\sigma-代数F1,F2\mathcal F_1,\mathcal{F}_2的乘积σ\sigma-代数.进一步,我们称RR中 的集合为可测矩形。

定义(乘积可测空间与截口):设(Ωk,Fk),k=1,2(\Omega_k,\mathcal{F}_k),k=1,2是两个可测空间,那么称

(Ω,F):=(Ω1×Ω2,F1F2)\left(\Omega,\mathcal{F}\right):=\left(\Omega_{1}\times\Omega_{2},\mathcal{F}_{1}\otimes\mathcal{F}_{2}\right)

为乘积可测空间.对任意EΩ1×Ω2E\subset\Omega_1\times\Omega_2wiΩi,i=1,2w_i\in\Omega_i,i=1,2,我们定义:

{Eω1:={wΩ2;(ω1,ω)E}Ω2,Eω2:={wΩ1;(ω,ω2)E}Ω1.\begin{cases}E_{\omega_{1}}:=\left\{w\in\Omega_{2};\left(\omega_{1},\omega\right)\in E\right\}\subset\Omega_{2},\\E_{\omega_{2}}:=\left\{w\in\Omega_{1};\left(\omega,\omega_{2}\right)\in E\right\}\subset\Omega_{1}.\end{cases}

进一步,分别称Eω1E_{\omega_1}EEω1\omega_1-截口(ω1-section)和 Eω2 为 E 的 ω2-截口\left(\omega_1\text{-section)和 }E_{\omega_2}\text{ 为 }E\text{ 的 }\omega_2\text{-截口}\right.

定理:任何Ω1×Ω2\Omega_1\times\Omega_2中的可测集的截口都是可测的

定理:设f:Ω1×Ω2Rf:\Omega_1\times\Omega_2\to\overline{\mathbb{R}}是一个可测函数.对于ωiΩi,i=1,2\omega_i\in\Omega_i,i=1,2,定义截口函数:

fω1(ω2):=f(ω1,ω2),fω2(ω1):=f(ω1,ω2).f_{\omega_{1}}(\omega_{2}):=f(\omega_{1},\omega_{2}),\quad f_{\omega_{2}}(\omega_{1}):=f(\omega_{1},\omega_{2}).

那么有

(i)对任意ω1Ω1,fω1:Ω2R\left(\mathrm{i}\right)对任意\omega_1\in\Omega_1,f_{\omega_1}:\Omega_2\to\overline{\mathbb{R}}是可测的; (ii)对任意ω2Ω2,fω2:Ω1R\left(\mathrm{ii}\right)对任意\omega_{2}\in\Omega_{2},f_{\omega_{2}}:\Omega_{1}\rightarrow\overline{\mathbb{R}}是可测的

定理:对于 i=1,2,νii= 1, 2, 设 \nu _{i}为可测空间(Ωi,Fi)\left(\Omega_i,\mathcal{F}_i\right)上的σ\sigma-有限测度,那么 存在唯一的(Ω,F):=(Ω1×Ω2,F1F2)上的σ有限测度ν,使得\left(\Omega,\mathcal{F}\right):=\left(\Omega_{1}\times\Omega_{2},\mathcal{F}_{1}\otimes\mathcal{F}_{2}\right)上的\sigma-有限测度\nu,使得

ν(k=1mAk×Bk)=k=1mν1(Ak)ν2(Bk),\nu\left(\biguplus_{k=1}^{m}A_{k}\times B_{k}\right)=\sum_{k=1}^{m}\nu_{1}\left(A_{k}\right)\nu_{2}\left(B_{k}\right),

其中AkF1,BkF2A_k\in\mathcal{F}_1,B_k\in\mathcal{F}_2使得{Ak×Bk}k=1m\{A_k\times B_k\}_{k=1}^m是互不相交的。对于这样的vv我们称为乘积测度,v1,v2v_1,v_2称为边际测度。

最后,我们将乘积测度和联合分布建立联系有

定理 随机变量X1,,XnX_1,\cdots,X_n是相互独立的当且仅当如下等式成立:

P(X1,,Xn)=i=1nPXi,Sn.P_{\left(X_{1},\cdots,X_{n}\right)}=\prod_{i=1}^{n}P_{X_{i}},\text{在}S^{\otimes n}上.

条件期望

离散时间条件期望

我们在初等概率论中研究的条件期望理论实际上是残缺的,只关注计算而确实对其本质的理解,这里需要补充一定的关于条件期望的内容以方便金融随机分析展开关于鞅的讨论。

在每个时刻nn 对于每个抛硬币结果序列 我们都可以对股票进行二叉树的定价,这和前面介绍的期权定价模型本质一样,形式如下

Sn(ω1ωn)=11+r[p~Sn+1(ω1ωnH)+q~Sn+1(ω1ωnT)]S_n(\omega_1\cdots\omega_n)=\frac1{1+r}[\widetilde{p}S_{n+1}(\omega_1\cdots\omega_nH)+\widetilde{q}S_{n+1}(\omega_1\cdots\omega_nT)]

为了简化记号,我们定义

E~n[Sn+1](ω1ωn)=p~Sn+1(ω1ωnH)+q~Sn+1(ω1ωnT)\tilde{\mathbb{E}}_n[S_{n+1}](\omega_1\cdotp\cdotp\cdotp\omega_n)=\tilde{p}S_{n+1}(\omega_1\cdotp\cdotp\cdotp\omega_nH)+\tilde{q}S_{n+1}(\omega_1\cdotp\cdotp\cdotp\omega_nT)

这样就可以简化原本的式子为

Sn=11+rEn[Sn+1]S_n=\frac1{1+r}\mathbb{E}_n[S_{n+1}]

这里的E[Sn+1]E[S_{n+1}] 称为 基于时刻nn信息的Sn+1S_{n+1}的条件期望。

据此我们能够给出进一步推广

定义 设nn满足 1nN\leqslant n\leqslant N,对于给定的序列 ω1ωn\omega_1\cdots\omega_n,存在 2Nn^{N-n}种可能的后续 ωn+1ωN\omega_n+1\cdots\omega_N。用 H(ωn+1ωN)\sharp H(\omega_{n+1}\cdots\omega_N)表示在后续 ωn+1ωN\omega_{n+1}\cdots\omega_N 中出现正面的次数,T(ωn+1ωN)\sharp T(\omega_n+1\cdots\omega_N)表示出现背面的次数。我们定义:

E~n[X](ω1ωn)=ωn+1ωNp~#H(ωn+1ωN)q~#T(ωn+1ωN)X(ω1ωnωn+1ωN)\tilde{\mathbb{E}}_n[X](\omega_1\cdots\omega_n)=\sum_{\omega_{n+1}\cdots\omega_N}\tilde{p}^{\#H(\omega_{n+1}\cdots\omega_N)}\tilde{q}^{\#T(\omega_{n+1}\cdots\omega_N)}X(\omega_1\cdots\omega_n\omega_{n+1}\cdots\omega_N)

为基于时刻nn信息的XX的条件期望

在只有时刻0的信息的时候,条件期望也是一个随机变量,依赖于nn次实验的结果。我们在本节条件期望符号的下角标nn标示了条件是前几次实验的结果,至于是否已知基于问题的情况。

离散时间条件期望的性质

我们不假证明的给出下面的条件期望性质

设 N 为正整数,XXYY 为依赖于前NN次抛掷硬币结果的随机变量。对于给定的 0nN\leqslant n\leqslant N ,以下性质成立

条件期望的线性性:对于所有常数c1c_1c2c_2

En[c1X+c2Y]=c1En[X]+c2En[Y]\mathbb{E}_n\begin{bmatrix}c_1X+c_2Y\end{bmatrix}=c_1\mathbb{E}_n\begin{bmatrix}X\end{bmatrix}+c_2\mathbb{E}_n\begin{bmatrix}Y\end{bmatrix}

提取已知量:如果XX实际上只依赖于前nn次硬币抛掷,那么:

En[XY]=XEn[Y]\mathbb{E}_n[XY]=X\cdot\mathbb{E}_n[Y]

累次条件期望:(其实就是全期望公式)如果 0nmN0\leqslant n\leqslant m\leqslant N,那么:

En[Em[X]]=En[X]\mathbb{E}_n[\mathbb{E}_m[X]]=\mathbb{E}_n[X]

独立性:如果XX只依赖从第n+1n+1次至第 NN 次抛掷硬币的结果,那么:

En[X]=EX\mathbb{E}_n[X]=\mathbb{E}X

条件詹森不等式:如果φ(x)\varphi(x)为哑变量xx的凸函数,那么:

En[φ(X)]φ(En[X])\mathbb{E}_n[\varphi(X)]\geqslant\varphi(\mathbb{E}_n[X])

这些性质将有利于我们后面的一些证明的展开,至于广义的条件期望的性质,参考本文“条件期望 / 条件期望的性质”一节

符号测度

符号测度是为了补充高等概率论中的测度基础而进行的,对于证明本文“独立性”一节中相关性质以及研究本文“条件期望的存在唯一性”一节有作用

符号测度的定义

数学分析中,我们研究了不定积分和导数的问题,对于连续的ff

F(x)=axf(y)dyF(x) = \int_{a}^{x}f(y)dy

分别称为不定积分与导数

相应的,对于测度空间上积分存在的可测函数ff 我们可以定义集函数φ\varphi

φ(A)=Afdμ   AF\varphi(A) = \int_{A}fd\mu~~~A\in F

分别为不定积分与关于测度μ\mu的导数

对于集函数的导数是否存在与关于测度的求导的问题,就是本节研究的对象 定义:对于测度空间上积分存在的可测函数ff的不定积分

φ(A)=Afdμ   AF\varphi(A) = \int_{A}fd\mu~~~A\in F

根据积分的定义我们知道,φ\varphi满足非负性以外的所有测度的基本条件,我们称其为符号测度 并且所有满足这样的条件的测度均称为符号测度。

Hann与Jordan分解

符号测度不具备非负性这件事情让人非常讨厌,我们有没有什么方法让他再有类似非负性的性质呢? 这就是分解所研究的。

考虑前面的不定积分,对可测函数的定义域按照下面的规则分割

X+=f0,X=f<0X^{+}=\langle f\geqslant0\rangle,\quad X^{-}=\langle f<0\rangle

则可以把原始空间XX分成下面的两部分

AF,AX+φ(A)0;AF,AXφ(A)0.A\in\mathscr{F},A\subset X^{+}\Rightarrow\varphi(A)\geqslant0;\\A\in\mathscr{F},A\subset X^{-}\Longrightarrow\varphi(A)\leqslant0.

我们将这样的对原始空间XX的分解称为Hann分解。

再令

φ±(A)=Af±dμ\varphi^{\pm} (A)=\int_{A}f^{\pm} \mathrm{d}\mu

则可以得到测度φ\varphi被分解为两个测度,并有分解式

φ=φ+φ\varphi=\varphi^+-\varphi^-

这称为Jordan分解,也成为符号测度的全变差。

对于一般的符号测度,有存在Hann与Jordan分解

Radon-Nikodym 定理

φ\varphi是测度空间(X,F,μ)X,\mathscr{F},\mu)上的符号测度,我们将着手定义 φ\varphi 的导数. 基本的想法其实很简单:如果这个符号测度能惟一地表成不定积分形式

φ(A)=Afdμ   AF\varphi(A) = \int_{A}fd\mu~~~A\in F

那么就可以认为他们互相具有导数和不定积分。

定义:设 φ\varphi是测度空间(X,F,μ)\mathscr{F},\mu)上的符号测度.如果存在a.e.意义下惟一的可测函数ff前述式成立,则称ffφ\varphi对于μ\mu的R-N(Radon-Nikodym)导数(或简称导数),记为dφdμ=deff.\frac{\mathrm{d}\varphi}{\mathrm{d}\mu}\overset{\mathrm{def}}{\operatorname*{=}}f.

正如微积分中并非所有的函数都可以求导一样,也不是每一个符号测度都有 R-N 导数.什么样的符号测度才有 R-N 导数呢?只有当 φ\varphiμ\mu 绝对连续时才有可能

定义 设 φ\varphiμ\mu 分别是可测空间(X,FX,\mathscr{F})上的符号测度和测度.如果对任何AFA\in\mathscr{F}均有

μ(A)=0φ(A)=0\mu(A)=0\Rightarrow\varphi(A)=0\:

则称 φ\varphiμ\mu \textbf{}绝对连续,记作φμ.\varphi \ll \mu .

Lebegue分解

本节的主题是 Lebesgue 分解,其目的是要证明,任何σ有限符测度φ\varphi对于任意一个 σ\sigma有限测度 μ\mu,可以分解成两部分:一部分对μ\mu绝对连续;另一部分则与μ\mu是相互奇异的

条件期望的存在唯一性

原始的初等概率论中的条件期望也很难让我们满意,因此这里我们研究公理化的条件期望的问题。

定义 设 X,YX, Y 是定义在概率空间 (Ω,F,P)(\Omega, \mathscr{F}, \mathbb{P}) 上的可积变量, G\mathscr{G}F\mathscr{F} 的子 σ\sigma -代数。如果

  • YGY \in \mathscr{G} (即 YYG\mathscr{G} 可测的,即 σ(Y)G\sigma(Y)\subset \mathscr{G});
  • 对任意 AGA \in \mathscr{G} ,AY(ω)dP(ω)=AX(ω)dP(ω),\int_{A} Y(\omega) d \mathbb{P}(\omega)=\int_{A} X(\omega) d \mathbb{P}(\omega), 则称 YYXXG\mathscr{\mathscr { G }} 的条件期望, 记为 Y=E[XG]Y = \mathbb{E}[X \mid \mathscr{G}]

好像和以前所学习的条件期望有一点不太一样? 所有有下面附注

附注1 :若G\mathscr{G}是由某个随机变量ZZ生成的σ\sigma代数,则

E[XG]=E[Xσ(Z)]=E[XZ].\mathbb{E}[X|\mathscr{G}]=\mathbb{E}[X|\sigma(Z)]=\mathbb{E}[X|Z].

附注2 :对于概率空间上(Ω,F,P)(\Omega, \mathscr{F}, \mathbb{P}) 的任意可积实值变量XX 和任意σ\sigma -代数GF\mathscr{G} \subset \mathscr{F} 一定存在可测随机变量YY满足前述条件,并且该随机变量唯一。

附注3 :随机变量的条件期望还是一个随机变量,还是原本的概率空间(Ω,F,P)(\Omega, \mathscr{F}, \mathbb{P}) 上的可测函数,我们可以记为f(Z)f(Z)因为其生成的σ\sigma代数变小了

附注4 :一个事件AA关于一个σ\sigma代数的条件概率就定义为E[IAG]E[I_{A}\mid \mathscr{G}]

条件期望的性质

X,YX,Y是定义在概率空间(Ω,F,P)(\Omega,\mathscr{F},\mathbb{P})上的随机变量,且HG\mathcal{H}\subset\mathscr{G}F\mathscr{F} 的子 σ\sigma代数 则有下面的性质成立

  1. 对任意a,bRa,b\in\mathbb{R},都有E[aX+bYG]=aE[XG]+bE[YG].\mathbb{E}[aX+bY|\mathscr{G}]=a\mathbb{E}[X|\mathscr{G}]+b\mathbb{E}[Y|\mathscr{G}].
  2. XGX\in \mathscr{G}, 则 E[XYG]=XE[YG].\mathbb{E} [ XY| \mathscr{G} ] = X\mathbb{E} [ Y| \mathscr{G} ] .
  3. XGX\bot \mathscr{G}, 则 E[XG]E[X].\mathbb{E} [ X| \mathscr{G} ] \Longrightarrow \mathbb{E} [ X] .
  4. E[E[XG]H]=E[XH].\mathbb{E} [ \mathbb{E} [ X| \mathscr{G} ] \mid \mathscr{H} ] = \mathbb{E} [ X| \mathscr{H} ] . 全期望公式
  5. φ\varphi是凸函数,则φ(E[XG])E[φ(X)G].\varphi(\mathbb{E}[X|\mathscr{G}])\leq\mathbb{E}[\varphi(X)|\mathscr{G}].

他们分别对应

  1. 线性性
  2. 把知道的拿出去(提取已知量)
  3. 独立性
  4. 累次条件期望(即全期望公式的广义形式)
  5. 条件詹森不等式
  • Title: Advanced Probability: Probability Spaces, Random Variables, and Measure-Theoretic Foundations
  • Author: Hyacehila
  • Created at : 2024-10-09 13:29:48
  • Link: https://hyacehila.github.io//blog/2024/10/09/advanced-probability-notes/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments