概率导论-基础部分笔记
心得
这部分内容是概率论的基础理论,可视为数学部分。从学到后面的感觉来看,重要的是正确认识这些概率的基本理论。
1.概率模型
概率模型是对不确定现象的数学描述。组成部分:样本空间,概率率。概率有时候像物理。
样本空间
样本空间Ω \OmegaΩ:一个试验的所有可能结果的集合。
注意:例如在掷骰子时,不能把“1或2”和“1或3”同时作为一个试验结果(样本空间的元素)。在确定样本空间的时候,不同的试验结果必须是相互排斥的,即试验过程中只可能产生唯一的一个结果。
序贯模型:方便研究概率问题的模型工具,关系图(它不是一种概率律模型)。
概率律
概率律即概率公理:它给每一个事件A AA确定一个数P ( A ) P(A)P(A),满足下面的3条公理:
- 非负性:P ( A ) ≥ 0 P(A) \geq 0P(A)≥0
- 可加性:设A 、 B A、BA、B是不相容事件:A ∩ B = ∅ A\cap B=\emptysetA∩B=∅ ,则:P ( A ∩ B ) = P ( A ) + P ( B ) P(A\cap B)=P(A)+P(B)P(A∩B)=P(A)+P(B).结论可以推广到多个事件的情况。
- 归一化:P ( Ω ) = 1 P(\Omega)=1P(Ω)=1,整个样本空间是必然事件。
疑问:以上三条公理并似乎并不能把“概率”与我们对概率的直观感受联系在一起。例如定义掷均匀硬币,朝上的概率为1 / 3 1/31/3,朝下2 / 3 2/32/3.这个概率率是符合概率公理的,但它不符合现实的规律,问题是数学不需要与现实规律相符合。概率律只需要对概率公理负责,大概这就是概率悖论非常多的原因。
概率率模型-离散模型
设样本空间由有限个可能的结果组成,则使用离散模型构造概率律,另外的一种是连续模型。
由3条公理可以证明一些概率率性质,例如:
P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A ∩ B ) P ( A ∪ B ) = P ( A ∪ ( A c ∩ B ) ) = P ( A ) + P ( A c ∩ B ) P ( B ) = P ( B ∩ A ) + P ( B ∩ A c ) P(A\cup B)=P(A)+P(B)-P(A\cap B)\\ P(A\cup B)=P(A\cup (A^{ c }\cap B))=P(A)+P(A^{ c }\cap B)\\ P(B)=P(B\cap A)+P(B\cap { A }^{ c })P(A∪B)=P(A)+P(B)−P(A∩B)P(A∪B)=P(A∪(Ac∩B))=P(A)+P(Ac∩B)P(B)=P(B∩A)+P(B∩Ac)
概率分析的步骤:
1.在一个适当的样本空间中给出概率律。要求满足概率的3条公理。因此甚至可以建立明显违反现实直觉的模型,只因该模型便于计算。
2.在概率模型下进行严格的逻辑推导。
对同一个问题,在步骤1选择不同的模型,计算结果可能不同。如贝特朗悖论(样本空间不同)。(我一向不喜欢数学试卷上的文字应用题,歧义不少,语义不明更是常见现象。)
古典概型
设样本空间由n nn个等可能的试验结果组成,则基本事件A的概率为
P ( A ) = 1 n P(A)=\frac {1}{n}P(A)=n1
这是一种模型,可理解为公理,反正我从数学上讲不出道理。
条件概率
给定事件B BB已发生的条件下,事件A发生的概率
P ( A ∣ B ) = P ( A ∩ B ) P ( B ) P(A|B)=\frac {P(A \cap B)}{P(B)}P(A∣B)=P(B)P(A∩B)
注意条件概率P ( _ ∣ B ) P(\_ |B)P(_∣B)也是一个概率律,事件B即是必然事件或者理解为样本空间。上面这个公式不依赖于概率模型,而是条件概率的定义。如:
P ( A ∪ C ∣ B ) = P ( A ∣ B ) + P ( C ∣ B ) − P ( A ∩ C ∣ B ) P(A\cup C|B)=P(A|B)+P(C|B)-P(A\cap C|B)P(A∪C∣B)=P(A∣B)+P(C∣B)−P(A∩C∣B)
P ( A ∩ B ) = P ( A ) P ( B ∣ A ) = P ( B ) P ( A ∣ B ) P(A\cap B)=P(A)P(B|A)=P(B)P(A|B)P(A∩B)=P(A)P(B∣A)=P(B)P(A∣B)
经典例子:三门问题。A AA:第一门有奖品,B BB:第二门有奖品,C CC:第三门有奖品。
假设直接选择第一门(把这当作事实,不属于概率范围),打开一扇无奖品的第二门(把这个当作已知条件,设为事件E)以后:
P ( E ) = P ( E A ) + P ( E B ) + P ( E C ) = 1 / 2 P(E)=P(EA)+P(EB)+P(EC)=1/2P(E)=P(EA)+P(EB)+P(EC)=1/2
P ( A E ) = 1 / 3 ∗ 1 / 2 = 1 / 6 , P ( B E ) = 0 , P ( C E ) = 1 / 3 P(AE)=1/3*1/2=1/6,P(BE)=0,P(CE)=1/3P(AE)=1/3∗1/2=1/6,P(BE)=0,P(CE)=1/3
P ( A ∣ E ) = P ( A E ) P ( E ) = 1 / 6 1 / 2 = 1 3 P ( B ∣ E ) = 0 P(A|E)=\frac { P(AE) }{ P(E) } =\frac { 1/6}{ 1/2 } =\frac { 1 }{ 3 } \\ P(B|E)=0P(A∣E)=P(E)P(AE)=1/21/6=31P(B∣E)=0.
P ( C ∣ E ) = P ( C E ) P ( E ) = 1 / 3 1 / 2 = 2 3 P(C|E)=\frac { P(CE) }{ P(E) } =\frac { 1/3}{ 1/2 } =\frac { 2 }{ 3 }P(C∣E)=P(E)P(CE)=1/21/3=32
所以换一门才是更优的选择。
全概率定理和贝叶斯准则
全概率定理:设A 1 , A 2 , . . . , A n A_1,A_2,...,A_nA1,A2,...,An是样本空间的一个分割(A 1 , A 2 , . . . , A n A_1,A_2,...,A_nA1,A2,...,An互不相容且必定有一个发生),P ( A i ) > 0 P(A_i)>0P(Ai)>0,则:
P ( B ) = P ( A 1 ∩ B ) + P ( A 2 ∩ B ) + . . . + P ( A n ∩ B ) P ( B ) = P ( A 1 ) P ( B ∣ A 1 ) + P ( A 2 ) P ( B ∣ A 2 ) + . . . + P ( A n ) P ( B ∣ A n ) P(B)=P(A_{ 1 }\cap B)+P(A_{ 2 }\cap B)+...+P(A_{ n }\cap B)\\ P(B)=P(A_{ 1 })P(B|A_{ 1 })+P(A_{ 2 })P(B|A_{ 2 })+...+P(A_{ n })P(B|A_{ n })P(B)=P(A1∩B)+P(A2∩B)+...+P(An∩B)P(B)=P(A1)P(B∣A1)+P(A2)P(B∣A2)+...+P(An)P(B∣An)
贝叶斯准则:设A 1 , A 2 , . . . , A n A_1,A_2,...,A_nA1,A2,...,An是样本空间的一个分割,P ( A i ) > 0 P(A_i)>0P(Ai)>0,则:
P ( C ∣ B ) = P ( C ∩ B ) P ( B ) = P ( C ) P ( B ∣ C ) P ( B ∩ A 1 ) + P ( B ∩ A 2 ) + . . . + P ( B ∩ A n ) P(C|B)=\frac { P(C \cap B) }{ P(B) } =\frac { P(C)P(B|C) }{ P(B\cap A_{ 1 })+P(B\cap A_{ 2 })+...+P(B\cap A_{ n }) }P(C∣B)=P(B)P(C∩B)=P(B∩A1)+P(B∩A2)+...+P(B∩An)P(C)P(B∣C)
用全概率公式可以证明贝叶斯准则。贝叶斯准则联系了P ( A ∣ B ) P(A|B)P(A∣B)与P ( B ∣ A ) P(B|A)P(B∣A).贝叶斯准则可以用来进行因果推理,即知道结果,推测原因。这种概率称为后验概率。计算这种概率应严格采用贝叶斯公式计算,否则极易出错。
经典例子:假阳性问题。对于某种少见疾病(发病率0.001):有病检测结果成阳性的概率为0.95,无病检测结果成阳性的概率是0.05.
现有一结果成阳性的被检人,其患病概率是多少。
A 1 A_1A1:有病 A 2 A_2A2:无病。B BB:检测成阳性。
P ( B ∣ A 1 ) = 0.95 , P ( B ∣ A 2 ) = 0.05 , P ( A 1 ) = 0.001 , P ( A 2 ) = 0.999 , P(B|A_1)=0.95,P(B|A_2)=0.05,P(A_1)=0.001,P(A_2)=0.999,P(B∣A1)=0.95,P(B∣A2)=0.05,P(A1)=0.001,P(A2)=0.999,
P ( B ) = P ( A 1 ) P ( B ∣ A 1 ) + P ( A 2 ) P ( B ∣ A 2 ) = 0.00095 + 0.4995 = 0.0509 P(B)=P(A_1)P(B|A_1)+P(A_2)P(B|A_2)=0.00095+0.4995=0.0509P(B)=P(A1)P(B∣A1)+P(A2)P(B∣A2)=0.00095+0.4995=0.0509则
P ( A 1 ∣ B ) = P ( A 1 B ) P ( B ) = P ( A 1 ) P ( B ∣ A 1 ) P ( B ) = 0.0187 P(A_{ 1 }|B)=\frac { P(A_{ 1 }B) }{ P(B) } =\frac { P(A_{ 1 })P(B|A_{ 1 }) }{ P(B) } =0.0187P(A1∣B)=P(B)P(A1B)=P(B)P(A1)P(B∣A1)=0.0187
这说明仪器的检测误差远大于发病率时,仪器的误诊率会相当高。当然这里面还存在一个问题,即被检人不是随意选取的,而是本身就怀疑自己患病的。
独立性
若事件A , B A,BA,B满足:P ( A B ) = P ( A ∩ B ) = P ( A ) P ( B ) P(AB)=P(A \cap B)=P(A)P(B)P(AB)=P(A∩B)=P(A)P(B),则称事件A,B互相独立。
注意:独立性的定义是从上面概率的关系式出发的。例如在区间[0,1]任选一实数,则事件A={x=0.1},事件B={x<0.5},A与B是相互独立的。
A,B互不相容是从事件本身出发定义的,一定不能同时发生,而独立则不同。事件A发生没有给事件B的概率提供任何信息则独立(即使提供了也不一定不独立)。
若事件A,B满足:
P ( A ∩ B ∣ C ) = P ( A ∣ C ) P ( B ∣ C ) P(A\cap B|C)=P(A|C)P(B|C)P(A∩B∣C)=P(A∣C)P(B∣C)
则称A,B在条件C下条件独立。
注意:独立与条件独立不能互相推导出。A,B互相独立不能推出A,B在某条件下是否条件独立,反之亦然。例如:星期二男孩问题。
独 立 < ≠ > 条 件 独 立 独立 <\neq> 条件独立独立≮=>条件独立
一组事件的独立性:设A 1 , A 2 , . . . , A n {A_1,A_2,...,A_n}A1,A2,...,An是n nn个事件的集合,则对其任意子集都有P ( A i A j . . . ) = P ( A i ) P ( A j ) . . . P(A_iA_j...)=P(A_i)P(A_j)...P(AiAj...)=P(Ai)P(Aj)...,则称这组事件相互独立。
注意:两两独立不能说明相互独立。相互独立需要满足的式子很多很多…
独立试验&二项概率
设试验由一系列独立并且相同的小试验组成,这种试验称为“独立试验序列”。当每个阶段的小试验只有两种结果时,称为独立的伯努利试验序列。
n次试验其中k次成功的概率是
P ( X = k ) = C n k p k ( 1 − p ) n − k = ( n ! ) ( k ! ) ( n − k ) ! p k ( 1 − p ) n − k P(X=k)={ C }_{ n }^{ k }p^{ k }(1-p)^{ n-k }=\frac { (n!) }{ (k!)(n-k)! } p^{ k }(1-p)^{ n-k }P(X=k)=Cnkpk(1−p)n−k=(k!)(n−k)!(n!)pk(1−p)n−k
2.离散随机变量
对于样本空间的一个试验结果,都关联着一个特定的数,这种关联关系就形成随机变量,随机变量是试验结果的实值函数。
随机变量的函数定义另一个随机变量。可以在某条件下定义随机变量。对于随机变量,可以定义均值和方差。
若随机变量的值域为有限集或者可数无限集,则称离散随机变量。本章的随机变量都是指离散随机变量
分布列
离散随机变量有一个分布列,它对于随机变量的每一个值给出一个概率。
伯努利分布列
伯努利随机变量分布列是:
| X | 1 | 0 |
|---|---|---|
| P(X) | p | 1-p |
二项随机变量:n次伯努利试验结果取到1的次数为二项随机变量。X=k的概率是
P ( X = k ) = C n k p k ( 1 − p ) n − k = ( n ! ) ( k ! ) ( n − k ) ! p k ( 1 − p ) n − k P(X=k)={ C }_{ n }^{ k }p^{ k }(1-p)^{ n-k }=\frac { (n!) }{ (k!)(n-k)! } p^{ k }(1-p)^{ n-k }P(X=k)=Cnkpk(1−p)n−k=(k!)(n−k)!(n!)pk(1−p)n−k
几何随机变量:伯努利试验序列,直到试验结果取到1的所需的次数。
P ( X = k ) = ( 1 − p ) k − 1 p k P(X=k)=(1-p)^{k-1}p^kP(X=k)=(1−p)k−1pk
泊松随机变量:设随机变量的分布由下式给出:
P ( X = k ) = e − λ λ k k ! P(X=k)={ e }^{ -\lambda }\frac { { \lambda }^{ k } }{ k! }P(X=k)=e−λk!λk
k = 0 , 1 , 2 , . . . k=0,1,2,...k=0,1,2,...
利用泊松分布可以逼近二项分布,λ ≈ n p \lambda \approx npλ≈np(n很大,p很小时).
随机变量的函数
设Y = g ( X ) Y=g(X)Y=g(X),则Y YY的分布列为:
P ( Y = y ) = ∑ P ( X = x ) x ∈ { g ( X ) = y } P(Y=y)=\underset { x\in \{ g(X)=y\} }{ \sum { P(X=x) } }P(Y=y)=x∈{g(X)=y}∑P(X=x)
求Y分布列的方法:
- 确定X的值域。
- 确定Y的值域。
- 确定Y的值域中每一个值对应的概率
注意:步骤1,2中都不涉及概率。有时候X的分布列是用一个分段函数表示的,这个分段函数里的表达式通常和X的值域没有半毛钱关系,不要被迷惑了。
期望均值方差
期望(加权平均值)为E ( X ) = ∑ x P ( X = x ) E(X)=\sum { xP(X=x) }E(X)=∑xP(X=x)
n阶矩:E ( X n ) E(X^{ n })E(Xn)
方差V a r ( X ) = E [ ( X − E x ) 2 ] Var(X)=E[(X-E_{ x })^{ 2 }]Var(X)=E[(X−Ex)2]
标准差:σ ( X ) = V a r ( x ) \sigma (X)=\sqrt { Var(x) }σ(X)=Var(x) (标准差的好处是其单位和X相同)
随机变量函数的期望为:
E ( g ( X ) ) = ∑ x g ( x ) P ( X = x ) E(g(X))=\sum _{ x }^{ }{ g(x)P(X=x) }E(g(X))=x∑g(x)P(X=x)
方差标准差都可以看作随机变量的函数。
V a r ( X ) = E ( X 2 ) − E X 2 Var(X)=E(X^2)-E_X^2Var(X)=E(X2)−EX2
若Y = a X + b Y=aX+bY=aX+b,则
E ( Y ) = a E ( X ) + b . V a r ( Y ) = a 2 V a r ( X ) . E(Y)=aE(X)+b. Var(Y)=a^2Var(X).E(Y)=aE(X)+b.Var(Y)=a2Var(X).
伯努利随机变量的
期望E ( X ) = E ( X n ) = 1 n p = p E(X)=E(X^n)=1^np=pE(X)=E(Xn)=1np=p
方差V a r ( X ) = p − p 2 Var(X)=p-p^2Var(X)=p−p2
泊松分布的方差和期望都是λ \lambdaλ。利用e x e^xex的泰勒展开式可以证明。
多个随机变量的联合分布
P ( X = x , Y = y ) P(X=x,Y=y)P(X=x,Y=y)
| Y\X | 0 | 1 | 2 |
|---|---|---|---|
| 0 | P(Y=0,X=0) | ||
| 1 | |||
| 2 |
联合分布列的归一化条件是表格所有的概率值的和为1,不是每一行(列)的和为1.求联合分布列往往要用到条件概率的公式。
关于X的边缘分布列为:
P ( X = x ) = ∑ y P ( X = x , Y = y ) P(X=x)=\sum _{ y }^{ }{ P(X=x,Y=y) }P(X=x)=y∑P(X=x,Y=y)
注意上式右边是对y求和,是关于x的函数。
联合随机变量的函数g ( X , Y ) g(X,Y)g(X,Y)的分布:
P ( Z = z ) = ∑ g ( x , y ) = z P ( X = x , Y = y ) = ∑ x ∑ y g ( x , y ) P ( X = x , Y = y ) P(Z=z)=\sum _{ g(x,y)=z }^{ }{ P(X=x,Y=y) } =\sum _{ x }^{ }{ \sum _{ y }^{ }{ g(x,y)P(X=x,Y=y) } }P(Z=z)=g(x,y)=z∑P(X=x,Y=y)=x∑y∑g(x,y)P(X=x,Y=y)
期望:E ( Z ) = ∑ g ( x , y ) = z g ( x , y ) P ( X = x , Y = y ) E(Z)=\sum _{ g(x,y)=z }^{ }{ g(x,y)P(X=x,Y=y) }E(Z)=g(x,y)=z∑g(x,y)P(X=x,Y=y)
在某个条件下的随机变量
条件随机变量仍然是随机变量,其不同点只是计算概率分布时为P ( X = x ∣ A ) P(X=x|A)P(X=x∣A).
P ( X = x ∣ Y = y ) = P X ∣ Y ( x ∣ y ) . P X , Y ( x , y ) = P ( X = x , Y = y ) = P ( X = x ) P ( Y = y ∣ X = x ) = P ( Y = y ) P ( X = x ∣ Y = y ) P(X=x|Y=y)=P_{X|Y}(x|y). \\P_{X,Y}(x,y)=P(X=x,Y=y)=P(X=x)P(Y=y|X=x)=P(Y=y)P(X=x|Y=y)P(X=x∣Y=y)=PX∣Y(x∣y).PX,Y(x,y)=P(X=x,Y=y)=P(X=x)P(Y=y∣X=x)=P(Y=y)P(X=x∣Y=y)
上式常用来计算联合分布列、期望等。另外当x不同时X=x是互不相容事件。
经典问题:两个信封悖论。有2个信封,其中一个钱数是另一个的2倍。
这个问题一般的错误在于一上来就计算另一封信的钱数的期望0.5c+0.5*2c=1.5c。最开始计算的应该是两封信钱数X,Y的联合分布。如果不能确定联合分布,又怎么能确定期望。按照通常理解的“总是应该交换信封”的错误之处在于此时期望值都是无穷大,不存在大小关系。
独立性
随机变量X与事件A独立:P ( X = x , A ) = P ( X = x ) P ( A ) P(X=x ,A)=P(X=x)P(A)P(X=x,A)=P(X=x)P(A)
随机变量X与随机变量Y独立:P ( X = x , Y = y ) = P ( X = x ) P ( Y = y ) P(X=x,Y=y)=P(X=x)P(Y=y)P(X=x,Y=y)=P(X=x)P(Y=y)
若X与Y独立,则:
- E ( X Y ) = E ( X ) E ( Y ) . E ( g ( X ) f ( Y ) ) = E ( g ( X ) ) E ( f ( Y ) ) E(XY) = E(X) E(Y).E( g(X) f(Y) )=E(g(X)) E(f(Y))E(XY)=E(X)E(Y).E(g(X)f(Y))=E(g(X))E(f(Y))
- V a r ( X + Y ) = V a r ( X ) + V a r ( Y ) Var(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y)
3.连续随机变量
对于随机变量X XX,若存在一个非负函数f X f_XfX,使得
P ( X ∈ B ) = ∫ B f X ( x ) d x P(X\in B)=\underset { B }{ \int } { f_{ X }(x)dx }P(X∈B)=B∫fX(x)dx
对每一个实轴上的集合B BB都成立,则称X XX为连续随机变量,f X f_XfX为X XX的概率密度函数(PDF)。积分式可理解为黎曼积分。
若B是一个区间[a,b],则
P ( a ≤ X ≤ b ) = ∫ b a f X ( x ) d x P(a\leq X\leq b)=\int _{ b}^{ a}{ f_X(x)dx }P(a≤X≤b)=∫bafX(x)dx
P ( a ≤ X ≤ a ) = ∫ a a f X ( x ) d x = 0 P(a\leq X\leq a)=\int _{ a }^{ a }{ f_{ X }(x)dx } =0P(a≤X≤a)=∫aafX(x)dx=0
函数f X f_XfX能成为PDF的条件:1)非负.2)归一性,即
∫ − ∞ ∞ f X ( x ) d x = 1 \int _{ -\infty }^{ \infty }{ f_{ X }(x)dx } =1∫−∞∞fX(x)dx=1
估算积分值:当Δ x \Delta xΔx很小时,在区间[ x , x + Δ x ] [x,x+\Delta x][x,x+Δx]上的概率约为f X ( x ) Δ x f_X(x)\Delta xfX(x)Δx.
期望:
E ( X ) = ∫ − ∞ ∞ x f X ( x ) d x E ( g ( X ) ) = ∫ − ∞ ∞ g ( x ) f X ( x ) d x E(X)=\int _{ -\infty }^{ \infty }{ xf_{ X }(x)dx } \\ E(g(X))=\int _{ -\infty }^{ \infty }{ g(x)f_{ X }(x)dx }E(X)=∫−∞∞xfX(x)dxE(g(X))=∫−∞∞g(x)fX(x)dx
方差V a r ( X ) = E [ ( X − E X ) 2 ] Var(X)=E[(X-E_X)^2]Var(X)=E[(X−EX)2]
均匀分布的随机变量的PDF: f X = c :f_X=c:fX=c。图像是一条直线。
指数随机变量:
若随机变量X的的PDF为:
f X = λ e − λ x , x ≥ 0 ; f X = 0 , x < 0. f_{ X }=\lambda e^{-\lambda x},x\geq 0;f_X=0,x<0.fX=λe−λx,x≥0;fX=0,x<0.
则X为指数分布的随机变量。可以验证PDF满足归一性。
指数分布的特性是:X ≥ a X\geq aX≥a的概率随着a的增加呈指数递减:
P ( X ≥ a ) = ∫ a ∞ λ e − λ x d x = − e ∞ ⋅ λ − ( − e − λ a ) = e − λ a P(X\geq a)=\int _{ a }^{ \infty }{\lambda e^{-\lambda x}dx } =-e^{\infty \cdot \lambda}-(-e^{-\lambda a})=e^{-\lambda a}P(X≥a)=∫a∞λe−λxdx=−e∞⋅λ−(−e−λa)=e−λa
指数分布的期望是1 / λ 1/\lambda1/λ ,方差是1 λ 2 \frac {1}{\lambda ^2}λ21.
分布函数F(X)
离散随机变量用分布列表示X XX的取值规律,连续随机变量用PDF表示X的取值规律,将两种统一起来,就是分布函数(CDF)。
随机变量X的分布函数就是x xx的函数,记为F X ( x ) = P ( X ≤ x ) F_X(x)=P(X\leq x)FX(x)=P(X≤x).X XX可以是离散的,也可以是连续的,也可以既不连续也不离散(混合)。
CDF又称累计分布函数。(这里注意区分X XX与x xx,2013年考研数学一有一概率题,题设条件X与x不分。)
CDF的性质:
1)单调(不严格的)递增函数:若x 1 < x 2 x_1 < x_2x1<x2,则F ( x 1 ) ≤ F ( x 2 ) F(x_1)\leq F(x_2)F(x1)≤F(x2).
2)F ( − ∞ ) = 0 , F ( ∞ ) = 1 F(-\infty )=0,F(\infty)=1F(−∞)=0,F(∞)=1
3)若X是离散随机变量,则F ( x ) F(x)F(x)是阶梯型函数。F ( x ) F(x)F(x)与分布列可利用求和/差分 互相求得。
4)若X是连续随机变量,则F ( x ) F(x)F(x)是关于x xx的连续函数。F ( x ) F(x)F(x)与f ( x ) f(x)f(x)可利用积分/微分互相求得:
F ( x ) = ∫ − ∞ x f ( x ) d x , f ( x ) = d F ( x ) d x F(x)=\int _{ -\infty }^{ x }{ f(x)dx } ,f(x)=\frac { dF(x) }{ dx }F(x)=∫−∞xf(x)dx,f(x)=dxdF(x)
正态分布(高斯分布)
一个随机变量X XX服从正态分布(高斯分布),如果其PDF为:
f X ( x ) = 1 2 π σ e − ( x − μ ) 2 / 2 σ 2 f_{ X }(x)=\frac { 1 }{ \sqrt { 2\pi } \sigma } { e }^{-(x-\mu )^2/2\sigma ^2 }fX(x)=2πσ1e−(x−μ)2/2σ2
正态分布E ( x ) = μ E(x)=\muE(x)=μ 标准差σ \sigmaσ 。
若随机变量X XX服从正态分布,则Y = a X + b Y=aX+bY=aX+b,a ≠ 0 a\neq 0a̸=0也服从正态分布。
标准正态分布:μ = 0 , σ = 1 \mu =0,\sigma =1μ=0,σ=1,即
f X ( x ) = 1 2 π e − ( x ) 2 / 2 f_{ X }(x)=\frac { 1 }{ \sqrt { 2\pi } } { e }^{ -(x)^{ 2 }/2 }fX(x)=2π1e−(x)2/2
标准正态分布的分布函数CDF记为Φ ( x ) \Phi (x)Φ(x),通常使用表格查询函数值。
联合分布
联合概率密度函数PDF:
P ( a ≤ X ≤ b , c ≤ y ≤ d ) = ∫ c d ∫ a b f X Y ( x , y ) d x d y P(a\leq X\leq b,c\leq y\leq d)=\int _{ c }^{ d }{ \int _{ a }^{ b }{ f_{ XY }(x,y)dxdy } }P(a≤X≤b,c≤y≤d)=∫cd∫abfXY(x,y)dxdy
PDF:f X Y ( x , y ) f_{XY}(x,y)fXY(x,y)就是( X , Y ) (X,Y)(X,Y)落入( x , y ) (x,y)(x,y)附近单位面积正方形的概率。
布丰抛针试验估算π \piπ 值。蒙特卡罗方法:设计一个适当的试验,它的概率与我们感兴趣的一个量有关,然后利用试验结果来估计这个量,随着计算机等现代技术的发展,这一方法已经发展为具有广泛应用性的蒙特卡罗方法.
例如画一个边长为2的正方形,在正方形内部画一个半径为1的圆,设计一个沙漏实验,沙子等概率落在正方形内部,则沙子落入圆内的概率就是π / 4 \pi/4π/4.
联合CDF:
F X Y ( x , y ) = P ( X ≤ x , Y ≤ y ) = ∫ − ∞ x ∫ − ∞ y f ( s , t ) d t d s F_{ XY }(x,y)=P({ X\leq x,Y\leq y })=\int _{ -\infty }^{ x }{ \int _{ -\infty }^{ y }{ f(s,t)dtds} }FXY(x,y)=P(X≤x,Y≤y)=∫−∞x∫−∞yf(s,t)dtds
PDF:
f X Y ( x , y ) = ∂ F X Y ( x , y ) ∂ x ∂ y f_{XY}(x,y)=\frac { \partial F_{ XY }(x,y) }{ \partial x\partial y }fXY(x,y)=∂x∂y∂FXY(x,y)
期望E:
E ( g ( X , Y ) ) = ∫ − ∞ + ∞ ∫ − ∞ + ∞ g ( x , y ) f X Y ( x , y ) d x d y E(g(X,Y))=\int _{ -\infty }^{ +\infty }{ \int _{ -\infty }^{ +\infty }g(x,y)f_{XY}(x,y)dxdy }E(g(X,Y))=∫−∞+∞∫−∞+∞g(x,y)fXY(x,y)dxdy
条件
在连续随机变量中可能遇到以0概率事件为条件的问题。
以事件为条件的随机变量
P ( X ∈ B ∣ A ) = P ( X ∈ B , X ∈ A ) P ( A ) = ∫ B f X ∣ A ( x ) d x P(X\in B|A)=\frac { P(X\in B,X\in A) }{ P(A) } =\int _{ B }^{ }{ f_{X|A}(x)dx }P(X∈B∣A)=P(A)P(X∈B,X∈A)=∫BfX∣A(x)dx
设A是一个实数集合,P ( X ∈ A ) > 0 P(X\in A)>0P(X∈A)>0,则
f X ∣ X ∈ A = f X ( x ) P ( x ∈ A ) f_{ X|{ X\in A } }=\frac { f_{X}(x) }{ P(x \in A)}fX∣X∈A=P(x∈A)fX(x) ,x ∈ A . f X ∣ X ∈ A = 0 , x ∉ A x\in A.f_{ X|{ X\in A } }=0,x\notin Ax∈A.fX∣X∈A=0,x∈/A.
利用分布函数F_{X|B}(x)对比F_X(x)可以得到.
全概率定理的一个变形:
设A 1 , A 2 , . . . , A n A_1,A_2,...,A_nA1,A2,...,An是样本空间的一个分割,则
f X ( x ) = ∑ i = 1 n A i f X ∣ A i ( x ) f_{ X }(x)=\sum _{ i=1 }^{ n }{ A_{ i }f_{ X|A_{ i } }(x) }fX(x)=i=1∑nAifX∣Ai(x)
.
以随机变量为条件的随机变量
设X , Y X,YX,Y是联合连续随机变量,联合PDF为f X Y ( x , y ) f_{XY}(x,y)fXY(x,y),X XX的条件概率密度函数为:
f X ∣ Y ( x ∣ y ) = f X Y ( x , y ) f Y ( y ) f_{X|Y}(x|y)=\frac {f_{XY}(x,y)}{f_Y(y)}fX∣Y(x∣y)=fY(y)fXY(x,y).
可以利用F X ∣ Y ( x , y ) F_{X|Y}(x,y)FX∣Y(x,y)对x , y x,yx,y求偏导数得到。
独立性
设X , Y X,YX,Y是联合连续随机变量,如果f X Y ( x , y ) = f X ( x ) f Y ( y ) f_{XY}(x,y)=f_X(x)f_Y(y)fXY(x,y)=fX(x)fY(y)对一切x , y x,yx,y成立,则称X , Y X,YX,Y互相独立。
若X , Y X,YX,Y独立:E ( X Y ) = E ( X ) E ( Y ) , V a r ( X + Y ) = V a r ( X ) + V a r ( Y ) E(XY)=E(X)E(Y),Var(X+Y)=Var(X)+Var(Y)E(XY)=E(X)E(Y),Var(X+Y)=Var(X)+Var(Y)
连续贝叶斯准则
连续随机变量的贝叶斯准则可以根据条件PDF推导出来的。
f X ∣ Y ( x ∣ y ) = f X Y ( x , y ) f Y ( y ) = f Y ∣ X ( y ∣ x ) f X ( x ) ∫ − ∞ + ∞ f X Y ( t , y ) d t = f Y ∣ X ( y ∣ x ) f X ( x ) ∫ − ∞ + ∞ f Y ∣ X ( y ∣ t ) f X ( t ) d t f_{ X|Y }(x|y)=\frac { f_{ XY }(x,y) }{ f_{ Y }(y) } =\frac { f_{ Y|X }(y|x)f_{ X }(x) }{ \int _{ -\infty }^{ +\infty }{ f_{ XY }(t,y)dt } } =\frac { f_{ Y|X }(y|x)f_{ X }(x) }{ \int _{ -\infty }^{ +\infty }{ f_{ Y|X }(y|t)f_{ X }(t)dt } }fX∣Y(x∣y)=fY(y)fXY(x,y)=∫−∞+∞fXY(t,y)dtfY∣X(y∣x)fX(x)=∫−∞+∞fY∣X(y∣t)fX(t)dtfY∣X(y∣x)fX(x)
4.随机变量的深入内容
研究方法均是1)研究CDF:F ( x ) F(x)F(x);2)求F ( x ) F(x)F(x)导数得PDF:f ( x ) f(x)f(x).
随机变量函数的概率密度函数
考虑Y = g ( X ) Y=g(X)Y=g(X)的概率密度函数。
设X XX是连续随机变量,PDF:f X ( x ) f_X(x)fX(x).随机变量Y = g ( X ) Y=g(X)Y=g(X),则
F Y ( y ) = P ( g ( X ) ≤ y ) = ∫ { x ∣ g ( x ) ≤ y } f ( x ) d x F_Y(y)=P(g(X)\leq y)=\int _{ \{ x|g(x)\leq y\} }^{ }{ f(x)dx }FY(y)=P(g(X)≤y)=∫{x∣g(x)≤y}f(x)dx .
对y求导数得:
f Y ( y ) = d F Y ( y ) d y f_{ Y }(y)=\frac { dF_{ Y }(y) }{ dy }fY(y)=dydFY(y)
若Y = a X + b . a ≠ 0 Y=aX+b.a \neq 0Y=aX+b.a̸=0,易证Y YY和X XX服从同一类型的分布。
例题:若X , Y X,YX,Y均服从[ 0 , 1 ] [0,1][0,1]上的均匀分布且互相独立,求Z = Y / X Z=Y/XZ=Y/X的PDF。
由全概率定理可得(为了便于理我自己理解写成求和形式)
F Z ( z ) = P ( Y / X ≤ z ) = ∑ x P ( { Y ≤ x z } ∣ X = x ) P ( X = x ) F_{ Z }(z)=P(Y/X\leq z)=\sum _{ x }^{ }{ P(\{ Y\le xz\} |X=x)P(X=x) }FZ(z)=P(Y/X≤z)=x∑P({Y≤xz}∣X=x)P(X=x)
已知:P ( X = x ) = lim Δ x → 0 f X ( x ) Δ x P(X=x)=\lim _{ \Delta x\rightarrow 0 } f_{ X }(x)\Delta xP(X=x)=limΔx→0fX(x)Δx
注意XY独立的条件,把右边式子的积分改写成积分形式:
F Z ( z ) = ∫ 0 1 F Y ( x z ) f X ( x ) d x = ∫ 0 1 F Y ( x z ) ⋅ 1 d x F_{ Z }(z)=\int _{ 0 }^{ 1 }{ F_{ Y }(xz)f_{ X }(x)dx } =\int _{ 0 }^{ 1 }{ F_{ Y }(xz)\cdot 1dx }FZ(z)=∫01FY(xz)fX(x)dx=∫01FY(xz)⋅1dx
令x z = t , d t = z d x xz=t,dt=zdxxz=t,dt=zdx,于是:
F Z ( z ) = 1 z ∫ 0 z F Y ( t ) d t F_{ Z }(z)=\frac { 1 }{ z } \int _{ 0 }^{ z }{ F_{ Y }(t) } dtFZ(z)=z1∫0zFY(t)dt
F Y ( y ) = 0 , y ≤ 0 F_Y(y)=0,y\leq 0FY(y)=0,y≤0
F Y ( y ) = y , y ∈ [ 0 , 1 ] F_Y(y)=y,y \in [0,1]FY(y)=y,y∈[0,1]
F Y ( y ) = 1 , y ≥ 1 F_Y(y)=1,y \geq 1FY(y)=1,y≥1
故:
F Z ( z ) = 0 , z ≤ 0 F_Z(z)=0,z \leq 0FZ(z)=0,z≤0;
F Z ( z ) = 1 z ∫ 0 z t d t = z 2 , z ∈ [ 0 , 1 ] F_Z(z)=\frac { 1 }{ z } \int _{ 0 }^{ z }{ tdt }=\frac { z }{ 2 },z \in [0,1]FZ(z)=z1∫0ztdt=2z,z∈[0,1]
F Z ( z ) = 1 z ( ∫ 0 1 t d t + ∫ 1 z 1 d t ) = 1 − 1 2 z , z > 1 F_{ Z }(z)=\frac { 1 }{ z } (\int _{ 0 }^{ 1 }{ tdt } +\int _{ 1 }^{ z }{ 1dt } )=1-\frac { 1 }{ 2z },z > 1FZ(z)=z1(∫01tdt+∫1z1dt)=1−2z1,z>1
求F Z ( z ) F_Z(z)FZ(z)的导数即得PDF:f Z ( z ) f_Z(z)fZ(z)。
也可以由联合概率密度函数f X Y ( x , y ) f_{XY}(x,y)fXY(x,y),事实上P ( Y ≤ X z ) P(Y\leq Xz)P(Y≤Xz)的概率就是f X Y f_{XY}fXY在指定( x , y ) (x,y)(x,y)范围上的二重积分。
F Z ( z ) = P ( Y / X ≤ z ) = ∬ y / x ≤ z f X Y ( x , y ) d x d y F_{ Z }(z)=P(Y/X\leq z)={ \iint _{ y/x\leq z }{ f_{ XY }(x,y)dxdy } }FZ(z)=P(Y/X≤z)=∬y/x≤zfXY(x,y)dxdy
也可以由类似线性规划的方式采用图形解决,但"数形结合"只能处理低维度的,用来理解概念是很不错的,用来研究解决问题就力不从心了。到了像线性代数之类的维度很高的学科,图形都很难建立起来,这可能牵扯到另一个现代数学分支:代数几何。我不是很懂,但我的意思就是不应当依赖于图形解决问题了。
随机变量的和-卷积
Z = X + Y Z=X+YZ=X+Y,X与Y独立.
(1)X , Y X,YX,Y均是离散.
$p_Z(z)=P(X+Y=z)=\sum _{ x }^{ }{ P(X=x)P(Y=z-x|X=x) } $
p Z ( z ) = ∑ x p X ( x ) p Y ( z − x ) p_Z(z)=\sum _{ x }^{ }p_X(x)p_Y(z-x)pZ(z)=x∑pX(x)pY(z−x)
p Z p_ZpZ称为X XX和Y YY的卷积。
(2)X , Y X,YX,Y均是连续.
对利用Z = X + Y Z=X+YZ=X+Y可以证明F Z ∣ X ( z ∣ x ) = F Y ( z − x ) F_{Z|X}(z|x)=F_Y(z-x)FZ∣X(z∣x)=FY(z−x),取z微分:
若 Z = X + Y , 则 f Z ∣ X ( z ∣ x ) = f Y ( z − x ) 若Z=X+Y,则f_{Z|X}(z|x)=f_Y(z-x)若Z=X+Y,则fZ∣X(z∣x)=fY(z−x)
又有:
f X , Z ( x , z ) = f X ( x ) f Z ∣ X ( z ∣ x ) , 总 是 成 立 的 。 f_{X,Z}(x,z)=f_X(x)f_{Z|X}(z|x),总是成立的。fX,Z(x,z)=fX(x)fZ∣X(z∣x),总是成立的。
所以:
f Z ( z ) = ∫ − ∞ + ∞ f X , Z ( x , z ) d x = ∫ − ∞ + ∞ f X ( x ) f Y ( z − x ) d x f_Z(z)=\int _{-\infty }^{+\infty}{f_{X,Z}(x,z)dx}=\int _{-\infty }^{+\infty}{f_X(x)f_Y(z-x)dx}fZ(z)=∫−∞+∞fX,Z(x,z)dx=∫−∞+∞fX(x)fY(z−x)dx
上式积分以后x没有了,只是z的函数。
同离散的式子比较,用密度函数代替来分布列,积分代替求和。
利用这个结论可以证明两个独立的正态分布之和仍然是正态分布。
协方差相关
协方差定义:
c o v ( X , Y ) = E [ ( X − E X ) ( Y − E Y ) ] = E ( X Y ) − E X E Y cov(X,Y)=E[(X-E_X)(Y-E_Y)]=E(XY)-E_XE_Ycov(X,Y)=E[(X−EX)(Y−EY)]=E(XY)−EXEY
当c o v ( X , Y ) = 0 cov(X,Y)=0cov(X,Y)=0,X,Y不相关,E ( X Y ) = E X E Y E(XY)=E_XE_YE(XY)=EXEY。
协方差可以表征X与Y的值“趋向”,相关性。
c o v ( X , X ) = E ( X 2 ) − E X 2 = v a r ( X ) cov(X,X)=E(X^2)-E_X^2=var(X)cov(X,X)=E(X2)−EX2=var(X)
X与其自身肯定是相关的。
c o v ( X , a Y + b ) = a ∗ c o v ( X , Y ) cov(X,aY+b)=a*cov(X,Y)cov(X,aY+b)=a∗cov(X,Y)
Y与X相关,g(Y)则当然也应该与X相关。aY+b与Y的关系是a(常数在“差关系”中可忽略)
c o v ( X , Y + Z ) = c o v ( X , Y ) + c o v ( X , Z ) cov(X,Y+Z)=cov(X,Y)+cov(X,Z)cov(X,Y+Z)=cov(X,Y)+cov(X,Z)
整体相关性可以分解为部分之间的相关性
注意:独立==>不相关,反之不成立。
相关系数ρ \rhoρ:
ρ = c o v ( X , Y ) v a r X ∗ v a r Y \rho=\frac{cov(X,Y)}{\sqrt{var_X*var_Y}}ρ=varX∗varYcov(X,Y)
可以证明ρ ∈ [ − 1 , − 1 ] \rho \in [-1,-1]ρ∈[−1,−1]
ρ \rhoρ可以视作协方差的标准化。如果X的方差很大,即X − E X X-E_XX−EX很大,则协方差也很大,但这时候显然不代表X , Y X,YX,Y相关性很强。用方差可以“中和“单一变量方差大的影响。所以ρ \rhoρ的分母会出现方差。
协方差可用于计算随机变量和的方差:
v a r ( X + Y ) = v a r ( X ) + v a r ( Y ) + 2 c o v ( X , Y ) var(X+Y)=var(X)+var(Y)+2cov(X,Y)var(X+Y)=var(X)+var(Y)+2cov(X,Y)
从这个式子可以看出"协方差"的定义。
v a r ( X 1 + X 2 + X 3 ) = ∑ i v a r ( X i ) + ∑ i ! = j c o v ( X i , X j ) var(X_1+X_2+X_3)=\sum _{i}{var(X_i)}+\sum _{i!=j}{cov(X_i,X_j)}var(X1+X2+X3)=i∑var(Xi)+i!=j∑cov(Xi,Xj)
条件期望/条件方差
条件期望E ( X ∣ Y = y ) = g ( y ) E(X|Y=y)=g(y)E(X∣Y=y)=g(y)是关于y的函数。因此Z = E ( X ∣ Y ) = g ( Y ) Z=E(X|Y)=g(Y)Z=E(X∣Y)=g(Y)可以视为一个随机变量,分布依赖于Y的分布。
E ( Z ) = ∑ z z P ( Z = z ) = ∑ y g ( y ) P ( Y = y ) = ∑ y E ( X ∣ Y = y ) p Y ( y ) E(Z)=\sum _{z}{zP(Z=z)}=\sum _{y}{g(y)P(Y=y)}=\sum _{y}{E(X|Y=y)p_Y(y)}E(Z)=∑zzP(Z=z)=∑yg(y)P(Y=y)=∑yE(X∣Y=y)pY(y)
$E(Z)=\int _{-\infty}^{+\infty}{E(X|Y=y)f_Y(y)dy} $
全期望定理(X的期望等于条件期望的和):
E ( X ) = ∑ i E ( X ∣ A i ) P ( A i ) E(X)=\sum _{i}{E(X|A_i)P(A_i)}E(X)=i∑E(X∣Ai)P(Ai)
可以得出重期望法则:
E ( E ( X ∣ Y ) ) = E ( X ) E(E(X|Y))=E(X)E(E(X∣Y))=E(X)
例如X为全班学生的成绩,Y为学生的分组编号。那么全班学生的平均成绩显然等于 全部分组平均成绩的平均。整体的平均=部分平均的平均。
条件期望重要性质:
E ( X g ( Y ) ∣ Y ) = g ( Y ) E ( X ∣ Y ) E(Xg(Y)|Y)=g(Y)E(X|Y)E(Xg(Y)∣Y)=g(Y)E(X∣Y)
成立的原因是在求期望的过程中当Y=y时g(y)是常数。注意在条件期望的期望中,g(y)不能提出来,因为是对y求期望!
将条件期望作为估计量
X ^ = E [ X ∣ Y ] \hat {X}=E[X|Y]X^=E[X∣Y]
有时候想要直接知道X的真实值不容易,那么可以通过做实验,观测在Y条件下X的值,并把此时得到的X的期望当作X的估计量,即上式。E ( X ^ ) = E ( X ) E(\hat X)=E(X)E(X^)=E(X).
既然是估计,那就要研究估计误差:
X ~ = X ^ − X \tilde X=\hat X-XX~=X^−X
E ( X ~ ) = E ( E ( X ∣ Y ) ) − E ( X ) = 0 E(\tilde X)=E(E(X|Y))-E(X)=0E(X~)=E(E(X∣Y))−E(X)=0
E ( X ~ ∣ Y ) = 0 E(\tilde X|Y)=0E(X~∣Y)=0
把均值当作估计量一般都有这个性质,即估计误差的期望为0(没有系统性的正负偏倚,而是互相抵消)。
E ( X ^ X ~ ) = E ( E ( X ^ X ~ ∣ Y ) ) = E ( E ( g ( Y ) X ~ ∣ Y ) = E ( g ( Y ) E ( X ~ ∣ Y ) ) = 0 = E ( X ^ ) E ( X ~ ) E(\hat X\tilde X)=E(E(\hat X\tilde X|Y))=E(E(g(Y)\tilde X|Y)=E(g(Y)E(\tilde X|Y))=0=E(\hat X)E(\tilde X)E(X^X~)=E(E(X^X~∣Y))=E(E(g(Y)X~∣Y)=E(g(Y)E(X~∣Y))=0=E(X^)E(X~)
c o v ( X ^ , X ~ ) = E ( X ^ X ~ ) − E ( X ^ ) E ( X ~ ) = 0 cov(\hat X,\tilde X)=E(\hat X\tilde X)-E(\hat X)E(\tilde X)=0cov(X^,X~)=E(X^X~)−E(X^)E(X~)=0
这说明把条件期望当作估计量时,误差和估计量没有相关性。原因是X ^ \hat XX^是关于Y的函数。由此又可以得到:
v a r ( X ) = v a r ( X ^ ) + v a r ( X ~ ) var(X)=var(\hat X)+var(\tilde X)var(X)=var(X^)+var(X~)
条件方差
v a r ( X ∣ Y ) = g ( Y ) = E [ ( X − E ( X ∣ Y ) ) 2 ∣ Y ] = E ( X ~ 2 ∣ Y ) var(X|Y)=g(Y)=E[(X-E(X|Y))^2|Y]=E(\tilde X^2|Y)var(X∣Y)=g(Y)=E[(X−E(X∣Y))2∣Y]=E(X~2∣Y)
右边的式子是估计误差的二阶矩,容易联想到估计误差的方差:
v a r ( X ~ ) = E ( X ~ 2 ) − ( E ( X ~ ) ) 2 = E ( X ~ 2 ) = E ( E ( X ~ 2 ∣ Y ) ) = E ( v a r ( X ∣ Y ) ) var(\tilde X)=E(\tilde X^2)-(E(\tilde X))^2=E(\tilde X^2)=E(E(\tilde X^2|Y))=E(var(X|Y))var(X~)=E(X~2)−(E(X~))2=E(X~2)=E(E(X~2∣Y))=E(var(X∣Y))
意思是把条件期望当作估计量时,估计(条件期望)误差的方差可以等于条件方差的期望。
v a r ( X ) = E ( v a r ( X ∣ Y ) ) + v a r ( E ( X ∣ Y ) ) var(X)=E(var(X|Y))+var(E(X|Y))var(X)=E(var(X∣Y))+var(E(X∣Y))
上式又叫全方差法则。X的方差=条件方差的期望 + 条件期望的方差。这个公式可以简化方差计算:比如X的分布不是那么清晰,而是依赖于其他的一个参数Y。而Y的分布是已知的,那么此时就可以计算X的方差了。
为什么会相等呢,值得思考。注意这里都是在把条件期望E(X|Y)当作估计量时得出的结论。
矩母函数(变换函数)
矩母函数是研究随机变量的一种工具函数,非常类似于研究信号时的拉普拉斯变换。可以简化很多计算。
随机变量X XX的矩母函数:
M X ( s ) = E [ e s X ] M_X(s)=E[e^{sX}]MX(s)=E[esX]
所以M X ( s ) M_X(s)MX(s)分为离散和连续两种:
M X ( s ) = ∑ x e s x P ( X = x ) M_X(s)=\sum _xe^{sx}P(X=x)MX(s)=∑xesxP(X=x)
M X ( s ) = ∫ ∞ + ∞ e s x f X d x M_X(s)=\int _{\infty}^{+\infty}{e^{sx}f_Xdx}MX(s)=∫∞+∞esxfXdx
注意s ss的定义域是使求和/积分存在。常见随机变量的矩母函数:
多利用e x e^xex的泰勒展开式(用多项式去逼近任何函数,任意阶导数相等).
- 参数为p的伯努利分布:M ( s ) = 1 − p + p e s M(s)=1-p+pe^sM(s)=1−p+pes
- 参数为n,p的二项分布:M ( s ) = ( 1 − p + p e s ) n M(s)=(1-p+pe^s)^nM(s)=(1−p+pes)n
- 参数为p的几何分布(第一次成功为k的概率):M ( s ) = p e s 1 − ( 1 − p ) e s M(s)=\frac {pe^s}{1-(1-p)e^s}M(s)=1−(1−p)espes
- 参数为$\lambda 的 泊 松 分 布 : 的泊松分布:的泊松分布:M(s)=e^{\lambda (e^s-1)}$
- ( a , b ) (a,b)(a,b)均匀分布(k = a , a + 1 , . . . , b , l = b − a + 1 k=a,a+1,...,b,l=b-a+1k=a,a+1,...,b,l=b−a+1):M ( s ) = e a s l ∗ e l s − 1 e s − 1 M(s)=\frac {e^{as}}{l}*\frac{e^{ls}-1}{e^s-1}M(s)=leas∗es−1els−1
- U(a,b)的矩母函数:M ( s ) = 1 b − a e s b − e s a s M(s)=\frac{1}{b-a}\frac{e^{sb}-e^{sa}}{s}M(s)=b−a1sesb−esa
- 参数为λ \lambdaλ的指数分布f X = λ e − λ x f_X=\lambda e^{-\lambda x}fX=λe−λx:M ( s ) = λ λ − s M(s)=\frac{\lambda}{\lambda -s}M(s)=λ−sλ
- 参数为μ , δ 2 \mu ,\delta ^2μ,δ2的正态分布f X = 1 2 π δ exp { − ( x − μ ) 2 2 δ 2 } f_X=\frac{1}{\sqrt{2\pi }\delta}\exp\{-\frac{(x-\mu)^2}{2\delta^2}\}fX=2πδ1exp{−2δ2(x−μ)2}:M ( s ) = e x p { δ 2 s 2 2 + μ s } M(s)=exp\{\frac {\delta ^2s^2}{2}+\mu s\}M(s)=exp{2δ2s2+μs}
若Y = a X + b Y=aX+bY=aX+b,则M Y ( s ) = E ( e a s X + b s ) = e s b M X ( s a ) M_Y(s)=E(e^{asX+bs})=e^{sb}M_X(sa)MY(s)=E(easX+bs)=esbMX(sa).X加一个常数,矩母函数扩大e b s e^bsebs倍.X XX乘以a aa倍,矩母函数宽度缩小a aa倍。
矩母函数到矩
考虑连续随机变量X的矩母函数的导数:
d M ( s ) d s = d d s ( ∫ − ∞ + ∞ e s x f X d x ) = ∫ − ∞ + ∞ d d s ( e s x f X d x ) = ∫ − ∞ + ∞ ( x e s x f X d x ) \frac{dM(s)}{ds}=\frac{d}{ds}(\int _{-\infty}^{+\infty} e^{sx}f_Xdx)=\int _{-\infty}^{+\infty}\frac{d}{ds}(e^{sx}f_Xdx)=\int _{-\infty}^{+\infty}(xe^{sx}f_Xdx)dsdM(s)=dsd(∫−∞+∞esxfXdx)=∫−∞+∞dsd(esxfXdx)=∫−∞+∞(xesxfXdx)
上面这里涉及到了交换积分微分次序,一般都可以。
d d s M ( s ) = d d s E ( e s X ) = E ( d d s e s X ) = E ( x e s X ) \frac{d}{ds}M(s)=\frac{d}{ds}E(e^{sX})=E(\frac{d}{ds}e^{sX})=E(xe^{sX})dsdM(s)=dsdE(esX)=E(dsdesX)=E(xesX)
当x = 0 x=0x=0时,M ( 1 ) ( 0 ) = E ( X ) M^{(1)}(0)=E(X)M(1)(0)=E(X)
M ( n ) ( 0 ) = E ( X n ) M^{(n)}(0)=E(X^n)M(n)(0)=E(Xn)
这就是计算X矩的方法,也是为什么叫矩母函数.国外叫变换函数.
矩母函数是可逆的,所以它可以确定X的分布。证明很难。反向确定X分布的方法是观察已知分布的矩母函数,拼凑出来。
若Z = X + Y Z=X+YZ=X+Y且X , Y X,YX,Y独立,则M X + Y ( s ) = E ( e X s ) E ( e Y s ) = M X ( s ) M Y ( s ) M_{X+Y}(s)=E(e^{Xs})E(e^{Ys})=M_X(s)M_Y(s)MX+Y(s)=E(eXs)E(eYs)=MX(s)MY(s)
用这个公式可以轻易证明两个独立的正态分布之和仍是正态分布。
联合分布矩母函数
联合矩母函数是由多个随机变量的联合分布,可以想到联合矩母函数应该是个多元参数。定义:
M X 1 , X 2 , . . . , X n ( s 1 , s 2 , . . . , s n ) = E ( e x p { s 1 X 1 + s 2 X 2 + . . . + s n X n } ) M_{X_1,X_2,...,X_n}(s_1,s_2,...,s_n)=E(exp\{s_1X_1+s_2X_2+...+s_nX_n\})MX1,X2,...,Xn(s1,s2,...,sn)=E(exp{s1X1+s2X2+...+snXn})
随机N个相互独立同分布的随机变量之和
Y = X 1 + X 2 + . . . + X N Y=X_1+X_2+...+X_NY=X1+X2+...+XN
E ( Y ∣ N = n ) = n E ( X ) = > E ( Y ∣ N ) = N E ( X ) E(Y|N=n)=nE(X) => E(Y|N)=NE(X)E(Y∣N=n)=nE(X)=>E(Y∣N)=NE(X)
期望E ( Y ) = E ( E ( Y ∣ N ) ) = E ( N E ( X ) ) = N E ( X ) E(Y)=E(E(Y|N))=E(NE(X))=NE(X)E(Y)=E(E(Y∣N))=E(NE(X))=NE(X)
v a r ( Y ∣ N = n ) = v a r ( X 1 + X 2 + . . . + X n ∣ N = n ) = n ∗ v a r ( X ) var(Y|N=n)=var(X_1+X_2+...+X_n|N=n)=n*var(X)var(Y∣N=n)=var(X1+X2+...+Xn∣N=n)=n∗var(X)
方差v a r ( Y ) = E ( v a r ( Y ∣ N ) ) + v a r ( E ( Y ∣ N ) ) = n v a r ( X ) + [ E ( X ) ] 2 v a r ( N ) var(Y)=E(var(Y|N))+var(E(Y|N))=nvar(X)+[E(X)]^2var(N)var(Y)=E(var(Y∣N))+var(E(Y∣N))=nvar(X)+[E(X)]2var(N)
矩母函数M Y ( s ) = ∑ n = 1 ∞ ( M X ( s ) ) n P ( N = n ) M_Y(s)=\sum _{n=1}^{\infty}(M_X(s))^nP(N=n)MY(s)=n=1∑∞(MX(s))nP(N=n)
M N ( s ) = ∑ n = 1 ∞ ( e s ) n P ( N = n ) M_N(s)=\sum _{n=1}^{\infty}(e^s)^nP(N=n)MN(s)=n=1∑∞(es)nP(N=n)
比较上面两个式子的区别可类比:
Y = X 1 + X 2 + . . . + X N Y=X_1+X_2+...+X_NY=X1+X2+...+XN
N = 1 + 1 + . . . + 1 N=1+1+...+1N=1+1+...+1
M 1 ( s ) = e s M_1(s)=e^sM1(s)=es
将M 1 ( s ) M_1(s)M1(s)替换成M X ( s ) M_X(s)MX(s)即得到M Y ( s ) M_Y(s)MY(s)的矩母函数.