概率导论(基础部分笔记)

心得

这部分内容是概率论的基础理论,可视为数学部分。从学到后面的感觉来看,重要的是正确认识这些概率的基本理论。

1.概率模型

概率模型是对不确定现象的数学描述。组成部分:样本空间,概率率。概率有时候像物理。

样本空间

样本空间Ω \OmegaΩ:一个试验的所有可能结果的集合。
注意:例如在掷骰子时,不能把“1或2”和“1或3”同时作为一个试验结果(样本空间的元素)。在确定样本空间的时候,不同的试验结果必须是相互排斥的,即试验过程中只可能产生唯一的一个结果。
序贯模型:方便研究概率问题的模型工具,关系图(它不是一种概率律模型)。

概率律

概率律即概率公理:它给每一个事件A AA确定一个数P ( A ) P(A)P(A),满足下面的3条公理

  • 非负性:P ( A ) ≥ 0 P(A) \geq 0P(A)0
  • 可加性:设A 、 B A、BAB是不相容事件:A ∩ B = ∅ A\cap B=\emptysetAB= ,则:P ( A ∩ B ) = P ( A ) + P ( B ) P(A\cap B)=P(A)+P(B)P(AB)=P(A)+P(B).结论可以推广到多个事件的情况。
  • 归一化:P ( Ω ) = 1 P(\Omega)=1P(Ω)=1,整个样本空间是必然事件。

疑问:以上三条公理并似乎并不能把“概率”与我们对概率的直观感受联系在一起。例如定义掷均匀硬币,朝上的概率为1 / 3 1/31/3,朝下2 / 3 2/32/3.这个概率率是符合概率公理的,但它不符合现实的规律,问题是数学不需要与现实规律相符合。概率律只需要对概率公理负责,大概这就是概率悖论非常多的原因。

概率率模型-离散模型

设样本空间由有限个可能的结果组成,则使用离散模型构造概率律,另外的一种是连续模型。
由3条公理可以证明一些概率率性质,例如:
P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A ∩ B ) P ( A ∪ B ) = P ( A ∪ ( A c ∩ B ) ) = P ( A ) + P ( A c ∩ B ) P ( B ) = P ( B ∩ A ) + P ( B ∩ A c ) P(A\cup B)=P(A)+P(B)-P(A\cap B)\\ P(A\cup B)=P(A\cup (A^{ c }\cap B))=P(A)+P(A^{ c }\cap B)\\ P(B)=P(B\cap A)+P(B\cap { A }^{ c })P(AB)=P(A)+P(B)P(AB)P(AB)=P(A(AcB))=P(A)+P(AcB)P(B)=P(BA)+P(BAc)
概率分析的步骤:
1.在一个适当的样本空间中给出概率律。要求满足概率的3条公理。因此甚至可以建立明显违反现实直觉的模型,只因该模型便于计算。
2.在概率模型下进行严格的逻辑推导。

对同一个问题,在步骤1选择不同的模型,计算结果可能不同。如贝特朗悖论(样本空间不同)。(我一向不喜欢数学试卷上的文字应用题,歧义不少,语义不明更是常见现象。)

古典概型

设样本空间由n nn个等可能的试验结果组成,则基本事件A的概率为
P ( A ) = 1 n P(A)=\frac {1}{n}P(A)=n1

这是一种模型,可理解为公理,反正我从数学上讲不出道理。

条件概率

给定事件B BB已发生的条件下,事件A发生的概率
P ( A ∣ B ) = P ( A ∩ B ) P ( B ) P(A|B)=\frac {P(A \cap B)}{P(B)}P(AB)=P(B)P(AB)
注意条件概率P ( _ ∣ B ) P(\_ |B)P(_B)也是一个概率律,事件B即是必然事件或者理解为样本空间。上面这个公式不依赖于概率模型,而是条件概率的定义。如:
P ( A ∪ C ∣ B ) = P ( A ∣ B ) + P ( C ∣ B ) − P ( A ∩ C ∣ B ) P(A\cup C|B)=P(A|B)+P(C|B)-P(A\cap C|B)P(ACB)=P(AB)+P(CB)P(ACB)
P ( A ∩ B ) = P ( A ) P ( B ∣ A ) = P ( B ) P ( A ∣ B ) P(A\cap B)=P(A)P(B|A)=P(B)P(A|B)P(AB)=P(A)P(BA)=P(B)P(AB)

经典例子:三门问题A AA:第一门有奖品,B BB:第二门有奖品,C CC:第三门有奖品。
假设直接选择第一门(把这当作事实,不属于概率范围),打开一扇无奖品的第二门(把这个当作已知条件,设为事件E)以后:
P ( E ) = P ( E A ) + P ( E B ) + P ( E C ) = 1 / 2 P(E)=P(EA)+P(EB)+P(EC)=1/2P(E)=P(EA)+P(EB)+P(EC)=1/2
P ( A E ) = 1 / 3 ∗ 1 / 2 = 1 / 6 , P ( B E ) = 0 , P ( C E ) = 1 / 3 P(AE)=1/3*1/2=1/6,P(BE)=0,P(CE)=1/3P(AE)=1/31/2=1/6,P(BE)=0,P(CE)=1/3
P ( A ∣ E ) = P ( A E ) P ( E ) = 1 / 6 1 / 2 = 1 3 P ( B ∣ E ) = 0 P(A|E)=\frac { P(AE) }{ P(E) } =\frac { 1/6}{ 1/2 } =\frac { 1 }{ 3 } \\ P(B|E)=0P(AE)=P(E)P(AE)=1/21/6=31P(BE)=0.
P ( C ∣ E ) = P ( C E ) P ( E ) = 1 / 3 1 / 2 = 2 3 P(C|E)=\frac { P(CE) }{ P(E) } =\frac { 1/3}{ 1/2 } =\frac { 2 }{ 3 }P(CE)=P(E)P(CE)=1/21/3=32
所以换一门才是更优的选择。

全概率定理和贝叶斯准则

全概率定理:设A 1 , A 2 , . . . , A n A_1,A_2,...,A_nA1,A2,...,An是样本空间的一个分割(A 1 , A 2 , . . . , A n A_1,A_2,...,A_nA1,A2,...,An互不相容且必定有一个发生),P ( A i ) > 0 P(A_i)>0P(Ai)>0,则:
P ( B ) = P ( A 1 ∩ B ) + P ( A 2 ∩ B ) + . . . + P ( A n ∩ B ) P ( B ) = P ( A 1 ) P ( B ∣ A 1 ) + P ( A 2 ) P ( B ∣ A 2 ) + . . . + P ( A n ) P ( B ∣ A n ) P(B)=P(A_{ 1 }\cap B)+P(A_{ 2 }\cap B)+...+P(A_{ n }\cap B)\\ P(B)=P(A_{ 1 })P(B|A_{ 1 })+P(A_{ 2 })P(B|A_{ 2 })+...+P(A_{ n })P(B|A_{ n })P(B)=P(A1B)+P(A2B)+...+P(AnB)P(B)=P(A1)P(BA1)+P(A2)P(BA2)+...+P(An)P(BAn)
贝叶斯准则:设A 1 , A 2 , . . . , A n A_1,A_2,...,A_nA1,A2,...,An是样本空间的一个分割,P ( A i ) > 0 P(A_i)>0P(Ai)>0,则:
P ( C ∣ B ) = P ( C ∩ B ) P ( B ) = P ( C ) P ( B ∣ C ) P ( B ∩ A 1 ) + P ( B ∩ A 2 ) + . . . + P ( B ∩ A n ) P(C|B)=\frac { P(C \cap B) }{ P(B) } =\frac { P(C)P(B|C) }{ P(B\cap A_{ 1 })+P(B\cap A_{ 2 })+...+P(B\cap A_{ n }) }P(CB)=P(B)P(CB)=P(BA1)+P(BA2)+...+P(BAn)P(C)P(BC)

用全概率公式可以证明贝叶斯准则。贝叶斯准则联系了P ( A ∣ B ) P(A|B)P(AB)P ( B ∣ A ) P(B|A)P(BA).贝叶斯准则可以用来进行因果推理,即知道结果,推测原因。这种概率称为后验概率。计算这种概率应严格采用贝叶斯公式计算,否则极易出错。

经典例子:假阳性问题。对于某种少见疾病(发病率0.001):有病检测结果成阳性的概率为0.95,无病检测结果成阳性的概率是0.05.
现有一结果成阳性的被检人,其患病概率是多少。
A 1 A_1A1:有病 A 2 A_2A2:无病。B BB:检测成阳性。
P ( B ∣ A 1 ) = 0.95 , P ( B ∣ A 2 ) = 0.05 , P ( A 1 ) = 0.001 , P ( A 2 ) = 0.999 , P(B|A_1)=0.95,P(B|A_2)=0.05,P(A_1)=0.001,P(A_2)=0.999,P(BA1)=0.95,P(BA2)=0.05,P(A1)=0.001,P(A2)=0.999
P ( B ) = P ( A 1 ) P ( B ∣ A 1 ) + P ( A 2 ) P ( B ∣ A 2 ) = 0.00095 + 0.4995 = 0.0509 P(B)=P(A_1)P(B|A_1)+P(A_2)P(B|A_2)=0.00095+0.4995=0.0509P(B)=P(A1)P(BA1)+P(A2)P(BA2)=0.00095+0.4995=0.0509
P ( A 1 ∣ B ) = P ( A 1 B ) P ( B ) = P ( A 1 ) P ( B ∣ A 1 ) P ( B ) = 0.0187 P(A_{ 1 }|B)=\frac { P(A_{ 1 }B) }{ P(B) } =\frac { P(A_{ 1 })P(B|A_{ 1 }) }{ P(B) } =0.0187P(A1B)=P(B)P(A1B)=P(B)P(A1)P(BA1)=0.0187
这说明仪器的检测误差远大于发病率时,仪器的误诊率会相当高。当然这里面还存在一个问题,即被检人不是随意选取的,而是本身就怀疑自己患病的。

独立性

若事件A , B A,BAB满足:P ( A B ) = P ( A ∩ B ) = P ( A ) P ( B ) P(AB)=P(A \cap B)=P(A)P(B)P(AB)=P(AB)=P(A)P(B),则称事件A,B互相独立。
注意:独立性的定义是从上面概率的关系式出发的。例如在区间[0,1]任选一实数,则事件A={x=0.1},事件B={x<0.5},A与B是相互独立的。
A,B互不相容是从事件本身出发定义的,一定不能同时发生,而独立则不同。事件A发生没有给事件B的概率提供任何信息则独立(即使提供了也不一定不独立)。
若事件A,B满足:
P ( A ∩ B ∣ C ) = P ( A ∣ C ) P ( B ∣ C ) P(A\cap B|C)=P(A|C)P(B|C)P(ABC)=P(AC)P(BC)
则称A,B在条件C下条件独立

注意:独立与条件独立不能互相推导出。A,B互相独立不能推出A,B在某条件下是否条件独立,反之亦然。例如:星期二男孩问题。
独 立 &lt; ≠ &gt; 条 件 独 立 独立 &lt;\neq&gt; 条件独立≮=>

一组事件的独立性:设A 1 , A 2 , . . . , A n {A_1,A_2,...,A_n}A1,A2,...,Ann nn个事件的集合,则对其任意子集都有P ( A i A j . . . ) = P ( A i ) P ( A j ) . . . P(A_iA_j...)=P(A_i)P(A_j)...P(AiAj...)=P(Ai)P(Aj)...,则称这组事件相互独立。
注意:两两独立不能说明相互独立。相互独立需要满足的式子很多很多…

独立试验&二项概率
设试验由一系列独立并且相同的小试验组成,这种试验称为“独立试验序列”。当每个阶段的小试验只有两种结果时,称为独立的伯努利试验序列
n次试验其中k次成功的概率是
P ( X = k ) = C n k p k ( 1 − p ) n − k = ( n ! ) ( k ! ) ( n − k ) ! p k ( 1 − p ) n − k P(X=k)={ C }_{ n }^{ k }p^{ k }(1-p)^{ n-k }=\frac { (n!) }{ (k!)(n-k)! } p^{ k }(1-p)^{ n-k }P(X=k)=Cnkpk(1p)nk=(k!)(nk)!(n!)pk(1p)nk

2.离散随机变量

对于样本空间的一个试验结果,都关联着一个特定的数,这种关联关系就形成随机变量,随机变量是试验结果的实值函数。
随机变量的函数定义另一个随机变量。可以在某条件下定义随机变量。对于随机变量,可以定义均值和方差。
若随机变量的值域为有限集或者可数无限集,则称离散随机变量。本章的随机变量都是指离散随机变量

分布列

离散随机变量有一个分布列,它对于随机变量的每一个值给出一个概率。

伯努利分布列

伯努利随机变量分布列是:

X10
P(X)p1-p

二项随机变量:n次伯努利试验结果取到1的次数为二项随机变量。X=k的概率是
P ( X = k ) = C n k p k ( 1 − p ) n − k = ( n ! ) ( k ! ) ( n − k ) ! p k ( 1 − p ) n − k P(X=k)={ C }_{ n }^{ k }p^{ k }(1-p)^{ n-k }=\frac { (n!) }{ (k!)(n-k)! } p^{ k }(1-p)^{ n-k }P(X=k)=Cnkpk(1p)nk=(k!)(nk)!(n!)pk(1p)nk
几何随机变量:伯努利试验序列,直到试验结果取到1的所需的次数。
P ( X = k ) = ( 1 − p ) k − 1 p k P(X=k)=(1-p)^{k-1}p^kP(X=k)=(1p)k1pk
泊松随机变量:设随机变量的分布由下式给出:
P ( X = k ) = e − λ λ k k ! P(X=k)={ e }^{ -\lambda }\frac { { \lambda }^{ k } }{ k! }P(X=k)=eλk!λk
k = 0 , 1 , 2 , . . . k=0,1,2,...k=0,1,2,...
利用泊松分布可以逼近二项分布,λ ≈ n p \lambda \approx npλnp(n很大,p很小时).

随机变量的函数

Y = g ( X ) Y=g(X)Y=g(X),则Y YY的分布列为:
P ( Y = y ) = ∑ P ( X = x ) x ∈ { g ( X ) = y } P(Y=y)=\underset { x\in \{ g(X)=y\} }{ \sum { P(X=x) } }P(Y=y)=x{g(X)=y}P(X=x)
求Y分布列的方法:

  1. 确定X的值域。
  2. 确定Y的值域。
  3. 确定Y的值域中每一个值对应的概率

注意:步骤1,2中都不涉及概率。有时候X的分布列是用一个分段函数表示的,这个分段函数里的表达式通常和X的值域没有半毛钱关系,不要被迷惑了。

期望均值方差

期望(加权平均值)为E ( X ) = ∑ x P ( X = x ) E(X)=\sum { xP(X=x) }E(X)=xP(X=x)
n阶矩:E ( X n ) E(X^{ n })E(Xn)
方差V a r ( X ) = E [ ( X − E x ) 2 ] Var(X)=E[(X-E_{ x })^{ 2 }]Var(X)=E[(XEx)2]
标准差:σ ( X ) = V a r ( x ) \sigma (X)=\sqrt { Var(x) }σ(X)=Var(x) (标准差的好处是其单位和X相同)

随机变量函数的期望为:
E ( g ( X ) ) = ∑ x g ( x ) P ( X = x ) E(g(X))=\sum _{ x }^{ }{ g(x)P(X=x) }E(g(X))=xg(x)P(X=x)
方差标准差都可以看作随机变量的函数。
V a r ( X ) = E ( X 2 ) − E X 2 Var(X)=E(X^2)-E_X^2Var(X)=E(X2)EX2

Y = a X + b Y=aX+bY=aX+b,则
E ( Y ) = a E ( X ) + b . V a r ( Y ) = a 2 V a r ( X ) . E(Y)=aE(X)+b. Var(Y)=a^2Var(X).E(Y)=aE(X)+b.Var(Y)=a2Var(X).

伯努利随机变量的
期望E ( X ) = E ( X n ) = 1 n p = p E(X)=E(X^n)=1^np=pE(X)=E(Xn)=1np=p
方差V a r ( X ) = p − p 2 Var(X)=p-p^2Var(X)=pp2
泊松分布的方差和期望都是λ \lambdaλ。利用e x e^xex的泰勒展开式可以证明。

多个随机变量的联合分布

P ( X = x , Y = y ) P(X=x,Y=y)P(X=x,Y=y)

Y\X012
0P(Y=0,X=0)
1
2

联合分布列的归一化条件是表格所有的概率值的和为1,不是每一行(列)的和为1.求联合分布列往往要用到条件概率的公式。
关于X的边缘分布列为:
P ( X = x ) = ∑ y P ( X = x , Y = y ) P(X=x)=\sum _{ y }^{ }{ P(X=x,Y=y) }P(X=x)=yP(X=x,Y=y)
注意上式右边是对y求和,是关于x的函数。
联合随机变量的函数g ( X , Y ) g(X,Y)g(X,Y)的分布:
P ( Z = z ) = ∑ g ( x , y ) = z P ( X = x , Y = y ) = ∑ x ∑ y g ( x , y ) P ( X = x , Y = y ) P(Z=z)=\sum _{ g(x,y)=z }^{ }{ P(X=x,Y=y) } =\sum _{ x }^{ }{ \sum _{ y }^{ }{ g(x,y)P(X=x,Y=y) } }P(Z=z)=g(x,y)=zP(X=x,Y=y)=xyg(x,y)P(X=x,Y=y)
期望:E ( Z ) = ∑ g ( x , y ) = z g ( x , y ) P ( X = x , Y = y ) E(Z)=\sum _{ g(x,y)=z }^{ }{ g(x,y)P(X=x,Y=y) }E(Z)=g(x,y)=zg(x,y)P(X=x,Y=y)

在某个条件下的随机变量

条件随机变量仍然是随机变量,其不同点只是计算概率分布时为P ( X = x ∣ A ) P(X=x|A)P(X=xA).
P ( X = x ∣ Y = y ) = P X ∣ Y ( x ∣ y ) . P X , Y ( x , y ) = P ( X = x , Y = y ) = P ( X = x ) P ( Y = y ∣ X = x ) = P ( Y = y ) P ( X = x ∣ Y = y ) P(X=x|Y=y)=P_{X|Y}(x|y). \\P_{X,Y}(x,y)=P(X=x,Y=y)=P(X=x)P(Y=y|X=x)=P(Y=y)P(X=x|Y=y)P(X=xY=y)=PXY(xy).PX,Y(x,y)=P(X=x,Y=y)=P(X=x)P(Y=yX=x)=P(Y=y)P(X=xY=y)
上式常用来计算联合分布列、期望等。另外当x不同时X=x是互不相容事件。

经典问题:两个信封悖论。有2个信封,其中一个钱数是另一个的2倍。
这个问题一般的错误在于一上来就计算另一封信的钱数的期望0.5c+0.5*2c=1.5c。最开始计算的应该是两封信钱数X,Y的联合分布。如果不能确定联合分布,又怎么能确定期望。按照通常理解的“总是应该交换信封”的错误之处在于此时期望值都是无穷大,不存在大小关系。

独立性

随机变量X与事件A独立:P ( X = x , A ) = P ( X = x ) P ( A ) P(X=x ,A)=P(X=x)P(A)P(X=x,A)=P(X=x)P(A)
随机变量X与随机变量Y独立:P ( X = x , Y = y ) = P ( X = x ) P ( Y = y ) P(X=x,Y=y)=P(X=x)P(Y=y)P(X=x,Y=y)=P(X=x)P(Y=y)
若X与Y独立,则:

  • E ( X Y ) = E ( X ) E ( Y ) . E ( g ( X ) f ( Y ) ) = E ( g ( X ) ) E ( f ( Y ) ) E(XY) = E(X) E(Y).E( g(X) f(Y) )=E(g(X)) E(f(Y))E(XY)=E(X)E(Y).E(g(X)f(Y))=E(g(X))E(f(Y))
  • V a r ( X + Y ) = V a r ( X ) + V a r ( Y ) Var(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y)

3.连续随机变量

对于随机变量X XX,若存在一个非负函数f X f_XfX,使得
P ( X ∈ B ) = ∫ B f X ( x ) d x P(X\in B)=\underset { B }{ \int } { f_{ X }(x)dx }P(XB)=BfX(x)dx
对每一个实轴上的集合B BB都成立,则称X XX为连续随机变量,f X f_XfXX XX的概率密度函数(PDF)。积分式可理解为黎曼积分。
若B是一个区间[a,b],则
P ( a ≤ X ≤ b ) = ∫ b a f X ( x ) d x P(a\leq X\leq b)=\int _{ b}^{ a}{ f_X(x)dx }P(aXb)=bafX(x)dx

P ( a ≤ X ≤ a ) = ∫ a a f X ( x ) d x = 0 P(a\leq X\leq a)=\int _{ a }^{ a }{ f_{ X }(x)dx } =0P(aXa)=aafX(x)dx=0
函数f X f_XfX能成为PDF的条件:1)非负.2)归一性,即
∫ − ∞ ∞ f X ( x ) d x = 1 \int _{ -\infty }^{ \infty }{ f_{ X }(x)dx } =1fX(x)dx=1

估算积分值:当Δ x \Delta xΔx很小时,在区间[ x , x + Δ x ] [x,x+\Delta x][x,x+Δx]上的概率约为f X ( x ) Δ x f_X(x)\Delta xfX(x)Δx.

期望:
E ( X ) = ∫ − ∞ ∞ x f X ( x ) d x E ( g ( X ) ) = ∫ − ∞ ∞ g ( x ) f X ( x ) d x E(X)=\int _{ -\infty }^{ \infty }{ xf_{ X }(x)dx } \\ E(g(X))=\int _{ -\infty }^{ \infty }{ g(x)f_{ X }(x)dx }E(X)=xfX(x)dxE(g(X))=g(x)fX(x)dx
方差V a r ( X ) = E [ ( X − E X ) 2 ] Var(X)=E[(X-E_X)^2]Var(X)=E[(XEX)2]

均匀分布的随机变量的PDF: f X = c :f_X=c:fX=c。图像是一条直线。
指数随机变量:
若随机变量X的的PDF为:
f X = λ e − λ x , x ≥ 0 ; f X = 0 , x &lt; 0. f_{ X }=\lambda e^{-\lambda x},x\geq 0;f_X=0,x&lt;0.fX=λeλx,x0;fX=0,x<0.
则X为指数分布的随机变量。可以验证PDF满足归一性。
指数分布的特性是:X ≥ a X\geq aXa的概率随着a的增加呈指数递减:
P ( X ≥ a ) = ∫ a ∞ λ e − λ x d x = − e ∞ ⋅ λ − ( − e − λ a ) = e − λ a P(X\geq a)=\int _{ a }^{ \infty }{\lambda e^{-\lambda x}dx } =-e^{\infty \cdot \lambda}-(-e^{-\lambda a})=e^{-\lambda a}P(Xa)=aλeλxdx=eλ(eλa)=eλa
指数分布的期望是1 / λ 1/\lambda1/λ ,方差是1 λ 2 \frac {1}{\lambda ^2}λ21.

分布函数F(X)

离散随机变量用分布列表示X XX的取值规律,连续随机变量用PDF表示X的取值规律,将两种统一起来,就是分布函数(CDF)。
随机变量X的分布函数就是x xx的函数,记为F X ( x ) = P ( X ≤ x ) F_X(x)=P(X\leq x)FX(x)=P(Xx).X XX可以是离散的,也可以是连续的,也可以既不连续也不离散(混合)。
CDF又称累计分布函数。(这里注意区分X XXx xx,2013年考研数学一有一概率题,题设条件X与x不分。)
CDF的性质:
1)单调(不严格的)递增函数:若x 1 &lt; x 2 x_1 &lt; x_2x1<x2,则F ( x 1 ) ≤ F ( x 2 ) F(x_1)\leq F(x_2)F(x1)F(x2).
2)F ( − ∞ ) = 0 , F ( ∞ ) = 1 F(-\infty )=0,F(\infty)=1F()=0,F()=1
3)若X是离散随机变量,则F ( x ) F(x)F(x)是阶梯型函数。F ( x ) F(x)F(x)与分布列可利用求和/差分 互相求得。
4)若X是连续随机变量,则F ( x ) F(x)F(x)是关于x xx的连续函数。F ( x ) F(x)F(x)f ( x ) f(x)f(x)可利用积分/微分互相求得:
F ( x ) = ∫ − ∞ x f ( x ) d x , f ( x ) = d F ( x ) d x F(x)=\int _{ -\infty }^{ x }{ f(x)dx } ,f(x)=\frac { dF(x) }{ dx }F(x)=xf(x)dx,f(x)=dxdF(x)

正态分布(高斯分布)

一个随机变量X XX服从正态分布(高斯分布),如果其PDF为:
f X ( x ) = 1 2 π σ e − ( x − μ ) 2 / 2 σ 2 f_{ X }(x)=\frac { 1 }{ \sqrt { 2\pi } \sigma } { e }^{-(x-\mu )^2/2\sigma ^2 }fX(x)=2πσ1e(xμ)2/2σ2
正态分布E ( x ) = μ E(x)=\muE(x)=μ 标准差σ \sigmaσ
若随机变量X XX服从正态分布,则Y = a X + b Y=aX+bY=aX+ba ≠ 0 a\neq 0a̸=0也服从正态分布。
标准正态分布:μ = 0 , σ = 1 \mu =0,\sigma =1μ=0,σ=1,即
f X ( x ) = 1 2 π e − ( x ) 2 / 2 f_{ X }(x)=\frac { 1 }{ \sqrt { 2\pi } } { e }^{ -(x)^{ 2 }/2 }fX(x)=2π1e(x)2/2
标准正态分布的分布函数CDF记为Φ ( x ) \Phi (x)Φ(x),通常使用表格查询函数值。

联合分布

联合概率密度函数PDF:
P ( a ≤ X ≤ b , c ≤ y ≤ d ) = ∫ c d ∫ a b f X Y ( x , y ) d x d y P(a\leq X\leq b,c\leq y\leq d)=\int _{ c }^{ d }{ \int _{ a }^{ b }{ f_{ XY }(x,y)dxdy } }P(aXb,cyd)=cdabfXY(x,y)dxdy
PDF:f X Y ( x , y ) f_{XY}(x,y)fXY(x,y)就是( X , Y ) (X,Y)(X,Y)落入( x , y ) (x,y)(x,y)附近单位面积正方形的概率。
布丰抛针试验估算π \piπ 值。蒙特卡罗方法:设计一个适当的试验,它的概率与我们感兴趣的一个量有关,然后利用试验结果来估计这个量,随着计算机等现代技术的发展,这一方法已经发展为具有广泛应用性的蒙特卡罗方法.

例如画一个边长为2的正方形,在正方形内部画一个半径为1的圆,设计一个沙漏实验,沙子等概率落在正方形内部,则沙子落入圆内的概率就是π / 4 \pi/4π/4.

联合CDF:
F X Y ( x , y ) = P ( X ≤ x , Y ≤ y ) = ∫ − ∞ x ∫ − ∞ y f ( s , t ) d t d s F_{ XY }(x,y)=P({ X\leq x,Y\leq y })=\int _{ -\infty }^{ x }{ \int _{ -\infty }^{ y }{ f(s,t)dtds} }FXY(x,y)=P(Xx,Yy)=xyf(s,t)dtds
PDF:
f X Y ( x , y ) = ∂ F X Y ( x , y ) ∂ x ∂ y f_{XY}(x,y)=\frac { \partial F_{ XY }(x,y) }{ \partial x\partial y }fXY(x,y)=xyFXY(x,y)
期望E:
E ( g ( X , Y ) ) = ∫ − ∞ + ∞ ∫ − ∞ + ∞ g ( x , y ) f X Y ( x , y ) d x d y E(g(X,Y))=\int _{ -\infty }^{ +\infty }{ \int _{ -\infty }^{ +\infty }g(x,y)f_{XY}(x,y)dxdy }E(g(X,Y))=++g(x,y)fXY(x,y)dxdy

条件

在连续随机变量中可能遇到以0概率事件为条件的问题。

以事件为条件的随机变量

P ( X ∈ B ∣ A ) = P ( X ∈ B , X ∈ A ) P ( A ) = ∫ B f X ∣ A ( x ) d x P(X\in B|A)=\frac { P(X\in B,X\in A) }{ P(A) } =\int _{ B }^{ }{ f_{X|A}(x)dx }P(XBA)=P(A)P(XB,XA)=BfXA(x)dx
设A是一个实数集合,P ( X ∈ A ) &gt; 0 P(X\in A)&gt;0P(XA)>0,则
f X ∣ X ∈ A = f X ( x ) P ( x ∈ A ) f_{ X|{ X\in A } }=\frac { f_{X}(x) }{ P(x \in A)}fXXA=P(xA)fX(x) ,x ∈ A . f X ∣ X ∈ A = 0 , x ∉ A x\in A.f_{ X|{ X\in A } }=0,x\notin AxA.fXXA=0,x/A.
利用分布函数F_{X|B}(x)对比F_X(x)可以得到.
全概率定理的一个变形:
A 1 , A 2 , . . . , A n A_1,A_2,...,A_nA1,A2,...,An是样本空间的一个分割,则
f X ( x ) = ∑ i = 1 n A i f X ∣ A i ( x ) f_{ X }(x)=\sum _{ i=1 }^{ n }{ A_{ i }f_{ X|A_{ i } }(x) }fX(x)=i=1nAifXAi(x)
.

以随机变量为条件的随机变量

X , Y X,YX,Y是联合连续随机变量,联合PDF为f X Y ( x , y ) f_{XY}(x,y)fXY(x,y),X XX的条件概率密度函数为:
f X ∣ Y ( x ∣ y ) = f X Y ( x , y ) f Y ( y ) f_{X|Y}(x|y)=\frac {f_{XY}(x,y)}{f_Y(y)}fXY(xy)=fY(y)fXY(x,y).
可以利用F X ∣ Y ( x , y ) F_{X|Y}(x,y)FXY(x,y)x , y x,yx,y求偏导数得到。

独立性

X , Y X,YX,Y是联合连续随机变量,如果f X Y ( x , y ) = f X ( x ) f Y ( y ) f_{XY}(x,y)=f_X(x)f_Y(y)fXY(x,y)=fX(x)fY(y)对一切x , y x,yx,y成立,则称X , Y X,YXY互相独立。
X , Y X,YXY独立:E ( X Y ) = E ( X ) E ( Y ) , V a r ( X + Y ) = V a r ( X ) + V a r ( Y ) E(XY)=E(X)E(Y),Var(X+Y)=Var(X)+Var(Y)E(XY)=E(X)E(Y),Var(X+Y)=Var(X)+Var(Y)

连续贝叶斯准则

连续随机变量的贝叶斯准则可以根据条件PDF推导出来的。
f X ∣ Y ( x ∣ y ) = f X Y ( x , y ) f Y ( y ) = f Y ∣ X ( y ∣ x ) f X ( x ) ∫ − ∞ + ∞ f X Y ( t , y ) d t = f Y ∣ X ( y ∣ x ) f X ( x ) ∫ − ∞ + ∞ f Y ∣ X ( y ∣ t ) f X ( t ) d t f_{ X|Y }(x|y)=\frac { f_{ XY }(x,y) }{ f_{ Y }(y) } =\frac { f_{ Y|X }(y|x)f_{ X }(x) }{ \int _{ -\infty }^{ +\infty }{ f_{ XY }(t,y)dt } } =\frac { f_{ Y|X }(y|x)f_{ X }(x) }{ \int _{ -\infty }^{ +\infty }{ f_{ Y|X }(y|t)f_{ X }(t)dt } }fXY(xy)=fY(y)fXY(x,y)=+fXY(t,y)dtfYX(yx)fX(x)=+fYX(yt)fX(t)dtfYX(yx)fX(x)

4.随机变量的深入内容

研究方法均是1)研究CDF:F ( x ) F(x)F(x);2)求F ( x ) F(x)F(x)导数得PDF:f ( x ) f(x)f(x).

随机变量函数的概率密度函数

考虑Y = g ( X ) Y=g(X)Y=g(X)的概率密度函数。
X XX是连续随机变量,PDF:f X ( x ) f_X(x)fX(x).随机变量Y = g ( X ) Y=g(X)Y=g(X),则
F Y ( y ) = P ( g ( X ) ≤ y ) = ∫ { x ∣ g ( x ) ≤ y } f ( x ) d x F_Y(y)=P(g(X)\leq y)=\int _{ \{ x|g(x)\leq y\} }^{ }{ f(x)dx }FY(y)=P(g(X)y)={xg(x)y}f(x)dx .
对y求导数得:
f Y ( y ) = d F Y ( y ) d y f_{ Y }(y)=\frac { dF_{ Y }(y) }{ dy }fY(y)=dydFY(y)

Y = a X + b . a ≠ 0 Y=aX+b.a \neq 0Y=aX+b.a̸=0,易证Y YYX XX服从同一类型的分布。

例题:若X , Y X,YXY均服从[ 0 , 1 ] [0,1][0,1]上的均匀分布且互相独立,求Z = Y / X Z=Y/XZ=Y/X的PDF。
由全概率定理可得(为了便于理我自己理解写成求和形式)
F Z ( z ) = P ( Y / X ≤ z ) = ∑ x P ( { Y ≤ x z } ∣ X = x ) P ( X = x ) F_{ Z }(z)=P(Y/X\leq z)=\sum _{ x }^{ }{ P(\{ Y\le xz\} |X=x)P(X=x) }FZ(z)=P(Y/Xz)=xP({Yxz}X=x)P(X=x)
已知:P ( X = x ) = lim ⁡ Δ x → 0 f X ( x ) Δ x P(X=x)=\lim _{ \Delta x\rightarrow 0 } f_{ X }(x)\Delta xP(X=x)=limΔx0fX(x)Δx
注意XY独立的条件,把右边式子的积分改写成积分形式:
F Z ( z ) = ∫ 0 1 F Y ( x z ) f X ( x ) d x = ∫ 0 1 F Y ( x z ) ⋅ 1 d x F_{ Z }(z)=\int _{ 0 }^{ 1 }{ F_{ Y }(xz)f_{ X }(x)dx } =\int _{ 0 }^{ 1 }{ F_{ Y }(xz)\cdot 1dx }FZ(z)=01FY(xz)fX(x)dx=01FY(xz)1dx
x z = t , d t = z d x xz=t,dt=zdxxz=t,dt=zdx,于是:
F Z ( z ) = 1 z ∫ 0 z F Y ( t ) d t F_{ Z }(z)=\frac { 1 }{ z } \int _{ 0 }^{ z }{ F_{ Y }(t) } dtFZ(z)=z10zFY(t)dt
F Y ( y ) = 0 , y ≤ 0 F_Y(y)=0,y\leq 0FY(y)=0,y0
F Y ( y ) = y , y ∈ [ 0 , 1 ] F_Y(y)=y,y \in [0,1]FY(y)=y,y[0,1]
F Y ( y ) = 1 , y ≥ 1 F_Y(y)=1,y \geq 1FY(y)=1,y1
故:
F Z ( z ) = 0 , z ≤ 0 F_Z(z)=0,z \leq 0FZ(z)=0,z0;
F Z ( z ) = 1 z ∫ 0 z t d t = z 2 , z ∈ [ 0 , 1 ] F_Z(z)=\frac { 1 }{ z } \int _{ 0 }^{ z }{ tdt }=\frac { z }{ 2 },z \in [0,1]FZ(z)=z10ztdt=2z,z[0,1]
F Z ( z ) = 1 z ( ∫ 0 1 t d t + ∫ 1 z 1 d t ) = 1 − 1 2 z , z &gt; 1 F_{ Z }(z)=\frac { 1 }{ z } (\int _{ 0 }^{ 1 }{ tdt } +\int _{ 1 }^{ z }{ 1dt } )=1-\frac { 1 }{ 2z },z &gt; 1FZ(z)=z1(01tdt+1z1dt)=12z1,z>1
F Z ( z ) F_Z(z)FZ(z)的导数即得PDF:f Z ( z ) f_Z(z)fZ(z)
也可以由联合概率密度函数f X Y ( x , y ) f_{XY}(x,y)fXY(x,y),事实上P ( Y ≤ X z ) P(Y\leq Xz)P(YXz)的概率就是f X Y f_{XY}fXY在指定( x , y ) (x,y)(x,y)范围上的二重积分。
F Z ( z ) = P ( Y / X ≤ z ) = ∬ y / x ≤ z f X Y ( x , y ) d x d y F_{ Z }(z)=P(Y/X\leq z)={ \iint _{ y/x\leq z }{ f_{ XY }(x,y)dxdy } }FZ(z)=P(Y/Xz)=y/xzfXY(x,y)dxdy
也可以由类似线性规划的方式采用图形解决,但"数形结合"只能处理低维度的,用来理解概念是很不错的,用来研究解决问题就力不从心了。到了像线性代数之类的维度很高的学科,图形都很难建立起来,这可能牵扯到另一个现代数学分支:代数几何。我不是很懂,但我的意思就是不应当依赖于图形解决问题了。

随机变量的和-卷积

Z = X + Y Z=X+YZ=X+Y,X与Y独立.
(1)X , Y X,YX,Y均是离散.
$p_Z(z)=P(X+Y=z)=\sum _{ x }^{ }{ P(X=x)P(Y=z-x|X=x) } $
p Z ( z ) = ∑ x p X ( x ) p Y ( z − x ) p_Z(z)=\sum _{ x }^{ }p_X(x)p_Y(z-x)pZ(z)=xpX(x)pY(zx)
p Z p_ZpZ称为X XXY YY的卷积。
(2)X , Y X,YX,Y均是连续.
对利用Z = X + Y Z=X+YZ=X+Y可以证明F Z ∣ X ( z ∣ x ) = F Y ( z − x ) F_{Z|X}(z|x)=F_Y(z-x)FZX(zx)=FY(zx),取z微分:
若 Z = X + Y , 则 f Z ∣ X ( z ∣ x ) = f Y ( z − x ) 若Z=X+Y,则f_{Z|X}(z|x)=f_Y(z-x)Z=X+Y,fZX(zx)=fY(zx)
又有:
f X , Z ( x , z ) = f X ( x ) f Z ∣ X ( z ∣ x ) , 总 是 成 立 的 。 f_{X,Z}(x,z)=f_X(x)f_{Z|X}(z|x),总是成立的。fX,Z(x,z)=fX(x)fZX(zx),
所以:
f Z ( z ) = ∫ − ∞ + ∞ f X , Z ( x , z ) d x = ∫ − ∞ + ∞ f X ( x ) f Y ( z − x ) d x f_Z(z)=\int _{-\infty }^{+\infty}{f_{X,Z}(x,z)dx}=\int _{-\infty }^{+\infty}{f_X(x)f_Y(z-x)dx}fZ(z)=+fX,Z(x,z)dx=+fX(x)fY(zx)dx
上式积分以后x没有了,只是z的函数。
同离散的式子比较,用密度函数代替来分布列,积分代替求和。
利用这个结论可以证明两个独立的正态分布之和仍然是正态分布。

协方差相关

协方差定义:
c o v ( X , Y ) = E [ ( X − E X ) ( Y − E Y ) ] = E ( X Y ) − E X E Y cov(X,Y)=E[(X-E_X)(Y-E_Y)]=E(XY)-E_XE_Ycov(X,Y)=E[(XEX)(YEY)]=E(XY)EXEY

c o v ( X , Y ) = 0 cov(X,Y)=0cov(X,Y)=0,X,Y不相关,E ( X Y ) = E X E Y E(XY)=E_XE_YE(XY)=EXEY
协方差可以表征X与Y的值“趋向”,相关性。

c o v ( X , X ) = E ( X 2 ) − E X 2 = v a r ( X ) cov(X,X)=E(X^2)-E_X^2=var(X)cov(X,X)=E(X2)EX2=var(X)
X与其自身肯定是相关的。

c o v ( X , a Y + b ) = a ∗ c o v ( X , Y ) cov(X,aY+b)=a*cov(X,Y)cov(X,aY+b)=acov(X,Y)
Y与X相关,g(Y)则当然也应该与X相关。aY+b与Y的关系是a(常数在“差关系”中可忽略)

c o v ( X , Y + Z ) = c o v ( X , Y ) + c o v ( X , Z ) cov(X,Y+Z)=cov(X,Y)+cov(X,Z)cov(X,Y+Z)=cov(X,Y)+cov(X,Z)
整体相关性可以分解为部分之间的相关性

注意:独立==>不相关,反之不成立。
相关系数ρ \rhoρ:
ρ = c o v ( X , Y ) v a r X ∗ v a r Y \rho=\frac{cov(X,Y)}{\sqrt{var_X*var_Y}}ρ=varXvarYcov(X,Y)
可以证明ρ ∈ [ − 1 , − 1 ] \rho \in [-1,-1]ρ[1,1]
ρ \rhoρ可以视作协方差的标准化。如果X的方差很大,即X − E X X-E_XXEX很大,则协方差也很大,但这时候显然不代表X , Y X,YX,Y相关性很强。用方差可以“中和“单一变量方差大的影响。所以ρ \rhoρ的分母会出现方差。

协方差可用于计算随机变量和的方差:
v a r ( X + Y ) = v a r ( X ) + v a r ( Y ) + 2 c o v ( X , Y ) var(X+Y)=var(X)+var(Y)+2cov(X,Y)var(X+Y)=var(X)+var(Y)+2cov(X,Y)
从这个式子可以看出"协方差"的定义。
v a r ( X 1 + X 2 + X 3 ) = ∑ i v a r ( X i ) + ∑ i ! = j c o v ( X i , X j ) var(X_1+X_2+X_3)=\sum _{i}{var(X_i)}+\sum _{i!=j}{cov(X_i,X_j)}var(X1+X2+X3)=ivar(Xi)+i!=jcov(Xi,Xj)

条件期望/条件方差

条件期望E ( X ∣ Y = y ) = g ( y ) E(X|Y=y)=g(y)E(XY=y)=g(y)是关于y的函数。因此Z = E ( X ∣ Y ) = g ( Y ) Z=E(X|Y)=g(Y)Z=E(XY)=g(Y)可以视为一个随机变量,分布依赖于Y的分布。
E ( Z ) = ∑ z z P ( Z = z ) = ∑ y g ( y ) P ( Y = y ) = ∑ y E ( X ∣ Y = y ) p Y ( y ) E(Z)=\sum _{z}{zP(Z=z)}=\sum _{y}{g(y)P(Y=y)}=\sum _{y}{E(X|Y=y)p_Y(y)}E(Z)=zzP(Z=z)=yg(y)P(Y=y)=yE(XY=y)pY(y)
$E(Z)=\int _{-\infty}^{+\infty}{E(X|Y=y)f_Y(y)dy} $

全期望定理(X的期望等于条件期望的和):
E ( X ) = ∑ i E ( X ∣ A i ) P ( A i ) E(X)=\sum _{i}{E(X|A_i)P(A_i)}E(X)=iE(XAi)P(Ai)
可以得出重期望法则:
E ( E ( X ∣ Y ) ) = E ( X ) E(E(X|Y))=E(X)E(E(XY))=E(X)
例如X为全班学生的成绩,Y为学生的分组编号。那么全班学生的平均成绩显然等于 全部分组平均成绩的平均。整体的平均=部分平均的平均。
条件期望重要性质:
E ( X g ( Y ) ∣ Y ) = g ( Y ) E ( X ∣ Y ) E(Xg(Y)|Y)=g(Y)E(X|Y)E(Xg(Y)Y)=g(Y)E(XY)
成立的原因是在求期望的过程中当Y=y时g(y)是常数。注意在条件期望的期望中,g(y)不能提出来,因为是对y求期望!

将条件期望作为估计量

X ^ = E [ X ∣ Y ] \hat {X}=E[X|Y]X^=E[XY]
有时候想要直接知道X的真实值不容易,那么可以通过做实验,观测在Y条件下X的值,并把此时得到的X的期望当作X的估计量,即上式。E ( X ^ ) = E ( X ) E(\hat X)=E(X)E(X^)=E(X).
既然是估计,那就要研究估计误差:
X ~ = X ^ − X \tilde X=\hat X-XX~=X^X
E ( X ~ ) = E ( E ( X ∣ Y ) ) − E ( X ) = 0 E(\tilde X)=E(E(X|Y))-E(X)=0E(X~)=E(E(XY))E(X)=0
E ( X ~ ∣ Y ) = 0 E(\tilde X|Y)=0E(X~Y)=0
把均值当作估计量一般都有这个性质,即估计误差的期望为0(没有系统性的正负偏倚,而是互相抵消)。
E ( X ^ X ~ ) = E ( E ( X ^ X ~ ∣ Y ) ) = E ( E ( g ( Y ) X ~ ∣ Y ) = E ( g ( Y ) E ( X ~ ∣ Y ) ) = 0 = E ( X ^ ) E ( X ~ ) E(\hat X\tilde X)=E(E(\hat X\tilde X|Y))=E(E(g(Y)\tilde X|Y)=E(g(Y)E(\tilde X|Y))=0=E(\hat X)E(\tilde X)E(X^X~)=E(E(X^X~Y))=E(E(g(Y)X~Y)=E(g(Y)E(X~Y))=0=E(X^)E(X~)
c o v ( X ^ , X ~ ) = E ( X ^ X ~ ) − E ( X ^ ) E ( X ~ ) = 0 cov(\hat X,\tilde X)=E(\hat X\tilde X)-E(\hat X)E(\tilde X)=0cov(X^,X~)=E(X^X~)E(X^)E(X~)=0
这说明把条件期望当作估计量时,误差和估计量没有相关性。原因是X ^ \hat XX^是关于Y的函数。由此又可以得到:
v a r ( X ) = v a r ( X ^ ) + v a r ( X ~ ) var(X)=var(\hat X)+var(\tilde X)var(X)=var(X^)+var(X~)

条件方差

v a r ( X ∣ Y ) = g ( Y ) = E [ ( X − E ( X ∣ Y ) ) 2 ∣ Y ] = E ( X ~ 2 ∣ Y ) var(X|Y)=g(Y)=E[(X-E(X|Y))^2|Y]=E(\tilde X^2|Y)var(XY)=g(Y)=E[(XE(XY))2Y]=E(X~2Y)
右边的式子是估计误差的二阶矩,容易联想到估计误差的方差:
v a r ( X ~ ) = E ( X ~ 2 ) − ( E ( X ~ ) ) 2 = E ( X ~ 2 ) = E ( E ( X ~ 2 ∣ Y ) ) = E ( v a r ( X ∣ Y ) ) var(\tilde X)=E(\tilde X^2)-(E(\tilde X))^2=E(\tilde X^2)=E(E(\tilde X^2|Y))=E(var(X|Y))var(X~)=E(X~2)(E(X~))2=E(X~2)=E(E(X~2Y))=E(var(XY))
意思是把条件期望当作估计量时,估计(条件期望)误差的方差可以等于条件方差的期望。
v a r ( X ) = E ( v a r ( X ∣ Y ) ) + v a r ( E ( X ∣ Y ) ) var(X)=E(var(X|Y))+var(E(X|Y))var(X)=E(var(XY))+var(E(XY))
上式又叫全方差法则。X的方差=条件方差的期望 + 条件期望的方差。这个公式可以简化方差计算:比如X的分布不是那么清晰,而是依赖于其他的一个参数Y。而Y的分布是已知的,那么此时就可以计算X的方差了。

为什么会相等呢,值得思考。注意这里都是在把条件期望E(X|Y)当作估计量时得出的结论。

矩母函数(变换函数)

矩母函数是研究随机变量的一种工具函数,非常类似于研究信号时的拉普拉斯变换。可以简化很多计算。
随机变量X XX的矩母函数:
M X ( s ) = E [ e s X ] M_X(s)=E[e^{sX}]MX(s)=E[esX]
所以M X ( s ) M_X(s)MX(s)分为离散和连续两种:
M X ( s ) = ∑ x e s x P ( X = x ) M_X(s)=\sum _xe^{sx}P(X=x)MX(s)=xesxP(X=x)
M X ( s ) = ∫ ∞ + ∞ e s x f X d x M_X(s)=\int _{\infty}^{+\infty}{e^{sx}f_Xdx}MX(s)=+esxfXdx
注意s ss的定义域是使求和/积分存在。常见随机变量的矩母函数:
多利用e x e^xex的泰勒展开式(用多项式去逼近任何函数,任意阶导数相等).

  • 参数为p的伯努利分布:M ( s ) = 1 − p + p e s M(s)=1-p+pe^sM(s)=1p+pes
  • 参数为n,p的二项分布:M ( s ) = ( 1 − p + p e s ) n M(s)=(1-p+pe^s)^nM(s)=(1p+pes)n
  • 参数为p的几何分布(第一次成功为k的概率):M ( s ) = p e s 1 − ( 1 − p ) e s M(s)=\frac {pe^s}{1-(1-p)e^s}M(s)=1(1p)espes
  • 参数为$\lambda 的 泊 松 分 布 : 的泊松分布::M(s)=e^{\lambda (e^s-1)}$
  • ( a , b ) (a,b)(a,b)均匀分布(k = a , a + 1 , . . . , b , l = b − a + 1 k=a,a+1,...,b,l=b-a+1k=a,a+1,...,b,l=ba+1):M ( s ) = e a s l ∗ e l s − 1 e s − 1 M(s)=\frac {e^{as}}{l}*\frac{e^{ls}-1}{e^s-1}M(s)=leases1els1
  • U(a,b)的矩母函数:M ( s ) = 1 b − a e s b − e s a s M(s)=\frac{1}{b-a}\frac{e^{sb}-e^{sa}}{s}M(s)=ba1sesbesa
  • 参数为λ \lambdaλ的指数分布f X = λ e − λ x f_X=\lambda e^{-\lambda x}fX=λeλx:M ( s ) = λ λ − s M(s)=\frac{\lambda}{\lambda -s}M(s)=λsλ
  • 参数为μ , δ 2 \mu ,\delta ^2μ,δ2的正态分布f X = 1 2 π δ exp ⁡ { − ( x − μ ) 2 2 δ 2 } f_X=\frac{1}{\sqrt{2\pi }\delta}\exp\{-\frac{(x-\mu)^2}{2\delta^2}\}fX=2πδ1exp{2δ2(xμ)2}:M ( s ) = e x p { δ 2 s 2 2 + μ s } M(s)=exp\{\frac {\delta ^2s^2}{2}+\mu s\}M(s)=exp{2δ2s2+μs}

Y = a X + b Y=aX+bY=aX+b,则M Y ( s ) = E ( e a s X + b s ) = e s b M X ( s a ) M_Y(s)=E(e^{asX+bs})=e^{sb}M_X(sa)MY(s)=E(easX+bs)=esbMX(sa).X加一个常数,矩母函数扩大e b s e^bsebs倍.X XX乘以a aa倍,矩母函数宽度缩小a aa倍。

矩母函数到矩

考虑连续随机变量X的矩母函数的导数:
d M ( s ) d s = d d s ( ∫ − ∞ + ∞ e s x f X d x ) = ∫ − ∞ + ∞ d d s ( e s x f X d x ) = ∫ − ∞ + ∞ ( x e s x f X d x ) \frac{dM(s)}{ds}=\frac{d}{ds}(\int _{-\infty}^{+\infty} e^{sx}f_Xdx)=\int _{-\infty}^{+\infty}\frac{d}{ds}(e^{sx}f_Xdx)=\int _{-\infty}^{+\infty}(xe^{sx}f_Xdx)dsdM(s)=dsd(+esxfXdx)=+dsd(esxfXdx)=+(xesxfXdx)
上面这里涉及到了交换积分微分次序,一般都可以。
d d s M ( s ) = d d s E ( e s X ) = E ( d d s e s X ) = E ( x e s X ) \frac{d}{ds}M(s)=\frac{d}{ds}E(e^{sX})=E(\frac{d}{ds}e^{sX})=E(xe^{sX})dsdM(s)=dsdE(esX)=E(dsdesX)=E(xesX)
x = 0 x=0x=0时,M ( 1 ) ( 0 ) = E ( X ) M^{(1)}(0)=E(X)M(1)(0)=E(X)
M ( n ) ( 0 ) = E ( X n ) M^{(n)}(0)=E(X^n)M(n)(0)=E(Xn)
这就是计算X矩的方法,也是为什么叫矩母函数.国外叫变换函数.

矩母函数是可逆的,所以它可以确定X的分布。证明很难。反向确定X分布的方法是观察已知分布的矩母函数,拼凑出来。

Z = X + Y Z=X+YZ=X+YX , Y X,YX,Y独立,则M X + Y ( s ) = E ( e X s ) E ( e Y s ) = M X ( s ) M Y ( s ) M_{X+Y}(s)=E(e^{Xs})E(e^{Ys})=M_X(s)M_Y(s)MX+Y(s)=E(eXs)E(eYs)=MX(s)MY(s)
用这个公式可以轻易证明两个独立的正态分布之和仍是正态分布。

联合分布矩母函数

联合矩母函数是由多个随机变量的联合分布,可以想到联合矩母函数应该是个多元参数。定义:
M X 1 , X 2 , . . . , X n ( s 1 , s 2 , . . . , s n ) = E ( e x p { s 1 X 1 + s 2 X 2 + . . . + s n X n } ) M_{X_1,X_2,...,X_n}(s_1,s_2,...,s_n)=E(exp\{s_1X_1+s_2X_2+...+s_nX_n\})MX1,X2,...,Xn(s1,s2,...,sn)=E(exp{s1X1+s2X2+...+snXn})

随机N个相互独立同分布的随机变量之和

Y = X 1 + X 2 + . . . + X N Y=X_1+X_2+...+X_NY=X1+X2+...+XN
E ( Y ∣ N = n ) = n E ( X ) = &gt; E ( Y ∣ N ) = N E ( X ) E(Y|N=n)=nE(X) =&gt; E(Y|N)=NE(X)E(YN=n)=nE(X)=>E(YN)=NE(X)
期望E ( Y ) = E ( E ( Y ∣ N ) ) = E ( N E ( X ) ) = N E ( X ) E(Y)=E(E(Y|N))=E(NE(X))=NE(X)E(Y)=E(E(YN))=E(NE(X))=NE(X)
v a r ( Y ∣ N = n ) = v a r ( X 1 + X 2 + . . . + X n ∣ N = n ) = n ∗ v a r ( X ) var(Y|N=n)=var(X_1+X_2+...+X_n|N=n)=n*var(X)var(YN=n)=var(X1+X2+...+XnN=n)=nvar(X)
方差v a r ( Y ) = E ( v a r ( Y ∣ N ) ) + v a r ( E ( Y ∣ N ) ) = n v a r ( X ) + [ E ( X ) ] 2 v a r ( N ) var(Y)=E(var(Y|N))+var(E(Y|N))=nvar(X)+[E(X)]^2var(N)var(Y)=E(var(YN))+var(E(YN))=nvar(X)+[E(X)]2var(N)
矩母函数M Y ( s ) = ∑ n = 1 ∞ ( M X ( s ) ) n P ( N = n ) M_Y(s)=\sum _{n=1}^{\infty}(M_X(s))^nP(N=n)MY(s)=n=1(MX(s))nP(N=n)
M N ( s ) = ∑ n = 1 ∞ ( e s ) n P ( N = n ) M_N(s)=\sum _{n=1}^{\infty}(e^s)^nP(N=n)MN(s)=n=1(es)nP(N=n)
比较上面两个式子的区别可类比:
Y = X 1 + X 2 + . . . + X N Y=X_1+X_2+...+X_NY=X1+X2+...+XN
N = 1 + 1 + . . . + 1 N=1+1+...+1N=1+1+...+1
M 1 ( s ) = e s M_1(s)=e^sM1(s)=es
M 1 ( s ) M_1(s)M1(s)替换成M X ( s ) M_X(s)MX(s)即得到M Y ( s ) M_Y(s)MY(s)的矩母函数.


版权声明:本文为weixin_43956759原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接和本声明。