統計学入門 第7章 多次元の確率分布

Contents
  1. 今回の内容
  2. 7.1 同時確率分布と周辺確率分布
  3. 7.2 条件付き確率分布と独立な確率変数
  4. 7.3 多次元正規分布
  5. 7.4 独立な確率変数の和
  6. 練習問題
  7. 所感
  8. 次回

nownab.log | 統計学入門 第6章 確率変数

統計学入門 (基礎統計学Ⅰ)

機械学習勉強会として今は 統計学入門 をやっている。 週一でやっていて、今週から輪読形式で進めてみることになった。

また、勉強会で書いたコードや疑問点などをまとめるために GitHub のレポジトリを活用している。 Wondershake/ml-statistics-intro: 基礎統計学 I 統計学入門 (東京大学出版会)

今回の内容

7.1 同時確率分布と周辺確率分布

  • 同時確率分布 (joint probability distribution)
    • 離散型の確率変数X,YX, Yがあるとき、X=xX=xであり同時にY=yY=yである確率
    • P(X=x,Y=y)=f(x,y)P(X=x, Y=y) = f(x,y)
    • 次を満たす
      • f(x,y)≥0f(x, y) \geq 0
      • ∑x∑yf(x,y)=1\sum_x\sum_yf(x,y)=1
  • 2 次元の確率変数の場合、自称は(x,y)(x,y)が集まったある部分集合
    • 事象AAの確率はP((X,Y)∈A)=∑∑A  f(x,y)P((X, Y)\in A)={\sum\sum}_A\;f(x,y)
  • 同時確率密度関数 (joint probability density function)
    • 連続型の確率変数X,YX, Y
    • 次を満たす
      • f(x,y)≥0f(x,y)\geq0
      • ∫∫S  f(x,y)dxdy=1\int\int_S\;f(x,y)dxdy=1
        • SSは標本空間 (sample space)、2 次元ユークリッド平面の全範囲
    • 事象AA(SSの部分集合)の確率はP((X,Y)∈A)=∫∫A  f(x,y)dxdyP((X,Y)\in A)=\int\int_A\;f(x,y)dxdy
    • AAが区間ならばP(a≤X≤b,c≤Y≤d)=∫cd∫abf(x,y)dxdyP(a\leq X\leq b, c\leq Y\leq d)=\int_c^d\int_a^b f(x, y)dxdy
  • 周辺確率分布 (marginal probability distribution)
    • 同時確率分布から、X,YX, Y単独の確率分布
    • g(x)=∑yf(x,y)g(x)=\sum_y f(x,y)
    • h(y)=∑xf(x,y)h(y)=\sum_x f(x,y)
  • 周辺確率密度関数 (marginal probability density function)
    • g(x)=∫−∞∞f(x,y)dyg(x)=\int_{-\infty}^{\infty}f(x,y)dy
    • h(y)=∫−∞∞f(x,y)dxh(y)=\int_{-\infty}^{\infty}f(x,y)dx
  • 周辺確率分布は同時確率分布から導かれる
  • 共分散 (covariance)
    • Cov(X,Y)=E(X−μX)(Y−μY)=E(XY)−μXμYCov(X, Y)=E\\{(X-\mu_X)(Y-\mu_Y)\\}=E(XY)-\mu_X\mu_Y
    • X,YX, Yに関連があるとき、Cov(X,Y)≠0Cov(X,Y)\ne0
    • Cov(X,Y)>0Cov(X,Y)>0ならX,YX,Yは大小が同傾向、Cov(X,Y)<0Cov(X,Y)<0なら反対傾向
    • V(X+Y)=V(X)+V(Y)+2Cov(X,Y)V(X+Y)=V(X)+V(Y)+2Cov(X,Y)
  • 相関係数 (correlation coefficient)
    • 確率変数X,YX,Yの関係の強さ
    • ρXY=Cov(X,Y)V(X)⋅V(Y)\rho_{XY}=\frac{Cov(X,Y)}{\sqrt{V(X)}\cdot\sqrt{V(Y)}}
    • −1≤ρXY≤1-1\leq\rho_{XY}\leq 1
    • ρ=±1\rho=\pm 1のとき、X,YX,Yには 1 次式の関係が成り立つ
      • Y=aX+bY=aX+b
      • aaとρ\rhoの符号は同じ
  • 無相関 (uncorrelated): ρ=0\rho=0つまりCov(X,Y)=0Cov(X, Y)=0のときX,YX, Yは無相関であるという

7.2 条件付き確率分布と独立な確率変数

  • 条件付確率密度関数 (conditional probability density function)
    • Y=yY=yのときのXXの条件付確率密度関数: P(X=x∣Y=y)=P(X=x,Y=y)P(Y=y)P(X=x|Y=y)=\frac{P(X=x, Y=y)}{P(Y=y)}
    • 条件付期待値 (conditional expectation)
    • 条件付分散 (conditional variance)
  • 独立 (independent)
    • 同時確率分布において、あらゆるx,yx, yについてf(x,y)=g(x)⋅h(y)f(x,y)=g(x)\cdot h(y)が成り立つとき、X,YX,Yは互いに独立であるという
    • f(x,y)=g(x∣y)⋅h(y)=h(y∣x)⋅g(x)f(x,y)=g(x|y)\cdot h(y) = h(y|x)\cdot g(x)
    • nn個の確率変数X1,X2,…,XnX_1, X_2, \dots, X_nに対してもf(x1,x2,…,xn)=f1(x1)f2(x2)…fn(xn)f(x_1, x_2, \dots, x_n)=f_1(x_1)f_2(x_2)\dots f_n(x_n)が成り立つとき、X1,X2,…,XnX_1, X_2, \dots, X_nは独立
    • X,YX, Yが独立のとき、E(XY)=E(X)E(Y)E(XY)=E(X)E(Y)
    • X,YX, Yが独立のとき、無相関となる
      • ρ=Cov(X,Y)=E(XY)−E(X)E(Y)=0\rho=Cov(X,Y)=E(XY)-E(X)E(Y)=0
    • X,YX, Yが独立のとき、MX+Y(t)=MX(t)MY(t)M_{X+Y}(t)=M_X(t)M_Y(t)

7.3 多次元正規分布

7.4 独立な確率変数の和

  • 分散の加法性
    • 確率変数X,YX, Yについて常に次が成り立つ
      • E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y)
    • 確率変数X,YX, Yが独立のとき次が成り立つ(無相関のときも)
      • V(X±Y)=V(X)+V(Y)V(X\pm Y)=V(X)+V(Y)
    • 確率変数X1,X2,…,XnX_1, X_2, \dots, X_nに対しても次が成り立つ
      • E(X1+X2+⋯+Xn)=E(X1)+E(X2)+⋯+E(Xn)E(X_1+X_2+\dots+X_n)=E(X_1)+E(X_2)+\dots+E(X_n)
      • 独立のとき, V(X1+X2+⋯+Xn)=V(X1)+V(X2)+⋯+V(Xn)V(X_1+X_2+\dots+X_n)=V(X_1)+V(X_2)+\dots+V(X_n)
  • X1,X2,…,XnX_1, X_2, \dots, X_nが同一の確率分布に従うとき、
    • E(X1+X2+⋯+Xn)=nμE(X_1+X_2+\dots+X_n)=n\mu
    • V(X1+X2+⋯+Xn)=nσ2V(X_1+X_2+\dots+X_n)=n\sigma^2
    • D(X1+X2+⋯+Xn)=nσD(X_1+X_2+\dots+X_n)=\sqrt{n}\sigma
    • Xˉ=X1,X2,…,Xnn\bar{X}=\frac{X_1, X_2, \dots, X_n}{n}とすると、
      • E(Xˉ)=μE(\bar{X})=\mu
      • V(Xˉ)=σ2nV(\bar{X})=\frac{\sigma^2}{n}
  • たたみこみ (convolution)
    • 確率変数X,YX, Yが独立で、確率分布をg(x),h(y)g(x), h(y)とするとき
      • k(z)=∑xg(x)h(z−x)k(z)=\sum_xg(x)h(z-x)
      • k(z)=∫−∞∞g(x)h(z−x)dxk(z)=\int_{-\infty}^{\infty}g(x)h(z-x)dx
    • これをたたみこみといい、k=g∗hk=g*hとかく
    • 確率変数X,YX, Yが独立で、確率分布をg(x),h(y)g(x), h(y)とするとき、和X+YX+Yの確率分布k(x)k(x)を考える
      • P(X+Y=z)P(X+Y=z)なので、X=x,Y=z−xX=x, Y=z-xを同時に満たすすべての組み合わせ
    • 二項分布: X,YX, Yが独立でそれぞれBi(n,p),Bi(m,p)Bi(n, p), Bi(m, p)に従うとき、X+YX+YはBi(n,p)∗Bi(m,p)=Bi(n+m,p)Bi(n, p)*Bi(m, p)=Bi(n+m, p)に従う
    • ポアソン分布: X,YX, Yが独立でそれぞれP0(λ),P0(μ)P_0(\lambda), P_0(\mu)に従うとき、X+YX+YはP0(λ)∗P0(μ)=P0(λ+μ)P_0(\lambda)*P_0(\mu)=P_0(\lambda+\mu)に従う
    • 正規分布: X,YX, Yが独立でそれぞれN(μ1,σ12),N(μ2,σ22)N(\mu_1, \sigma_1^2), N(\mu_2, \sigma_2^2)に従うとき、X+YX+YはN(μ1+μ2,σ12+σ22)N(\mu_1+\mu_2, \sigma_1^2+\sigma_2^2)に従う
  • たたみこみの結果、同一種類の確率分布(確率分布族)が得られる時、確率分布族は**再生的 (reproductive)**であるという
  • 正規分布の再生性
    • X1,X2,…,XnX_1, X_2, \dots, X_nが独立でそれぞれ正規分布N(μ1,σ12),N(μ2,σ22),…,N(μn,σn2)N(\mu_1, \sigma_1^2), N(\mu_2, \sigma_2^2), \dots, N(\mu_n, \sigma_n^2)に従うとき
      • X1+X2+⋯+XnX_1+X_2+\dots+X_nはN(μ1+μ2+⋯+μn,σ12+σ22+⋯+σn2)N(\mu_1+\mu_2+\dots+\mu_n, \sigma_1^2+\sigma_2^2+\dots+\sigma_n^2)に従う
      • c1X1+c2X2+⋯+cnXnc_1X_1+c_2X_2+\dots+c_nX_nはN(c1μ1+c2μ2+⋯+cnμn,c12σ12+c22σ22+⋯+cn2σn2)N(c_1\mu_1+c_2\mu_2+\dots+c_n\mu_n, c_1^2\sigma_1^2+c_2^2\sigma_2^2+\dots+c_n^2\sigma_n^2)に従う
    • とくにX1,X2,…,XnX_1, X_2, \dots, X_nがすべて正規分布N(μ,σ2)N(\mu, \sigma^2)に従うとき
      • X1+X2+⋯+XnX_1+X_2+\dots+X_nはN(nμ,nσ2)N(n\mu, n\sigma^2)に従う
      • Xˉ=X1,X2,…,Xnn\bar{X}=\frac{X_1, X_2, \dots, X_n}{n}はN(μ,σ2n)N(\mu, \frac{\sigma^2}{n})に従う

練習問題

第7章 多次元の確率分布 · Issue #13 · Wondershake/ml-statistics-intro

所感

  • まだ E とか V とかをこねくり回してる感じなのでなんとか

次回

第 8 章大数の法則と中心極限定理