統計学入門 第5章 確率変数

Contents
  1. 今回の内容
  2. 第5章 確率変数
  3. 練習問題
  4. 所感
  5. 次回

nownab.log | 統計学入門 第4章 確率

統計学入門 (基礎統計学Ⅰ)

機械学習勉強会として今は 統計学入門 をやっている。 週一でやっていて、今週から輪読形式で進めてみることになった。

また、勉強会で書いたコードや疑問点などをまとめるために GitHub のレポジトリを活用している。 https://github.com/Wondershake/ml-statistics-intro

今回の内容

第5章 確率変数

5.1 確率変数と確率分布

  • 乱数 (random number, random digits): 起こる確率が等しいことが理論的に保証されている 0 から 9 までの数字
  • 確率変数 (random variable): それがとる各値に対してそれぞれ確率が与えられている変数
  • 離散型 (discrete type): 可算集合 x1,x2,…\\{x_1, x_2, \dots\\}の中の値をとる確率変数
  • 確率分布 (probability distribution)
    • 確率変数XXがあるとき、P(X=xk)=f(xk)P(X=x_k) = f(x_k) で表されるffを確率分布という
    • f(xk)≥0,(k=1,2,… )かつ∑kf(xk)=1f(x_k) \geq 0, (k=1, 2, \dots) \text{かつ} \sum_k f(x_k) = 1を満たす
    • 離散型の確率分布 (p. d. of discrete type)
  • 連続型 (continuous type)
    • 連続値をとる確率変数
    • P(a≥X≥b)=∫abf(x)dxP(a\geq X \geq b) = \int_a^bf(x)dxで表される
    • ただし、すべてのxに対しf(x)≥0かつ∫−∞∞f(x)dx=1\text{すべての}x\text{に対し}f(x)\geq 0 \text{かつ} \int_{-\infty}^\infty f(x)dx=1を満たす
    • f(x)f(x)をXXの**確率密度関数 (probability density function)**という
    • ある一点の確率はP(X=a)=0P(X=a) = 0となる
  • 指数分布 (exponential distribution)
    • x≥0x\geq 0のときf(x)=λe−λxf(x)=\lambda e^{-\lambda x}、x<0x < 0のときf(x)=0f(x) = 0
    • 待ち時間は指数分布に従う
      • ある災害が起こってから次の災害が起こるまでの時間XXや、電球が偶発的に切れるまでの寿命XXなど
  • 一様分布 (uniform distribution)
    • 0≤x≤10 \leq x \leq 1のときf(x)=1f(x)=1, それ以外のときf(x)=0f(x)=0
    • 区間[0,1][0, 1]の任意の値を等しくとる一様乱数 (uniform random number)
  • 累積分布関数 (cumulative distribution function)
    • 確率変数XXに対してXXがxx以下の確率
    • F(x)=P(X≤x)F(x)=P(X\leq x)
    • F(x)=∫−∞xf(u)duF(x)=\int_{-\infty}^x f(u) du
    • F′(x)=f(x)F'(x)=f(x)
    • 離散型の場合はF(x)=∑u≤xf(u)F(x)=\sum_{u\leq x}f(u)
    • 常に次の 3 つの性質をもつ
      • 広義単調増加: x1<x2x_1 < x_2ならばF(x1)≤F(x2)F(x_1) \leq F(x_2)
      • 範囲: x→∞x \rightarrow \inftyのときF(x)→1F(x)\rightarrow 1、x→−∞x\rightarrow -\inftyのときF(x)→0F(x)\rightarrow 0
      • 右連続: 各点xxでε↓0\varepsilon\downarrow 0のときF(x+ε)→F(x)F(x+\varepsilon)\rightarrow F(x)
  • モード (mode): f(x)f(x)を最大にするx=x0x=x_0
  • メディアン (median): P(X≤xm)=12P(X\leq x_m)=\frac{1}{2}となるxmx_m

5.2 確率変数の期待値と分散

  • 期待値 (expectation)
    • 平均、重心
    • 確率変数XXの期待値をE(X)E(X)と書く
    • 離散型のとき、E(X)=∑xxf(x)E(X)=\sum_x xf(x)
    • 連続型のとき、E(X)=∫−∞∞xf(x)dxE(X)=\int_{-\infty}^\infty xf(x) dx
    • E(X)=μE(X)=\muで表すこともある
  • XXの関数ϕ(X)\phi(X)に対する期待値の定義
    • E(ϕ(X))=∑xϕ(x)f(x)E(\phi(X))=\sum_x \phi(x)f(x)
    • E(ϕ(X))=∫−∞∞ϕ(x)f(x)dxE(\phi(X))=\int_{-\infty}^\infty \phi(x)f(x) dx
  • 期待値の演算の性質
    • E(c)=cE(c)=c
    • E(X+c)=E(X)+cE(X+c)=E(X)+c
    • E(cX)=cE(X)E(cX)=cE(X)
    • E(X+Y)=E(X)+E(Y)E(X+Y)=E(X)+E(Y)
  • 分散 (variance)
    • ばらつき具合
    • 確率変数XXの分散をV(X)V(X)と書く
    • V(X)=E((X−μ)2)=E(X2)−(E(X))2V(X)=E((X-\mu)^2)=E(X^2)-(E(X))^2
    • 離散型のとき、V(X)=∑x(x−μ)2f(x)V(X)=\sum_x (x-\mu)^2f(x)
    • 連続型のとき、V(X)=∫−∞∞(x−μ)2f(x)dxV(X)=\int_{-\infty}^\infty (x-\mu)^2f(x) dx
    • V(X)=E(X2)−(E(X))2V(X)=E(X^2)-(E(X))^2
    • σ2\sigma^2と表すことが多い
  • 標準偏差 (standard deviation)
    • 分散の平方根 D(X)=V(X)D(X)=\sqrt{V(X)}
    • σ\sigmaと表すことが多い
  • 分散の演算の性質
    • V(c)=0V(c)=0
    • V(X+c)=V(X)V(X+c)=V(X)
    • V(cX)=c2V(X)V(cX)=c^2V(X)
  • 標準化
    • Z=X−E(X)V(X)Z=\frac{X-E(X)}{\sqrt{V(X)}}とすると期待値と分散の性質から
    • E(Z)=0E(Z)=0
    • V(Z)=1V(Z)=1
    • この変換を標準化といい、ZZを標準化変数という

5.3 モーメントとモーメント母関数

  • 歪度 (skewness)
    • 歪度係数とも
    • 確率分布の非対称性の指標
    • α3=E((X−μ)3)σ3\alpha_3 = \frac{E((X-\mu)^3)}{\sigma^3}
    • α3>0\alpha_3>0ならば右の裾が長い
    • α3<0\alpha_3<0ならば左の裾が長い
    • ∣α3∣|\alpha_3|が程度を表す
    • β3\beta_3と書くこともある
  • 尖度 (kurtosis)
    • 超過係数 (coefficient of excess)
    • α4=E((X−μ)4)σ4\alpha_4=\frac{E((X-\mu)^4)}{\sigma^4}としたとき、α4−3\alpha_4-3のことをいう
    • 正規分布はα4=3\alpha_4=3
    • α4>3\alpha_4 >3なら正規分布より尖っている
    • α4<3\alpha_4 < 3なら正規分布より丸い
    • β4\beta_4と書くこともある
  • モーメント (moment)
    • 積率ともいう
    • μr=E(Xr)\mu_r=E(X^r): XXの(原点のまわりの)rr次のモーメント
    • μr′=E((X−μ)r)\mu'_r=E((X-\mu)^r): XXの期待値のまわりのrr次のモーメント
    • αr=E(X−μσr)\alpha_r=E(\\{\frac{X-\mu}{\sigma}\\}^r): XXのrr次の標準化モーメント
  • モーメント母関数 (moment generating function)
    • すべての次数のモーメントを生成する
    • すべての次数のモーメントが決まれば確率分布は一意に定まる
    • MX(t)=E(etX)M_X(t)=E(e^{tX})
    • 離散型: MX(t)=∑xetxf(x)M_X(t)=\sum_xe^{tx}f(x)
    • 連続型: MX(t)=∫−∞∞etxf(x)dxM_X(t)=\int_{-\infty}^\infty e^{tx}f(x)dx
    • MX(r)(0)=μrM_X^{(r)}(0)=\mu_r: モーメント母関数のrr階導関数からrr次のモーメントが求まる

5.4 チェビシェフの不等式

  • チェビシェフの不等式 (Chebyshev’s inequality)
    • いかなる確率変数XXに対してもP(∣X−μ∣≥kσ)≤1k2,  (k>0)P(|X-\mu|\geq k\sigma)\leq\frac{1}{k^2}, \;(k>0)が成り立つ
    • 確率分布がわからなくても、 期待値と分散さえわかれば確率の値が不等式で得られる

5.5 確率変数の変換

練習問題

https://github.com/Wondershake/ml-statistics-intro/issues/8

所感

  • 自分でちゃんと読んでるからか、教科書がいいのか、昔より理解できてる気がする
  • 輪読形式はただのもくもくより負荷は強くなるが、その分力にはなってる感じがあるので良い 💪

次回

第 6 章確率分布

https://github.com/Wondershake/ml-statistics-intro/issues/12