統計的な推測(二項分布・正規分布)

統計的な推測(二項分布・正規分布)― 一部から全体を「確率つきで」推定する

まず、身近なところから

「内閣支持率 45%(調査対象 2000 人)」。全国民に聞いたわけではないのに、なぜ言い切れる?
中 3 の標本調査は「だいたい同じ割合」で終わった。高校では どれくらいの誤差で 信頼できるかまで数で言う。そのために、確率変数・二項分布・正規分布を積み上げる。

確率変数と期待値・分散

さいころの目 X のように、確率に応じて値が決まる変数 を確率変数という。

値x₁x₂…
確率p₁p₂…

例 1 X が 1、2、3 を確率 1/6、2/6、3/6 でとる → E(X) = (1 + 4 + 9)/6 = 7/3

変数の変換

Y = aX + b とすると E(Y) = aE(X) + b、V(Y) = a²V(X)(数I のデータの変換と同じ)。
例 2 E(X) = 5、V(X) = 2 のとき Y = 3X + 1 → E(Y) = 16、V(Y) = 18

二項分布 B(n, p)

確率 p のことがらを n 回独立にくり返し、起こる 回数 X の分布。P(X = k) = ₙCₖ pᵏ(1 − p)ⁿ⁻ᵏ(反復試行)。

例 3 さいころを 30 回投げて 1 が出る回数 → E = 30 × 1/6 = 5、V = 30 × 1/6 × 5/6 = 25/6
例 4 B(100, 0.2) → E = 20、V = 100 × 0.2 × 0.8 = 16

正規分布 N(μ, σ²)

身長・測定誤差など、多くの量は平均 μ を中心とした 左右対称の釣り鐘型 に分布する。

             ╭───╮
           ╱       ╲
         ╱           ╲
       ╱               ╲
 ────╱───┼─────┼─────┼───╲────
       μ−2σ  μ−σ  μ  μ+σ  μ+2σ
        └── 約 68% ──┘
     └────── 約 95% ──────┘

標準化

どんな正規分布も z = (X − μ)/σ で平均 0、標準偏差 1 の 標準正規分布 N(0, 1) に直せる。確率は正規分布表で読む。
例 5 N(50, 10²) で X = 70 → z = (70 − 50)/10 = 2(平均より 2σ 上)

n が大きいとき、二項分布 B(n, p) は N(np, np(1 − p)) で近似できる。

標本平均の分布 ― 推定の土台

母平均 μ、母標準偏差 σ の母集団から大きさ n の標本をとって平均 X̄ を出す。X̄ は標本ごとにばらつくが

標本が大きいほど X̄ のばらつきは小さい(√n に反比例)。
例 6 σ = 12、n = 9 → X̄ の標準偏差 = 12/3 = 4、分散 = 144/9 = 16

母平均の推定 ― 95% 信頼区間

X̄ が正規分布に従い、95% は μ ± 1.96σ/√n に入る。裏返せば

例 7 σ = 20、n = 100 → 幅 k = 1.96 × 20/10 = 3.92。「母平均は x̄ ± 3.92 の範囲にある(95% の信頼度で)」

n を 4 倍にすると幅は半分になる(√n が 2 倍)。

練習してみよう

  1. B(50, 0.1) の E(X) → 5
  2. B(40, 0.5) の V(X) → 40 × 0.5 × 0.5 = 10
  3. N(60, 15²) で X = 45 の z → −1
  4. σ = 10、n = 25 の標本平均の標準偏差 → 2
  5. E(X) = 4、V(X) = 3、Y = 2X + 5 → E(Y) = 13、V(Y) = 12
  6. σ = 30、n = 400 の 95% 信頼区間の幅 k → 1.96 × 30/20 = 2.94

よくある間違い

練習の前に

二項分布の期待値・分散、標準化、標本平均の分散・標準偏差、aX + b、期待値、信頼区間の幅が 20 問。小数・分数可。
「期待値は np、分散は np(1 − p)、標本平均のばらつきは σ/√n」を軸に。