統計的な推測(二項分布・正規分布)― 一部から全体を「確率つきで」推定する
まず、身近なところから
「内閣支持率 45%(調査対象 2000 人)」。全国民に聞いたわけではないのに、なぜ言い切れる?
中 3 の標本調査は「だいたい同じ割合」で終わった。高校では どれくらいの誤差で 信頼できるかまで数で言う。そのために、確率変数・二項分布・正規分布を積み上げる。
確率変数と期待値・分散
さいころの目 X のように、確率に応じて値が決まる変数 を確率変数という。
| 値 | x₁ | x₂ | … |
|---|---|---|---|
| 確率 | p₁ | p₂ | … |
- 期待値(平均)E(X) = Σ xᵢ pᵢ(値 × 確率 の合計)
- 分散 V(X) = E(X²) − {E(X)}²、標準偏差 σ = √V(X)
例 1 X が 1、2、3 を確率 1/6、2/6、3/6 でとる → E(X) = (1 + 4 + 9)/6 = 7/3
変数の変換
Y = aX + b とすると E(Y) = aE(X) + b、V(Y) = a²V(X)(数I のデータの変換と同じ)。
例 2 E(X) = 5、V(X) = 2 のとき Y = 3X + 1 → E(Y) = 16、V(Y) = 18
二項分布 B(n, p)
確率 p のことがらを n 回独立にくり返し、起こる 回数 X の分布。P(X = k) = ₙCₖ pᵏ(1 − p)ⁿ⁻ᵏ(反復試行)。
例 3 さいころを 30 回投げて 1 が出る回数 → E = 30 × 1/6 = 5、V = 30 × 1/6 × 5/6 = 25/6
例 4 B(100, 0.2) → E = 20、V = 100 × 0.2 × 0.8 = 16
正規分布 N(μ, σ²)
身長・測定誤差など、多くの量は平均 μ を中心とした 左右対称の釣り鐘型 に分布する。
╭───╮
╱ ╲
╱ ╲
╱ ╲
────╱───┼─────┼─────┼───╲────
μ−2σ μ−σ μ μ+σ μ+2σ
└── 約 68% ──┘
└────── 約 95% ──────┘
標準化
どんな正規分布も z = (X − μ)/σ で平均 0、標準偏差 1 の 標準正規分布 N(0, 1) に直せる。確率は正規分布表で読む。
例 5 N(50, 10²) で X = 70 → z = (70 − 50)/10 = 2(平均より 2σ 上)
n が大きいとき、二項分布 B(n, p) は N(np, np(1 − p)) で近似できる。
標本平均の分布 ― 推定の土台
母平均 μ、母標準偏差 σ の母集団から大きさ n の標本をとって平均 X̄ を出す。X̄ は標本ごとにばらつくが
標本が大きいほど X̄ のばらつきは小さい(√n に反比例)。
例 6 σ = 12、n = 9 → X̄ の標準偏差 = 12/3 = 4、分散 = 144/9 = 16
母平均の推定 ― 95% 信頼区間
X̄ が正規分布に従い、95% は μ ± 1.96σ/√n に入る。裏返せば
例 7 σ = 20、n = 100 → 幅 k = 1.96 × 20/10 = 3.92。「母平均は x̄ ± 3.92 の範囲にある(95% の信頼度で)」
n を 4 倍にすると幅は半分になる(√n が 2 倍)。
練習してみよう
- B(50, 0.1) の E(X) → 5
- B(40, 0.5) の V(X) → 40 × 0.5 × 0.5 = 10
- N(60, 15²) で X = 45 の z → −1
- σ = 10、n = 25 の標本平均の標準偏差 → 2
- E(X) = 4、V(X) = 3、Y = 2X + 5 → E(Y) = 13、V(Y) = 12
- σ = 30、n = 400 の 95% 信頼区間の幅 k → 1.96 × 30/20 = 2.94
よくある間違い
- × V(aX + b) = aV(X) + b → 分散は a² 倍、b は無関係
- × 二項分布の分散を np にする → np(1 − p)
- × 標本平均の標準偏差を σ/n にする → σ/√n
- × 標準化で (X − μ)/σ² とする → わるのは σ(標準偏差)
練習の前に
二項分布の期待値・分散、標準化、標本平均の分散・標準偏差、aX + b、期待値、信頼区間の幅が 20 問。小数・分数可。
「期待値は np、分散は np(1 − p)、標本平均のばらつきは σ/√n」を軸に。