※小説ではない※専門書 要約資料集 為替(換算)3.9万円でもらう 紐解集生成 専門 初入門 資料 作:{作者名}
> 学問の宇宙・形式科学の恒星群 数学冠・派生第2巻。ガイド役: Fable 5 監修 / Sonnet 5 執筆(脚本班)
> トーン規約: GAKUMON_UNIVERSE.md準拠。専門用語は初出で必ず説明する。
> 読書系統: 前提=第1巻(BOOK-0083『確率論 前半』)。第1巻で学んだ「同様に確からしい」「余事象」「独立性」「加法・乗法定理」「期待値」「大数の法則」を土台として、本冊はその先——条件付き確率、確率変数の分布、正規分布、中心極限定理、ポアソン分布、ランダムウォーク、モンテカルロ法——へ進む。
> 重要な断り書き: 本冊も第1巻と同様、賭博を推奨するものではない。期待値がマイナスに設計されたゲームは、長期的には胴元側が得をする構造になっているという事実を、感覚ではなく計算によって確認する道具として確率論を扱う。
> 接続先: 他の書物への詳細な参照は行わない(第1巻BOOK-0083のみへの接続とする)。統計学・離散数学・確率過程論などの周辺分野は、題名として言及するに留める。
> 水準: 五〜六。条件付き確率とベイズの定理、確率変数と分布、二項分布から正規分布への収束、大数の法則の精密化と中心極限定理、ポアソン分布、ランダムウォーク、モンテカルロ法を扱う「後半」。
# BOOK-0124 確率論 後半 — 「不確実性を測る」ための数学(数学派生 第2巻)
> 学問の宇宙・形式科学の恒星群 数学冠・派生第2巻。ガイド役: Fable 5 監修 / Sonnet 5 執筆(脚本班)
> トーン規約: GAKUMON_UNIVERSE.md準拠。専門用語は初出で必ず説明する。
> 読書系統: 前提=第1巻(BOOK-0083『確率論 前半』)。第1巻で学んだ「同様に確からしい」「余事象」「独立性」「加法・乗法定理」「期待値」「大数の法則」を土台として、本冊はその先——条件付き確率、確率変数の分布、正規分布、中心極限定理、ポアソン分布、ランダムウォーク、モンテカルロ法——へ進む。
> 重要な断り書き: 本冊も第1巻と同様、賭博を推奨するものではない。期待値がマイナスに設計されたゲームは、長期的には胴元側が得をする構造になっているという事実を、感覚ではなく計算によって確認する道具として確率論を扱う。
> 接続先: 他の書物への詳細な参照は行わない(第1巻BOOK-0083のみへの接続とする)。統計学・離散数学・確率過程論などの周辺分野は、題名として言及するに留める。
> 水準: 五〜六。条件付き確率とベイズの定理、確率変数と分布、二項分布から正規分布への収束、大数の法則の精密化と中心極限定理、ポアソン分布、ランダムウォーク、モンテカルロ法を扱う「後半」。
---
## 入口の物語 — 望遠鏡の倍率を上げる
第1巻では、確率という現象を肉眼で観察した。サイコロの目、コインの裏表、くじの損得——これらは目に見える大きさの現象であり、「同様に確からしい」という前提と、足し算・掛け算という素朴な道具立てだけで十分に扱うことができた。
本冊では、その望遠鏡の倍率を上げる。たとえば、こういう問いを考えてみよう。ある病気の検査で「陽性」という結果が出たとき、実際にその病気にかかっている確率はどれくらいだろうか。直感的には「検査の精度が99%なら、陽性が出た人の99%は本当に病気だろう」と考えたくなる。しかし後で詳しく検算するように、この直感は大きく外れることがある。答えを大きく左右するのは、検査の精度だけではなく、「そもそもその病気にかかっている人がどれくらい珍しいか」という情報である。この「後から得た情報によって確率の見積もりを更新する」という技術こそが、本冊の第一の主役——**ベイズの定理**——である。
もう一つ、比喩を続けよう。コインを1回投げるだけなら表か裏かの2択で終わる。しかしコインを100回投げて表が出た回数を数えるとどうなるか。この「回数」は`{1,2,3,4,5,6}`のような単純な標本空間には収まらない。0回から100回までの101通りの値を取り、値ごとに起こりやすさが違う——山型の分布を描く。この「値ごとの起こりやすさの模様」を扱う理論が、本冊で扱う**確率変数**と**確率分布**である。
この山型の分布を突き詰めていくと、驚くべき事実に行き着く。コイン投げの表の回数だけでなく、身長のばらつき、測定誤差、株価の変動、テストの点数——「多数の小さな要因が積み重なって決まる量」であれば、その分布はほぼ例外なく同じ形——**正規分布**——に近づいていく。なぜこれほど多様な現象が同じ形に収束するのか。この謎を解く鍵が、本冊のもう一つの主役である**中心極限定理**である。
```
第1巻(望遠鏡・低倍率): 個々の事象を数え、確率を定義する
第2巻(望遠鏡・高倍率): 情報が来るたびに確率を更新し(ベイズ)、
多数回の試行の"模様"を分布として捉え(確率変数)、
あらゆる分布が正規分布へ収束する謎を追う(中心極限定理)
```
本冊では、条件付き確率とベイズの定理から始め、確率変数・期待値・分散という道具を整え、二項分布が正規分布へ姿を変える様子を歴史的に確認し、中心極限定理へ進む。さらにポアソン分布、ランダムウォーク、モンテカルロ法まで、確率論の後半戦を一気に旅する。
---
## 第一章: 条件付き確率とベイズの定理 — 情報が来るたびに確率は変わる(水準五)
### 条件付き確率とは何か
第1巻では、独立な事象——一方が起きても他方の確率が変わらない関係——を扱った。しかし現実の多くの場面では、事象同士は独立ではない。「ある情報がわかった後で、別の事象の確率がどう変わるか」を扱う道具が、**条件付き確率(じょうけんつきかくりつ、水準五: 事象Bが起こったという情報がすでにわかっている前提のもとで、事象Aが起こる確率。P(A|B)と書く)**である。
条件付き確率は次の式で定義される。
```
P(A|B) = P(A∩B) ÷ P(B) (ただしP(B) > 0)
(A∩Bは「AかつB」、つまり両方が同時に起こる事象を表す。第1巻・加法定理で登場した記号と同じもの)
```
この式の意味を確認しよう。「Bが起こった」とわかった時点で、関心の対象は標本空間全体ではなく「Bが起こった場合」に絞り込まれる。その絞り込まれた世界の中で、Aも同時に起こっている割合を求めるのが`P(A|B)`である。
**検算1**: トランプ52枚から1枚引く。「引いたカードがハートである」事象をA、「引いたカードが絵札(J・Q・K)である」事象をBとする。`P(B) = 12/52`(絵札は各スート3枚×4スート=12枚)。「ハートかつ絵札」の事象`A∩B`は、ハートのJ・Q・Kの3枚なので`P(A∩B) = 3/52`。よって`P(A|B) = (3/52) ÷ (12/52) = 3/12 = 1/4`。これは「絵札12枚のうち、ハートの絵札は3枚」という直接数えた割合とも一致する。
### ベイズの定理 — 確率をひっくり返す
条件付き確率の式`P(A|B) = P(A∩B) ÷ P(B)`を少し変形すると、`P(A∩B) = P(A|B) × P(B)`が得られる。同様に`P(B∩A) = P(B|A) × P(A)`も成り立つ(`A∩B`と`B∩A`は同じ事象なので、これらは等しい)。この二つの式を組み合わせると、次の関係が導かれる。
```
P(A|B) × P(B) = P(B|A) × P(A)
→ P(A|B) = P(B|A) × P(A) ÷ P(B)
```
この式が、**ベイズの定理(ベイズのていり、水準五: ある結果Bが観測されたという条件のもとで、その原因となりうる事象Aが起こっていた確率P(A|B)を、逆向きの条件付き確率P(B|A)(原因Aのもとで結果Bが起こる確率)から計算し直すための定理。18世紀のイギリスの牧師トーマス・ベイズに由来する)**である。
ベイズの定理の値打ちは、「求めたい向きの条件付き確率が直接測れないとき、測りやすい"逆向き"の確率から計算できる」点にある。次の検算で威力を確かめよう。
### 検算2(本冊の核心): 希少疾患検査のパラドックス
ある病気の検査を考える。この病気の**有病率(ゆうびょうりつ、水準五: ある集団の中で、実際にその病気にかかっている人の割合)**は`0.1%`(1000人に1人)とする。検査の**感度(かんど、水準五: 実際に病気にかかっている人を、検査が正しく「陽性」と判定する確率)**は`99%`、**偽陽性率(ぎようせいりつ、水準五: 実際には病気にかかっていない人を、検査が誤って「陽性」と判定してしまう確率)**は`1%`とする。
さて、ある人の検査結果が「陽性」だったとき、この人が実際に病気にかかっている確率はどれくらいだろうか。直感的には「感度99%だから99%くらいでは」と考えがちだが、実際に計算してみよう。人数を具体的に置いて**分割表(ぶんかつひょう、水準五: 二つ以上の分類基準によって全体をいくつかの区画に分け、それぞれの人数や個数を表にまとめたもの)**で検算するのがもっとも見通しがよい。
10万人の集団を考える。有病率`0.1%`なので、病気にかかっている人は`100,000 × 0.001 = 100人`、かかっていない人は`99,900人`である。
```
検査の分割表(10万人)
| 実際に病気(100人) | 実際は健康(99,900人) | 合計
─────────────────────────────────────────────────────────
検査: 陽性 | 100×0.99 = 99人 | 99,900×0.01 = 999人 | 1,098人
検査: 陰性 | 100×0.01 = 1人 | 99,900×0.99=98,901人| 98,902人
─────────────────────────────────────────────────────────
合計 | 100人 | 99,900人 | 100,000人
```
表の「検査: 陽性」の行を見よう。陽性と判定された人は合計`99 + 999 = 1,098人`である。このうち実際に病気にかかっている人は`99人`だけであり、残りの`999人`は健康なのに誤って陽性と判定された人(偽陽性)である。
```
P(病気 | 陽性) = 99 ÷ 1,098 ≈ 0.0902(約9.0%)
```
つまり、感度99%という高精度の検査であっても、陽性と判定された人が実際に病気にかかっている確率(**陽性的中率(ようせいてきちゅうりつ、水準五: 検査で陽性と判定された人のうち、実際にその病気にかかっている人の割合。PPV, Positive Predictive Valueとも呼ばれる)**)は、わずか**約9%**にしかならない。「陽性=ほぼ病気」という直感は、この病気のように有病率が極端に低い場合には大きく外れるのである。
これをベイズの定理の式で確認しておこう。`A`=「病気にかかっている」、`B`=「検査が陽性」とする。`P(A) = 0.001`(有病率)、`P(B|A) = 0.99`(感度)。`P(B)`(検査が陽性になる確率、全体)は、病気の人が陽性になる場合と、健康な人が誤って陽性になる場合の和になる。
```
P(B) = P(B|A)×P(A) + P(B|¬A)×P(¬A)
= 0.99×0.001 + 0.01×0.999
= 0.00099 + 0.00999
= 0.01098
P(A|B) = P(B|A)×P(A) ÷ P(B)
= (0.99×0.001) ÷ 0.01098
= 0.00099 ÷ 0.01098
≈ 0.0902(約9.0%)
```
分割表による計算とベイズの定理の式による計算が、ぴったり一致した(`約9.0%`)。このパラドックスの核心は、健康な人の母数(99,900人)が病気の人の母数(100人)に比べて圧倒的に大きいため、わずか1%の偽陽性率でも、偽陽性の絶対数(999人)が真陽性の絶対数(99人)を上回ってしまう、という点にある。
```
直感:「感度99%だから陽性ならほぼ病気だろう」
実際:陽性者1,098人のうち病気は99人のみ → 陽性的中率 約9%
→ 理由: 健康な人の数(99,900人)が病気の人の数(100人)よりずっと多いため、
わずか1%の偽陽性率でも、絶対数では真陽性を上回ってしまう
```
この事実は医療統計の分野でよく知られており、医療現場では一度の陽性だけで確定診断とせず、より精密な**再検査(二次検査)**を行って偽陽性を絞り込む手順が広く採られている——これもベイズの定理の応用である。
### ベイズ更新という考え方
ベイズの定理のもう一つの見方は、「事前の確率を、新しい証拠によって事後の確率へ更新する」という手続きとして捉えることである。検算2で使った`P(A) = 0.001`(有病率)は、検査を受ける前の段階での確率という意味で**事前確率(じぜんかくりつ、水準五: 新しい情報・証拠を得る前の時点での、ある事象の確率の見積もり)**と呼ばれ、検査結果(陽性)という証拠を得た後の`P(A|B) ≈ 0.09`は**事後確率(じごかくりつ、水準五: 新しい情報・証拠を得た後で更新された、ある事象の確率の見積もり)**と呼ばれる。この「証拠が来るたびに確率を更新していく」という考え方は、迷惑メールを自動判定するフィルタや天気予報の的中率評価など、現代の情報処理の広い分野で使われている基本原理である。
---
## 第二章: 確率変数・期待値・分散・標準偏差 — 分布という"模様"を測る道具(水準五)
### 確率変数とは何か
第1巻では、「サイコロの目」や「コインの表裏」という具体的な結果そのものを扱ってきた。本章からは、それらの結果に数値を対応させる**確率変数(かくりつへんすう、水準五: 試行の結果に応じて、ある数値を対応させる規則。結果ごとにどの数値が対応するかは決まっているが、どの結果が起こるかは偶然によって決まるため、確率変数の値も偶然によって定まる)**という考え方を導入する。
たとえばサイコロを1回振る試行で、「出た目の数」をそのまま確率変数`X`とすれば、`X`は`1`から`6`までの値をそれぞれ`1/6`の確率で取る。コインを3回投げて「表が出た回数」を確率変数`Y`とすれば、`Y`は`0, 1, 2, 3`のいずれかの値を取る(この対応関係の一覧を**確率分布(かくりつぶんぷ、水準五: 確率変数が取りうるそれぞれの値と、その値が起こる確率との対応関係の全体)**と呼ぶ)。
### 期待値の一般化
第1巻の第五章で「くじの賞金の期待値」を計算した。確率変数`X`の**期待値(きたいち、水準五: 確率変数が取りうるすべての値に、それぞれの確率を掛けて合計した値。記号E(X)で表す。第1巻で扱ったくじの期待値の計算を一般の確率変数に拡張したもの)**は、あの計算を一般化したものであり、次の式で定義される。
```
E(X) = Σ(xᵢ × P(X = xᵢ))
(xᵢは確率変数Xが取りうるそれぞれの値、P(X=xᵢ)はその値が起こる確率)
```
**検算3**: コインを3回投げて表が出た回数を`X`とする。標本空間は`{HHH,HHT,HTH,HTT,THH,THT,TTH,TTT}`の8通り(第1巻・積の法則により`2×2×2=8`)。`X=0`(TTTのみ)は`1/8`、`X=1`(HTT・THT・TTHの3通り)は`3/8`、`X=2`(HHT・HTH・THHの3通り)は`3/8`、`X=3`(HHHのみ)は`1/8`。
```
E(X) = 0×(1/8) + 1×(3/8) + 2×(3/8) + 3×(1/8)
= 0 + 3/8 + 6/8 + 3/8
= 12/8 = 1.5
```
期待値`1.5`は「コインを3回投げれば平均して1.5回表が出る」ことを意味する。コイン1回あたり表が出る確率が`1/2`なので、3回で`3 × 1/2 = 1.5回`という値は自然に納得できる。
### 分散と標準偏差 — 「ばらつき」を測る
期待値は分布の"中心"を教えてくれるが、分布の"広がり方"(ばらつき)は教えてくれない。「必ず1.5が出るくじ」と「0か3が半々の確率で出るくじ」は期待値が同じでもばらつき方はまったく違う。このばらつきを数値化する道具が**分散(ぶんさん、水準五: 確率変数の値が期待値からどれだけ離れているかを、その差の2乗の期待値として測った量。記号V(X)またはσ²で表す)**である。
```
V(X) = E((X - E(X))²)
= Σ((xᵢ - E(X))² × P(X = xᵢ))
```
分散は「差の2乗」を使うため単位が元の確率変数の2乗になってしまう(身長がcm単位なら分散はcm²単位)という扱いにくさがある。そこで分散の正の平方根を取ったものを**標準偏差(ひょうじゅんへんさ、水準五: 分散の正の平方根。確率変数と同じ単位でばらつきの大きさを表せるようにした量。記号σ(シグマ)で表す)**と呼び、実務ではこちらがよく使われる。
```
標準偏差 σ = √V(X)
```
**検算4**: 検算3のコイン3回投げ(`E(X)=1.5`)の分散を計算しよう。
```
V(X) = (0-1.5)²×(1/8) + (1-1.5)²×(3/8) + (2-1.5)²×(3/8) + (3-1.5)²×(1/8)
= 2.25×(1/8) + 0.25×(3/8) + 0.25×(3/8) + 2.25×(1/8)
= 0.28125 + 0.09375 + 0.09375 + 0.28125
= 0.75
標準偏差 σ = √0.75 ≈ 0.866
```
分散`0.75`、標準偏差**約0.866**が得られた。この標準偏差は、「表の出る回数が、平均(1.5回)からどれくらいばらつくのが典型的か」の目安を与える数値である。次章では、この分散・標準偏差が正規分布を特徴づける決定的な役割を果たすことを見ていく。
```
休憩(用語の整理):
期待値 E(X) = 分布の"重心"(平均的にどこに落ち着くか)
分散 V(X) = 期待値からのばらつきの大きさ(2乗した単位)
標準偏差 σ = 分散の平方根(元の単位に戻したばらつきの大きさ)
```
---
## 第三章: 二項分布から正規分布へ — ド・モアブル=ラプラスの発見と68-95-99.7則(水準五)
### 二項分布とは
第二章のコイン3回投げで登場した「表が出た回数」の分布は、より一般的な形として**二項分布(にこうぶんぷ、水準五: 成功確率がpである独立な試行をn回繰り返したとき、成功した回数が従う確率分布。記号B(n, p)で表す)**と呼ばれる。成功回数が`k`回になる確率は次の式で与えられる。
```
P(X = k) = C(n,k) × p^k × (1-p)^(n-k)
(C(n,k)は「n個からk個を選ぶ組合せの数」。→BOOK-0077『離散数学』で扱う組合せの数え方そのものである)
```
二項分布の期待値と分散には、次の簡潔な公式が知られている(導出は本冊では概略に留める)。
```
E(X) = n × p
V(X) = n × p × (1-p)
```
**検算5**: 検算3・4のコイン3回投げは、`n=3, p=1/2`の二項分布`B(3, 1/2)`にほかならない。公式で検算すると`E(X) = 3×(1/2) = 1.5`、`V(X) = 3×(1/2)×(1/2) = 0.75`となり、検算3・4で地道に計算した値(期待値1.5、分散0.75)とぴったり一致する。この一致は、二項分布の公式が正しいことを裏付けている。
### 試行回数を増やすと何が起こるか
ここで、コインを投げる回数`n`をどんどん増やしていくとどうなるか考えてみよう。`n`が大きくなるにつれ、二項分布の"形"がどう変わっていくかを、確率の棒グラフ(ヒストグラム)として概略的に描いてみる。
```
n=4(コイン4回投げ、表の回数の分布・概形)
確率
0.375| ■
0.250| ■ ■ ■
0.125| ■ ■ ■ ■ ■
└────0────1────2────3────4──→ 表の回数
(山型で、中央のk=2付近がもっとも高い)
n=20(コイン20回投げ、表の回数の分布・概形)
確率
| ▄▄▄██▄▄▄
| ▄▄▄████████▄▄▄
| ▄▄████████████████▄▄
└───0────5───10───15───20──→ 表の回数
(n=4よりもさらに滑らかな山型・釣鐘型に近づく)
```
`n`が小さいうちはカクカクした棒グラフだが、`n`を増やすほど、この山型はなめらかな釣鐘型の曲線に近づいていく。この事実を数学的に厳密な形で示したのが、フランス生まれの数学者**アブラーム・ド・モアブル(Abraham de Moivre、1667年 - 1754年)**である。ド・モアブルは**1733年**、二項分布において試行回数`n`が大きいとき、確率の分布がある特定のなめらかな曲線で近似できることを示した。この曲線こそが、後に**正規分布(せいきぶんぷ、水準五: 平均を中心に左右対称の釣鐘型をした、連続的な確率分布。多くの自然現象や測定誤差の分布として現れることから「正規」の名がついた。ガウス分布とも呼ばれる)**と呼ばれるようになる分布である。
その後**ピエール=シモン・ラプラス(第1巻・第七章で確率論の体系化者として登場した人物)**が、この結果をより一般的な形に拡張し、二項分布が正規分布へ近づくことを厳密に証明した(**1812年**の著作『確率の解析的理論』に収録)。この業績により、二項分布が正規分布に収束するこの定理は、**ド・モアブル=ラプラスの定理(ド・モアブル=ラプラスのていり、水準五: 二項分布B(n,p)において試行回数nが十分大きいとき、分布の形が正規分布によって近似できるという定理。中心極限定理の特別な場合にあたる、正規分布の歴史上最初期の発見)**と呼ばれている。
### 正規分布の式と68-95-99.7則
正規分布は、平均`μ`(ミュー)と標準偏差`σ`(シグマ、第二章で導入)という二つの値だけで形が完全に決まる分布である。数式そのものは複雑な指数関数を含むため本冊では概略に留めるが、重要なのは次の経験則である。
**68-95-99.7則(ろくはち-きゅうご-きゅうきゅうてんななそく、水準五: 正規分布に従うデータにおいて、平均から標準偏差1個分の範囲に全体の約68%、標準偏差2個分の範囲に約95%、標準偏差3個分の範囲に約99.7%のデータが収まるという経験則)**は、正規分布の"広がり方"を直感的に理解するための強力な目安である。
```
正規分布の断面図(概形)とσ(標準偏差)の範囲
___----------___
___/ \___
_/ \_
_/ \_
/ \
─┴────┬────┬────┬────┬────┬────┬────┴─→
μ-3σ μ-2σ μ-σ μ μ+σ μ+2σ μ+3σ
|←────────── 約68%(μ-σ 〜 μ+σ) ──────────→|
|←──────────────── 約95%(μ-2σ 〜 μ+2σ) ────────────────→|
|←──────────────────────── 約99.7%(μ-3σ 〜 μ+3σ) ────────────────────────→|
```
**検算6**: あるテストの得点が平均`μ=60点`、標準偏差`σ=10点`の正規分布に従うとしよう。68-95-99.7則を使うと、得点が`50点〜70点`(`μ-σ`から`μ+σ`)の範囲に入る受験者はおよそ`68%`、`40点〜80点`(`μ-2σ`から`μ+2σ`)ならおよそ`95%`、`30点〜90点`(`μ-3σ`から`μ+3σ`)ならおよそ`99.7%`と直ちに読み取れる——つまり30点未満または90点超という極端な得点を取る人は、全体のわずか`0.3%`程度しかいない。
68-95-99.7則は、品質管理・テストの偏差値設計・株式や為替の変動幅の目安づけなど、幅広い実務で使われる基本の物差しである。
---
## 第四章: 大数の法則(ベルヌーイ)と中心極限定理 — なぜ正規分布は遍在するのか(水準五〜六)
### 大数の法則の精密化
第1巻・第六章では、大数の法則を「回数を重ねるほど割合が確率に近づく」という直感的なレベルで紹介した。この法則を最初に厳密な形で証明したのが**ヤコブ・ベルヌーイ(第1巻・第七章で紹介した人物、1654年-1705年)**であり、死後出版の『推測法』(1713年)に収められている。ベルヌーイが証明した形は、現在**大数の弱法則(たいすうのじゃくほうそく、水準六: 試行回数nを限りなく大きくしたとき、観測された割合(標本平均)が真の確率(期待値)に近い値をとる確率が、限りなく1に近づいていくという定理)**と呼ばれる。
ここで重要な注意を一つ加えておこう。大数の法則が保証するのは「割合が真の確率に近づいていく」ということだけであり、「どのくらいの速さで、どのくらいの散らばり方で近づいていくか」については何も語らない。この「近づき方の"模様"」を明らかにするのが、次に紹介する中心極限定理である。
### 中心極限定理 — あらゆる合計が正規分布に近づく
**中心極限定理(ちゅうしんきょくげんていり、水準六: 平均・分散が一定であるような独立な確率変数を非常に多く足し合わせたとき、その合計(または平均)の分布が、もとの確率変数がどんな分布であっても、試行回数を増やすにつれて正規分布に近づいていくという定理)**は、確率論全体の中でもっとも驚くべき定理の一つに数えられている。
前章のド・モアブル=ラプラスの定理は、「コイン投げ(二項分布)という特定の状況」での収束を示したものだった。中心極限定理はこれを一般化し、「元になる確率変数の分布がどんな形であっても構わない」という点が本質である。一様に散らばった分布でも、極端に偏った分布でも、それらを独立に多数回足し合わせた"合計"(あるいは"平均")は、もとの分布の形によらず必ず正規分布に近づいていく。
```
中心極限定理のイメージ
元の分布(何でもよい): 一様分布・偏った分布・二項分布…
↓ 独立に大量に足し合わせる
合計(または平均)の分布: 形によらず、必ず正規分布に近づく
```
**検算7(概略)**: サイコロを1個振ったときの目の分布は、`{1,2,3,4,5,6}`のどの目も`1/6`という、山型でも何でもない「一様な」分布である。しかし、このサイコロを例えば`n=30`個同時に振って目の合計を求める試行を多数回繰り返すと、その"合計"の分布は、元の一様な分布とはまったく違う、正規分布に近い山型を描くようになることが知られている。厳密な数値計算は本冊では概略に留めるが、この現象自体が中心極限定理の具体例として広く紹介されている。
### なぜ正規分布はこれほど遍在するのか
中心極限定理は、「なぜ身長・測定誤差・テストの点数など、一見バラバラな現象がどれも同じ正規分布の形に従うのか」という謎への答えを与える。身長を例に取れば、最終的な身長は、遺伝的な要因・栄養状態・幼少期の健康状態など、無数の小さな要因が独立に積み重なった結果として決まると考えられる。こうした「多数の独立な小さな要因の合計」として説明できる量は、個々の要因がどんな分布であっても、全体としてはほぼ正規分布に従う——これが正規分布の遍在する理由として広く説明されている。測定機器の誤差も同様の構造を持つ。ラプラスが天文観測の誤差評価に確率論を応用した(第1巻・第七章)という史実も、この背景と結びついている。
**注意点**: 中心極限定理が成り立つには、「足し合わせる確率変数が独立であること」「個々の分散が有限であること」などの条件が必要であり、すべての現象が無条件に正規分布に従うわけではない(極端な外れ値を頻繁に生む分布では前提が崩れることが知られている)。
---
## 第五章: ポアソン分布 — 稀な事象を数える物差し(水準六)
### ポアソン分布とは
二項分布は「成功か失敗か」という試行を`n`回繰り返す状況を扱った。しかし現実には、「一定の時間内・範囲内に稀な出来事が何回起こるか」を数えたい場面が多くある——1時間あたりの電話の着信件数などである。このような状況を扱う分布が、**ポアソン分布(ポアソンぶんぷ、水準六: 一定の時間・空間の範囲内で、平均してλ(ラムダ)回起こることがわかっている稀な事象が、実際にちょうどk回起こる確率を表す確率分布。フランスの数学者シメオン・ドニ・ポアソンに由来する)**である。ポアソン分布の確率は次の式で与えられる。
```
P(X = k) = (λ^k × e^(-λ)) ÷ k!
(λは単位あたりの平均発生回数、kは実際に起こった回数、
eはネイピア数(約2.71828…)、k!はkの階乗)
```
ポアソン分布は、二項分布において試行回数`n`を大きくしつつ成功確率`p`を小さくし、積`n×p`を一定の値`λ`に保った極限として導かれることが知られている。
### ボルトキエヴィチの馬蹴り兵士データ(1898年)
ポアソン分布の実例として歴史上もっとも有名なものの一つが、ロシア生まれの経済学者・統計学者**ラディスラウス・ボルトキエヴィチ(Ladislaus Bortkiewicz、1868年 - 1931年)**が**1898年**に発表した、プロイセン陸軍の**馬に蹴られて死亡した兵士**のデータである。
ボルトキエヴィチは、プロイセン陸軍の14個の騎兵隊について、20年間の「1年間に馬に蹴られて死亡した兵士の数」を記録した資料を分析した。これは稀な出来事が多数の兵士の中でそれぞれ独立に低い確率で起こる状況であり、ポアソン分布が当てはまるかを検証する題材として取り上げられた。
分析の結果、実際に観測された「1年間の死亡者数の分布」は、ポアソン分布の理論値ときわめてよく一致することが確認されたとされる。この逸話は、稀な事象の統計学における古典的な実例として、現在も統計学の教科書でしばしば紹介されている。
**検算8**: ポアソン分布の使い方を、架空の数値で確認しておこう。あるコールセンターに1時間あたり平均`λ=3件`の緊急電話がかかってくるとする。この1時間に緊急電話が**ちょうど0件**である確率を計算する。
```
P(X=0) = (3^0 × e^(-3)) ÷ 0!
= (1 × e^(-3)) ÷ 1
= e^(-3)
≈ 0.0498(約5.0%)
```
平均3件の電話が予想される1時間でも、実際には1件も電話が来ない確率が約5%ある。この計算は、コールセンターの人員配置や稀な故障の発生頻度を見積もる場面などで実務的に使われる考え方である。
```
休憩(分布の使い分け):
二項分布 → 「成功/失敗」をn回繰り返した"成功回数"を数える(第三章)
正規分布 → 多数の要因の合計・平均がどんな形に落ち着くか(第三・四章)
ポアソン分布 → 一定範囲内で稀な事象が"何回"起こるかを数える(本章)
```
---
## 第六章: ランダムウォーク — 酔歩の先にあるもの(水準六)
### ランダムウォークとは
**ランダムウォーク(らんだむうぉーく、水準六: ある地点から出発し、各時刻ごとに一定の確率でランダムに位置を変えていく確率過程。日本語では「酔歩(すいほ)」とも訳される、酔っぱらいの千鳥足の動きにたとえられることに由来する)**は、時間とともに変化する確率的な現象を扱う入り口として、確率論の中でも特に応用が広いテーマである。
もっとも単純な形——**1次元ランダムウォーク**——を考えよう。数直線上の原点`0`から出発し、1ステップごとにコインを投げて、表が出れば`+1`、裏が出れば`-1`だけ位置を動かす。`n`ステップ後の位置を確率変数として扱うと、これは「表の回数から裏の回数を引いたもの」に相当し、第三章の二項分布と深く関係している。
```
1次元ランダムウォークの一例(10ステップ、表=+1・裏=-1)
ステップ: 0 1 2 3 4 5 6 7 8 9 10
コイン: 表 表 裏 表 裏 裏 表 表 裏 表
位置: 0 1 2 1 2 1 0 1 2 1 2
位置の推移(概形):
2| ● ● ● ●
1| ● ● ● ● ●
0|● ●
└──0──1──2──3──4──5──6──7──8──9──10→ ステップ数
```
### 原点回帰の性質(概略)
1次元ランダムウォークに関する古典的な結果として、「出発点(原点)に、確率1で(つまりほぼ確実に)いつかは戻ってくる」という性質が知られている。この性質は**原点回帰(げんてんかいき、水準六: ランダムウォークが出発点に、確率的にほぼ確実にいつか戻ってくるという性質。1次元・2次元では成り立つが、3次元以上では成り立たなくなることが知られている)**と呼ばれる。
この結果の厳密な証明には、無限級数の収束・発散を扱う高度な議論が必要となるため、本冊ではその存在を「概略」として紹介するにとどめる。直感的には、1次元の酔歩は「行きすぎたら戻ってくる」ような性質を持ちやすく、原点への回帰が保証される、という程度の理解で十分である。
この性質は次元を増やすと崩れる。2次元(平面上)でも原点回帰は成り立つが、3次元(立体空間)以上では原点に戻ってこない確率が正の値を持つようになる——つまり「戻ってこないことがありうる」。この「次元によって性質が劇的に変わる」事実は、ランダムウォークという単純な仕組みに豊かな数学が隠れていることを示す好例である。
### ランダムウォークの応用
ランダムウォークは、単なる数学的な遊びではなく、幅広い応用を持つ。花粉の粒子が水中で不規則に動く現象(ブラウン運動)の数理モデル、株価や為替レートの短期的な変動のモデル化など、「先が読めない変動」を扱う基礎モデルとして、自然科学・経済学・情報科学のさまざまな分野で使われている。次章のモンテカルロ法も、広い意味ではこれと同じ「乱数を使って複雑な問題を扱う」という発想を共有している。
---
## 第七章: モンテカルロ法入口 — 乱数で答えを掘り当てる(水準六)
### モンテカルロ法とは
**モンテカルロ法(もんてかるろほう、水準六: 乱数を用いた試行を大量に繰り返すことで、直接解くのが難しい数値計算の近似解を求める手法の総称。名称はモナコ公国のカジノで有名な地区「モンテカルロ」に由来する)**は、大数の法則(第1巻・第六章、本冊・第四章)を計算の"武器"として使う、確率論のもっとも実践的な応用の一つである。
大数の法則が保証するのは「試行回数を増やせば、観測された割合は真の確率に近づいていく」ということだった。モンテカルロ法はこの性質を逆手に取る。「答えを知りたい確率がある」→「対応する試行を乱数で大量に繰り返す」→「観測された割合から答えを近似的に求める」という手順である。
### 検算9: 円周率をモンテカルロ法で推定する
もっとも有名な例が、**円周率(π)をモンテカルロ法で推定する**方法である。一辺の長さが`2`の正方形の中に、半径`1`の円がぴったり内接しているとする(正方形の中心と円の中心を一致させる)。
```
円と正方形の配置(概形)
┌─────────────┐
│ ・・・・・ │ ← 正方形の面積 = 2×2 = 4
│ ・ ・ │
│ ・ ● ・ │ ← 円の面積 = π×1² = π
│ ・ ・ │
│ ・・・・・ │
└─────────────┘
```
この正方形の内部に、`(x座標, y座標)`をそれぞれ`-1`から`1`の範囲で一様ランダムに選んだ点を大量に打っていく。打った点が「円の内部」に入るかどうかは、原点からの距離が`1`以下かどうか、つまり`x² + y² ≤ 1`が成り立つかで判定できる。
大数の法則により、打った点の総数が非常に多くなれば、「円の内部に入った点の割合」は、「円の面積 ÷ 正方形の面積」という真の比率に近づいていく。
```
円の内部に入る点の割合 ≈ 円の面積 ÷ 正方形の面積 = π ÷ 4
→ π ≈ 4 × (円の内部に入った点の数 ÷ 打った点の総数)
```
**検算9(概略の数値例)**: たとえば`10,000`個の点を打った結果、そのうち`7,842個`が円の内部に入ったとしよう(理論値に近づくよう選んだ架空の例示的数値であり、実測値ではない)。この場合、円周率の推定値は次のようになる。
```
π の推定値 ≈ 4 × (7,842 ÷ 10,000) = 4 × 0.7842 = 3.1368
```
実際の円周率`π ≈ 3.14159…`と比べると、`10,000`個程度の試行でも小数点以下1桁程度まではそれなりに近い値が得られる(この例の誤差は`約0.005`)。試行回数をさらに増やせば増やすほど、大数の法則により推定値はより真の`π`に近づくと期待される——ただし収束の速さは試行回数の平方根に比例する程度であり、桁数を1桁増やすにはおよそ100倍の試行回数が必要になる(詳細は概略に留める)。
### 乱数で積分を近似する — モンテカルロ積分の考え方
円周率の推定は「関数の下の面積を求める」という、より一般的な問題(積分)の特別な場合である。この考え方を一般の関数に広げたものが**モンテカルロ積分(もんてかるろせきぶん、水準六: 積分——ある関数のグラフとx軸に挟まれた面積——を、乱数によるランダムな点の打ち込みから近似的に求める手法)**と呼ばれる。複雑な形や高次元の関数の面積・体積を解析的な方法で求めるのが困難な場合、モンテカルロ法は乱数を使った近似計算で実用的な答えを得る代替手段となる。天気予報のシミュレーション、金融商品のリスク評価など、現代の科学技術の幅広い場面で使われている。
---
## 三つの実践解 — 確率論の後半戦を日常で使う3法
理論を一通り積み上げたので、締めくくりとして、本冊で学んだ道具を日常生活で活かすための3つの実践解を、材料・工程・なぜ効くか・限界の四点セットで紹介する。
### 実践解1: 日常での確率見積もり術 — ベイズ的に「まず疑う」
- **材料**: 気になるニュースや検査結果、紙とペン(概算でよい)。
- **工程**: 衝撃的な一次情報に接したら、即座に信じ込む前に(1)母集団における発生率(有病率相当)、(2)判定方法の誤判定率(偽陽性率相当)の2つを概算する。第一章の分割表と同じ考え方で「本当に当たっている確率」を概算できる。
- **なぜ効くか**: 検算2で確認した通り、判定の精度が高くても対象が稀な出来事であれば的中率は驚くほど低くなりうる。母集団の分母を意識するだけで過剰反応を減らせる。
- **限界**: 正確なデータが手元にないと概算も粗くなる。桁数のオーダーを見誤らないための補正であり、厳密な診断の代わりにはならない。
### 実践解2: 68-95-99.7則で「普通」の範囲を即座に見積もる
- **材料**: 平均値と標準偏差(または、それに近い"ばらつきの目安")がわかっているデータ。
- **工程**: 気になる数値が「平均からどれだけ離れているか」を標準偏差の単位で数え、第三章の68-95-99.7則に当てはめる。1個分以内なら「よくある範囲(約68%)」、2個分以内なら「やや珍しい範囲(約95%)」、3個分超なら「かなり珍しい部類(0.3%未満)」という目安が即座に立てられる。
- **なぜ効くか**: 中心極限定理(第四章)により多くの自然現象は正規分布に近い形を取るため、68-95-99.7則は幅広いデータに"およそ"当てはまる汎用的な物差しとして機能する。
- **限界**: データの分布が正規分布から大きく外れている場合(極端な偏り・外れ値の多さ)には、そのままでは当てはまらない。
### 実践解3: モンテカルロ的発想で「複雑な判断」を数で割り切る
- **材料**: 選択肢が多く厳密な計算が大変な意思決定の場面、紙とペンまたは表計算ソフト。
- **工程**: 最適解を数式で求めようとせず、「ありうる条件の組み合わせ」を何十パターンか書き出し、それぞれの結果を概算して並べる。第七章のモンテカルロ法と同じ発想で、多数の試行の平均的な傾向から判断材料を得る。
- **なぜ効くか**: モンテカルロ法の核心は「厳密解が求めにくい問題でも、多数の試行の平均を取れば実用的な近似解が得られる」という点にある。完璧解を求めて立ち止まるより、現実的なパターンを数え上げて比較するほうが速く判断に到達できることが多い。
- **限界**: サンプリングするパターンが少なすぎると偏った例だけで判断する危険がある(検算9の通り、試行回数が少ないと誤差が大きい)。
---
## 休憩所(まとめ箱) — 後半戦の道具を振り返る
```
① 条件付き確率とベイズの定理: 新しい情報で確率を更新する。希少疾患検査は
感度99%でも有病率が低いと陽性的中率は約9%まで下がる(第一章)
② 確率変数・期待値・分散・標準偏差: 分布の"重心"(期待値)と"広がり"
(分散・標準偏差)を数値で測る(第二章)
③ 二項分布から正規分布へ: 試行回数を増やすと山型がなめらかな釣鐘型に
近づく(ド・モアブル=ラプラスの定理)。68-95-99.7則で広がりを読む(第三章)
④ 大数の法則(ベルヌーイ)と中心極限定理: あらゆる独立な和はもとの分布に
よらず正規分布に近づく——正規分布が遍在する理由(第四章)
⑤ ポアソン分布: 稀な事象が一定範囲内で何回起こるかを数える
(ボルトキエヴィチの馬蹴り兵士データ、1898年、第五章)
⑥ ランダムウォーク: 酔歩。1次元では原点回帰が(概略として)成り立つ(第六章)
⑦ モンテカルロ法: 乱数と大数の法則を使い、円周率の推定のように
直接解けない問題を近似的に解く(第七章)
```
---
## 出口の物語 — 望遠鏡を手にした旅人、次の惑星へ
第1巻で肉眼による観察から出発した旅は、本冊で望遠鏡の倍率を大きく上げることになった。条件付き確率とベイズの定理によって、「新しい情報が来るたびに確率の見積もりを更新する」という視点を手に入れた。希少疾患検査のパラドックスが教えてくれたのは、直感だけに頼ると、精度の高い検査でさえ的中率を見誤ってしまうという事実だった。
確率変数・期待値・分散という道具を手に、コイン投げの表の回数という題材から出発し、二項分布が試行回数を増やすにつれて正規分布へ姿を変えていく様子を、ド・モアブルとラプラスの発見としてたどった。そして中心極限定理——「元の分布が何であれ、独立な和は正規分布に近づく」——にまで到達した。これが、身長も測定誤差もテストの点数も、なぜ同じ釣鐘型の分布に従うのかという謎への答えだった。
稀な事象を数えるポアソン分布では、ボルトキエヴィチが1898年に示した馬に蹴られた兵士のデータに出会った。ランダムウォークでは次元によって性質が劇的に変わる数学を見た。そして最後に、モンテカルロ法という、乱数と大数の法則を組み合わせて円周率のような答えを"掘り当てる"技術にたどり着いた。
第1巻の出口で「感覚ではなく計算によって確かめる姿勢」こそが確率論の本質だと述べた。本冊で加わったのは、この姿勢に「新しい情報で更新し続ける」という時間の軸と、「多数の現象がどんな模様(分布)を描くか」という広がりの軸である。この二つの軸を手にした旅人は、これから訪れるどの惑星でも、不確実性という霧の中に隠れた秩序を、自分の手で計算し直し、掘り当てることができるはずである。
---
## 補章: 検算総覧(水準五〜六)
本冊で埋め込んだ検算を一覧にして振り返る。読者自身の手でもう一度なぞってみることを勧める。
1. 条件付き確率の基本: トランプ52枚から「絵札」という条件のもとで「ハート」である確率 → `1/4`。
2. 希少疾患検査のパラドックス(本冊の核心): 有病率0.1%・感度99%・偽陽性率1%のとき、陽性的中率 → 分割表・ベイズの定理いずれの計算でも`約9.0%`と一致。
3. 確率変数の期待値: コイン3回投げで表の出た回数の期待値 → `E(X)=1.5`。
4. 分散と標準偏差: 同じ分布の分散`V(X)=0.75`、標準偏差`σ≈0.866`。
5. 二項分布の公式検算: `B(3,1/2)`の公式`E(X)=np, V(X)=np(1-p)`が検算3・4の値と一致(期待値1.5・分散0.75)。
6. 68-95-99.7則: 平均60点・標準偏差10点のテストで、50〜70点に約68%、40〜80点に約95%、30〜90点に約99.7%。
7. 中心極限定理(概略): サイコロ複数個の目の合計は、元が一様分布でも正規分布に近づく。
8. ポアソン分布: 1時間平均3件の電話で、0件である確率 → `e^(-3)≈0.0498`(約5.0%)。
9. モンテカルロ法(概略の数値例): 10,000点中7,842点が円内 → `π`の推定値`3.1368`(実際の`π≈3.14159`との誤差約0.005)。
最後に、読者への小さな挑戦を残しておく。ある工場で1日あたり平均`λ=2個`の不良品が出るとする。この工場で、ある1日に不良品が**1個も出ない**確率をポアソン分布の式で求めてみてほしい。第五章の式`P(X=k)=(λ^k × e^(-λ)) ÷ k!`に`λ=2, k=0`を代入すると、`P(X=0) = (2^0 × e^(-2)) ÷ 0! = e^(-2) ≈ 0.1353`(約13.5%)となるはずである。検算8の`λ=3`の例と見比べ、`λ`が小さいほど「1件も起こらない確率」が高くなる関係を確かめてみてほしい。
# BOOK-0124 確率論 後半 — 「不確実性を測る」ための数学(数学派生 第2巻)