※小説ではない※専門書 要約資料集 為替(換算)3.9万円でもらう 紐解集生成 専門 初入門 資料 作:{作者名}
> 学問の宇宙・生命の惑星群 第1章(続の続の続の続の続の続の続の続の続の続の続)。
> トーン規約: GAKUMON_UNIVERSE.md準拠。専門用語は初出で必ず説明する。
> 重要注記: 本冊は学問の読み物であり、**統計解析の手順書ではない**。実際の解析は、データの性質と研究設計に応じて、適切な専門知識のもとで行うものである。
> 数値注記: 本冊の数値は**考え方を示すための代表値**である。
> 第10冊は「誰を見るか」、第11冊は「なぜ外れるか」を扱った。本冊は**その数字をどう数えるか**を扱う。
> **語の衝突についての断り(二つ)**:
> 一. 「検定」は本シリーズが**読者検定**(独立した読み手が本を読めたかを確かめる仕組み)の意味で使っている。統計の意味では本冊で一貫して**統計的仮説検定**と書く。
> 二. **「ハザード」は第3冊に水準二で在るが、そこでの意味は「害を起こしうる性質そのもの」**(ハザード×曝露=リスク)である。生存時間解析のハザードは**まったく別の概念**(ある時点まで残った人が次の瞬間に結果を起こす率)なので、本冊では再定義せず**ハザード率**として立てる。
> **本冊は単独で読めるように書いてある。** 回帰・確率分布・記述統計の基礎は、他冊を参照させずに本冊の中で定義し直してある。式の一覧は巻末付録にまとめた。
----------------------------------------ΩΩΩ あっ流れ星!
# BOOK-0011l 衛生学 — その数字は何を言っていないのか 第12冊
> 学問の宇宙・生命の惑星群 第1章(続の続の続の続の続の続の続の続の続の続の続)。
> トーン規約: GAKUMON_UNIVERSE.md準拠。専門用語は初出で必ず説明する。
> 重要注記: 本冊は学問の読み物であり、**統計解析の手順書ではない**。実際の解析は、データの性質と研究設計に応じて、適切な専門知識のもとで行うものである。
> 数値注記: 本冊の数値は**考え方を示すための代表値**である。
> 第10冊は「誰を見るか」、第11冊は「なぜ外れるか」を扱った。本冊は**その数字をどう数えるか**を扱う。
> **語の衝突についての断り(二つ)**:
> 一. 「検定」は本シリーズが**読者検定**(独立した読み手が本を読めたかを確かめる仕組み)の意味で使っている。統計の意味では本冊で一貫して**統計的仮説検定**と書く。
> 二. **「ハザード」は第3冊に水準二で在るが、そこでの意味は「害を起こしうる性質そのもの」**(ハザード×曝露=リスク)である。生存時間解析のハザードは**まったく別の概念**(ある時点まで残った人が次の瞬間に結果を起こす率)なので、本冊では再定義せず**ハザード率**として立てる。
> **本冊は単独で読めるように書いてある。** 回帰・確率分布・記述統計の基礎は、他冊を参照させずに本冊の中で定義し直してある。式の一覧は巻末付録にまとめた。
---
## 入口の物語 — 「有意差あり」は、何も約束していない
ある新しい消毒剤の試験結果が出た。
> 「従来品と比べ、細菌数の減少に**統計的に有意な差**が認められました(p < 0.05)。」
商談の席でこれを聞いて、次のどれを言われたと思うだろうか。
```
① この消毒剤のほうが優れている確率が95%以上ある
② 差が無い確率が5%未満である
③ 差の大きさは、実務で意味のある大きさである
④ 同じ試験をやり直せば、95%の確率で同じ結論が出る
```
**四つとも違う。** そして四つとも、現場で日常的に言われている読み方である。
p < 0.05 が言っているのは、ずっと控えめなことである——**「本当は差が無いとしたら、これくらい離れたデータが出るのは5%未満の珍しさだ」。** 差の大きさについて何も言っていないし、この消毒剤が優れている確率についても何も言っていない。
> **統計は「この数字は何を言っているか」より、「この数字は何を言っていないか」を覚えるほうが役に立つ。**
第11冊は「数字が外れる理由」を並べた。**本冊は、外れていない数字さえ、読み方を間違えると意味が反転することを扱う。**
> **一. 一つの数で答えるのか、幅で答えるのか。** ——**点推定と区間推定**。
> **二. 「有意差あり」は何を言っていて、何を言っていないのか。** ——**統計的仮説検定とp値**。
> **三. 区間と検定は、どういう関係にあるのか。** ——**同じことを、違う情報量で言っている**。
> **四. 複数の要因を同時に扱うには。** ——**回帰**。
> **五. 追跡の途中で消えた人を、どう数式に入れるのか。** ——**生存時間解析**。
> **六. たくさん調べると、なぜ嘘が増えるのか。** ——**多重性**。
---
## 第一章: 一つの数か、幅か
### 二つの答え方
**点推定**(第6冊で定義済み)は、答えを**一つの数**で返す。「リスク比は2.1である」。
その対になるのが、**区間推定(くかんすいてい、interval estimation、水準三: 答えを一つの数ではなく、ありうる値の幅として返す方法)**である。「リスク比は1.4から3.2の間にある」。
> **第6冊の点推定は曝露評価の文脈だったが、考え方は同じである**——代表値を一つ当てるか、ばらつきを持たせるか。
> 本冊は疫学の指標について同じ対を使う。
区間推定の結果として出るのが**信頼区間**(第3冊で定義済み)である。
### 標準偏差と標準誤差を混同しない
区間の幅を決めるのは、**標準誤差**である。そしてこれは標準偏差とは別物である。まず標準偏差のほうを立てる。
**分散(ぶんさん、variance、水準二: 一つ一つの値が平均からどれだけ離れているかを二乗して平均した量)**。
**標準偏差(ひょうじゅんへんさ、standard deviation、水準二: 分散の平方根。値のばらつきを、もとの値と同じ単位で表した量)**。
```
分散 = Σ(値 − 平均)² ÷ 個数
標準偏差 = √分散
```
**なぜ平方根を取るのか。** 分散は二乗しているので単位が二乗になってしまう(身長のcmが cm² になる)。**平方根を取ると、もとの単位に戻る**ので「平均170cm・標準偏差6cm」と並べて書ける。二乗する理由は、後で扱う最小二乗法と同じ——**符号を消すため**である。
**標準誤差(ひょうじゅんごさ、standard error、水準四: 標本から計算した推定値そのものが、標本を取り直すたびにどれだけばらつくかを表す量)**。
```
標準偏差 … **一人一人がどれだけばらついているか**。集団の性質。人数を増やしても変わらない
標準誤差 … **計算した平均などがどれだけばらつくか**。推定の精度。**人数を増やすと小さくなる**
標準誤差 ≒ 標準偏差 ÷ √人数
```
**この√が効く。** 検算する。
```
標準偏差 20、人数 100 のとき 標準誤差 = 20 ÷ 10 = 2.0
人数を 400 に増やすと 標準誤差 = 20 ÷ 20 = 1.0
人数を 1,600 に増やすと 標準誤差 = 20 ÷ 40 = 0.5
```
> **区間の幅を半分にするには、人数を4倍にする必要がある。** 精度は人数に比例せず、**平方根に比例する。**
> だから「あと少し精度を上げたい」は、たいてい「人数を何倍にもする」を意味する。
そして第11冊の話がここに戻ってくる——**人数を増やして小さくなるのは標準誤差だけである。** 系統誤差は動かない。
### なぜ √人数 なのか
上の式に平方根が現れる理由は、一つの定理から来ている。その定理を述べるには、まず分布の形に名前が要る。
**正規分布(せいきぶんぷ、normal distribution、水準五: 平均を中心に左右対称の釣鐘の形に散らばり、平均から離れるほど急に少なくなる、ばらつきの型)**。
身長や測定誤差のように、**多くの小さな要因が足し合わさってできる量**は、この形に近づくことが知られている。この分布は、**平均と標準偏差の二つの数だけで形が完全に決まる**という性質を持ち、そのために扱いやすい。
```
平均 ± 1標準偏差 の範囲に 約68%
平均 ± 2標準偏差 の範囲に 約95%
平均 ± 3標準偏差 の範囲に 約99.7%
```
**中心極限定理(ちゅうしんきょくげんていり、central limit theorem、水準六: もとのデータがどんな形に散らばっていても、そこから取った標本の平均は、人数が増えるにつれて正規分布に近づく、という定理)**。
**これは驚くべきことを言っている。** もとの分布が左に寄っていても、二つの山を持っていても、**「そこから100人取って平均する」を繰り返せば、その平均たちは釣鐘型に並ぶ。** しかも、その釣鐘の広がり(標準誤差)は、**もとの標準偏差を √人数 で割った値**になる——**ここから √ が出てくる。**
**これが効くから、区間推定は形を問わずに使える。** 血液検査値が左右対称でなくても、**その平均の分布は正規分布に近づく**ので、「平均 ± 1.96 × 標準誤差」という同じ形の式で95%の区間が作れる。
```
95%信頼区間 ≒ 推定値 ± 1.96 × 標準誤差
```
**1.96 という数は、正規分布の中央95%が入る範囲の端**である。区間の式を暗記するより、**「推定値のばらつき(標準誤差)を約2倍した幅」**と覚えておけば実務では足りる。
> **注意が一つ。** 中心極限定理が効くのは**平均や合計**についてであって、**一人一人の値については何も言っていない。**
> 「検査値は正規分布する」と言い切ってよいかは、別に確かめる必要がある。
### 平均が代表になれないとき
区間推定の前に、**そもそも代表値として平均でよいのか**という問いがある。
**中央値(ちゅうおうち、median、水準二: 値を小さい順に並べたとき、ちょうど真ん中に来る値)**。
**外れ値(はずれち、outlier、水準三: 他の値から極端に離れている値)**。
**平均(へいきん、mean、水準一: すべての値を足して個数で割った値)**は外れ値に大きく動かされ、中央値はほとんど動かない。検算する。
```
五人の年収(万円): 300, 350, 400, 420, 450
平均 = 1,920 ÷ 5 = **384** / 中央値 = **400**
一人だけ入れ替える: 300, 350, 400, 420, **10,000**
平均 = 11,470 ÷ 5 = **2,294** / 中央値 = **400**
```
**平均は6倍に跳ね、中央値は動かない。** 所得・入院日数・待ち時間のように片側に長く裾を引く量では、**平均を代表値にすると誰も経験していない値になる。**
> **外れ値は「捨てるもの」ではない。** 測り間違いなら直すが、本物なら**その値が出ること自体が情報である**。
> 捨てるかどうかは、データを見る前に決めた規則で決める(第10冊の「いつ決めるか」)。
### 信頼区間の読み方を間違えない
95%信頼区間について、いちばん多い誤読を先に潰す。
> **「真の値がこの区間に入る確率が95%」ではない。**
>
> 正しくは——**「同じやり方で研究を何度も繰り返したとき、そうして作った区間のうち95%が真の値を含む」。**
> 真の値は一つに決まっていて動かない。動くのは区間のほうである。
実務上の読み方としては、次の三つを見れば足りる。
```
一. 区間の幅 … 狭ければ精度が高い。広ければ「よく分からない」
二. 区間の位置 … どのあたりの値がありえるのか
三. 区間が「関連なし」の値(比なら1.0、差なら0)を挟んでいるか
```
**三つ目が、次章の統計的仮説検定と同じことを言っている。**
---
## 第二章: 統計的仮説検定 — 何を言っていて、何を言っていないか
### 仕組みは「とりあえず差が無いと仮定する」
**統計的仮説検定(とうけいてきかせつけんてい、statistical hypothesis testing、水準四: あらかじめ「差が無い」と仮定したうえで、手元のデータがその仮定のもとでどれくらい珍しいかを計算し、珍しすぎるなら仮定を捨てる手続き)**。
**帰無仮説(きむかせつ、null hypothesis、水準四: 「差が無い」「関連が無い」とする、否定されるために置かれる仮定)**。
**対立仮説(たいりつかせつ、alternative hypothesis、水準四: 帰無仮説が否定されたときに残る、「差が有る」とする仮定)**。
**有意水準(ゆういすいじゅん、significance level、水準四: 帰無仮説が本当は正しいのに捨ててしまうことを、どれくらいの確率まで許すかを、あらかじめ決めた値)**。
そして**p値(ピーち、p-value、水準四: 帰無仮説が正しいと仮定したときに、手元のデータと同じかそれ以上に極端な結果が出る確率)**。
### p値が言っていない四つのこと
入口の四択に戻る。**p = 0.04 が言っていないことを、順に潰す。**
```
✗ 「差が有る確率が96%」 … p値は仮説の確率ではない。データの珍しさである
✗ 「差が無い確率が4%」 … 同じ誤り。向きが逆になっているだけ
✗ 「差が大きい」 … p値は差の大きさを一切表さない
✗ 「やり直せば96%で同じ結論」 … 再現の確率でもない
```
> **p値は「仮定を置いたときのデータの珍しさ」であって、「仮定の正しさ」ではない。**
> この二つは**確率の向きが逆**である——p値は「仮説が正しいとしたらデータはどれくらい珍しいか」、
> 知りたいのは「データが出たとして仮説はどれくらい正しいか」。**後者を出すには事前確率が要る**(第13冊で扱う)。
### なぜ差の大きさを表さないのか — 検算
**p値は、差の大きさと人数の両方で動く。** だから同じp値が、まったく違う状況から出る。
```
■ 差は小さいが人数が多い
10,000人ずつ / 発症率 5.0% 対 5.6%(差 0.6ポイント) → p ≒ 0.04 **有意**
■ 差は大きいが人数が少ない
30人ずつ / 発症率 10% 対 30%(差 20ポイント) → p ≒ 0.06 **有意でない**
```
**上は実務的にほとんど意味のない差で「有意」、下は3倍の差で「有意でない」。**
> **「有意」は「大きい」ではない。** 人数が十分なら、どんなに小さな差でも有意になる。
> 逆に——**「有意でない」は「差が無い」ではない。** 人数が足りなければ、大きな差でも有意にならない。
この非対称を言い切る。
> **統計的仮説検定は「差が無い」ことを示せない。** 示せるのは「差が有るとは言えなかった」だけである。
> 第9冊で立てた**通/落/測れず**の三分で言えば、有意でない結果は**落ちではなく測れず**にあたることが多い。
### では、何を使って計算するのか
ここまで「統計的仮説検定」と抽象的に書いてきたが、**実際の場面では使う道具に名前がある。** 疫学で出会うものを並べる。
| 比べたいもの | よく使う道具 | 何を見ているか |
|---|---|---|
| 二群の**平均** | **t検定** | 平均の差を、ばらつきと人数で割った値 |
| 二群以上の**割合** | **カイ二乗検定** | 観察された件数と、期待される件数の離れ方 |
| 割合(件数が少ない) | **フィッシャーの正確検定** | すべての並び方を数え上げた確率 |
| 三群以上の平均 | **分散分析** | 群の間のばらつきと、群の中のばらつきの比 |
| 生存時間の曲線 | **ログランク検定**(第五章) | 曲線の全体の離れ方 |
**t検定(ティーけんてい、t-test、水準四: 二つの群の平均の差が、偶然のばらつきで説明できる範囲かを調べる統計的仮説検定)**。
**カイ二乗検定(カイにじょうけんてい、chi-squared test、水準四: 観察された件数が、帰無仮説のもとで期待される件数からどれだけ離れているかを調べる統計的仮説検定)**。
**フィッシャーの正確検定(Fisher's exact test、水準五: 件数が少ないときに、近似を使わず、ありうる並び方をすべて数え上げて確率を求める検定)**。
**分散分析(ぶんさんぶんせき、analysis of variance、ANOVA、水準五: 三つ以上の群の平均を、群の間のばらつきと群の中のばらつきの比で比べる方法)**。
> **「どの検定を使うか」は、データの形(平均か割合か・群の数・件数の多さ)で決まる。**
> そして**どれを使っても、第二章で述べたp値の限界は同じである。** 道具が変わっても、
> 「有意は大きいではない」「有意でないは差が無いではない」は変わらない。
### 独立性という、見落とされる仮定
**ほとんどの検定は、一人一人のデータが互いに独立であることを前提にしている。** そしてこの前提は、疫学の場面でしばしば破れる。
**独立性の仮定(どくりつせいのかてい、assumption of independence、水準五: 一人の観測値が、別の人の観測値と関係していないという前提)**。
破れる場面を並べる。
```
同じ人を前後で測った … 前の値と後の値は当然関係している
同じ世帯・同じ学校の人 … 生活も感染も共有している(第10冊のクラスター無作為化)
同じ医師が診た患者 … 診断の癖が共通して入る
同じ人の左右の目・両膝 … 一人から二つのデータを取っている
```
**前提が破れると、人数を実際より多く数えたことになり、区間が狭すぎ、p値が小さすぎる値になる。**
> **「1,000人分のデータ」が、実際には「100世帯分」の情報しか持っていないことがある。**
> 対策は、対応のあるデータ用の検定を使うか、集団の単位で解析するか、混合効果のモデルに入れることである。
**対応のあるデータ(たいおうのあるデータ、paired data、水準四: 同じ対象について二つ以上の測定が組になっているデータ)**には、対になっていることを使う検定がある(**対応のあるt検定**など)。**組を無視して独立な二群として扱うと、検出力を無駄に捨てる**——同じ人の中で比べるほうが、個人差が消えるので差が見えやすい。
### 二種類の間違え方
**第一種の過誤(だいいっしゅのかご、type I error、水準四: 本当は差が無いのに、有ると判定してしまう間違い)**。
**第二種の過誤(だいにしゅのかご、type II error、水準四: 本当は差が有るのに、無いと判定してしまう間違い)**。
**検出力**(第10冊で定義済み)は、第二種の過誤を起こさない確率、つまり **1 − 第二種の過誤の確率**である。
```
本当は差が有る 本当は差が無い
有意と判定 正しい(検出力) **第一種の過誤**(確率 = 有意水準)
有意でないと判定 **第二種の過誤** 正しい
```
**この表は第3冊の感度・特異度の表と同じ形をしている。** 有意水準を厳しくすれば第一種の過誤は減るが第二種の過誤は増える——**感度と特異度のトレードオフとまったく同じ構造**で、第13冊でその同型性を正面から扱う。
---
## 第三章: 区間と検定は同じことを言っている
### 対応関係
第一章の「区間が1.0を挟むか」と、第二章の「p < 0.05か」は、**同じ判定である。**
```
95%信頼区間が 1.0 を含まない ⟺ p < 0.05
95%信頼区間が 1.0 を含む ⟺ p ≥ 0.05
```
**だから片方を見れば、もう片方も分かる。** ならば、どちらを見るべきか。
### 区間のほうが情報が多い
三つの研究を並べる。**どれもp ≥ 0.05で「有意でない」。**
```
研究A リスク比 1.05 95%信頼区間 0.98 〜 1.12 → 関連は**無いか、あっても小さい**
研究B リスク比 2.40 95%信頼区間 0.85 〜 6.80 → **何も分からない**(3倍も8倍もありうる)
研究C リスク比 1.00 95%信頼区間 0.30 〜 3.30 → **何も分からない**(1/3も3倍もありうる)
```
**「有意でない」という一語では、この三つが区別できない。**
研究Aは「関連は無いか、あっても小さい」という**情報のある結論**である。研究BとCは「人数が足りない」と言っているにすぎない。
> **p値は三つを同じ棚に入れ、区間は三つを分ける。**
> 商談でも査読でも、**「有意でした/有意ではありませんでした」しか出てこないなら、区間を訊く。**
### 区間が広い理由は二つある
区間が広いとき、原因は二つに分かれる。
```
人数が少ない → 増やせば狭くなる(標準誤差が √人数 で縮む)
ばらつきが大きい → 測り方を細かくすれば狭くなることがある
```
**前者は費用の問題、後者は測定の問題である。** どちらなのかは、標準誤差の式(標準偏差 ÷ √人数)のどちらが大きいかで分かる。
---
## 第四章: 回帰 — 複数の要因を同時に扱う
### 関係を式にするということ
二つの量の間に関係がありそうだと分かったとき、**その関係を一本の式で書き表す**のが回帰である。
**回帰分析(かいきぶんせき、regression analysis、水準四: ある量の値から別の量の値を予測する式を、データに最もよく当てはまるように決める方法)**。
「回帰」という語は、身長の高い親から生まれた子の身長が**親ほどは高くならず、平均のほうへ戻っていく**現象を19世紀に記述したときの言葉(regression = 戻ること)に由来し、その後、方法の名前として定着した。**語の由来と、いま指している方法の中身は、ほとんど関係がない**——名前だけが残った例である。
**回帰直線(かいきちょくせん、regression line、水準四: 回帰分析で求めた式が一次式のとき、それを座標の上に引いた直線)**。
```
y = a + b x
a … 切片(x がゼロのときの y の値)
b … 傾き(x が1増えたときに y が変わる量)
```
### どうやって「最もよく当てはまる」を決めるのか
直線は無数に引けるので、**どれが最もよく当てはまるかを決める規則**が要る。
**残差(ざんさ、residual、水準三: 実際に観察された値と、式が予測した値との差)**。
**最小二乗法(さいしょうにじょうほう、least squares method、水準四: 残差をそれぞれ二乗して足し合わせ、その合計がいちばん小さくなるように式の係数を決める方法)**。
**なぜ二乗するのか。** 理由は二つある。
```
一. **符号を消すため** … 残差には正と負があり、そのまま足すと打ち消し合って常にゼロに近づく
二. **大きな外れを重く見るため** … 二乗すると、残差2の点は残差1の点の4倍の重みを持つ
```
**二つ目には副作用がある。** 外れ値が一つあると、直線がそちらへ大きく引っ張られる——第一章で見た平均と中央値の関係と、まったく同じ構造である。**最小二乗法は外れ値に弱い。**
### 当てはまりの良さを数で言う
**決定係数(けっていけいすう、coefficient of determination、R²、水準四: 目的変数のばらつきのうち、その式でどれだけ説明できたかを、0から1の間の値で表した指標)**。
```
決定係数 = 1 − (残差の二乗和 ÷ 全体のばらつきの二乗和)
1.0 … すべての点が直線の上にある
0.0 … その式は、平均を答えるのと同じ程度にしか当たっていない
```
**そして決定係数が高いことは、因果の証明ではない。** 第11冊の全体が、その注意に充てられている。
関連の強さを表す似た指標に**相関係数(そうかんけいすう、correlation coefficient、水準三: 二つの量が直線的にどれだけ揃って動くかを、−1 から +1 の間の値で表した指標)**があり、一次式の回帰では**決定係数は相関係数の二乗**になる。
### 式の外へ持ち出さない
**外挿(がいそう、extrapolation、水準四: データが存在する範囲の外側にまで、式をそのまま当てはめて予測すること)**。
**データが 20〜60歳の範囲しかないのに、その式で5歳や90歳を予測してはいけない。** 式は「観察した範囲でそう見えた」以上のことを言っていない。
> **第6冊で扱った用量反応関係にも同じ注意がある**——高用量で測った害を低用量へ直線で延ばしてよいかは、その物質に閾値があるかどうかで変わる。**外挿は、データではなく仮定に乗っている。**
### 説明する側が二つ以上あるとき
**重回帰分析(じゅうかいきぶんせき、multiple regression analysis、水準四: 説明する側の量を二つ以上同時に式へ入れて、それぞれの寄与を分けて推定する方法)**。
```
y = a + b₁x₁ + b₂x₂ + b₃x₃ + …
```
**これが第11冊の「多変量調整」の実体である。** 本冊が足すのは、**疫学で回帰を使うときに特有の部分**——係数の読み方、結果が0か1のときの形、そして交互作用項——である。
### 式の読み方
**説明変数(せつめいへんすう、explanatory variable、独立変数、水準三: 結果を説明する側として式に入れる変数)**と、**目的変数(もくてきへんすう、outcome variable、従属変数、水準三: 説明される側として式の左に置く変数)**。
**切片(せっぺん、intercept、水準三: 説明変数がすべてゼロのときの、目的変数の値)**。
**残差(ざんさ、residual、水準三: 実際の値と、式が予測した値との差)**。
疫学で重要なのは**係数の読み方**である。
```
血圧 = 110 + 0.4 × 年齢 + 3.2 × (塩分摂取が多い=1、少ない=0)
→ 「**年齢と塩分のうち一方を止めて**、もう一方を1単位動かしたときの変化」が係数である。
年齢が同じ人どうしで比べると、塩分が多い人は血圧が 3.2 高い。
```
**この「一方を止めて」が、第11冊の調整の数式版である。** 式に入れた変数は、その値をそろえた条件での比較になる。
### 結果が0か1かのときに要るもの
疫学の結果は「発症したか・していないか」の二値が多い。**そのまま直線を当てると壊れる**——予測値が0未満や1超になってしまう。
**ロジスティック回帰(logistic regression、水準五: 結果が二値のときに、その起こる確率を0から1の間に収まる形の式で表す回帰)**。
そして**この式から出てくる係数が、指数を取るとオッズ比になる。**
> **疫学の論文にオッズ比が大量に出てくる理由の一つがこれである。** 第10冊で「ケースコントロール研究は分母が無いからオッズ比」と書いたが、**もう一つの理由は、調整した値を出す道具がオッズ比を返すから**である。
>
> だから第10冊の注意がそのまま生きる——**よくある結果では、オッズ比を「何倍」と読み替えると言い過ぎる**(リスク0.50対0.25でリスク比2.0がオッズ比3.0になった)。
### 交互作用項
第11冊の**効果修飾**を、式で表すこともできる。
**交互作用項(こうごさようこう、interaction term、水準五: 二つの説明変数を掛け合わせた項を式に足して、一方の効果が他方の値によって変わることを表したもの)**。
```
発症 = … + a × 薬 + b × 高齢 + **c × 薬 × 高齢**
→ c が 0 でなければ、薬の効果が年齢によって違う(効果修飾がある)
```
**ただし第11冊の注意が重い。** 効果修飾は**尺度によって現れ方が変わる**ので、「交互作用項が有意でなかった」は「効果修飾が無い」を意味しない——**比の尺度で無くても差の尺度で有ることがある。** さらに交互作用項の検定は検出力が低いので、**無いのではなく見えていないことが多い。**
### 式に入れれば調整されるわけではない
**第11冊のいちばん重い注意を、ここで繰り返す。**
> **中間変数や合流点を式に入れると、答えは歪む。**
> 手元にある変数を全部入れるのは「調整」ではなく、**絵を描かずに変数を混ぜる行為**である。
>
> **調整した変数の一覧は、絵の記録として読む。** 一覧に曝露より後のものが混じっていないか——第11冊の問い四十を、式を見たときに使う。
---
## 第五章: 生存時間解析 — 消えた人を数式に入れる
### 何を扱う道具なのか
第10冊で**打ち切り**を立てたが、扱う道具を渡していなかった。それがこれである。
**生存時間解析(せいぞんじかんかいせき、survival analysis、水準四: 結果が起きるまでの時間を扱い、途中で観察が終わった人も、終わるまでの情報を使って解析する方法)**。
「生存」という語だが、**死亡に限らない**——退院まで、再発まで、機械の故障まで、どれでも同じ道具が使える(第9冊の MTBF はこの一族である)。
**扱えることが二つある。**
```
一. **いつ起きたか**を使える … 1年で起きたのと5年で起きたのを区別する
二. **打ち切り**を捨てない … 3年観察できたなら、その3年は使う
```
単純に「5年後に生きていた割合」を数えると、**3年で脱落した人をどう扱うかで答えが変わる。** 生存時間解析はここを正面から扱う。
### 積み上げて描く
**カプランマイヤー法(Kaplan-Meier method、水準五: 結果が起きた時点ごとに「その時点まで残っていた人のうち、そこを生き延びた割合」を計算し、それらを掛け合わせて生存確率の推移を描く方法)**。
**要点は、掛け算であることと、分母がその時点の人数であること**である。検算する。
```
100人から始める。
1年目: 5人に結果が起きた。それまで観察できたのは100人
その年を越えた割合 = (100 − 5) ÷ 100 = 0.950
→ 累積生存確率 0.950
2年目: 10人が打ち切り(脱落)。残り 100 − 5 − 10 = 85人
85人中4人に結果が起きた
その年を越えた割合 = (85 − 4) ÷ 85 = 0.953
→ 累積生存確率 0.950 × 0.953 = **0.905**
3年目: 残り 81人中3人に結果
(81 − 3) ÷ 81 = 0.963
→ 累積生存確率 0.905 × 0.963 = **0.872**
```
**打ち切られた10人は、2年目の分母には入っているが、3年目の分母からは外れている。** 「観察できたところまでは使い、その先は使わない」が、掛け算の形で自然に実現している。
**カプランマイヤー曲線は階段状になる。** 結果が起きた時点だけ下がり、打ち切りの時点では下がらない(ただし以後の分母が減る)。
### 二本の曲線を比べる
**ログランク検定(log-rank test、水準五: 二つ以上の群のカプランマイヤー曲線の全体が、同じと言えるかを調べる統計的仮説検定)**。
**曲線の全体を比べるのが要点である。** 「5年後の生存率」だけを比べると、途中の形の違いが消える——**早く効くが後で追いつかれる治療と、遅く効く治療が、同じ点数になる。**
### 率そのものを比べる
**ハザード率(hazard rate、水準五: ある時点まで結果が起きていない人が、次のごく短い時間の間に結果を起こす率)**。
> **第3冊の「ハザード」(害を起こしうる性質そのもの)とは、まったく別の概念である。**
> 同じ札を二つの意味で使わないため、本冊では**ハザード率**と呼ぶ。第3冊のハザードは性質、こちらは率である。
**ハザード比(hazard ratio、水準五: 二つの群のハザード率の比)**。
**コックス比例ハザード回帰(Cox proportional hazards regression、水準六: 生存時間を目的変数とし、複数の説明変数で調整したハザード比を推定する回帰)**。
これが**生存時間解析の重回帰版**である。打ち切りを扱いながら、第11冊の交絡を調整できる。
### 仮定が一つ乗っている
コックス回帰には、名前に入っている仮定がある。
**比例ハザードの仮定(proportional hazards assumption、水準六: 二つの群のハザード率の比が、時間を通じてほぼ一定であるという前提)**。
**この仮定が破れる典型は、曲線が交差する場合である。**
```
手術と薬を比べる例
時間 →
手術群: 最初は死亡が多い(手術そのものの危険) → 後半は少ない
薬 群: 最初は少ない → 後半は多い
→ 曲線が交差する。**ハザード比は前半で1より大きく、後半で1より小さい。**
「ハザード比 0.9」という一つの数は、**この状況について何も言っていない。**
```
> **一つの数にまとめる道具は、まとめてよい形であることを先に確かめる必要がある。**
> これは第11冊の効果修飾と同じ話である——**層ごとに違うものを、一つの値にまとめてはいけない。**
> こちらは層ではなく**時間**で違っている。
---
## 第六章: 多重性 — たくさん調べると嘘が増える
### 第10冊の計算を引き直す
第10冊で計算した。有意水準5%で無関係な指標を20個測ると、**少なくとも1個で偶然の差が出る確率は約64%**である。
**多重比較(たじゅうひかく、multiple comparisons、水準四: 一つの研究の中で、統計的仮説検定を何度も繰り返すこと)**。
そして**繰り返す形は、指標の数だけではない。**
```
測る指標が多い … 20個の検査値
群の組み合わせが多い … 4群なら 4×3÷2 = 6通りの比較
部分集団が多い … 年齢別・性別・地域別…
時点が多い … 中間解析を繰り返す(第10冊)
```
**どれも同じ計算になる。** 4群の比較なら6回、そこに3つの指標なら18回——**20回に近づく。**
### 補正する
**ボンフェローニ補正(Bonferroni correction、水準五: 検定の回数で有意水準を割ることで、全体として第一種の過誤が起きる確率を抑える方法)**。
```
20回検定するなら、各回の有意水準を 0.05 ÷ 20 = **0.0025** にする
→ 全体で少なくとも1回誤る確率 ≒ 1 − (1 − 0.0025)^20 ≒ **4.9%** … 約5%に収まる
```
**単純で確実だが、厳しすぎる。** 各回の基準が20倍厳しくなるので、**本当に有る差も見つけられなくなる**(第二種の過誤が増える)。
**偽発見率(ぎはっけんりつ、false discovery rate、FDR、水準六: 有意と判定したもののうち、実際には差が無かったものの割合)**。
「一度も誤らない」ことを目指すのをやめ、**「有意と言ったもののうち誤りが何割までなら許すか」で管理する**考え方である。遺伝子解析のように検定が何万回にもなる場面では、ボンフェローニでは何も見つからなくなるので、こちらが使われる。
### 補正すべきときと、すべきでないとき
**機械的に補正するのも間違いである。**
```
補正が要る … あらかじめ一つに決めていなかった指標を、いくつも調べて「当たり」を探した
補正が要らない … 主要アウトカムが一つに決まっており、それだけで結論を出す
補正では直らない … **事前登録がなく、後からアウトカムを差し替えた**(第10冊)
```
**三つ目が重要である。** ボンフェローニ補正は「20個測った」ことを補正できるが、**「20個測って1個だけ報告した」ことは補正できない**——報告されなかった19個が何個だったか、読む人には分からない。
> **多重性の本当の対策は、統計の補正ではなく、第10冊の事前登録である。**
> 補正は、**測った回数が分かっているとき**にだけ効く。
---
## 第七章: 数が足りているか
### 事前に計算する
**標本規模**(第10冊で定義済み)と**検出力**(第10冊で定義済み)は、**始める前に**計算する。
計算に要るものは四つである。
```
一. 有意水準 … ふつう 0.05
二. 欲しい検出力 … ふつう 0.80 か 0.90
三. 見込む差の大きさ … **ここがいちばん難しい**
四. 結果の起こりやすさ / ばらつき
```
三つ目を**効果量(こうかりょう、effect size、水準四: 見つけたい差の大きさを、測り方の単位に依らない形で表した量)**と呼ぶ。
**「どれくらいの差なら意味があるか」は統計が決めることではない。** 実務の判断である——1000人に2人減るのに意味があるかは、費用と重症度で決まる(第10冊の必要治療数)。
### 事後の検出力計算は意味がない
よくある誤りを一つ潰す。
> **「差が出なかったので、検出力を計算したら40%だった」——この計算はほとんど意味がない。**
理由は、**観察された差を使って検出力を計算すると、p値の言い換えにしかならない**からである。p > 0.05 なら事後の検出力は必ず50%を下回る。**新しい情報が一つも増えていない。**
**代わりに見るのは信頼区間である。** 第三章の研究AとBの違いがそれで、「区間の上端がどこか」が「どこまでの差なら否定できたか」を直接教えてくれる。
```
研究A 95%信頼区間 0.98 〜 1.12 → **1.12より大きい関連は否定できた**
研究B 95%信頼区間 0.85 〜 6.80 → **6.80までありうる。何も否定できていない**
```
> **「差が無かった」と書きたいなら、区間の端を示す。** それが「どこまで小さいと言えたか」の唯一の正直な表現である。
---
## 第七章の二: 欠けているデータをどう扱うか
### 捨てると偏る
第11冊で**脱落**を扱ったが、解析の側の話が残っている。
**欠測(けっそく、missing data、水準四: 測るはずだった値が、記録されていない状態)**。
いちばん素朴な扱いは、**欠測のある人を解析から外すこと**である。
**完全ケース解析(かんぜんケースかいせき、complete-case analysis、水準五: 必要な変数がすべてそろっている人だけを使って解析すること)**。
**多くの統計ソフトの既定がこれである。** そして**黙って起きる**——「1,000人のデータ」で解析したつもりが、実際には620人で計算されていることがある。
**問題は二つある。** 一つは人数が減って区間が広がること。**もう一つが重い**——第11冊の選択バイアスが、ここで入る。
```
欠測の理由が結果と無関係 → 人数が減るだけ。偏らない
欠測の理由が結果と関係している → **残った人だけの解析は偏る**
```
**具合が悪い人が検査に来なかった**なら、残った人は健康に寄る。**これは解析の段階で作られる選択バイアスである。**
### 埋める
**多重代入法(たじゅうだいにゅうほう、multiple imputation、水準六: 欠測値を、他の変数から予測した値で複数通りに埋め、それぞれで解析してから結果を統合する方法)**。
**「複数通り」が要点である。** 一通りだけ埋めると、**埋めた値を実際に測った値と同じ確かさで扱ってしまい、区間が狭すぎる値になる。** 複数通り作って結果のばらつきを足すことで、**「埋めた分の不確かさ」を区間に反映させる。**
> **ただし、どの方法も「欠測の理由」についての仮定に乗っている。**
> 埋める道具は、**測っていない理由を測ってはくれない。** 第11冊の未測定交絡と同じ構造である。
>
> **報告に要るのは、まず欠測の数と割合、次にその理由の見込み**である。
> 「解析対象 620名」とだけ書いて、元が1,000名だったことを書かない報告は、読む人から情報を隠している。
---
## 第七章の三: 複数の研究をまとめる
### 一本ではなく束で読む
一つの研究で結論が出ることは、めったにない。**複数の研究をまとめて読む道具がある。**
**系統的レビュー(けいとうてきレビュー、systematic review、水準五: あらかじめ決めた基準で文献を網羅的に探し、選び、評価してまとめる総説)**。
**メタアナリシス(meta-analysis、水準五: 複数の研究の結果を統計的に統合して、一つの推定値と区間を出す方法)**。
**この二つは別のものである。** 系統的レビューは**探し方と選び方の手続き**、メタアナリシスは**統合の計算**。統合しない系統的レビューもある。
**重み付けの原則が一つある。** 統合するとき、**人数の多い(標準誤差の小さい)研究を重く数える。** 一研究一票ではない。
### 束にしても消えないもの
**メタアナリシスは、偏りを消す道具ではない。**
> **同じ向きに偏った研究をいくつ集めても、偏りは平均されて消えない。むしろ区間が狭くなって、偏った値が確からしく見える。**
> これは第11冊第一章の**「偶然誤差が小さく系統誤差が大きい」状態**——的の④であり、いちばん危ない形である。
そして第10冊の**出版バイアス**がここで効く。差が出なかった研究が論文になっていなければ、**文献を網羅的に探しても、網羅できない。**
**異質性(いしつせい、heterogeneity、水準五: 統合しようとする研究の結果が、偶然のばらつき以上に互いに違っていること)**。
異質性が大きいときは、**第11冊の効果修飾と同じ判断になる**——まとめてよいのか、集団や条件で分けて報告すべきなのか。
```
異質性が小さい → 一つの値にまとめてよい
異質性が大きい → **なぜ違うのかを探すほうが、まとめるより価値がある**
(対象集団が違う? 用量が違う? 追跡期間が違う?)
```
**森プロット(もりプロット、forest plot、水準四: 各研究の推定値と信頼区間を横棒で並べ、統合した値を最下段に示す図)**は、この判断のために描かれる。**横棒が互いに重なっていなければ、異質性が目で見える。**
---
## 第八章: 商談と査読の席で何を訊くか
第11冊までで四十三になった問いに、五つを足す。
> **問い四十四: 「有意差あり」だけでなく、差の大きさと信頼区間はいくらか。** ——人数が十分なら、実務で意味のない差でも有意になる。
>
> **問い四十五: 「有意差なし」なら、信頼区間の端はどこか。** ——0.98〜1.12なら情報があるが、0.85〜6.80なら何も分かっていない。事後の検出力計算はp値の言い換えにすぎない。
>
> **問い四十六: 調整した変数の一覧を見せてもらえるか。** ——式に入れれば調整されるわけではない。曝露より後のものが混じっていないか(第11冊の問い四十)。
>
> **問い四十七: 何回検定したのか。主要アウトカムは事前に一つ決まっていたのか。** ——補正は測った回数が分かっているときだけ効く。報告されなかった検定は補正できない。
>
> **問い四十八: ハザード比が出ているなら、曲線は交差していないか。** ——交差しているなら、一つのハザード比はその状況について何も言っていない。
**商談の問いは、これで四十八になった。**
---
## 次に待っている風景 — 第13冊への矢印
本冊は数の扱いを与えた。区間と検定の関係、回帰、生存時間解析、多重性の始末。
**しかし第二章で、一つ借金を作った。**
「p値は『仮説が正しいとしたらデータはどれくらい珍しいか』であって、知りたいのは『データが出たとして仮説はどれくらい正しいか』である。**後者を出すには事前確率が要る**」——**この事前確率の話を、本冊は先送りにした。**
> **第13冊は「どう判断するか」を扱う。** ——第3冊・第10冊・第11冊で繰り返し出てきた感度・特異度・陽性的中率を、**尤度比とROC曲線**という形に組み直す。そして本冊の第二章で置いた借金、**事前確率から事後確率へ向かう計算**を正面から扱う。
>
> 第二章の「第一種・第二種の過誤の表は感度・特異度の表と同じ形をしている」という観察が、そこで**同型であることの説明**まで進む。
>
> **第14冊は「どう先を読むか」**——SIRモデル、基本再生産数と実効再生産数。第2冊で出した「集団免疫閾値 = 1 − 1/R₀」がどこから来た式なのかが分かる。
**あと二冊で、関門二(開発に入れる)が閉じる。**
---
## 章末: 数の道具の階段図
```
何が言えるようになるか ────────────────────────────────────────────
時間を扱える ┤ **生存時間解析** … 打ち切りを捨てず、いつ起きたかを使う。
│ カプランマイヤー・ログランク・コックス回帰。
│ **比例ハザードの仮定が破れたら一つの数にまとめない**
│ ▲
│ ハザード率(第3冊のハザードとは別概念)
│ ▲
複数を同時に ┤ **回帰** … 一方を止めて他方を動かす。
│ 二値の結果にはロジスティック回帰、係数の指数がオッズ比。
│ **式に入れれば調整されるわけではない**
│ ▲
│ 回帰分析・回帰直線・最小二乗法・決定係数・重回帰分析
│ ▲
幅で言える ┤ **区間推定** … 区間の幅・位置・1.0を挟むか。
│ **p値は三つの研究を同じ棚に入れ、区間は三つを分ける**
│ ▲
│ 標準誤差 = 標準偏差 ÷ √人数(**幅を半分にするには人数4倍**)
│ ▲
珍しさが言える┤ **統計的仮説検定** … 帰無仮説のもとでのデータの珍しさ。
│ **「有意」は「大きい」ではない。**
│ **「有意でない」は「差が無い」ではない**
│ ▲
数えるだけ ┤ **点推定** … 一つの数。安く速いが、ばらつきが見えない。
│ (第6冊で曝露評価の文脈で立てた語)
```
**横の広がり(同じ層にある姉妹の考え):**
```
二つの誤り : 第一種の過誤(無いのに有ると言う) ←(有意水準を動かすと逆に振れる)→ 第二種の過誤(有るのに無いと言う)
二つのばらつき: 標準偏差(一人一人の違い・人数で変わらない) ←→ 標準誤差(推定の精度・人数で縮む)
同じ判定 : 区間が1.0を挟むか ←(同値)→ p < 0.05 か ※ただし**情報量は区間のほうが多い**
多重性の対策: ボンフェローニ(一度も誤らない) ←→ 偽発見率(誤りが何割までなら許すか)
時間で違う : 比例ハザードが成り立つ(一つの比でよい) ←→ 交差する(一つの比は何も言わない)
```
**現在のフロンティア(年号つき):**
- **1900年前後**から整えられた統計的仮説検定の枠組みは、**「有意」という言葉の独り歩き**という副作用を生んだ。近年は主要な統計学の学術団体から**p値だけで結論を出さないよう促す声明**が出されており、区間と効果量を併記する作法が広がりつつある。
- **1958年** カプランとマイヤーの方法は、打ち切りを扱う標準として現在も使われている。**1972年**のコックス回帰がそこに調整を持ち込んだ。
- **偽発見率**の考え方は、遺伝子解析のように検定回数が何万にもなる場面から広がった。**「一度も誤らない」から「誤りの割合を管理する」への転換**である。
- フロンティアは**観察データから介入効果を推定する手法**で、回帰だけでは届かない。傾向スコアや操作変数といった道具がそこに入る——**第37冊(因果推論)**の領域である。
**次の一手 ─────▶** 第13冊(検査の統計)。本冊第二章が作った借金——**事前確率**——を返す冊である。
---
## 参照文献(定番教科書・一般書)
1. Rothman KJ, Greenland S, Lash TL, *Modern Epidemiology* — 区間推定と検定の対応、回帰の疫学的解釈、多重性の扱いの標準的記述。
2. Kirkwood BR, Sterne JAC, *Essential Medical Statistics* — 標準誤差・信頼区間・回帰・生存時間解析の入門的定番。
3. Hosmer DW, Lemeshow S, *Applied Logistic Regression* — ロジスティック回帰と係数の解釈(オッズ比との関係)の標準的記述。
4. Collett D, *Modelling Survival Data in Medical Research* — カプランマイヤー・ログランク・コックス回帰と比例ハザードの仮定の検討。
5. Kaplan EL, Meier P (1958) — 打ち切りを含む生存確率推定の原典的記述。
6. Cox DR (1972) — 比例ハザード回帰の原典的記述。
7. Benjamini Y, Hochberg Y, 偽発見率に関する方法論論文分野 — 多重性の管理を「誤りの割合」で行う考え方。
8. 統計学の主要学術団体によるp値に関する声明(2016年前後)— p値の解釈についての注意の整理。
9. Galton F (1886) — 平均への回帰の記述。「回帰」という語の由来。
---
(本冊子は現代学問宇宙図鑑シリーズ BOOK-0011l(衛生学 第12冊)。第10冊が設計、第11冊が偏りと交絡、本冊が数の扱いを扱う。次冊は BOOK-0011m(衛生学 第13冊: 検査の統計)を予定。GAKUMON_UNIVERSE.md 進捗台帳を参照。)
# BOOK-0011l 衛生学 — その数字は何を言っていないのか 第12冊