※小説ではない※専門書 要約資料集 為替(換算)3.9万円でもらう 紐解集生成 専門 初入門 資料   作:{作者名}

58 / 382
# BOOK-0026 回帰と統計 第1冊 — データの群れに線を引く

> 学問の宇宙・統計学惑星 第1章(水準一〜四)。ガイド役: Fable 5 監修 / Sonnet 5 執筆(脚本班)
> トーン規約: GAKUMON_UNIVERSE.md準拠。専門用語は初出で必ず説明する。

--- -------------------------------------
ΩΩΩ あっ流れ星! 


# BOOK-0026 回帰と統計 第1冊 — データの群れに線を引く

# BOOK-0026 回帰と統計 第1冊 — データの群れに線を引く

 

> 学問の宇宙・統計学惑星 第1章(水準一〜四)。ガイド役: Fable 5 監修 / Sonnet 5 執筆(脚本班)

> トーン規約: GAKUMON_UNIVERSE.md準拠。専門用語は初出で必ず説明する。

 

---

 

## 入口の物語 — 散らばった点の群れを前にして

 

学問の宇宙地図に、まだ輪郭のぼんやりした惑星がある。名前を**統計学(とうけいがく、水準一: 集めたデータの中から、ばらつきや傾向といった規則性を読み取る学問)**という。この惑星がほかの惑星と少し違うのは、住人たちが最初から「きれいな法則」を持っていないところだ。物理学の惑星には運動方程式という完成された地図があり、算術の恒星には九九という揺るがない早見表がある。だが統計学の惑星に降り立った旅人が最初に渡されるのは、ただの「点の群れ」でしかない。

 

たとえば、ある学級の生徒40人について、家庭学習の時間(横軸)とテストの得点(縦軸)を1人ずつ記録したとしよう。40個の点を紙の上に打っていくと、点はきれいな一本の線には並ばない。右上に散らばる点もあれば、左下にぽつんと外れた点もある。まるで夜空に散った星々のようだ。この「バラバラの点の群れ」を前にして、統計学という惑星の住人たちは、こう問いかける。「この散らばりの中に、何か法則めいた線を見出せないだろうか」。

 

この冊子は、その問いに答えるための最初の四段の階段(水準一〜四)を上る旅である。旅の道具立ては四つ。**平均とばらつきを数えること**、**グラフと散布図で群れの形を見ること**、**相関と因果を区別すること**、そして**最小二乗法という物差しで一本の線を引くこと**。これらはどれも、一見地味な技術に見える。しかし実際には、天文学者が惑星の軌道のずれから未知の惑星を予言し、遺伝学者が親子の身長の謎を解き、そして現代の機械学習が画像や文章を「予測」する営みの、すべての土台になっている技術群である。地味に見える道具ほど、実は宇宙の隅々まで届く光を放っている——それが統計学という惑星の面白さだ。

 

---

 

## 第一章: 群れを一つの数でつかまえる — 平均とばらつき

 

### 具体例から始めよう

 

先ほどの40人の学級で、テストの得点を1人ずつ読み上げていっても、学級全体の様子はなかなか頭に入らない。そこで人類が編み出した最初の裏技が**平均(へいきん、水準一: すべての値を足し合わせて、その個数で割った値。集団を代表する一つの数)**である。40人分の得点をすべて足し、40で割れば、「この学級はだいたい何点くらいの集団なのか」を一つの数で表せる。

 

平均は強力だが、それだけでは群れの姿を半分しか語っていない。たとえば平均点が同じ60点の二つの学級があったとしても、一方は全員がほぼ60点前後に集まっているかもしれず、もう一方は0点に近い生徒と100点近い生徒が半々かもしれない。この「散らばり具合」を数値にしたものが**分散(ぶんさん、水準二: それぞれの値が平均からどれだけ離れているかを、二乗して平均した量。散らばりの大きさを表す)**であり、分散の平方根(2乗する前の元の大きさに戻した値)を**標準偏差(ひょうじゅんへんさ、水準二: 分散の平方根であり、データの散らばりを元の単位に戻して表した目安)**と呼ぶ。

 

### なぜ「二乗してから平均する」のか

 

分散を作るとき、単に「平均からのずれ」をそのまま平均してしまうと、プラスのずれとマイナスのずれが打ち消し合い、常にゼロに近い値になってしまう。60点の生徒が平均より+10点、40点の生徒が平均より-10点なら、足すとゼロだ。この打ち消し合いを防ぐために、ずれを一度二乗してからプラスの値に揃え、それを平均する。これが分散の仕組みである。二乗するという操作は、この冊子全体を貫く重要な考え方の最初の顔合わせでもある。後の章で登場する「最小二乗法」も、まさにこの「二乗してから足し合わせる」という発想の延長線上にある。

 

### 度数分布表とヒストグラム

 

40人分の得点を、10点刻みの区間(0〜9点、10〜19点、……)に分けて、それぞれの区間に何人いるかを数えた表を**度数分布表(どすうぶんぷひょう、水準二: データをいくつかの区間に分け、各区間に含まれる個数〈度数〉を数えた表)**と呼ぶ。この表を棒グラフの形にしたものが**ヒストグラム(水準二: 度数分布表を柱状の棒グラフにしたもの。データの分布の形を目で見えるようにする)**である。ヒストグラムを描くと、得点が中央付近に山型に集まっているのか、両端に偏っているのか、二つの山があるのか、といった「群れの形」が一目でわかる。

 

### 休憩所 — ここまでのまとめ箱

 

ここまでの道具を整理しよう。平均は「群れ全体を代表する中心の位置」を教えてくれる一つの数であり、分散・標準偏差は「その中心からどれだけ散らばっているか」を教えてくれる一つの数である。度数分布表とヒストグラムは、その散らばりの「形」そのものを絵にして見せてくれる。この三つはセットで使うことで初めて、群れの姿がおおまかに立ち上がってくる。平均だけを見て「この学級は60点だ」と決めつけるのは、写真を1ピクセルだけ見て絵の内容を判断するようなものだ、と考えるとわかりやすい。

 

### 次への一歩

 

平均と分散は、あくまで「一つの変数(たとえばテストの得点だけ)」の群れを要約する道具だった。しかし冒頭の例では、「家庭学習の時間」と「テストの得点」という、二つの変数を同時に扱いたかった。二つの変数の関係を目で見えるようにする道具が、次章で扱う散布図である。

 

---

 

## 第二章: 群れの形を絵にする — 散布図とグラフの読み方

 

### 散布図という窓

 

「家庭学習の時間」を横軸(x軸)に、「テストの得点」を縦軸(y軸)に取り、生徒1人ごとに1つの点を打っていく。こうしてできる図を**散布図(さんぷず、水準二: 二つの変数の値の組を、それぞれ1つの点として平面上に打っていった図)**と呼ぶ。40人分の点を打ち終えると、右上に向かって点が集まる傾向(学習時間が長いほど得点も高い傾向)が、ぼんやりとした帯のように浮かび上がってくることがある。

 

散布図の値打ちは、数字の表では見えなかった「群れ全体の傾き」を、一枚の絵として直感的に見せてくれるところにある。第一章のヒストグラムが「一つの変数の分布の形」を見せる道具だったのに対し、散布図は「二つの変数の関係の形」を見せる道具だ、と対比すると理解しやすい。

 

### 傾向の強さを目で測る

 

散布図に打たれた点の並び方には、いくつかの典型的な形がある。点が右上がりの帯状にきっちり並んでいれば「強い右上がりの関係」、点が丸くぼんやりと広がっていれば「関係が弱い、あるいは無関係」、点が右下がりに並んでいれば「一方が増えるともう一方は減る関係」がありそうだ、と読み取れる。ただし、この「読み取り」はあくまで目分量であり、人によって「強そうだ」「弱そうだ」の感じ方にはブレが出る。この目分量を、誰が見ても同じ結果になる一つの数値に変換する方法が、次の第三章で扱う相関係数である。

 

### 目盛りに騙されないために

 

散布図を読むときにも、グラフ全般に共通する注意点がある。縦軸・横軸の**目盛り(めもり、水準一: グラフの軸に等間隔で刻まれた、数の大きさを示す印)**の取り方によって、同じデータでも「関係が強そうに見える図」と「関係が弱そうに見える図」を意図的に作り分けることができてしまう。軸の範囲を極端に狭く取れば、わずかな傾向でも急な坂に見える。統計を読む側は、必ず目盛りの数値そのものを確認する習慣を持つ必要がある。

 

### 休憩所 — ここまでのまとめ箱

 

散布図は、二つの変数のペアを点の集まりとして描き、その並び方から関係の有無やおおまかな向き(右上がり・右下がり・無関係)を読み取るための窓である。ただし、それはあくまで「見た目の印象」にとどまる。次の第三章では、この印象を「相関」という言葉で正確に定義し、さらに「相関があるからといって、一方が他方の原因だとは限らない」という、統計学でもっとも誤解されやすい落とし穴に光を当てる。

 

---

 

## 第三章: 相関と因果 — 似ているが同じではない二つの関係

 

### 相関係数という物差し

 

散布図で見た「点の並びの傾向」を、一つの数値で正確に表す道具が**相関係数(そうかんけいすう、水準三: 二つの変数がどれだけ直線的な関係で結びついているかを、-1から+1までの数値で表したもの)**である。相関係数が+1に近いほど「右上がりの強い直線的な関係」、-1に近いほど「右下がりの強い直線的な関係」、0に近いほど「直線的な関係はほとんどない」ことを示す。家庭学習の時間とテストの得点の相関係数が、たとえば+0.7だったとすれば、「かなり強い右上がりの関係がある」と読める。

 

相関係数には注意すべき性質が一つある。相関係数はあくまで「直線的な関係」の強さしか測れない、という点だ。点がきれいなU字型やS字型に並んでいるような、曲線的な強い関係があっても、相関係数はゼロに近い値を示すことがある。「相関係数がゼロに近い=何の関係もない」と即断してはいけない。これは第四章で回帰直線を扱う際にも関わってくる注意点である。

 

### 相関と因果の違い — この章でもっとも重要な一線

 

ここで、統計学を学ぶ上で必ず踏まえておくべき一線を引く。**相関(そうかん)があるからといって、因果(いんが、水準三: 一方の出来事が原因となって、もう一方の結果が引き起こされる関係)があるとは限らない**。これは統計学の入門でもっとも重要な警句のひとつであり、しばしば「相関は因果を意味しない(correlation does not imply causation)」という言い回しで語られる。

 

具体例で考えてみよう。夏場のある期間、「アイスクリームの売上」と「水の事故の件数」を毎日記録すると、両者にはかなり強い正の相関が現れることが知られている。しかし、アイスクリームを食べたことが水の事故の原因になっているわけではない。真の背景には「気温」という第三の要因があり、気温が上がるとアイスクリームの売上も、水遊びをする人の数(したがって事故の件数)も、どちらも同時に増える。この「見かけ上の相関を生み出しているが、直接測定されていない共通の背景要因」を**交絡因子(こうらくいんし、水準四: 二つの変数の両方に影響を与え、見かけ上の相関を生み出してしまう、隠れた第三の要因)**と呼ぶ。

 

### なぜこの区別が難しいのか

 

散布図や相関係数は「二つの変数が一緒に動いているかどうか」しか教えてくれない。「どちらが原因で、どちらが結果か」、あるいは「両方とも別の原因の結果にすぎないのか」は、データの並び方だけからは判定できない。この区別をつけるためには、実験によって他の条件をそろえた上で一方だけを意図的に変化させる、といった追加の手続き(統計学のより進んだ水準で扱われる「実験計画」や「因果推論」という領域)が必要になる。この第1冊の範囲では、「相関が見えたら、まず交絡因子の可能性を疑う」という態度そのものを持ち帰ってもらえれば十分である。

 

### 休憩所 — ここまでのまとめ箱

 

相関係数は、二つの変数の直線的な関係の強さを-1から+1の数値で表す道具である。しかし相関が強いことは、一方が他方の原因であることを意味しない。見かけの相関の裏には、交絡因子という隠れた第三の要因が潜んでいることがある。この「相関≠因果」という一線を踏まえた上で、次章ではいよいよ、散布図の点の群れに「一本の線」を実際に引く技術——回帰直線と最小二乗法——に進む。

 

---

 

## 第四章: 群れに線を引く — 最小二乗法と回帰直線

 

### 「もっともよく当てはまる線」とは何か

 

第二章の散布図に戻ろう。点は完全な一直線には並ばないが、右上がりの帯のような傾向は見て取れる。この帯のちょうど真ん中を通るような、一本の直線を引きたい。この「群れの傾向をもっともよく代表する直線」を**回帰直線(かいきちょくせん、水準四: 散布図に打たれた点の集まりに対して、もっとも当てはまりがよいとされる一本の直線)**と呼び、回帰直線を求める手続き全体を**回帰分析(かいきぶんせき、水準四: データの点の集まりから、変数どうしの関係を表す式〈回帰直線など〉を求める分析手法)**と呼ぶ。

 

問題は「もっともよく当てはまる」の意味をどう決めるかである。同じ点の群れを見ても、人によって「良い線」の引き方は微妙に異なってしまう。そこで必要になるのが、誰が計算しても同じ答えにたどり着ける、客観的な物差しである。

 

### 最小二乗法という発想

 

その物差しが**最小二乗法(さいしょうにじょうほう、水準四: 実際のデータの点と、引いた直線との縦方向のずれを二乗し、その合計がもっとも小さくなるように直線を決める方法)**である。手順はこうだ。まず候補となる一本の直線を仮に引く。次に、それぞれの点から、その直線までの縦方向の距離(実際の値と、直線が予測する値との差。これを**残差〈ざんさ〉**と呼ぶ)を測る。この残差を、第一章の分散のときと同じ理由でプラスに揃えるために二乗し、すべての点について足し合わせる。この「残差の二乗の合計」を、あらゆる直線の中でもっとも小さくするような一本の直線こそが、その群れにもっともよく当てはまる回帰直線だ、と決める。これが最小二乗法の核心である。

 

なぜ「二乗する」のかという疑問は、第一章の分散を思い出せば答えが見えてくる。残差をそのまま足すと、直線の上に出た点(プラスのずれ)と下に出た点(マイナスのずれ)が打ち消し合ってしまい、正しく「ずれの大きさ」を測れない。二乗することで、上下どちらのずれも同じプラスの重みで数えられるようになる。「ばらつきを測るときは二乗してから合計する」という第一章の考え方が、ここでもう一度、形を変えて主役として登場しているのである。

 

### 回帰分析を組み立てる6ステップ(共通の組み立て手順の実例)

 

回帰分析という技術も、他の多くの技術と同じく「目的→部品→順序→接合→検査→仕上げ」という共通の組み立て手順に沿って理解すると見通しがよい。

 

1. **目的を定める**: 何を予測・説明したいのかを決める(例: 家庭学習の時間からテストの得点を説明したい)。

2. **部品を集める**: 説明したい変数(得点、これを**目的変数**と呼ぶ)と、説明に使う変数(学習時間、これを**説明変数**と呼ぶ)のペアのデータを、できるだけ多く集める。

3. **順序を決める**: まず散布図を描いて全体の形を目で確認し(第二章)、次に相関係数で直線的な関係の強さを数値化し(第三章)、最後に回帰直線を計算する、という順序を踏む。順序を飛ばして、いきなり回帰直線だけを計算するのは危険である。曲線的な関係やあり得ない外れ値を見逃す恐れがあるからだ。

4. **接合する**: 最小二乗法という物差しを使い、残差の二乗和がもっとも小さくなる直線の傾きと切片(直線が縦軸と交わる位置)を計算で求める。

5. **検査する**: 求めた直線が実際のデータにどれだけ当てはまっているかを確認する。当てはまりの良さを表す指標として、相関係数を二乗した**決定係数(けっていけいすう、水準四: 回帰直線がデータのばらつきをどれだけ説明できているかを表す、0から1までの数値)**がよく使われる。決定係数が1に近いほど、直線がデータをよく説明できていることになる。

6. **仕上げる**: 求めた回帰直線を使って、まだ測っていない新しいデータについて予測を行ったり、他の人にもわかる形でグラフとともに報告したりする。ただし、第三章で確認した「相関≠因果」の注意を仕上げの報告に必ず添える。回帰直線が引けたからといって、それが因果関係の証明にはならない。

 

### 外挿の危険 — 線を引いた範囲の外に出ないこと

 

回帰直線を使うときにもう一つ注意したいのが**外挿(がいそう、水準四: 実際に観測したデータの範囲を超えて、回帰直線を使って予測すること)**の危険である。学習時間が0〜3時間の範囲のデータから引いた回帰直線を使って、「学習時間20時間ならテストは200点になるはずだ」と外側まで延長して予測するのは、多くの場合誤りを招く。現実の関係は、観測した範囲の外では直線から外れてしまうことが多いからだ。回帰直線は、あくまで観測した範囲の内側でこそ信頼できる道具である。

 

### 休憩所 — ここまでのまとめ箱

 

回帰直線は、散布図の点の群れに対して、残差の二乗和を最小にするという明確な基準で引かれる一本の線である。この基準こそが最小二乗法であり、「二乗してから合計する」という第一章由来の発想の応用である。回帰分析は目的の設定からデータ収集、計算、当てはまりの検査、報告までの一連の組み立て作業であり、途中で相関と因果の区別を見失わないこと、観測範囲の外へ外挿しすぎないことが、実務での大きな注意点になる。

 

---

 

## 第五章: 歴史の物語 — ゴルトンの「平均への回帰」とガウス・ルジャンドルの先取権

 

### フランシス・ゴルトンと「平均への回帰」

 

「回帰」という言葉そのものの由来は、意外にも身長の研究にある。19世紀イギリスの学者**フランシス・ゴルトン(Francis Galton、1822年 - 1911年)**は、親の身長と子の身長の関係を調べる中で、興味深い現象に気づいた。背の高い親の子どもは、平均的には親よりやや低くなる傾向があり、逆に背の低い親の子どもは、平均的には親よりやや高くなる傾向がある。つまり、世代を経るごとに、極端に高い・低いという特徴は、集団全体の平均のほうへ「後退していく」ように見えたのである。

 

ゴルトンはこの現象を1886年頃に発表した論文の中で **"regression toward mediocrity"(平凡への回帰)** という言葉で表現した。この "regression"(後退する、戻る、という意味の英単語)という言葉が、そのまま今日の統計学における「回帰」という専門用語の語源になった。ここは面白いねじれで、ゴルトンが観察した「平均への回帰」という現象そのものは、実は特定の測定に必ずつきまとう統計的な性質(極端な値は、次に測ると平均に近づきやすいという、後の統計学で「平均への回帰現象」と呼ばれる一般的な効果)の一例であることが後にわかっている。しかし、この現象に名前をつけたゴルトンの言葉が、現象そのものの説明とは別に、直線を引く技術全体の呼び名として定着していった、という歴史の経緯は記録として残っている。

 

### ガウスと最小二乗法

 

一方、最小二乗法という計算技法そのものの発展には、複数の学者が関わっている。ドイツの数学者**カール・フリードリヒ・ガウス(Carl Friedrich Gauss、1777年 - 1855年)**は、天体の軌道計算に最小二乗法を応用したことで知られている。1801年に発見された小惑星ケレスが観測できなくなった後、その軌道を数少ない観測データから正確に予測する必要が生じた際、ガウスは自身が考案していた最小二乗法にもとづく計算によって軌道を予測し、翌年その位置に実際にケレスが見つかったことで、この手法の有効性が広く知られるようになった、と伝えられている。ガウス自身は、この方法を1795年頃には着想していたと後年主張している。

 

### ルジャンドルの先取権 — 「未確定部分あり」

 

しかし、最小二乗法という手法を**最初に公表**したのは、フランスの数学者**アドリアン=マリ・ルジャンドル(Adrien-Marie Legendre、1752年 - 1833年)**である。ルジャンドルは1805年、彗星の軌道決定に関する著作の付録の中で、最小二乗法を明確な形で公表した。

 

ここで、この冊子では正直に書いておかねばならない一点がある。「ガウスが1795年頃にはすでに着想していた」という主張と、「ルジャンドルが1805年に最初に公表した」という事実の両方が記録に残っており、どちらが真に最初の発見者かという**先取権(せんしゅけん、優先権とも呼ばれる。ある発見や発明を最初に行ったのは誰かをめぐる評価)**については、歴史的に論争が続いてきた。ガウスの着想時期に関する自己申告を裏付ける当時の一次資料が乏しいこともあり、この先取権問題は今日でも学者の間で完全には決着していない、**未確定の部分がある**と、この冊子では明記しておく。確実に言えるのは、「公表という記録が残っている最初の年は1805年のルジャンドルである」という一点であり、それ以上に踏み込んだ断定は避けるべきだろう。

 

### なぜこの物語が面白いのか

 

回帰という言葉と最小二乗法という計算技術は、まったく別の学者によって、まったく別の問題(片や身長の遺伝、片や天体の軌道)から独立に育てられ、後になって一つの体系としてまとめられていった。この「複数の入口から同じ山に登っていた」という経緯こそ、統計学という惑星が一人の天才の頭の中だけで完成したものではなく、天文学・生物学・数学という複数の惑星からの光が交差する場所にできあがった、という事実を物語っている。統計学の面白さの一つは、この「寄り合い所帯」としての成り立ちそのものにある。

 

### 章末休憩所

 

ゴルトンが「平均への回帰」という現象に名前を与え、それが回帰分析全体の呼び名として定着したこと。ガウスとルジャンドルが、それぞれの動機から最小二乗法にたどり着き、公表の先取権については未確定の部分を残しながら歴史に刻まれたこと。この二つの物語を知っておくと、「回帰直線」という言葉を使うたびに、身長を測るゴルトンと、夜空の小惑星を追いかけるガウス、そして彗星の軌道を計算するルジャンドルの姿が、少しだけ思い浮かぶようになるはずだ。

 

---

 

## 第六章: 現代のフロンティア — 機械学習は回帰の子孫である

 

### 単純な直線から、複雑な予測へ

 

第四章で見た回帰直線は、説明変数がたった一つ(学習時間)、直線もまっすぐな一本という、もっとも単純な形だった。しかし現実の問題では、説明変数が何十、何百とあることも珍しくない。複数の説明変数を同時に使う回帰を**重回帰分析(じゅうかいきぶんせき、水準四: 説明変数が二つ以上ある場合の回帰分析)**と呼び、直線ではなく曲線やもっと複雑な形の関数を当てはめる回帰の拡張も数多く研究されてきた。

 

### 機械学習は回帰の延長線上にある

 

現代のニュースでよく耳にする**機械学習(きかいがくしゅう、水準四: 大量のデータから、コンピュータが自動的に規則やパターンを見つけ出す技術の総称)**、とりわけ画像認識や文章生成に使われる巨大な仕組みも、根っこをたどれば、この冊子で見てきた回帰分析の考え方の延長線上にある。基本の骨格は変わらない。大量の点(データ)があり、それらにもっともよく当てはまる関数(直線や、もっと複雑な形をした関数)を探し、その当てはまりの悪さ(誤差)をできるだけ小さくする、という営みだ。機械学習の世界で使われる「損失関数を最小化する」という言い回しは、この冊子の最小二乗法における「残差の二乗和を最小化する」という考え方の、より一般化された姿にほかならない。

 

もちろん、現代の機械学習は、直線一本ではとても表現しきれない複雑な関係を扱うために、無数のパラメータ(調整可能な数値)を持つ、はるかに複雑な関数の形を使う。しかし「当てはまりの悪さを測る物差しを決め、それを最小にするパラメータを探す」という骨格そのものは、ガウスやルジャンドルが最小二乗法にたどり着いたときの発想と、驚くほど地続きになっている。統計学という惑星の「最初の光」である回帰直線は、姿を変えながら、現代の巨大な計算機の中でも今この瞬間、働き続けているのである。

 

### 未来への視線

 

統計学という惑星のこれから先には、この冊子でまだ触れていない広い領域が待っている。観測データから未知の値の範囲を確率的に見積もる「推測統計」、原因と結果を実験によって切り分ける「因果推論」、そして大量の変数の中から本当に重要な変数だけを選び出す技術など、水準五以降で扱うべき風景はまだたくさん残っている。この冊子で身につけた「平均とばらつきを数える」「散布図で群れの形を見る」「相関と因果を区別する」「最小二乗法で線を引く」という四つの基本動作は、その先のどの風景に進むときにも、変わらず土台であり続ける。

 

### 休憩所 — 最終まとめ箱

 

機械学習は、統計学の惑星の遠い子孫にあたる。当てはまりの悪さを測る物差しを定め、それを最小にする、という骨格は、最小二乗法の時代から一貫している。回帰という技術は、ゴルトンの身長の観察やガウス・ルジャンドルの天体計算という、一見地味な出発点から始まりながら、現代の情報社会を支える巨大な技術にまで育っていった。地味な道具ほど遠くまで届く、という統計学惑星の性格が、ここでも顔を出している。

 

---

 

## 章末: 簡易図解(散布図と回帰直線)

 

```

得点

100 | ●

| ●

80 | ● /

| ● /●

60 | ● /

| /●

40 |/

+----------------------------- 学習時間

0 1 2 3 4 5

 

/ = 最小二乗法で求めた回帰直線(残差の二乗和が最小)

● = 実際の生徒1人ぶんのデータ点(散布図)

点から線までの縦の距離 = 残差(二乗して合計したものを最小化する)

```

 

```

算術(恒星の光)

│

├─ 平均・分散(水準一〜二) … 群れを一つの数で要約

│

├─ 散布図・相関係数(水準二〜三) … 二変数の関係を見る/測る

│ └─ 相関 ≠ 因果(交絡因子に要注意)

│

└─ 最小二乗法・回帰直線(水準四) … 群れに線を引く

│

├─ ゴルトン(1886年頃) 「平均への回帰」の命名

├─ ガウス/ルジャンドル(1805年公表、先取権は未確定部分あり)

└─ 現代: 重回帰・機械学習へ接続

```

 

---

 

## 次に待っている風景 — 統計学第2冊への予告

 

この冊子で歩いたのは、統計学という惑星の入口(水準一〜四)——数える、見る、区別する、線を引く、という四つの基本動作だった。次の冊子で待っている風景を少しだけ覗いておこう。

 

- **推測統計**: 手元にある一部のデータ(標本)から、まだ見ていない全体(母集団)の性質を確率的に見積もる技術。

- **仮説検定**: 「本当に差がある」と言い切ってよいかどうかを、確率の言葉で判定する手続き。

- **因果推論**: 相関と因果の区別という第三章の課題に、実験や観察の設計によって正面から取り組む領域。

- **重回帰・非線形回帰**: この冊子の回帰直線を、複数の変数や曲線の形へ拡張する技術。

 

これらは今回の旅の続きであり、次の冊子でまた新しい裏技として姿を現す。

 

---

 

## 参照文献(定番教科書・一般書・パブリックドメイン標準)

 

1. 東京大学教養学部統計学教室編『基礎統計学I 統計学入門』(東京大学出版会) — 平均・分散・相関・回帰の定番日本語教科書。

2. 涌井良幸・涌井貞美『統計学の基礎』(技術評論社) — 初学者向けの相関・回帰の平易な解説書。

3. Galton, F. "Regression towards Mediocrity in Hereditary Stature", *Journal of the Anthropological Institute*, 1886年 — 「回帰」という語の由来となった原論文。

4. Stigler, S. M. *The History of Statistics: The Measurement of Uncertainty before 1900*, Harvard University Press, 1986年 — 最小二乗法の先取権論争を含む統計学史の定番研究書。

5. Legendre, A.-M. *Nouvelles méthodes pour la détermination des orbites des comètes*, 1805年 — 最小二乗法を最初に公表した原著の付録。

6. Gauss, C. F. *Theoria Motus Corporum Coelestium*, 1809年 — ガウス自身による天体軌道計算と最小二乗法の記述。

 

---

 

(本冊子は現代学問宇宙図鑑シリーズ BOOK-0026。次冊は回帰と統計第2冊(水準五以降: 推測統計・仮説検定・因果推論)を予定。)

 




# BOOK-0026 回帰と統計 第1冊 — データの群れに線を引く
  1. 目次
  2. 小説情報
  3. 縦書き
  4. しおりを挟む
  5. お気に入り登録
  6. 評価
  7. 感想
  8. ここすき
  9. 誤字
  10. 閲覧設定