復習 ── 中1で学んだデータの整理
- 平均値:データの和 ÷ 個数
- 中央値(メジアン):データを並べたときの中央の値
- 最頻値(モード):一番多く出てくる値
- 範囲:最大値 − 最小値
- 中2では、これに 四分位数を加える
四分位数の定義
第1四分位数 Q₁:下位 25% の位置(下から1/4)
第2四分位数 Q₂:中央値(50% の位置)
第3四分位数 Q₃:上位 25% の位置(75% の位置)
四分位数の求め方
① データを 小さい順に並べる
② 全体の 中央値 Q₂ を求める
③ 中央値より 下半分の中央値 → Q₁
④ 中央値より 上半分の中央値 → Q₃
→ データが Q₁、Q₂、Q₃ で4つのグループに分かれる
奇数個のデータ ── 例
並んでいる、データ数 7
中央値 Q₂ = 8(4番目、中央のデータ)
下半分:2, 5, 7(3個)→ 中央 → Q₁ = 5
上半分:12, 15, 18(3個)→ 中央 → Q₃ = 15
→ 4つに分かれる:(2,5)、(5,8)、(8,15)、(15,18)
偶数個のデータ ── 例
データ数 6 → 中央値は 3番目と4番目の平均
中央値 Q₂ = (7+9)/2 = 8
下半分:3, 5, 7(3個)→ Q₁ = 5
上半分:9, 11, 13(3個)→ Q₃ = 11
データ:4, 6, 7, 9, 10, 12, 14, 16
中央値 Q₂ = (9+10)/2 = 9.5
下半分(前半4個):4, 6, 7, 9 → Q₁ = (6+7)/2 = 6.5
上半分(後半4個):10, 12, 14, 16 → Q₃ = (12+14)/2 = 13
四分位範囲(IQR)
データの 中央 50% の散らばりを表す。
外れ値の影響を受けにくい指標。
Q₁ = 5、Q₃ = 15 → 四分位範囲 = 15 − 5 = 10
→ データの中央 50% は 5〜15 の範囲に収まる
「範囲」と「四分位範囲」の違い
範囲 = 最大値 − 最小値(外れ値の影響を受けやすい)
四分位範囲 = Q₃ − Q₁(外れ値の影響を受けにくい、中央50%)
例:1, 5, 6, 7, 8, 9, 100
範囲 = 100 − 1 = 99(100 の影響大)
四分位範囲 = 9 − 5 = 4(外れ値の100が含まれない)
→ 外れ値があるデータでは四分位範囲のほうが信頼できる
外れ値とは
他のデータから極端に離れた値
慣例的な判定基準:
Q₁ − 1.5 × IQR より小さい値
Q₃ + 1.5 × IQR より大きい値
→ これに該当すれば外れ値の可能性
5数要約
5数要約:最小値、Q₁、Q₂(中央値)、Q₃、最大値
例1の場合:2、5、8、15、18
これでデータの分布の概要が分かる
→ 次回学ぶ「箱ひげ図」のもと
- 奇数個:中央のデータがそのまま中央値
- 偶数個:中央の2つの平均が中央値
- 上下に分けたときも同じルール
- 分け方を間違えると四分位数が変わる
- 奇数個のとき、上半分・下半分に中央値を 含めない
- 例:データ 2,5,7,8,12,15,18 → 中央値 8 を除き、下半分 2,5,7、上半分 12,15,18
- この教材では教科書に合わせて、この方式で統一する
- データはまず 昇順に並べる
- 順番に並んでいないと、Q₁ や Q₃ の位置が分からない
- 並べ替えを忘れずに
この章でつまずきやすいところ
四分位数の本文を読んでいると、「中央値を含めるの?」「並べ替えはいる?」と、定義の流儀や手順の途中で迷う場面が次々に出てきます。ここでは、本文を読み進めながら起きやすい4つの迷いを取り上げ、見分け方のコツを整理します。
奇数個のとき中央値を下半分にも含めると思い込んでしまう
- つまずく場面:本文の例1で「2, 5, 7, 8, 12, 15, 18」が出てきて中央値 Q₂ = 8 を確認した直後、下半分を作る場面で「8 も含めて 2, 5, 7, 8 でいいのかな」と止まり、4つの値で Q₁ を計算しそうになる迷い。
- 克服のコツ:流儀の見分け方で整理する。本文は「奇数個のときは全体の中央値を上下に含めない」教科書型を採用している。判断順序は、まず個数を見て奇数なら中央値を1個だけ除き、残りを上下に等分する。偶数個では中央の2つの平均をとり、データ全体を前半・後半に分けるだけでよい。
- ミニ例:例:2, 5, 7, 8, 12, 15, 18 → 中央値 8 を除き、下半分は 2, 5, 7 の3個。ここから Q₁ = 5 となる。8 を下半分に含めないのがこの教材のルール。
並べ替えをせずに元の順番のまま Q₁ を取ろうとしてしまう
- つまずく場面:練習問題で「12, 5, 18, 8, 22, 10, 15」のようにバラバラに並んだデータを見て、本文の手順①「小さい順に並べる」を飛ばし、左から数えて2番目を Q₁ にしてしまいそうになる場面の迷い。
- 克服のコツ:位置関係で整理する。四分位数は「並べたあとの位置」が決める値で、元の並びの位置ではない。手順は、①必ず昇順に書き直す、②中央値 Q₂ を取る、③その下半分・上半分それぞれの中央値で Q₁・Q₃ を取る、の順を崩さない。並べ替えなしで位置を読むのは禁止と覚える。
- ミニ例:例:12, 5, 18, 8, 22, 10, 15 → 昇順に書き直すと 5, 8, 10, 12, 15, 18, 22。中央値 Q₂ = 12、下半分 5, 8, 10 から Q₁ = 8 となる。並べ替え前の「5」を Q₁ と勘違いしない。
四分位範囲を「最大−最小」で出してしまう
- つまずく場面:本文で「散らばりを表す指標」という言葉を読んだ瞬間、これまで学んだ「範囲=最大−最小」が頭に浮かび、四分位範囲を求めるところでも 最大値−最小値 を計算してしまいそうになる場面の迷い。
- 克服のコツ:役割の見分け方で整理する。範囲(最大−最小)はデータ全体の幅、四分位範囲(Q₃−Q₁)は中央50%の幅で、見ている部分が違う。本文は四分位範囲を「外れ値に引っぱられにくい指標」と整理している。問われている語が「四分位範囲」なら最大・最小は使わず、必ず Q₃ と Q₁ を引く。
- ミニ例:例:1, 5, 6, 7, 8, 9, 100 → 範囲 = 100 − 1 = 99、四分位範囲 = Q₃ − Q₁ = 9 − 5 = 4。同じデータでも、最大−最小で答えると 99 になり、四分位範囲とは別の値になってしまう。
偶数個のデータで Q₂ を「中央の1個」と読み取ってしまう
- つまずく場面:本文の例2「3, 5, 7, 9, 11, 13」を読みながら、慣れで「中央のデータ=Q₂」と決めつけ、3番目の 7 だけを Q₂ としてしまいそうになる場面の迷い。本文に書かれた「3番目と4番目の平均」を読み飛ばしている状態。
- 克服のコツ:個数による見分け方で整理する。奇数個なら中央の1個がそのまま Q₂、偶数個なら中央にある2つの値の平均が Q₂ になる。同じルールが下半分・上半分にも当てはまり、下半分が偶数個なら2つの平均で Q₁ を出す。まず個数の偶奇を確かめてから手順に進むと迷わない。
- ミニ例:例:3, 5, 7, 9, 11, 13(6個) → 中央は3番目の 7 と4番目の 9。Q₂ = (7 + 9) / 2 = 8。下半分 3, 5, 7 から Q₁ = 5、上半分 9, 11, 13 から Q₃ = 11 と続く。
練習問題
データ:5, 8, 10, 12, 15, 18, 22 で Q₁, Q₂, Q₃ を求めよ。
答えを見る
データ数 7
Q₂ = 12(中央)
下半分 5, 8, 10 → Q₁ = 8
上半分 15, 18, 22 → Q₃ = 18
問題1のデータの四分位範囲を求めよ。
答えを見る
Q₃ − Q₁ = 18 − 8 = 10
データ:4, 6, 8, 10, 12, 14 で Q₁, Q₂, Q₃ と四分位範囲を求めよ。
答えを見る
データ数 6
Q₂ = (8+10)/2 = 9
下半分 4, 6, 8 → Q₁ = 6
上半分 10, 12, 14 → Q₃ = 12
四分位範囲 = 12 − 6 = 6
データ:3, 5, 7, 8, 10, 12, 15, 18, 20 の5数要約を答えよ。
答えを見る
データ数 9、中央値 Q₂ = 10(5番目)
下半分 3,5,7,8 → Q₁ = (5+7)/2 = 6
上半分 12,15,18,20 → Q₃ = (15+18)/2 = 16.5
5数要約:最小 3、Q₁ 6、Q₂ 10、Q₃ 16.5、最大 20
まとめ
- 四分位数:データを 4等分する3つの値(Q₁, Q₂, Q₃)。
- Q₂ = 中央値(メジアン)。
- 四分位範囲 = Q₃ − Q₁(中央50%の散らばり)。
- 外れ値の影響を受けにくい散らばりの指標。
- 5数要約:最小、Q₁、Q₂、Q₃、最大。
- 箱ひげ図(次回)の基礎となる。
もっと知る ── 発展・実生活(出典つき)
※ 教科書の内容に、信頼できる出典をもとにした発展・実生活・時事の話題を補足しています(教科書そのものではありません)。
四分位数はもともと高校の内容だった発展
四分位数や四分位範囲、箱ひげ図は、2017年(平成29年)告示の学習指導要領で、それまで高校で学んでいた内容が中学2年生に移ってきたものです。インターネットの普及で身のまわりに大量のデータがあふれる時代に、それを正しく読み取る力を早くから育てるためです。
国の統計でも箱ひげ図が使われている実生活
総務省統計局は、都道府県別の「人口10万人あたりの医師数」のばらつきを箱ひげ図で示し、地域による差を比べています。箱ひげ図は、たくさんの集団の散らばり具合を並べて一目で比較できるので、政府の統計でも実際に活用されています。
貧困を測るものさしも「真ん中」の値実生活
厚生労働省は、世帯の手取り収入(可処分所得)を世帯人数に応じてならした「等価可処分所得」を低い順に並べ、その中央値(ちょうど真ん中の値)の半分を「貧困線」と呼んでいます。そして、その線より下の人の割合を相対的貧困率として発表しています。平均ではなく中央値を使うのは、一部のとても高い所得に結果が引っぱられないようにするためです。
平均年収より「中央値」が実感に近い理由実生活
国税庁は、民間で働く人の年間給与の実態を毎年調べて平均給与などを発表しています。ただし平均はごく一部の高所得の人に引き上げられやすいため、ふつうの人の感覚を知るには、データを並べた中央付近を見る中央値や四分位の考え方のほうが役立ちます。
気温の「平年並」も順位で区切る発展
気象庁は、過去30年間の気温などを小さい順に並べ、出現率がほぼ3等分になるように区切って「低い」「平年並」「高い」を決めています。並べたデータの順位で境目を求める考え方は、四分位数の出し方とよく似ています。
外れ値を見つける1.5倍ルールとその考案者発展
箱ひげ図は、アメリカの統計学者ジョン・テューキーが1970年代に提唱した図です。彼の考え方では、第1四分位数からIQR(四分位範囲)の1.5倍より小さい値、第3四分位数からIQRの1.5倍より大きい値を外れ値とみなします。極端な値に気づくための実用的なものさしです。
出典:Tukey, J. W. (1977) 『Exploratory Data Analysis』Addison-Wesley
