データを比べる5つのポイント
- ① 中央値:データ全体の代表値(どちらが大きい?)
- ② 四分位範囲:中央 50% の散らばり
- ③ 全範囲(最大−最小):全体の散らばり
- ④ 分布の形:左右対称/偏り
- ⑤ 外れ値:他のデータから極端に離れた値
例:2クラスの数学テスト比較
クラスA:min=40, Q₁=55, Q₂=65, Q₃=75, max=90
クラスB:min=50, Q₁=60, Q₂=70, Q₃=80, max=95
→ クラスB の方が全体的に 高得点(中央値 70 vs 65)
→ 散らばり:A の四分位範囲 = 75 − 55 = 20、B = 80 − 60 = 20(同じ)
→ 全範囲:A = 50、B = 45(A の方が広い)
→ 「クラス B のほうが高得点、散らばり方は似ている」と判断
例:散らばりの大小
グループ1:min=30, Q₁=40, Q₂=50, Q₃=60, max=70
範囲 40、四分位範囲 20
グループ2:min=10, Q₁=30, Q₂=50, Q₃=70, max=90
範囲 80、四分位範囲 40
→ 中央値はどちらも 50 で同じ
→ グループ2 の方が 散らばりが大きい
→ 中央値だけでは違いが分からない、四分位範囲も大切
外れ値の発見と影響
原因を確認する必要がある(測定ミス、特殊事情、本物の異常値など)。
四分位範囲の 1.5倍を超えるとき:外れ値の可能性
具体的には:
Q₁ − 1.5 × IQR より 小のデータ
Q₃ + 1.5 × IQR より 大のデータ
→ 外れ値があれば、原因を調べる
データ:5, 7, 8, 9, 10, 11, 12, 14, 100(9個)
中央値(5番目)= 10 を除き、下半分 5,7,8,9 の中央値 Q₁ = (7+8)/2 = 7.5、上半分 11,12,14,100 の中央値 Q₃ = (12+14)/2 = 13
IQR = Q₃ − Q₁ = 13 − 7.5 = 5.5
外れ値の境界:Q₃ + 1.5×5.5 = 13 + 8.25 = 21.25
→ 100 は 21.25 を大きく超える → 外れ値
平均値と中央値の使い分け
平均値:外れ値の影響を受けやすい
例:5,7,8,9,100 の平均 = 25.8(極端な数100に引きずられる)
中央値:外れ値の影響を受けにくい
例:5,7,8,9,100 の中央値 = 8(妥当な代表値)
→ 外れ値がある/偏りが大きいデータでは 中央値を使う
→ 外れ値がなく対称分布では平均値でもOK
箱ひげ図から分布を読み取る
対称的:箱の中央値が箱の中央付近、左右のひげが同じ長さ
右に長い(右に偏り):中央値が箱の左寄り、右のひげが長い
左に長い(左に偏り):中央値が箱の右寄り、左のひげが長い
→ 偏りが大きい場合、平均値より中央値が代表値として適切
3つ以上のグループの比較
A:中央値 60、IQR 15
B:中央値 65、IQR 20
C:中央値 55、IQR 30
→ B が最も平均的に高得点
→ A が最も安定(散らばり小)
→ C は散らばりが大きい(個人差が大きい)
時系列の比較
過去5年間の売上、テストの点数、気温などを箱ひげ図で並べる
→ 年ごとの変化(中央値の上昇/下降)が分かる
→ 散らばりの傾向も比較できる
→ ニュースやレポートでよく使われる手法
- 平均値:データの算術平均。外れ値の影響を 受けやすい
- 中央値:データの真ん中。外れ値の影響を 受けにくい
- 分布が偏っているときや外れ値があるときは 中央値を使う
- 中央値が同じでも、散らばりが違うことがある
- 必ず四分位範囲も確認する
- 分布の形も大切
- 外れ値は 除外して分析することもある
- ただし、本物の異常値(重要な情報)の場合は除外しない
- 外れ値の 原因を考えることが大切
この章でつまずきやすいところ
データを比べる問題を読んでいる途中、「中央値が高い方が勝ち」「箱が長い方が良い」と思い込んで先に進んでしまうことがあります。ここでは、本文や箱ひげ図を見ている最中に起きやすい4つの迷い(<strong>①中央値の高低だけで決める/②箱の長短に良し悪しを貼る/③中央値が同じだと同じデータと読む/④飛び離れた値があるのに平均を選ぶ</strong>)を、見分け方つきで整理します。
中央値が高い方が常に「優れている」と思い込んでしまう
- つまずく場面:「クラスAの中央値65、クラスBの中央値70」と読んだ瞬間、もう「Bの方が良い」と決めて先に進んでしまう。でも本文には「散らばりも見る」と書いてあり、四分位範囲の数字が後から出てくると判断が揺らぐ。
- 克服のコツ:見分け方は順番で整理する。①中央値で中心の高さ → ②四分位範囲で中央50%のばらつき → ③全範囲(最小〜最大の幅)で全体の広がり、の順に必ず3つ読む。本文では「高い」と「安定」は別の話として扱われているので、目的が「高得点」なのか「安定」なのかを問題文から先に拾う。
- ミニ例:クラスA:中央値65・IQR15・範囲40/クラスB:中央値70・IQR25・範囲60。Bの方が中心は高いが、Aの方が中央50%も全体の幅も小さく安定している。どちらが「優れている」かは目的次第と本文は整理している。
箱が長い方を「良い」または「悪い」と決めつけてしまう
- つまずく場面:箱ひげ図を見ている途中、Aの箱が短くBの箱が長いのを見て「短い方が安定だから良い」と即断する。でも問題が「個人差が大きいのはどちら」だった場合、判断が逆になることに後から気づいて戸惑う。
- 克服のコツ:見分け方は目的を言葉に置き換えること。「安定」を聞かれているなら箱が短い方、「多様性・個人差」を聞かれているなら箱が長い方。長い・短いに「良い/悪い」のラベルを最初から貼らず、設問の目的語を先に確認する。
- ミニ例:2クラスA(IQR15)・B(IQR25)。安定しているのはA、個人差が大きいのはB。同じ「箱の長さ」でも、目的が変われば答えが入れ替わる。
中央値が同じだと「同じデータ」と読み飛ばしてしまう
- つまずく場面:本文の「グループ1とグループ2はどちらも中央値50」を見て、つい「同じだ」と読み流す。すぐ後にひげの長さがまったく違うことに気づいても、なぜ「同じ中央値なのに違う」と言えるのかが頭の中で結びつかない。
- 克服のコツ:見分け方は中央値が一致したら必ず四分位範囲と全範囲を続けて読むこと。中央値は「真ん中の1点」の情報、四分位範囲は「中央50%の幅」の情報で、見ている対象が違う。本文は「中央値だけでは違いが分からない」と明示している。
- ミニ例:グループ1:IQR20・範囲40/グループ2:IQR40・範囲80。中央値はどちらも50でも、四分位範囲は2倍(20→40)、全範囲も2倍(40→80)に広がっている。
極端に大きい1つの値を見て「平均値」を代表値に選んでしまう
- つまずく場面:「5, 7, 8, 9, 10, 11, 12, 14, 100」のようなデータを読み、平均を計算しかける。100があるのは気になるが、「平均=代表値」という思い込みから、飛び離れた値を含んだまま平均を答えてしまう。
- 克服のコツ:見分け方は明らかに飛び離れて大きい/小さい値があるかを目で確認すること。本文はそうした値があるときは平均値ではなく中央値を使うことが多いと整理している。平均値は飛び離れた値の影響を受けやすく、中央値は受けにくい、という役割の違いで選ぶ。発展として「Q1=7.5, Q3=13, IQR=5.5, 境界=13+1.5×5.5=21.25」のように上側の目安を計算する方法もある。
- ミニ例:5,7,8,9,10,11,12,14,100 の平均は約19.6(176÷9)で100に引っ張られているが、中央値は10。100は他の値から飛び離れているので、教科書では中央値を代表値に採る。
練習問題
2クラスの英語テスト:クラスA の中央値が70、クラスB が65。四分位範囲はA が15、B が25。どちらが点数のばらつきが大きいか。
答えを見る
クラスB(四分位範囲が大きい = 中央50%の散らばりが大きい)
あるデータの分布が「中央値より平均値がずっと大きい」ときに考えられる状況は?
答えを見る
大きな外れ値が含まれている、または分布が右に長く偏っている(右に裾が引かれている)。例:所得分布など。
3クラス A、B、C のテストの中央値がそれぞれ 60、65、55。四分位範囲が 10、20、15。どのクラスが「点数が高くて均一」と言えるか?
答えを見る
中央値が最も高い(65)のはクラス B だが、四分位範囲も最大(20)で、3クラスの中でもっとも散らばりが大きい。
四分位範囲が最小(10)のクラス A は中央値60(Bより低い)で、3クラスの中でもっとも均一。中央値55・四分位範囲15のクラス C はどちらの指標でも中間にある。
「点数が高くて均一」を両方満たすクラスは存在しないため、高得点を重視するかばらつきの小ささを重視するかで答えが変わる。
データ 5, 7, 8, 9, 10, 11, 12, 14, 100 の中で、外れ値はあるか。
答えを見る
中央値(5番目)10 を除き、下半分 5,7,8,9 の中央値 Q₁ = 7.5、上半分 11,12,14,100 の中央値 Q₃ = 13、IQR = 13 − 7.5 = 5.5
境界:Q₃ + 1.5×IQR = 13 + 1.5×5.5 = 21.25
100 は 21.25 を超える → 外れ値
まとめ
- データ比較:中央値・散らばり・分布の形・外れ値を見る。
- 四分位範囲が 散らばりの指標。
- 箱ひげ図で複数を 並べて比較できる。
- 平均値は外れ値の影響大、中央値は影響小。
- 外れ値の判定:Q₁ − 1.5×IQR より小、Q₃ + 1.5×IQR より大。
- 分布の偏り(左/右)も読み取れる。
もっと知る ── 発展・実生活(出典つき)
※ 教科書の内容に、信頼できる出典をもとにした発展・実生活・時事の話題を補足しています(教科書そのものではありません)。
所得は「平均」より「中央値」が実感に近い実生活
厚生労働省の国民生活基礎調査では、2022年の1世帯あたり平均所得金額は524万2千円ですが、中央値は405万円と低くなっています。これは一部の高所得世帯が平均を押し上げているためで、実際に平均以下の世帯が約62%を占めます。だから所得のように偏りの大きいデータでは、平均値だけでなく中央値で比べることが大切です。
箱ひげ図はヒストグラムと違い「複数を並べて比べられる」発展
総務省統計局の解説によると、ヒストグラムは1つのデータの散らばりを示すのに対し、箱ひげ図は異なる複数のデータの散らばりをまとめて比較できるのが強みです。データを小さい順に並べて4等分し、まん中を中央値、4分の1と4分の3の位置を第1・第3四分位数として箱を作ります。だから年度別や地域別など、いくつもの集団を1枚の図で見比べたいときに役立ちます。
外れ値の「1.5倍ルール」を考えたのはテューキー発展
四分位範囲(IQR)の1.5倍を箱の外側にひげとしてのばし、それより外れた値を外れ値とみなす考え方は、統計学者テューキー(Tukey, 1977)が提案した箱ひげ図にもとづくものです。平均値や標準偏差は外れ値の影響を受けやすいのに対し、中央値や四分位範囲は順序にもとづくため影響を受けにくく、調査データのように外れ値が混ざりうるデータでも安定して使えます。教科書で習う「Q₁−1.5×IQR」「Q₃+1.5×IQR」という基準は、こうした考え方からきています。
出典:野呂竜夫・和田かず美「統計実務におけるレンジチェックのための外れ値検出方法」統計研究彙報 第72号(独立行政法人統計センター, 2015年3月)
気温データのばらつきを箱ひげ図で読む実生活
気象庁は過去の気温や降水量のデータを年・月ごとに公開しており、これらを箱ひげ図に並べると年ごとの中央値の変化やばらつきの傾向が見えてきます。たとえば月ごとに気温を比べると、中央値の高さだけでなく、日々の気温が安定しているか大きく変動するかも読み取れます。身近な気象データは、データ比較の練習に最適な題材です。
「平年値」は30年分のデータの代表値発展
気象庁の「平年値」は、その年だけの値ではなく、1991年から2020年までの30年間の観測値を平均してつくった代表値です(2020年平年値)。1年だけの気温では暑い・寒いを正しく判断できないため、長期間のデータを集めて基準を決めています。これは「最大値だけでは全体の傾向はわからない」という、データ比較の考え方そのものです。
出典:気象庁「第5章 平年値」
中学生向けの統計学習サイトで代表値を確かめる実生活
東京都が運営する中学生向けの統計学習ページでは、最頻値・中央値・平均値の3つの代表値や、箱ひげ図によるちらばりの見方をやさしく解説しています。とくに「平均値は極端に大きい・小さい値があると影響を受けてしまう」と注意していて、教科書の内容を別の言葉でも確認できます。学んだことを公式の資料で見直すと理解が深まります。
