データの数値を、カンマ(,)や空白で区切って入力してください。入力の順番は問いません(計算時に小さい順に並べ替えます)。
このページでできること
- データの数値を入れるだけで、第1四分位数 \(Q_1\)・中央値(第2四分位数)\(Q_2\)・第3四分位数 \(Q_3\)・四分位範囲 IQR・四分位偏差・最小値・最大値をまとめて計算できます
- 計算結果から箱ひげ図をその場で描画します(PNG・SVGで保存できます)
- 外れ値(\(Q_1 - 1.5 \times \mathrm{IQR}\) 以下、または \(Q_3 + 1.5 \times \mathrm{IQR}\) 以上の値)も自動で判定し、箱ひげ図では外れ値を分けて点で示します
- 四分位数は高校教科書(数学I「データの分析」)の定義で計算し、途中式(下位のデータ・上位のデータの分け方)も表示します
- 式のやさしい解説・Excel/Googleスプレッドシート/Python用のコピペ数式・計算ドリル(演習問題)もこのページにまとまっています
この計算は何の役に立つ?
テストの点数は、平均点だけでは「全体がどう散らばっているか」がわかりません。四分位数を使うと「真ん中半分の人は何点から何点の間か」「上位25%に入るには何点必要か」が読み取れます。
学校の成績資料や模試の結果分析では、クラスや教科ごとの箱ひげ図を並べて、分布の違いを一目で比べる使い方が定番です。
給与や貯蓄額のようなデータは、一部の極端に大きい値に平均値が引っ張られ、「平均=普通の人の値」にならないことで知られています。こうしたデータでは、中央値や第1・第3四分位数で分布を見る方が実感に近く、国の賃金統計でも平均値と併せて四分位数が公表されています。
「自分の位置は全体のどのあたりか」を知りたいときに、四分位数は平均値より頼りになる物差しです。
製品の寸法データやセンサーの測定値、分析前のデータセットから「怪しい値」を探すとき、1.5×IQRルールは最もよく使われる目安の一つです。平均や標準偏差と違って外れ値自身の影響を受けにくいため、外れ値探しの物差しとして都合がよいのです。
ただし外れ値=誤りとは限らないため、実務では機械的に捨てず、原因(入力ミスか、本当に起きた珍しい現象か)を確認してから扱いを決めます。
陸上や水泳の選手のタイムは、平均の速さだけでなく「安定しているか」も重要です。複数の選手や時期ごとの記録を箱ひげ図で並べると、速さと安定感(箱の小ささ)を同時に比べられます。
気象の分野でも、都市ごと・月ごとの気温や降水量のばらつきを比べる図として箱ひげ図がよく使われています。
式と図
用語・記号の解説
記号
| \(Q_1\) | キューワン | 第1四分位数。\(Q\) は quartile(四分位数)の頭文字です。データを小さい順に並べたとき、下から4分の1(約25%)の位置にあたる値で、下位のデータ(前半)の中央値として求めます。 |
| \(Q_2\) | キューツー | 第2四分位数。データ全体のちょうど真ん中の値、つまり中央値そのものです。箱ひげ図では箱の中の仕切り線にあたります。 |
| \(Q_3\) | キュースリー | 第3四分位数。下から4分の3(約75%)の位置にあたる値で、上位のデータ(後半)の中央値として求めます。 |
| \(\mathrm{IQR}\) | アイキューアール | 四分位範囲。interquartile range(四分位数の間の範囲)の頭文字で、\(Q_3 - Q_1\) のことです。真ん中の約50%のデータが収まる幅を表します。 |
| \(x\) | エックス | データの1つ1つの値を表す文字。このページでは、外れ値の判定式(\(x < Q_1 - 1.5 \times \mathrm{IQR}\) など)に登場します。 |
| \(n\) | エヌ | データの個数。number(数)の頭文字です。四分位数の求め方は、\(n\) が偶数か奇数かで中央値の扱いが変わります。 |
用語
| 四分位数 | しぶんいすう | データを小さい順に並べて個数で4等分したときの、3つの区切りにあたる値。小さい方から第1四分位数 \(Q_1\)・第2四分位数 \(Q_2\)(=中央値)・第3四分位数 \(Q_3\) といいます。 |
| 中央値 | ちゅうおうち | データを小さい順に並べたときの、ちょうど真ん中の値(メジアン)。データが偶数個のときは、中央の2つの値の平均です。平均値と違って、極端に大きい・小さい値の影響を受けにくい代表値です。 |
| 下位のデータ | かいのデータ | データを中央値で分けたときの、前半(中央値より小さい側)のデータの集まり。データが奇数個のときは、中央値そのものは入れません。下位のデータの中央値が \(Q_1\) です。参考書によっては「前半」「下組」と呼ぶこともあります。 |
| 上位のデータ | じょういのデータ | データを中央値で分けたときの、後半(中央値より大きい側)のデータの集まり。データが奇数個のときは、中央値そのものは入れません。上位のデータの中央値が \(Q_3\) です。参考書によっては「後半」「上組」と呼ぶこともあります。 |
| 四分位範囲 | しぶんいはんい | \(Q_3 - Q_1\) のこと(IQR)。真ん中の約50%のデータが収まる幅で、散らばりの指標として使われます。外れ値の影響を受けにくいのが特長です。 |
| 四分位偏差 | しぶんいへんさ | 四分位範囲を2で割った値。中央値から前後にどのくらいの幅で真ん中半分のデータが散らばっているか、の目安です。 |
| 箱ひげ図 | はこひげず | 最小値・\(Q_1\)・中央値・\(Q_3\)・最大値の5つの値(5数要約)を、数直線の上に「箱」と「ひげ」で表した図。複数のデータの散らばりを並べて比べるのが得意で、現在は中学2年で最初に習い、高校の数学Iでも扱います。 |
| ひげ | ひげ | 箱ひげ図の箱から左右に伸びる線。基本形では最小値・最大値まで引きます。外れ値を分けて示す流儀では、外れ値を除いた最小値・最大値までにし、外れ値は個別の点で打ちます。 |
| 外れ値 | はずれち | 他の値から極端に離れた値。よく使われる目安が1.5×IQRルール(\(Q_1 - 1.5 \times \mathrm{IQR}\) 以下、または \(Q_3 + 1.5 \times \mathrm{IQR}\) 以上の値)です。 |
| 代表値 | だいひょうち | データ全体の特徴を1つの数で代表させた値。平均値・中央値・最頻値などがあります。四分位数は、中央値の考え方を「4等分の区切り」に広げたものです。 |
| 範囲 | はんい | 最大値から最小値を引いた値(レンジ)。データ全体の広がりを表しますが、外れ値が1つあるだけで大きく変わってしまう弱点があり、それを補うのが四分位範囲です。 |
前提として理解しておくといいこと
このページの計算を「意味がわかって」使えるようになるために、前提として理解しておくといいことをまとめました。
つまずいたら、この表の内容に戻って復習するのが近道です。
| 数の大小と数直線(小学校〜中学1年) |
|
| 平均値・中央値などの代表値(小学6年〜中学1年) |
|
| 箱ひげ図と四分位範囲(中学2年) |
|
| 小数・分数の計算(小学5年〜中学1年) |
|
| データの分析(高校 数学I) |
|
Excelで計算する方法
| データ1(小さい順に入力) | 2 |
| データ2 | 3 |
| データ3 | 4 |
| データ4 | 5 |
| データ5 | 6 |
| データ6 | 7 |
| データ7 | 7 |
| データ8 | 7 |
| データ9 | 8 |
| データ10 | 10 |
| 中央値 Q2(全体の中央値) | =MEDIAN(B1:B10) |
| 第1四分位数 Q1(下位のデータ=前半5個の中央値) | =MEDIAN(B1:B5) |
| 第3四分位数 Q3(上位のデータ=後半5個の中央値) | =MEDIAN(B6:B10) |
| 四分位範囲 IQR | =B13-B12 |
| 四分位偏差 | =B14/2 |
| データ1 | 2 |
| データ2 | 3 |
| データ3 | 4 |
| データ4 | 5 |
| データ5 | 6 |
| データ6 | 7 |
| データ7 | 7 |
| データ8 | 7 |
| データ9 | 8 |
| データ10 | 10 |
| Q1(QUARTILE.INC) | =QUARTILE.INC(B1:B10,1) |
| Q2(QUARTILE.INC) | =QUARTILE.INC(B1:B10,2) |
| Q3(QUARTILE.INC) | =QUARTILE.INC(B1:B10,3) |
| 第1四分位数 Q1 | 4 |
| 第3四分位数 Q3 | 7 |
| 四分位範囲 IQR | =B2-B1 |
| 外れ値の目安(下側)Q1−1.5×IQR | =B1-1.5*B3 |
| 外れ値の目安(上側)Q3+1.5×IQR | =B2+1.5*B3 |
2つ目の表のQUARTILE.INC関数は、データの間を比例配分(補間)する別の定義のため、教科書の定義と値が異なることがあります。同じデータでも QUARTILE.INC は Q1 = 4.25 を返し、1つ目の表の Q1 = 4 とずれます(この例では Q2 = 6.5・Q3 = 7 はたまたま一致します)。テストの答え合わせには1つ目の表を使ってください。
3つ目の表は外れ値の目安で、答えは下側 −0.5・上側 11.5 になります。下側の値(−0.5)以下、または上側の値(11.5)以上のデータが外れ値です。
Googleスプレッドシートで計算する方法
| データ1(小さい順に入力) | 2 |
| データ2 | 3 |
| データ3 | 4 |
| データ4 | 5 |
| データ5 | 6 |
| データ6 | 7 |
| データ7 | 7 |
| データ8 | 7 |
| データ9 | 8 |
| データ10 | 10 |
| 中央値 Q2(全体の中央値) | =MEDIAN(B1:B10) |
| 第1四分位数 Q1(下位のデータ=前半5個の中央値) | =MEDIAN(B1:B5) |
| 第3四分位数 Q3(上位のデータ=後半5個の中央値) | =MEDIAN(B6:B10) |
| 四分位範囲 IQR | =B13-B12 |
| 四分位偏差 | =B14/2 |
| データ1 | 2 |
| データ2 | 3 |
| データ3 | 4 |
| データ4 | 5 |
| データ5 | 6 |
| データ6 | 7 |
| データ7 | 7 |
| データ8 | 7 |
| データ9 | 8 |
| データ10 | 10 |
| Q1(QUARTILE) | =QUARTILE(B1:B10,1) |
| Q2(QUARTILE) | =QUARTILE(B1:B10,2) |
| Q3(QUARTILE) | =QUARTILE(B1:B10,3) |
| 第1四分位数 Q1 | 4 |
| 第3四分位数 Q3 | 7 |
| 四分位範囲 IQR | =B2-B1 |
| 外れ値の目安(下側)Q1−1.5×IQR | =B1-1.5*B3 |
| 外れ値の目安(上側)Q3+1.5×IQR | =B2+1.5*B3 |
Pythonで計算する方法
# データ(カンマ区切りで書き換えてください)
data = [3, 7, 7, 4, 10, 8, 6, 5, 7, 2]
def median(sorted_values):
# 小さい順に並んだリストの中央値(偶数個なら中央2つの平均)
count = len(sorted_values)
middle = count // 2
if count % 2 == 1:
return sorted_values[middle]
return (sorted_values[middle - 1] + sorted_values[middle]) / 2
values = sorted(data)
n = len(values)
lower_half = values[: n // 2] # 下位のデータ(奇数個なら中央値を除いた前半)
upper_half = values[(n + 1) // 2:] # 上位のデータ(同じく後半)
q1 = median(lower_half)
q2 = median(values)
q3 = median(upper_half)
iqr = q3 - q1
quartile_deviation = iqr / 2
fence_low = q1 - 1.5 * iqr
fence_high = q3 + 1.5 * iqr
outliers = [v for v in values if v <= fence_low or v >= fence_high]
print(f"Q1 = {q1}, Q2(中央値)= {q2}, Q3 = {q3}")
print(f"四分位範囲 IQR = {iqr}, 四分位偏差 = {quartile_deviation}")
print(f"外れ値(1.5×IQR基準): {outliers if outliers else 'なし'}")
数式記述言語(LaTeX等)での書き方(コピペ可)
Q₂ = Med(全体), Q₁ = Med(下位のデータ), Q₃ = Med(上位のデータ)
Q_2 = \mathrm{Med}(\text{全体}),\quad Q_1 = \mathrm{Med}(\text{下位のデータ}),\quad Q_3 = \mathrm{Med}(\text{上位のデータ})
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<msub><mi>Q</mi><mn>2</mn></msub><mo>=</mo>
<mi>Med</mi><mo>(</mo><mtext>全体</mtext><mo>)</mo>
<mo>,</mo>
<msub><mi>Q</mi><mn>1</mn></msub><mo>=</mo>
<mi>Med</mi><mo>(</mo><mtext>下位のデータ</mtext><mo>)</mo>
<mo>,</mo>
<msub><mi>Q</mi><mn>3</mn></msub><mo>=</mo>
<mi>Med</mi><mo>(</mo><mtext>上位のデータ</mtext><mo>)</mo>
</mrow>
</math>
Q_2 = "Med"("全体"), Q_1 = "Med"("下位のデータ"), Q_3 = "Med"("上位のデータ")
q2 = Median[data]; q1 = Median[lower]; q3 = Median[upper] (* lower/upper = 中央値で分けた前半・後半 *)
q2 := Statistics:-Median(data); q1 := Statistics:-Median(lower); q3 := Statistics:-Median(upper);
q2 = median(x); q1 = median(lower); q3 = median(upper);
Q_2 = Med(全体), Q_1 = Med(下位のデータ), Q_3 = Med(上位のデータ)
IQR = Q₃ − Q₁, 四分位偏差 = IQR ÷ 2
\mathrm{IQR} = Q_3 - Q_1,\quad \text{四分位偏差} = \dfrac{\mathrm{IQR}}{2}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>IQR</mi><mo>=</mo>
<msub><mi>Q</mi><mn>3</mn></msub>
<mo>−</mo>
<msub><mi>Q</mi><mn>1</mn></msub>
<mo>,</mo>
<mtext>四分位偏差</mtext><mo>=</mo>
<mfrac><mi>IQR</mi><mn>2</mn></mfrac>
</mrow>
</math>
IQR = Q_3 - Q_1, "四分位偏差" = IQR / 2
iqr = q3 - q1; quartileDeviation = iqr/2
iqr := q3 - q1; qd := iqr/2;
iqr_value = q3 - q1; qd = iqr_value/2;
IQR = Q_3 − Q_1, 四分位偏差 = IQR/2
x ≦ Q₁ − 1.5×IQR または x ≧ Q₃ + 1.5×IQR
x \leqq Q_1 - 1.5 \times \mathrm{IQR} \quad \text{または} \quad x \geqq Q_3 + 1.5 \times \mathrm{IQR}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>x</mi><mo>≦</mo>
<msub><mi>Q</mi><mn>1</mn></msub>
<mo>−</mo>
<mn>1.5</mn><mo>×</mo><mi>IQR</mi>
<mtext> または </mtext>
<mi>x</mi><mo>≧</mo>
<msub><mi>Q</mi><mn>3</mn></msub>
<mo>+</mo>
<mn>1.5</mn><mo>×</mo><mi>IQR</mi>
</mrow>
</math>
x <= Q_1 - 1.5 xx IQR " または " x >= Q_3 + 1.5 xx IQR
Select[data, # <= q1 - 1.5 iqr || # >= q3 + 1.5 iqr &]
select(v -> v <= q1 - 1.5*iqr or v >= q3 + 1.5*iqr, data);
outliers = x(x <= q1 - 1.5*iqr | x >= q3 + 1.5*iqr);
x ≤ Q_1 − 1.5×IQR or x ≥ Q_3 + 1.5×IQR
ChatGPT に聞いて計算してもらう方法
あなたは数学(データの分析)の計算アシスタントです。次の計算を、必ずPythonコードを実際に実行して行い、実行結果の数値だけを根拠に回答してください(暗算や推測で答えないでください)。 次のデータの四分位数を、日本の高校教科書の定義で計算してください。 データ: 3, 7, 7, 4, 10, 8, 6, 5, 7, 2 教科書の定義: データを小さい順に並べ、中央値で前半(下位のデータ)と後半(上位のデータ)に分ける(データが奇数個のときは中央値をどちらにも含めない)。第1四分位数 Q1 は下位のデータの中央値、第3四分位数 Q3 は上位のデータの中央値とする。statistics.quantiles などの補間式の関数は使わないでください。 次の内容をそれぞれ示してください。 1. 小さい順に並べたデータと、下位のデータ・上位のデータの分け方 2. Q1・中央値 Q2・Q3 の値 3. 四分位範囲 IQR と四分位偏差 4. 1.5×IQRルール(Q1 − 1.5×IQR 以下、または Q3 + 1.5×IQR 以上の値)による外れ値
計算ドリル(演習問題)
このページの計算を、自分の手でできるようになるための演習問題です。
答えと解説は解答ページにあります。
使い方
-
1数値を入力計算したい数値を入力欄に入力します
-
2計算「計算する」ボタンを押します
-
3結果を確認計算結果がその場に表示されます。計算の考え方や式の解説も同じページで確認できます
DataChefの特徴
専門知識不要、直感的で簡単な操作
個人情報を登録することなく使用できます
「ダウンロード」押下でファイルを自動削除
クレジット表記不要
商用利用許諾の連絡も不要です
