평균, 표준편차와 알고 싶은 범위의 하한·상한을 입력하세요. 범위에 들어갈 확률과 신뢰구간의 표를 계산합니다.
이 페이지에서 할 수 있는 것
- ‘평균 \(\mu\)’와 ‘흩어진 정도(표준편차 \(\sigma\))’를 넣기만 하면 값이 지정한 범위에 들어갈 확률을 그 자리에서 알 수 있습니다
- ‘80점 이상은 상위 몇 %?’처럼 어떤 값 이상(이하)이 될 확률도 함께 계산합니다
- 통계에서 자주 쓰는 신뢰구간(전체의 95%가 들어가는 범위 등)의 표도 함께 보여 줍니다
- 정규분포의 쉬운 해설과 Excel·Google 스프레드시트·Python에 그대로 복사해 쓸 수 있는 수식도 이 페이지에 정리되어 있습니다
이 계산은 어디에 쓰일까요?
수능의 국어·수학 표준점수는 원점수를 ‘평균을 100, 표준편차 1개분을 20점’으로 바꾼 것입니다. 정규분포라면 평균 \(+1\sigma\) 이상(표준점수 120점 이상)은 전체의 약 16%, \(+2\sigma\) 이상(140점 이상)은 약 2.3%밖에 되지 않습니다.
이 관계를 알면 ‘표준점수가 10점 오른다’는 것의 무게나 모의고사의 백분위·등급이 뜻하는 바를 감이 아니라 숫자로 읽을 수 있게 됩니다(실제 시험의 점수 분포는 정규분포와 완전히 같지는 않습니다).
혈액 검사 등의 ‘참고 범위(정상 범위)’는 건강한 사람의 측정값의 분포에서 가운데 95%가 들어가는 범위(대략 평균 \(\pm 2\sigma\))로 정하는 경우가 많습니다.
즉 어느 검사 항목이든 건강한 사람의 약 5%(20명 중 1명)는 참고 범위를 벗어납니다. 항목이 많은 건강검진에서는 건강해도 어딘가 하나는 걸리는 사람이 오히려 드물지 않습니다. 이 사실을 알면 ‘기준치를 조금 벗어났다 = 곧바로 이상’이 아니라는 것을 이해한 상태에서 의사의 설명을 차분하게 들을 수 있습니다. 검사 결과에 일희일비하기 쉬운 사람일수록 도움이 되는 지식입니다.
제품의 무게나 치수의 차이는 정규분포에 가까워집니다. 예를 들어 ‘내용량의 평균 102 g, 표준편차 1 g, 규격의 하한 100 g’이라면 규격에 못 미치는 것은 \(-2\sigma\)보다 바깥쪽인 약 2.3%라고 어림할 수 있습니다.
공장에서는 이 계산으로 불량률을 예측하고, 평균을 어디에 맞추면(= 얼마나 넉넉하게 넣으면) 불만과 원가의 균형을 맞출 수 있는지 정합니다.
디자인 A와 B 중 어느 쪽의 클릭률이 높은지 비교할 때 ‘이 차이가 우연의 범위인지, 진짜 차이인지’를 정규분포(신뢰구간)로 판정합니다.
결과에 표시되는 신뢰구간 표의 ‘0.95’ 행이 바로 실무에서 가장 많이 쓰는 ‘95% 신뢰구간’입니다. 광고비처럼 큰돈을 움직이는 판단의 뒤에서 이 계산이 매일 쓰이고 있습니다.
보험계리사라고 불리는 전문가는 보험금 지급의 위험을 확률로 어림해 보험료를 정합니다.
하나하나의 사고는 예측할 수 없어도 많은 계약자의 합계는 정규분포에 가까워지는 성질(중심극한정리)이 있으므로 전체 지급액은 놀랄 만큼 정확하게 예측할 수 있습니다. 우리가 적당한 보험료로 큰 보장을 받을 수 있는 것은 이 수학 덕분입니다.
공식과 그래프
용어·기호 해설
기호
| \(\mu\) | 뮤 | 평균입니다. 분포의 봉우리의 중심 위치입니다. 그리스 문자로, 영어의 m에 해당합니다. |
| \(\sigma\) | 시그마 | 표준편차입니다. 자료가 흩어진 정도의 크기로, 봉우리의 폭을 정합니다. 클수록 봉우리는 낮고 넓어집니다. 그리스 문자로, 영어의 s에 해당합니다. |
| \(X\) | 엑스(확률변수) | 시험 점수나 키처럼 ‘잴 때마다 값이 달라질 수 있는 양’을 나타내는 문자입니다. |
| \(\Phi\) | 파이(대문자) | 표준정규분포(평균 0, 표준편차 1)의 누적분포함수입니다. ‘그 값 이하가 될 확률’을 돌려주는 함수입니다. |
| \(z\) | 제트(z값·z점수) | 값이 평균에서 표준편차 몇 개분 떨어져 있는지를 나타내는 수입니다. \(z = (x - \mu) \div \sigma\)로 구합니다. |
| \(e\) | 이(자연로그의 밑, 네이피어 수) | 약 2.71828…인 상수입니다. 지수함수의 바탕이 되는 특별한 수입니다. |
| \(\pi\) | 파이(원주율) | 약 3.14159…인 상수입니다. 정규분포의 식에서는 곡선 아래의 넓이의 합을 딱 1로 만들기 위해 나옵니다. |
용어
| 정규분포 | 평균을 중심으로 좌우 대칭인 종 모양으로 흩어진 분포입니다. ‘평균 근처의 값이 가장 자주 나오고, 평균에서 멀어질수록 드물어지는’ 성질을 가진 자료(키, 시험 점수, 제품 무게의 차이 등)의 모형으로 씁니다. |
| 표준편차 | 자료가 흩어진 정도의 크기를 하나의 수로 나타낸 것입니다. 평균이 같아도 넓게 흩어진 자료와 좁게 모인 자료가 있으며, 표준편차가 클수록 분포의 봉우리는 낮고 넓어집니다. |
| 표준화 (z값) | 값을 ‘평균에서 표준편차 몇 개분 떨어져 있는지(\(z\)값)’로 바꾸는 것입니다. 어떤 정규분포든 표준화하면 평균 0, 표준편차 1인 표준정규분포 하나로 확률을 구할 수 있습니다. 수능의 표준점수도 같은 생각으로, 국어·수학은 \(100 + 20 \times z\), 탐구 영역은 \(50 + 10 \times z\)입니다. |
| 누적분포함수 | ‘그 값 이하가 될 확률’을 돌려주는 함수입니다. 표준정규분포의 것은 기호 \(\Phi\)(파이)로 나타내며, 범위에 들어갈 확률은 ‘상한까지의 \(\Phi\)’에서 ‘하한까지의 \(\Phi\)’를 빼서 구합니다. |
| 확률밀도함수 | 분포의 곡선 자체의 식입니다. 곡선의 높이는 확률이 아니라 ‘확률의 밀도’이며, 곡선과 가로축으로 둘러싸인 범위의 넓이가 확률을 나타냅니다. 정규분포에서는 종 모양의 곡선이 됩니다. |
| 신뢰구간 | 결과에 표시되는 표는 평균을 중심으로 분포 전체의 ○%가 들어가는 범위(\(\mu \pm z \times \sigma\))와 배율 \(z\)의 대응표입니다. 참고로 통계학에서 ‘95% 신뢰구간’이라고 할 때는 원래 표본 자료로 모평균 등의 참값을 추정한 구간을 말하지만, 정규분포를 가정하면 같은 \(z\)값(95%라면 1.96)을 쓰므로 이 표의 \(z\)값이 그대로 도움이 됩니다. 여론조사나 검사 결과의 ‘오차의 폭’을 계산할 때 자주 씁니다. |
| 68–95–99.7 규칙 | 정규분포에서는 평균 \(\pm 1\sigma\)에 약 68.3%, \(\pm 2\sigma\)에 약 95.4%, \(\pm 3\sigma\)에 약 99.7%의 자료가 들어간다는, 기억해 두면 편리한 기준입니다(경험 법칙이라고도 합니다). |
| 중심극한정리 | 작은 우연이 많이 겹쳐서 생기는 양(합계나 평균)은 원래 분포와 관계없이 정규분포에 가까워진다는 수학적인 성질입니다. 세상의 많은 자료가 정규분포에 가까워지는 배경에 있는 정리입니다. |
먼저 알아 두면 좋은 내용
이 페이지의 계산을 ‘뜻을 이해하고’ 쓸 수 있도록, 미리 알아 두면 좋은 내용을 정리했습니다.
| 평균(초등학교 5학년, 10~11세) |
|
| 산포도와 표준편차(중학교 3학년, 14~15세) |
|
| 비율과 넓이로 보는 방법(초등학교 6학년~중학교 1학년, 11~13세) |
|
| 표준화와 z값(고등학교 ‘확률과 통계’, 16~18세) |
|
Excel로 계산하는 방법
| 평균 μ | 62 |
| 표준편차 σ | 14 |
| 범위의 하한 | 50 |
| 범위의 상한 | 80 |
| 하한~상한 사이에 들어갈 확률 | =NORM.DIST(B4,B1,B2,TRUE)-NORM.DIST(B3,B1,B2,TRUE) |
| 평균 μ | 62 |
| 표준편차 σ | 14 |
| 이 값 이상의 비율을 알고 싶음 | 80 |
| 그 값 이상이 될 확률 | =1-NORM.DIST(B3,B1,B2,TRUE) |
| 평균 μ | 62 |
| 표준편차 σ | 14 |
| 높이를 알고 싶은 위치 x | 80 |
| 그 위치에서의 곡선의 높이 | =NORM.DIST(B3,B1,B2,FALSE) |
‘범위에 들어갈 확률’은 ‘상한 이하가 될 확률’에서 ‘하한 이하가 될 확률’을 빼서 구합니다.
마지막 인수를 FALSE로 하면 확률이 아니라 그 위치에서의 곡선의 높이(확률밀도함수의 값)가 나옵니다.
붙여 넣으면 B열이 입력 칸이 되고, 마지막 행의 수식이 자동으로 계산합니다. 첫 번째 표는 약 0.70(약 70%), 두 번째 표는 약 0.10(약 10% = 상위 약 10%)이 표시됩니다.
Google 스프레드시트로 계산하는 방법
| 평균 μ | 62 |
| 표준편차 σ | 14 |
| 범위의 하한 | 50 |
| 범위의 상한 | 80 |
| 하한~상한 사이에 들어갈 확률 | =NORMDIST(B4,B1,B2,TRUE)-NORMDIST(B3,B1,B2,TRUE) |
| 평균 μ | 62 |
| 표준편차 σ | 14 |
| 이 값 이상의 비율을 알고 싶음 | 80 |
| 그 값 이상이 될 확률 | =1-NORMDIST(B3,B1,B2,TRUE) |
| 평균 μ | 62 |
| 표준편차 σ | 14 |
| 높이를 알고 싶은 위치 x | 80 |
| 그 위치에서의 곡선의 높이 | =NORMDIST(B3,B1,B2,FALSE) |
NORMDIST(x, 평균, 표준편차, TRUE)가 ‘x 이하가 될 확률’을 돌려주므로, 상한의 값에서 하한의 값을 빼면 범위 안의 확률이 됩니다.
마지막 인수를 FALSE로 하면 확률이 아니라 그 위치에서의 곡선의 높이(확률밀도)가 나옵니다.
Python으로 계산하는 방법
from statistics import NormalDist
mean = 62 # 평균
standard_deviation = 14 # 표준편차
lower_bound = 50 # 범위의 하한
upper_bound = 80 # 범위의 상한
distribution = NormalDist(mean, standard_deviation)
p_between = distribution.cdf(upper_bound) - distribution.cdf(lower_bound)
print(f"{lower_bound}부터 {upper_bound} 사이에 들어갈 확률: {p_between}")
LaTeX 등 수식 언어로 쓰는 법(복사 가능)
P(a ≤ X ≤ b) = Φ((b − μ)/σ) − Φ((a − μ)/σ)
P(a \le X \le b) = \Phi\!\left(\frac{b-\mu}{\sigma}\right) - \Phi\!\left(\frac{a-\mu}{\sigma}\right)
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>P</mi><mo>(</mo><mi>a</mi><mo>≤</mo><mi>X</mi><mo>≤</mo><mi>b</mi><mo>)</mo>
<mo>=</mo>
<mi>Φ</mi>
<mrow>
<mo>(</mo>
<mfrac><mrow><mi>b</mi><mo>−</mo><mi>μ</mi></mrow><mi>σ</mi></mfrac>
<mo>)</mo>
</mrow>
<mo>−</mo>
<mi>Φ</mi>
<mrow>
<mo>(</mo>
<mfrac><mrow><mi>a</mi><mo>−</mo><mi>μ</mi></mrow><mi>σ</mi></mfrac>
<mo>)</mo>
</mrow>
</mrow>
</math>
P(a <= X <= b) = Phi((b - mu)/sigma) - Phi((a - mu)/sigma)
CDF[NormalDistribution[mu, sigma], b] - CDF[NormalDistribution[mu, sigma], a]
with(Statistics): CDF(RandomVariable(Normal(mu, sigma)), b) - CDF(RandomVariable(Normal(mu, sigma)), a);
p = normcdf(b, mu, sigma) - normcdf(a, mu, sigma);
P(a ≤ X ≤ b) = Φ((b-μ)/σ) - Φ((a-μ)/σ)
f(x) = 1/(σ√(2π)) · e^(−(x − μ)²/(2σ²))
f(x) = \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x-\mu)^2}{2\sigma^2}}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>f</mi><mo>(</mo><mi>x</mi><mo>)</mo>
<mo>=</mo>
<mfrac>
<mn>1</mn>
<mrow><mi>σ</mi><msqrt><mrow><mn>2</mn><mi>π</mi></mrow></msqrt></mrow>
</mfrac>
<msup>
<mi>e</mi>
<mrow>
<mo>−</mo>
<mfrac>
<msup><mrow><mo>(</mo><mi>x</mi><mo>−</mo><mi>μ</mi><mo>)</mo></mrow><mn>2</mn></msup>
<mrow><mn>2</mn><msup><mi>σ</mi><mn>2</mn></msup></mrow>
</mfrac>
</mrow>
</msup>
</mrow>
</math>
f(x) = 1/(sigma sqrt(2 pi)) e^(-(x - mu)^2 / (2 sigma^2))
PDF[NormalDistribution[mu, sigma], x]
with(Statistics): PDF(RandomVariable(Normal(mu, sigma)), x);
y = normpdf(x, mu, sigma);
f(x) = 1/(σ√(2π)) e^(-(x-μ)^2/(2σ^2))
ChatGPT 에게 물어서 계산하는 방법
당신은 확률 계산 도우미입니다. 다음 계산을 반드시 Python 코드를 실제로 실행해서 하고, 실행 결과의 숫자만을 근거로 답해 주세요(암산이나 추측으로 답하지 마세요). 어떤 시험의 점수가 평균 62점, 표준편차 14점인 정규분포를 따른다고 합니다. 다음을 각각 구해 주세요. 1. 점수가 50점부터 80점 사이에 들어갈 확률 2. 점수가 80점 이상이 될 확률(상위 몇 %인지) 3. 점수가 50점 이하가 될 확률 Python의 statistics.NormalDist를 쓰고, 사용한 코드와 실행 결과의 숫자를 보여 주세요.
사용법
-
1숫자 입력계산하고 싶은 숫자를 입력란에 입력합니다
-
2계산‘계산’ 버튼을 누릅니다
-
3결과 확인계산 결과가 바로 표시됩니다. 계산의 원리와 공식 해설도 같은 페이지에서 확인할 수 있습니다
DataChef의 특징
전문 지식 없이도 직관적이고 간단하게 사용
개인정보를 등록하지 않고도 이용할 수 있습니다
"다운로드"를 누르면 파일이 자동으로 삭제됩니다
출처 표기 불필요
상업적 이용 허가 연락도 필요 없습니다