관계를 알아보고 싶은 두 종류의 자료를 각각 쉼표(,)로 구분해 입력하세요. 상관계수 r, 공분산, 회귀직선의 식을 계산하고 산점도에 회귀직선을 겹쳐 그립니다.
이 페이지에서 할 수 있는 것
- \(x\)와 \(y\)의 짝 자료(두 변량)를 넣기만 하면 상관계수 \(r\)과 공분산 \(s_{xy}\)를 그 자리에서 알 수 있습니다
- \(x\), \(y\) 각각의 평균, 분산, 표준편차와 회귀직선(최소제곱법) \(y = ax + b\)의 식도 함께 계산합니다
- 산점도에 회귀직선과 평균점을 겹쳐 그리므로 두 자료의 관계(오른쪽 위로 올라가는지, 오른쪽 아래로 내려가는지, 흩어져 있는지)를 한눈에 알 수 있습니다
- 상관계수의 값으로 ‘강한 양의 상관관계’, ‘상관관계가 거의 없음’ 같은 기준에 따른 해석도 보여 줍니다
- 공식의 쉬운 해설과 Excel·Google 스프레드시트·Python에 그대로 복사해 쓸 수 있는 수식도 이 페이지에 정리되어 있습니다
이 계산은 어디에 쓰일까요?
‘공부 시간을 늘리면 성적이 오를까’를 감이 아니라 자료로 확인하는 것이 상관계수의 대표적인 쓰임입니다. 학생마다의 공부 시간과 점수의 짝으로 \(r\)을 계산하면 관계의 강도를 하나의 숫자로 알 수 있습니다.
학교나 학원에서는 모의고사의 과목 간 상관관계(수학을 잘하는 학생은 과학도 잘하는지 등)를 조사해 지도에 활용하기도 합니다. 다만 상관관계가 있어도 ‘시간만 늘리면 반드시 오른다’는 인과관계의 증명은 되지 않는다는 점에 주의해야 합니다.
아이스크림이나 차가운 음료의 매출은 기온과 양의 상관관계, 호빵이나 어묵은 기온과 음의 상관관계를 가진다고 알려져 있습니다. 편의점이나 음식점에서는 과거의 ‘기온과 판매량’ 자료로 상관관계를 확인하고, 일기 예보에 맞춰 발주량이나 진열을 바꿉니다.
회귀직선까지 구하면 ‘내일 예상 기온이 30도라면 판매량은 약 몇 개’라는 구체적인 예측의 기준도 세울 수 있습니다.
투자의 세계에서는 주식, 채권, 금 등 자산끼리의 가격 움직임의 상관계수가 분산 투자의 기본 도구입니다. 상관관계가 낮은(또는 음의) 자산을 섞으면 한쪽이 내려도 다른 쪽은 잘 내려가지 않으므로 자산 전체의 가격 변동 폭을 줄일 수 있습니다.
연기금이나 펀드의 운용에서도 자산 배분을 정하기 전에 반드시 자산 사이의 상관관계를 분석합니다.
공장에서 불량품이 늘었을 때 ‘가공 온도’, ‘습도’, ‘기계 가동 시간’ 같은 조건과 불량률의 상관계수를 조사하면 어떤 조건이 불량과 함께 움직이는지 좁혀 갈 수 있습니다. 품질 관리에서는 이 분석에 쓰는 산점도가 ‘QC 7가지 도구’ 중 하나로 꼽힐 만큼 기본적인 방법입니다.
상관관계가 강한 조건을 찾으면, 실험으로 조건을 바꿔 인과관계를 확인하는 순서로 개선을 진행합니다.
‘운동량과 혈압’, ‘흡연량과 어떤 병에 걸릴 가능성’처럼 생활 습관과 건강의 관계를 조사하는 연구도 먼저 자료의 상관관계를 확인하는 데서 시작합니다.
한편 ‘상관관계 = 원인’이라고 성급하게 판단하지 않는 훈련의 장이기도 합니다. 유명한 예가 ‘아이스크림의 매출과 물놀이 사고의 건수에는 양의 상관관계가 있다’는 이야기인데, 이는 둘 다 기온이라는 공통의 요인 때문에 늘어날 뿐입니다. 의학 연구에서는 이런 제3의 요인의 영향을 없애는 방법을 거듭해 인과관계에 다가갑니다.
공식과 그림
용어·기호 해설
기호
| \(x_i,\ y_i\) | 엑스 아이, 와이 아이 | \(i\)번째 쌍의 \(x\)의 값과 \(y\)의 값입니다. (예: 세 번째 학생의 공부 시간 \(x_3\)과 점수 \(y_3\)) \(i\)는 index(번호)를 나타낼 때 자주 쓰는 문자입니다. |
| \(n\) | 엔 | 자료의 쌍의 수입니다. number(수)의 머리글자입니다. (예: 5명분의 짝이라면 \(n = 5\)) |
| \(\bar{x},\ \bar{y}\) | 엑스 바, 와이 바 | \(x\), \(y\) 각각의 평균입니다. 문자 위의 가로 막대(바)는 ‘평균’을 나타내는 관례적인 기호입니다. |
| \(x_i - \bar{x}\) | 엑스 아이 빼기 엑스 바 | \(x\)의 편차입니다. 각 자료가 \(x\)의 평균에서 얼마나 떨어져 있는지를 나타냅니다. \(y_i - \bar{y}\)는 \(y\)의 편차입니다. |
| \(s_{xy}\) | 에스 엑스와이 | \(x\)와 \(y\)의 공분산입니다. 편차의 곱의 평균으로, 두 자료가 함께 움직이는 경향을 나타냅니다. \(s\)는 standard deviation(표준편차)과 같은 계열의 통계량임을 나타내는 관례적인 문자입니다. |
| \(s_x,\ s_y\) | 에스 엑스, 에스 와이 | \(x\), \(y\) 각각의 표준편차(흩어진 정도의 크기)입니다. 분산의 제곱근입니다. |
| \(s_x^2,\ s_y^2\) | 에스 엑스 제곱, 에스 와이 제곱 | \(x\), \(y\) 각각의 분산입니다. 편차의 제곱의 평균(\(n\)으로 나눔)입니다. |
| \(r\) | 알 | 상관계수입니다. correlation(상관)이나 relation(관계)의 \(r\)에서 왔다고 합니다. 반드시 \(-1\) 이상 \(1\) 이하의 값이 됩니다. |
| \(\sum\) | 시그마(합의 기호) | ‘모두 더한다’는 뜻의 기호입니다. \(\sum_{i=1}^{n}\)는 ‘\(i = 1\)부터 \(n\)까지 모두 더한다’고 읽습니다. |
| \(a,\ b\) | 에이, 비 | 회귀직선 \(y = ax + b\)의 기울기와 y절편입니다. 일차함수와 같은 기호입니다. |
용어
| 상관관계 | 한쪽이 늘면 다른 쪽도 늘어나는(또는 줄어드는), 두 자료 사이의 직선적인 관계의 경향을 말합니다. 관계가 강할수록 산점도의 점들이 직선에 가깝게 늘어섭니다. |
| 양의 상관관계 | \(x\)가 늘면 \(y\)도 늘어나는 경향을 말합니다. 산점도는 오른쪽 위로 올라가고, 상관계수는 양수가 됩니다. |
| 음의 상관관계 | \(x\)가 늘면 \(y\)가 줄어드는 경향을 말합니다. 산점도는 오른쪽 아래로 내려가고, 상관계수는 음수가 됩니다. |
| 상관계수 | 상관관계의 강도와 방향을 \(-1\)부터 \(1\)까지의 하나의 숫자로 나타낸 지표입니다(피어슨 상관계수라고도 합니다). 공분산을 \(x\), \(y\)의 표준편차의 곱으로 나누어 구합니다. 단위에 영향을 받지 않으므로 서로 다른 자료끼리도 강도를 비교할 수 있습니다. |
| 공분산 | \(x\)의 편차와 \(y\)의 편차의 곱의 평균입니다. 양수이면 오른쪽 위로 올라가는 경향, 음수이면 오른쪽 아래로 내려가는 경향을 나타냅니다. 이 페이지에서는 쌍의 수 \(n\)으로 나눕니다(모집단 방식). |
| 산점도 | 짝 자료 \((x,\ y)\)를 좌표평면 위의 점으로 찍은 그림입니다. 점들이 늘어선 모양으로 상관관계의 방향과 강도를 한눈에 읽을 수 있습니다. |
| 변량 | 키, 점수, 기온처럼 자료로 재는 양을 말합니다. 이 페이지에서는 \(x\)와 \(y\)의 ‘두 변량’의 관계를 알아봅니다. |
| 편차 | 각 자료와 평균의 차입니다. 양수이면 평균보다 크고, 음수이면 평균보다 작다는 뜻입니다. 공분산, 분산, 표준편차는 모두 편차로 만들어집니다. |
| 분산 | 편차의 제곱의 평균입니다. 자료가 흩어진 정도의 크기를 나타냅니다. 회귀직선의 기울기의 분모에 나옵니다. |
| 표준편차 | 분산의 제곱근입니다. 단위가 자료와 같아지므로 흩어진 정도의 기준으로 쓰기 좋은 값입니다. 상관계수의 분모에 나옵니다. |
| 회귀직선 (추세선) | 산점도의 점들에 가장 잘 들어맞는 직선 \(y = ax + b\)를 말합니다. \(x\)의 값으로 \(y\)의 값을 예측할 때 씁니다. Excel 등에서는 ‘추세선’이라고 부릅니다. |
| 최소제곱법 | 각 점과 직선 사이의 세로 방향의 차이(오차)를 제곱해서 모두 더한 값이 가장 작아지도록 직선의 기울기와 y절편을 정하는 방법입니다. 회귀직선은 이 방법으로 정한 직선입니다. |
| 이상값 | 다른 점들에서 크게 떨어진 값입니다. 상관계수는 이상값의 영향을 크게 받으므로 산점도와 함께 확인하는 것이 기본입니다. |
| 연관성 | 두 양이 함께 움직이는(한쪽이 늘면 다른 쪽도 늘거나 줄어드는) 관계입니다. 상관관계가 있어도 한쪽이 원인이고 다른 쪽이 결과(인과관계)라고는 할 수 없습니다. 뒤에 공통의 원인(제3의 요인)이 있을 뿐인 경우도 있습니다. |
| 인과관계 | 한쪽이 원인이고 다른 쪽이 그 결과로 정해지는 관계입니다. 연관성(함께 움직이는 것)이 있다는 것만으로는 인과관계라고 할 수 없으며, 뒤에 공통의 원인(제3의 요인)이 있을 뿐인 경우도 있습니다. |
먼저 알아 두면 좋은 내용
이 페이지의 계산을 ‘뜻을 이해하고’ 쓸 수 있도록, 미리 알아 두면 좋은 내용을 정리했습니다.
막히면 이 표의 내용으로 돌아가 복습하는 것이 지름길입니다.
| 평균(초등학교 5학년, 10~11세) |
|
| 정수와 유리수의 계산(중학교 1학년, 12~13세) |
|
| 좌표평면과 일차함수(중학교 1~2학년, 12~14세) |
|
| 제곱근(중학교 3학년, 14~15세) |
|
| 산포도와 상관관계(중학교 3학년, 14~15세) |
|
Excel로 계산하는 방법
| x의 1번째 | 1 |
| x의 2번째 | 2 |
| x의 3번째 | 3 |
| x의 4번째 | 4 |
| x의 5번째 | 5 |
| y의 1번째 | 2 |
| y의 2번째 | 4 |
| y의 3번째 | 4 |
| y의 4번째 | 4 |
| y의 5번째 | 6 |
| 공분산 s_xy(n으로 나눔) | =COVARIANCE.P(B1:B5,B6:B10) |
| (참고) n−1로 나누는 표본공분산 | =COVARIANCE.S(B1:B5,B6:B10) |
| x의 1번째 | 1 |
| x의 2번째 | 2 |
| x의 3번째 | 3 |
| x의 4번째 | 4 |
| x의 5번째 | 5 |
| y의 1번째 | 2 |
| y의 2번째 | 4 |
| y의 3번째 | 4 |
| y의 4번째 | 4 |
| y의 5번째 | 6 |
| 상관계수 r | =CORREL(B1:B5,B6:B10) |
| (참고) PEARSON 함수로도 같은 값 | =PEARSON(B1:B5,B6:B10) |
| x의 1번째 | 1 |
| x의 2번째 | 2 |
| x의 3번째 | 3 |
| x의 4번째 | 4 |
| x의 5번째 | 5 |
| y의 1번째 | 2 |
| y의 2번째 | 4 |
| y의 3번째 | 4 |
| y의 4번째 | 4 |
| y의 5번째 | 6 |
| 기울기 a | =SLOPE(B6:B10,B1:B5) |
| y절편 b | =INTERCEPT(B6:B10,B1:B5) |
| x의 1번째 | 1 |
| x의 2번째 | 2 |
| x의 3번째 | 3 |
| x의 4번째 | 4 |
| x의 5번째 | 5 |
| y의 1번째 | 2 |
| y의 2번째 | 4 |
| y의 3번째 | 4 |
| y의 4번째 | 4 |
| y의 5번째 | 6 |
| x의 평균 x̄ | =AVERAGE(B1:B5) |
| y의 평균 ȳ | =AVERAGE(B6:B10) |
| x의 분산 s_x² | =VARP(B1:B5) |
| x의 표준편차 s_x | =STDEVP(B1:B5) |
| y의 분산 s_y² | =VARP(B6:B10) |
| y의 표준편차 s_y | =STDEVP(B6:B10) |
첫 번째 표의 공분산은 1.6(표본공분산은 2), 두 번째 표의 상관계수는 약 0.8944, 세 번째 표는 기울기 0.8, y절편 1.6이 됩니다.
공분산의 함수는 두 가지이므로 주의하세요. COVARIANCE.P가 ‘n으로 나누는’ 공분산(이 계산기와 같음), COVARIANCE.S가 ‘n − 1로 나누는’ 표본공분산입니다. 오래된 Excel(2007 이전)에서는 COVARIANCE.P 대신 COVAR를 씁니다.
상관계수는 CORREL로도 PEARSON으로도 같은 값이 나옵니다(상관계수는 n으로 나누든 n − 1로 나누든 같은 값이 되므로 함수를 구별해서 쓸 필요가 없습니다).
SLOPE와 INTERCEPT는 ‘y의 범위, x의 범위’ 순서로 지정합니다(x가 먼저가 아니라는 점에 주의하세요).
자료의 쌍의 수를 바꾸고 싶을 때는 숫자의 행을 늘리거나 줄인 뒤, 수식의 ‘B1:B5’, ‘B6:B10’ 부분을 실제 자료 범위로 바꾸세요.
Google 스프레드시트로 계산하는 방법
| x의 1번째 | 1 |
| x의 2번째 | 2 |
| x의 3번째 | 3 |
| x의 4번째 | 4 |
| x의 5번째 | 5 |
| y의 1번째 | 2 |
| y의 2번째 | 4 |
| y의 3번째 | 4 |
| y의 4번째 | 4 |
| y의 5번째 | 6 |
| 공분산 s_xy(n으로 나눔) | =COVAR(B1:B5,B6:B10) |
| x의 1번째 | 1 |
| x의 2번째 | 2 |
| x의 3번째 | 3 |
| x의 4번째 | 4 |
| x의 5번째 | 5 |
| y의 1번째 | 2 |
| y의 2번째 | 4 |
| y의 3번째 | 4 |
| y의 4번째 | 4 |
| y의 5번째 | 6 |
| 상관계수 r | =CORREL(B1:B5,B6:B10) |
| x의 1번째 | 1 |
| x의 2번째 | 2 |
| x의 3번째 | 3 |
| x의 4번째 | 4 |
| x의 5번째 | 5 |
| y의 1번째 | 2 |
| y의 2번째 | 4 |
| y의 3번째 | 4 |
| y의 4번째 | 4 |
| y의 5번째 | 6 |
| 기울기 a | =SLOPE(B6:B10,B1:B5) |
| y절편 b | =INTERCEPT(B6:B10,B1:B5) |
Google 스프레드시트에서는 ‘n으로 나누는’ 공분산을 COVAR 함수로 구합니다(이 계산기와 같은 정의. COVARIANCE.P라는 이름으로도 같은 함수를 부를 수 있습니다). 상관계수는 Excel과 같은 CORREL입니다.
Python으로 계산하는 방법
import statistics
xs = [1, 2, 3, 4, 5] # x의 자료(예: 공부 시간)
ys = [2, 4, 4, 4, 6] # y의 자료(예: 쪽지 시험 점수)
n = len(xs)
mean_x = statistics.mean(xs) # x의 평균
mean_y = statistics.mean(ys) # y의 평균
# 공분산 s_xy(모집단 방식: n으로 나눔)
covariance = sum((x - mean_x) * (y - mean_y) for x, y in zip(xs, ys)) / n
sd_x = statistics.pstdev(xs) # x의 표준편차(n으로 나눔)
sd_y = statistics.pstdev(ys) # y의 표준편차(n으로 나눔)
r = covariance / (sd_x * sd_y) # 상관계수
slope = covariance / statistics.pvariance(xs) # 회귀직선의 기울기 a
intercept = mean_y - slope * mean_x # 회귀직선의 y절편 b
print(f"공분산 s_xy: {covariance}")
print(f"상관계수 r: {r}")
# y절편에 부동소수점 오차(1.5999...)가 생길 수 있으므로 유효숫자 10자리로 반올림해 표시
print(f"회귀직선: y = {slope:.10g}x + {intercept:.10g}")
LaTeX 등 수식 언어로 쓰는 법(복사 가능)
s_xy = {(x₁ − x̄)(y₁ − ȳ) + … + (xₙ − x̄)(yₙ − ȳ)} ÷ n
s_{xy} = \dfrac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<mo>=</mo>
<mfrac><mn>1</mn><mi>n</mi></mfrac>
<munderover>
<mo>∑</mo>
<mrow><mi>i</mi><mo>=</mo><mn>1</mn></mrow>
<mi>n</mi>
</munderover>
<mrow>
<mo>(</mo><msub><mi>x</mi><mi>i</mi></msub><mo>−</mo><mover><mi>x</mi><mo>¯</mo></mover><mo>)</mo>
<mo>(</mo><msub><mi>y</mi><mi>i</mi></msub><mo>−</mo><mover><mi>y</mi><mo>¯</mo></mover><mo>)</mo>
</mrow>
</mrow>
</math>
s_(xy) = (1/n) sum_(i=1)^n (x_i - bar x)(y_i - bar y)
Covariance[xdata, ydata]*(Length[xdata] - 1)/Length[xdata] (* Covariance는 n-1로 나누므로 n으로 나눈 값으로 바꾸었습니다 *)
s_xy := add((x[i] - x_bar)*(y[i] - y_bar), i = 1 .. n)/n;
s_xy = mean((x - mean(x)).*(y - mean(y)));
s_xy = (1/n) ∑_(i=1)^n (x_i − x̄)(y_i − ȳ)
r = s_xy ÷ (s_x × s_y)
r = \dfrac{s_{xy}}{s_x\, s_y}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>r</mi>
<mo>=</mo>
<mfrac>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<mrow><msub><mi>s</mi><mi>x</mi></msub><msub><mi>s</mi><mi>y</mi></msub></mrow>
</mfrac>
</mrow>
</math>
r = s_(xy) / (s_x s_y)
Correlation[xdata, ydata]
r := s_xy/(s_x*s_y);
R = corrcoef(x, y); r = R(1, 2);
r = s_xy/(s_x s_y)
y = ax + b, a = s_xy ÷ s_x², b = ȳ − a·x̄
y = ax + b, \quad a = \dfrac{s_{xy}}{s_x^{2}}, \quad b = \bar{y} - a\bar{x}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>y</mi><mo>=</mo><mi>a</mi><mi>x</mi><mo>+</mo><mi>b</mi>
<mo>,</mo><mspace width="1em"/>
<mi>a</mi><mo>=</mo>
<mfrac>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<msubsup><mi>s</mi><mi>x</mi><mn>2</mn></msubsup>
</mfrac>
<mo>,</mo><mspace width="1em"/>
<mi>b</mi><mo>=</mo>
<mover><mi>y</mi><mo>¯</mo></mover>
<mo>−</mo>
<mi>a</mi><mover><mi>x</mi><mo>¯</mo></mover>
</mrow>
</math>
y = a x + b, a = s_(xy)/s_x^2, b = bar y - a bar x
lm = LinearModelFit[Transpose[{xdata, ydata}], t, t]; lm["BestFitParameters"]
a := s_xy/s_x^2; b := y_bar - a*x_bar;
p = polyfit(x, y, 1); % p(1) = 기울기 a, p(2) = y절편 b
y = ax + b, a = s_xy/s_x^2, b = ȳ − ax̄
ChatGPT 에게 물어서 계산하는 방법
당신은 통계 계산 도우미입니다. 다음 계산을 반드시 Python 코드를 실제로 실행해서 하고, 실행 결과의 숫자만을 근거로 답해 주세요(암산이나 추측으로 답하지 마세요). 다음 짝 자료에 대해 아래 값을 각각 구해 주세요. x: 1, 2, 3, 4, 5 y: 2, 4, 4, 4, 6 1. x와 y 각각의 평균, n으로 나누는 분산과 표준편차 2. 공분산 s_xy(편차의 곱의 합을 쌍의 수 n으로 나눈 값. n − 1로 나누지 마세요) 3. 상관계수 r 4. 회귀직선 y = ax + b(최소제곱법)의 기울기 a와 y절편 b 계산에 사용한 공식과 실행 결과의 숫자를 보여 주세요.
사용법
-
1숫자 입력계산하고 싶은 숫자를 입력란에 입력합니다
-
2계산‘계산’ 버튼을 누릅니다
-
3결과 확인계산 결과가 바로 표시됩니다. 계산의 원리와 공식 해설도 같은 페이지에서 확인할 수 있습니다
DataChef의 특징
전문 지식 없이도 직관적이고 간단하게 사용
개인정보를 등록하지 않고도 이용할 수 있습니다
"다운로드"를 누르면 파일이 자동으로 삭제됩니다
출처 표기 불필요
상업적 이용 허가 연락도 필요 없습니다