書籤    
鞋碼換算    
根號化簡    
梯形面積    
圓的計算    
扇形面積    
橢圓面積    
圓柱體積    
球的體積    
圓錐體積    
圓管體積    
年齡計算    
天數計算    
複利計算    
單利計算    
利息計算    
現值計算    
ROI 計算機    
IRR 計算機    
GDP 計算機    
ROAS 計算    
BMI 計算機    
BMR 計算機    
1RM 計算機    
進位轉換    
薪資換算    
油錢計算    
油耗計算    
坡度計算    
   新增
機率與隨機計算工具
獨立事件機率
獨立事件機率
兩事件機率反推
兩事件機率反推
重複試驗機率
重複試驗機率
條件機率與貝氏定理
條件機率與貝氏定理
期望值計算機
期望值計算機
二項分布計算機
二項分布計算機
排列組合計算
排列組合計算
環狀排列計算
環狀排列計算
重複組合計算
重複組合計算
亂數產生器
亂數產生器
平均與統計計算工具
平均數計算機
平均數計算機
眾數中位數計算
眾數中位數計算
標準差計算機
標準差計算機
四分位數計算機
四分位數計算機
次數分配表
次數分配表
相關係數計算機
相關係數計算機
常態分布機率
常態分布機率
z 分數計算機
z 分數計算機
信賴區間計算機
信賴區間計算機
樣本數計算機
樣本數計算機
捉放法與抽樣調查
捉放法與抽樣調查
p 值計算機
p 值計算機
比例與百分比計算工具
百分比計算機
百分比計算機
增減率計算機
增減率計算機
百分比差異
百分比差異
百分誤差計算機
百分誤差計算機
比例計算機
比例計算機
打折計算機
打折計算機
營業稅計算機
營業稅計算機
毛利率計算機
毛利率計算機
速度計算工具
速率計算機
速率計算機
密度與濃度計算工具
密度計算機
密度計算機
莫耳濃度計算機
莫耳濃度計算機
分子量/莫耳質量
分子量/莫耳質量
物理與電學計算工具
歐姆定律計算
歐姆定律計算
瓦數↔安培換算
瓦數↔安培換算
電阻色碼計算
電阻色碼計算
電壓降計算
電壓降計算
單位換算計算工具
坪↔平方公尺換算
坪↔平方公尺換算
重量單位換算
重量單位換算
鞋碼換算
鞋碼換算
整數與正負數計算工具
除法直式計算
除法直式計算
最小公倍數計算
最小公倍數計算
最大公因數計算
最大公因數計算
正負數計算機
正負數計算機
質因數分解
質因數分解
一次不定方程式
一次不定方程式
同餘與餘數計算
同餘與餘數計算
因數計算機
因數計算機
羅馬數字轉換
羅馬數字轉換
分數、小數與四捨五入計算工具
分數計算機
分數計算機
帶分數計算機
帶分數計算機
約分計算機
約分計算機
分數換小數
分數換小數
小數換分數
小數換分數
四捨五入計算機
四捨五入計算機
方程式與不等式計算工具
一元一次方程式
一元一次方程式
聯立方程式
聯立方程式
一元二次方程式
一元二次方程式
絕對值方程式
絕對值方程式
一元二次不等式
一元二次不等式
多項式與乘法展開計算工具
二項式定理
二項式定理
平方根與 n 次方根計算工具
根號化簡
根號化簡
開根號計算
開根號計算
指數與對數計算工具
次方計算機
次方計算機
對數計算機
對數計算機
常用對數與位數
常用對數與位數
科學記號換算
科學記號換算
科學記號運算
科學記號運算
半衰期計算機
半衰期計算機
複數計算工具
複數計算機
複數計算機
複數極式轉換
複數極式轉換
棣美弗定理
棣美弗定理
函數與圖形計算工具
直線斜率計算
直線斜率計算
一次函數計算機
一次函數計算機
正比反比計算機
正比反比計算機
二次函數 y=ax²
二次函數 y=ax²
兩點距離公式
兩點距離公式
空間兩點距離
空間兩點距離
內分點與外分點
內分點與外分點
點到直線的距離
點到直線的距離
經緯度距離計算
經緯度距離計算
配方法計算機
配方法計算機
圓方程式計算機
圓方程式計算機
圓錐曲線計算機
圓錐曲線計算機
極坐標轉換
極坐標轉換
數列計算工具
等差數列計算
等差數列計算
等比數列計算
等比數列計算
費氏數列計算
費氏數列計算
遞迴關係式計算
遞迴關係式計算
向量計算工具
向量計算機
向量計算機
向量外積計算
向量外積計算
矩陣計算工具
矩陣計算機
矩陣計算機
行列式計算機
行列式計算機
反矩陣計算
反矩陣計算
平面圖形計算工具
sin cos tan 計算
sin cos tan 計算
度與弧度換算
度與弧度換算
三角函數疊合
三角函數疊合
三角形計算機
三角形計算機
三角形面積計算
三角形面積計算
直角三角形計算
直角三角形計算
畢氏定理計算
畢氏定理計算
多邊形內角外角
多邊形內角外角
相似比與面積比
相似比與面積比
平行線與角
平行線與角
長方形面積
長方形面積
平行四邊形面積
平行四邊形面積
梯形面積
梯形面積
圓的計算
圓的計算
扇形面積
扇形面積
圓周角定理
圓周角定理
橢圓面積
橢圓面積
立體圖形計算工具
正方體體積
正方體體積
正方體表面積
正方體表面積
長方體體積
長方體體積
長方體表面積
長方體表面積
圓柱體積
圓柱體積
圓柱表面積
圓柱表面積
球的體積
球的體積
球的表面積
球的表面積
球冠的體積
球冠的體積
球冠的表面積
球冠的表面積
橢球的體積
橢球的體積
橢球的表面積
橢球的表面積
四角錐體積
四角錐體積
四角錐表面積
四角錐表面積
圓錐體積
圓錐體積
圓錐表面積
圓錐表面積
圓錐台體積
圓錐台體積
圓錐台表面積
圓錐台表面積
圓管體積
圓管體積
膠囊形體積
膠囊形體積
膠囊表面積
膠囊表面積
日期與時間計算工具
年齡計算
年齡計算
天數計算
天數計算
幾天後的日期
幾天後的日期
幾小時後的日期時間
幾小時後的日期時間
星期幾查詢
星期幾查詢
時間加減計算機
時間加減計算機
時差計算機
時差計算機
工時計算機
工時計算機
時間差計算機
時間差計算機
打卡工時計算
打卡工時計算
金融與經濟計算工具
複利計算
複利計算
單利計算
單利計算
利息計算
利息計算
財務計算機 TVM
財務計算機 TVM
現值計算
現值計算
未來值計算
未來值計算
ROI 計算機
ROI 計算機
IRR 計算機
IRR 計算機
回收期間計算
回收期間計算
平均報酬率計算
平均報酬率計算
GDP 計算機
GDP 計算機
網路行銷與廣告指標計算工具
CTR 點擊率計算
CTR 點擊率計算
CVR 轉換率計算
CVR 轉換率計算
CPC、CPM、CPA 計算
CPC、CPM、CPA 計算
ROAS 計算
ROAS 計算
損益平衡 CPA
損益平衡 CPA
LTV 顧客終身價值
LTV 顧客終身價值
CAC 顧客取得成本
CAC 顧客取得成本
流失率計算
流失率計算
A/B 測試顯著性
A/B 測試顯著性
A/B 測試樣本數
A/B 測試樣本數
SEO 流量預估
SEO 流量預估
損益平衡點計算
損益平衡點計算
成本率毛利率換算
成本率毛利率換算
CAGR 計算機
CAGR 計算機
健康與健身計算工具
BMI 計算機
BMI 計算機
睡眠週期計算
睡眠週期計算
熱量計算機
熱量計算機
BMR 計算機
BMR 計算機
TDEE 計算機
TDEE 計算機
理想體重計算機
理想體重計算機
體脂率計算機
體脂率計算機
去脂體重計算機
去脂體重計算機
消耗熱量計算機
消耗熱量計算機
蛋白質計算機
蛋白質計算機
三大營養素計算
三大營養素計算
碳水攝取量計算
碳水攝取量計算
脂肪攝取量計算
脂肪攝取量計算
孩子身高預測
孩子身高預測
運動計算工具
高爾夫差點計算
高爾夫差點計算
配速計算機
配速計算機
1RM 計算機
1RM 計算機
目標心跳率計算
目標心跳率計算
氣象計算工具
體感溫度計算
體感溫度計算
風寒效應計算
風寒效應計算
露點溫度計算
露點溫度計算
電腦計算工具
進位轉換
進位轉換
子網路計算機
子網路計算機
下載時間計算
下載時間計算
家計與水電瓦斯費計算工具
家電電費計算
家電電費計算
度數算電費/反推
度數算電費/反推
年耗電量算電費
年耗電量算電費
冷氣坪數計算
冷氣坪數計算
冷氣電費計算
冷氣電費計算
暖氣電費比較
暖氣電費比較
瓦斯與電費比較
瓦斯與電費比較
換 LED 省多少
換 LED 省多少
薪資換算
薪資換算
家庭收支計算
家庭收支計算
汽車計算工具
油錢計算
油錢計算
電動車充電費用
電動車充電費用
電動車 vs 油車
電動車 vs 油車
油耗計算
油耗計算
輪胎尺寸計算
輪胎尺寸計算
太陽能發電與儲能計算工具
太陽能發電量
太陽能發電量
太陽能板片數
太陽能板片數
太陽能回本年限
太陽能回本年限
儲能電池容量試算
儲能電池容量試算
居家與 DIY計算工具
磁磚數量計算
磁磚數量計算
樓梯尺寸計算
樓梯尺寸計算
混凝土用量計算
混凝土用量計算
房間牆面積計算
房間牆面積計算
壁紙用量計算
壁紙用量計算
油漆用量計算
油漆用量計算
木地板片數計算
木地板片數計算
外牆面積計算
外牆面積計算
碎石用量計算
碎石用量計算
水泥砂漿配比
水泥砂漿配比
坡度計算
坡度計算
木材裁切計算
木材裁切計算
建蔽率、容積率
建蔽率、容積率
地板捲材用量
地板捲材用量
隔熱材用量計算
隔熱材用量計算
窗簾尺寸計算
窗簾尺寸計算
電視尺寸與距離
電視尺寸與距離
培養土用量計算
培養土用量計算
草皮用量計算
草皮用量計算
空心磚數量計算
空心磚數量計算
紅磚數量計算
紅磚數量計算
木棧板材料計算
木棧板材料計算
坡道長度計算
坡道長度計算
螺絲導孔與長度
螺絲導孔與長度
換氣量計算
換氣量計算
油漆稀釋計算
油漆稀釋計算
踢腳板長度計算
踢腳板長度計算
百葉窗捲簾尺寸
百葉窗捲簾尺寸
掛畫高度與位置
掛畫高度與位置
排水坡度與高低差
排水坡度與高低差
螺絲數量計算
螺絲數量計算
木材才數計算
木材才數計算
圍籬材料計算
圍籬材料計算
木材收縮計算
木材收縮計算
矽利康用量計算
矽利康用量計算
房間熱損失計算
房間熱損失計算
家具搬入計算
家具搬入計算
搬家紙箱數量
搬家紙箱數量
收納容量計算
收納容量計算
板材裁切計算
板材裁切計算
層板承重計算
層板承重計算

相關係數計算機(共變異數、散布圖、迴歸直線)

請把想調查關係的兩種資料,各自用逗號(,)分隔輸入。會算出相關係數 r、共變異數與迴歸直線的方程式,並在散布圖上疊畫迴歸直線。

x 和 y 依順序配對:第 1 個 x 配第 1 個 y、第 2 個 x 配第 2 個 y……。請輸入相同個數(2 組以上)。也可以輸入小數和負數。
計算結果與圖表
在左側輸入欄用逗號分隔輸入 x 和 y 的資料,按下「計算」,結果和散布圖就會顯示在這裡。

這個頁面可以做什麼

  • 只要輸入成對的 \(x\)、\(y\) 資料(兩個變量),馬上就能知道相關係數 \(r\) 與共變異數 \(s_{xy}\)
  • 同時算出 \(x\)、\(y\) 各自的平均數、變異數、標準差,以及迴歸直線(最小平方法)\(y = ax + b\) 的方程式
  • 在散布圖上疊畫迴歸直線與平均點,兩組資料的關係(往右上升、往右下降,還是散亂)一目了然
  • 依相關係數的值,顯示「高度正相關」「幾乎沒有相關」等參考解讀
  • 這個頁面還整理了公式的淺顯解說,以及可直接複製到 Excel、Google 試算表、Python 使用的公式
共變異數與變異數和台灣高中課本一樣,用「除以資料組數 \(n\)」的定義計算(和除以 \(n-1\) 的樣本版的差別,在 Excel 章節說明)。相關係數 \(r\) 和迴歸直線不論用哪一種,結果都相同。\(x\) 和 \(y\) 的資料個數要相同,至少需要 2 組。

這個計算有什麼用?

用數字確認讀書時間與成績的關係(教育、學習)

用資料而不是憑感覺來確認「讀書時間增加,成績會不會進步」,是相關係數最具代表性的用法。用每個學生讀書時間與分數的成對資料算出 \(r\),一個數字就能看出關係有多強。
學校或補習班有時也會調查模擬考各科之間的相關(數學好的學生,自然科是不是也好等),作為教學的參考。不過要注意,有相關並不能證明「只要增加時間,成績一定會進步」這樣的因果。

由氣溫與銷售量的關係決定進貨(零售、餐飲)

冰淇淋和冷飲的銷售量和氣溫有正相關,關東煮和熱飲則和氣溫有負相關。便利商店和餐廳會從過去「氣溫與銷售數量」的資料確認相關,再依天氣預報調整進貨量和陳列。
再進一步求出迴歸直線,就能做出「明天預報最高氣溫 33 度,大約能賣出幾個」這樣具體的預估。

組合價格走勢相關性低的資產來降低風險(金融、理財)

在投資的世界,股票、債券、黃金等資產之間價格走勢的相關係數,是分散投資的基本工具。組合相關性低(或負相關)的資產,當一方下跌時,另一方比較不容易跟著下跌,整體投資組合的起伏就會比較小。
退休基金和共同基金在決定資產配置之前,也一定會分析資產之間的相關性。

由製造條件與不良率的關係縮小原因範圍(製造、品質管理)

工廠的不良品增加時,調查「加工溫度」「濕度」「機器運轉時間」等條件與不良率之間的相關係數,就能縮小範圍,找出哪些條件和不良一起變動。這是非常基本的方法,用來分析的散布圖甚至是品質管理「QC 七大手法」之一。
找到相關性強的條件後,再用實驗改變條件來確認因果關係,依這樣的流程推動改善。

探究健康與疾病因素的研究起點(醫療、流行病學)

像「運動量與血壓」「吸菸量與罹患某種疾病的機率」這種調查生活習慣與健康關係的研究,也是從確認資料的相關開始。
同時,這也是訓練自己不要把「相關」草率當成「原因」的好機會。有名的例子是「冰淇淋的銷售量和溺水事故的件數有正相關」,其實兩者只是都因為氣溫這個共同因素而增加。醫學研究會用各種方法排除這種第三個因素的影響,以接近真正的因果關係。

公式與圖示

共變異數 \(s_{xy}\)
圖示
數學寫法 (一般的數學式)
\(s_{xy}\) \(=\) \(\displaystyle\sum_{i=1}^{n}\) \((x_i - \bar{x})\) \((y_i - \bar{y})\) \(\div\) \(n\)
文字寫法 (把符號換成文字的公式)
⑤ \(s_{xy}\):共變異數 \(=\) ③ \(\displaystyle\sum\):全部加起來 ① \((x_i - \bar{x})\):\(x\) 的離均差 ② \((y_i - \bar{y})\):\(y\) 的離均差 \(\div\) ④ \(n\):資料組數
用文字讀公式
① 對每一組資料,把 \(x\) 的離均差(\(x\) 的值與 \(x\) 的平均數的差)
② 乘上 \(y\) 的離均差(\(y\) 的值與 \(y\) 的平均數的差) ,
③ 再把這些乘積 全部加起來 \(\displaystyle\sum\) ,
④ 除以 \(n\):資料組數 ,
⑤ 就得到 \(s_{xy}\):共變異數 。
簡單範例
5 個人的讀書時間 \(x\)(小時)是 1, 2, 3, 4, 5,小考分數 \(y\)(分)是 2, 4, 4, 4, 6(平均數 \(\bar{x} = 3\)、\(\bar{y} = 4\))時
\(s_{xy}\):共變異數 \(=\) 離均差乘積的總和(8) \(\div\) 組數(5 組)
\((-2)(-2) + (-1)(0) + (0)(0) + (1)(0) + (2)(2) = 4 + 0 + 0 + 0 + 4 = 8\)
\(s_{xy} = 8 \div 5 = 1.6\)
思考重點
共變異數是把「兩組資料一起變動的傾向」化為數字。\(x\)、\(y\) 同時大於平均數(+×+)或同時小於平均數(−×−)的組越多,乘積的總和就是正的;只有其中一個大於平均數(+×−)的組越多,總和就是負的。 所以共變異數為正,代表「\(x\) 越大,\(y\) 也越大」的傾向(散布圖往右上升);為負,代表「\(x\) 越大,\(y\) 越小」的傾向(往右下降);接近 0,代表「沒有明顯的傾向」。 分母和本頁的變異數一樣是資料組數 \(n\)(母體的式子,和台灣高中課本相同)。統計軟體中也有除以 \(n-1\) 的「樣本共變異數」,Excel 用函數名稱來區分(請見 Excel 章節)。
相關係數 \(r\)
圖示
數學寫法 (一般的數學式)
\(r\) \(=\) \(s_{xy}\) \(\div\) \((\) \(s_x\) \(\times\) \(s_y\) \()\)
文字寫法 (把符號換成文字的公式)
④ \(r\):相關係數 \(=\) ① \(s_{xy}\):共變異數 \(\div\) \((\) ② \(s_x\):\(x\) 的標準差 \(\times\) ③ \(s_y\):\(y\) 的標準差 \()\)
用文字讀公式
① 把 \(s_{xy}\):共變異數
② 除以 \(s_x\):\(x\) 的標準差
③ 與 \(s_y\):\(y\) 的標準差 的乘積,
④ 就得到 \(r\):相關係數 (\(r\) 一定在 \(-1\) 到 \(1\) 之間)。
簡單範例
以剛才讀書時間與分數的例子(\(s_{xy} = 1.6\)、\(s_x = \sqrt{2}\)、\(s_y = \sqrt{1.6}\))來算
\(r\):相關係數 \(=\) 共變異數(1.6) \(\div\) \((\) \(\sqrt{2}\) \(\times\) \(\sqrt{1.6}\) \()\)
\(s_x \times s_y = \sqrt{2} \times \sqrt{1.6} = \sqrt{3.2} \approx 1.789\)
\(r = 1.6 \div 1.789 \approx 0.894\)
思考重點
共變異數很好用,但會受單位影響(把時間從「小時」改成「分鐘」,值就變成 60 倍)。把共變異數除以 \(x\)、\(y\) 的標準差,就變成不受單位影響、介於 \(-1\) 到 \(1\) 的數,這就是相關係數 \(r\)。 \(r\) 越接近 \(1\),正相關越強(越接近往右上升的直線);越接近 \(-1\),負相關越強(越接近往右下降的直線);越接近 \(0\),直線關係越弱。本頁使用的參考標準是:\(0.7 \le |r|\) 為高度相關,\(0.4 \le |r| < 0.7\) 為中度相關,\(0.2 \le |r| < 0.4\) 為低度相關,\(|r| < 0.2\) 為幾乎沒有相關(分界值依課本與領域而不同)。 要注意的是,相關係數衡量的只有「直線關係」。像 U 字形的關係,即使有關係,\(r\) 也可能接近 0。相關係數也很容易受離群值影響,記得搭配散布圖確認。另外,「有相關」不等於有因果關係(一方是另一方的原因)。
迴歸直線(最小平方法)\(y = ax + b\)
圖示
數學寫法 (一般的數學式)
\(a\) \(=\) \(s_{xy}\) \(\div\) \(s_x^{2}\)
\(b\) \(=\) \(\bar{y}\) \(-\) \(a\,\bar{x}\)
文字寫法 (把符號換成文字的公式)
③ \(a\):迴歸直線的斜率 \(=\) ① \(s_{xy}\):共變異數 \(\div\) ② \(s_x^2\):\(x\) 的變異數
⑥ \(b\):迴歸直線的截距 \(=\) ④ \(\bar{y}\):\(y\) 的平均數 \(-\) ⑤ 斜率 \(a\) × \(x\) 的平均數 \(\bar{x}\)
用文字讀公式
① 把 \(s_{xy}\):共變異數
② 除以 \(s_x^2\):\(x\) 的變異數 ,
③ 就得到 \(a\):迴歸直線的斜率 。
④ 從 \(\bar{y}\):\(y\) 的平均數
⑤ 減去 斜率 \(a\) 與 \(x\) 的平均數 \(\bar{x}\) 的乘積 ,
⑥ 就得到 \(b\):迴歸直線的截距 。
簡單範例
以剛才的例子(\(s_{xy} = 1.6\)、\(s_x^2 = 2\)、\(\bar{x} = 3\)、\(\bar{y} = 4\))來算
斜率 \(a\) \(=\) 共變異數(1.6) \(\div\) \(x\) 的變異數(2)
\(a = 1.6 \div 2 = 0.8\)
\(b = 4 - 0.8 \times 3 = 1.6\)
\(y = 0.8x + 1.6\)
思考重點
迴歸直線是最符合散布圖上一群點的直線。它的決定方式是:讓每個點和直線之間的垂直誤差平方後加起來的總和最小。這種決定直線的方法稱為最小平方法(需要的計算只有上面的除法和減法)。 迴歸直線一定會通過平均點 \((\bar{x},\ \bar{y})\),可以在本頁的散布圖上確認。 台灣的高中課本常把迴歸直線寫成 \(y - \bar{y} = r \times \dfrac{s_y}{s_x}(x - \bar{x})\)。因為 \(a = \dfrac{s_{xy}}{s_x^2} = r \times \dfrac{s_y}{s_x}\),所以和本頁的 \(y = ax + b\) 是同一條直線。 用迴歸直線就能做預測,例如「讀書 3.5 小時,分數大約是 \(0.8 \times 3.5 + 1.6 = 4.4\) 分」。不過,把直線延伸到資料範圍之外很遠的預測並不可靠;相關很弱時,用直線預測也沒有什麼意義。
相關係數的求法依序是:(1) 求出 \(x\)、\(y\) 各自的平均數 →(2) 把離均差的乘積 \((x_i - \bar{x})(y_i - \bar{y})\) 全部加起來,除以組數 \(n\),得到共變異數 \(s_{xy}\) →(3) 把共變異數除以 \(x\)、\(y\) 的標準差的乘積。\(r\) 一定在 \(-1\) 到 \(1\) 之間,越接近 \(1\) 表示往右上升的直線關係越強,越接近 \(-1\) 表示往右下降的直線關係越強。

符號與用語解說

符號

\(x_i,\ y_i\) x 下標 i、y 下標 i 第 \(i\) 組資料的 \(x\) 值與 \(y\) 值。(例:第 3 個人的讀書時間 \(x_3\) 與分數 \(y_3\))。\(i\) 是常用來表示編號(index)的文字。
\(n\) n 資料組數,是英文 number(數)的第一個字母。(例:5 個人的成對資料,\(n = 5\))
\(\bar{x},\ \bar{y}\) x bar、y bar \(x\)、\(y\) 各自的平均數。文字上方的橫線(bar)是表示「平均」的慣用符號。台灣高中課本也寫成 \(\mu_x,\ \mu_y\)。
\(x_i - \bar{x}\) x 下標 i 減 x bar \(x\) 的離均差,表示每筆資料離 \(x\) 的平均數有多遠。\(y_i - \bar{y}\) 是 \(y\) 的離均差。
\(s_{xy}\) s 下標 xy \(x\) 與 \(y\) 的共變異數,是離均差乘積的平均,表示兩組資料一起變動的傾向。\(s\) 是表示和標準差(standard deviation)同類統計量的慣用文字。
\(s_x,\ s_y\) s 下標 x、s 下標 y \(x\)、\(y\) 各自的標準差(分散程度的大小),是變異數的平方根。台灣高中課本也寫成 \(\sigma_x,\ \sigma_y\)。
\(s_x^2,\ s_y^2\) s 下標 x 平方、s 下標 y 平方 \(x\)、\(y\) 各自的變異數,是離均差平方的平均(除以 \(n\))。
\(r\) r 相關係數,據說來自英文 correlation(相關)或 relation(關係)的 \(r\)。一定介於 \(-1\) 到 \(1\) 之間。
\(\sum\) sigma(連加符號) 表示「全部加起來」的符號。\(\sum_{i=1}^{n}\) 讀作「從 \(i = 1\) 加到 \(n\)」。
\(a,\ b\) a、b 迴歸直線 \(y = ax + b\) 的斜率與截距,和一次函數的符號相同。

用語

相關 一方增加時另一方也增加(或減少),兩組資料之間直線關係的傾向。關係越強,散布圖上的點越接近排成一條直線。
正相關 \(x\) 增加時 \(y\) 也增加的傾向。散布圖往右上升,相關係數為正。
負相關 \(x\) 增加時 \(y\) 減少的傾向。散布圖往右下降,相關係數為負。
相關係數 用 \(-1\) 到 \(1\) 的一個數值表示相關強度與方向的指標(也稱為皮爾森相關係數)。由共變異數除以 \(x\)、\(y\) 的標準差的乘積求出。因為不受單位影響,不同的資料之間也能比較強弱。
共變異數 \(x\) 的離均差與 \(y\) 的離均差乘積的平均。為正表示往右上升的傾向,為負表示往右下降的傾向。本頁和台灣高中課本一樣除以組數 \(n\)。
散布圖 把成對資料 \((x,\ y)\) 當作坐標平面上的點畫出來的圖。從點的排列方式,一眼就能看出相關的方向與強弱。
變量 像身高、分數、氣溫這樣,當作資料來測量的量。本頁調查 \(x\) 與 \(y\) 這「兩個變量」的關係。
離均差 每筆資料與平均數的差。正數表示比平均數大,負數表示比平均數小。共變異數、變異數、標準差都是由離均差算出來的。
變異數 離均差平方的平均,表示資料分散程度的大小。出現在迴歸直線斜率的分母。
標準差 變異數的平方根。單位和資料相同,很適合當作分散程度的參考。出現在相關係數的分母。
迴歸直線 最符合散布圖上一群點的直線 \(y = ax + b\),也稱為最適直線。用來由 \(x\) 的值預測 \(y\) 的值。
最小平方法 讓每個點與直線之間的垂直誤差平方後加起來的值最小,以此決定直線斜率與截距的方法。迴歸直線就是用這個方法決定的直線。
離群值 和其他點相差很遠的值。相關係數很容易受離群值影響,所以基本上要搭配散布圖一起確認。
相關關係 兩個量一起變動(一方增加時,另一方也增加或減少)的關係。即使有相關,也不一定是一方為原因、另一方為結果(因果關係),可能只是背後有共同的原因(第三個因素)。
因果關係 一方是原因、另一方是它的結果的關係。只有相關關係(一起變動),並不能說有因果關係,可能只是背後有共同的原因(第三個因素)。

建議先了解的基礎知識

為了讓您「真正理解意義」地使用這個頁面的計算,這裡整理了建議事先理解的基礎知識。
遇到卡關時,回頭複習這些內容是最快的捷徑。

平均數(國小高年級、國中七年級)
  • 知道平均數=總和 ÷ 個數
  • 知道平均數代表「資料整體中心的大致位置」
正負數(國中七年級,12~13 歲)
  • 會算含有負數的乘法,例如 \((-1) \times 2 = -2\)、\((-2) \times (-2) = 4\)
  • 知道負數乘負數會變成正數(這是理解共變異數正負意義的基礎)
坐標與一次函數(國中七年級~八年級,12~14 歲)
  • 能把 \((x,\ y)\) 這組數畫成坐標平面上的點(散布圖就是這些點的集合)
  • 知道一次函數 \(y = ax + b\) 中,\(a\) 是斜率、\(b\) 是截距(迴歸直線就是這種形式的直線)
平方根(國中八年級,13~14 歲)
  • 理解平方根是「平方後會等於這個數的數」,例如 \(\sqrt{9} = 3\)
  • 會算平方根的乘法,例如 \(\sqrt{2} \times \sqrt{1.6} = \sqrt{3.2}\)
數據分析(高一「一維數據分析」「二維數據分析」,15~16 歲)
  • 知道離均差(每筆資料與平均數的差)代表什麼
  • 理解變異數與標準差是把「分散程度大小」化為數字的指標(可以在相關頁面的標準差計算機複習)
  • 能從散布圖讀出「往右上升、往右下降、散亂」的傾向

用 Excel 計算的方法

把下方表格整個複製,貼到 Excel 的 A1 儲存格就能直接使用。
求「共變異數 s_xy」的表格
第 1 組的 x 1
第 2 組的 x 2
第 3 組的 x 3
第 4 組的 x 4
第 5 組的 x 5
第 1 組的 y 2
第 2 組的 y 4
第 3 組的 y 4
第 4 組的 y 4
第 5 組的 y 6
共變異數 s_xy(除以 n) =COVARIANCE.P(B1:B5,B6:B10)
(參考)除以 n−1 的樣本共變異數 =COVARIANCE.S(B1:B5,B6:B10)
求「相關係數 r」的表格
第 1 組的 x 1
第 2 組的 x 2
第 3 組的 x 3
第 4 組的 x 4
第 5 組的 x 5
第 1 組的 y 2
第 2 組的 y 4
第 3 組的 y 4
第 4 組的 y 4
第 5 組的 y 6
相關係數 r =CORREL(B1:B5,B6:B10)
(參考)用 PEARSON 函數也是相同的值 =PEARSON(B1:B5,B6:B10)
求「迴歸直線 y = ax + b」的表格
第 1 組的 x 1
第 2 組的 x 2
第 3 組的 x 3
第 4 組的 x 4
第 5 組的 x 5
第 1 組的 y 2
第 2 組的 y 4
第 3 組的 y 4
第 4 組的 y 4
第 5 組的 y 6
斜率 a =SLOPE(B6:B10,B1:B5)
截距 b =INTERCEPT(B6:B10,B1:B5)
求「平均數、變異數、標準差(除以 n)」的表格
第 1 組的 x 1
第 2 組的 x 2
第 3 組的 x 3
第 4 組的 x 4
第 5 組的 x 5
第 1 組的 y 2
第 2 組的 y 4
第 3 組的 y 4
第 4 組的 y 4
第 5 組的 y 6
x 的平均數 x̄ =AVERAGE(B1:B5)
y 的平均數 ȳ =AVERAGE(B6:B10)
x 的變異數 s_x² =VARP(B1:B5)
x 的標準差 s_x =STDEVP(B1:B5)
y 的變異數 s_y² =VARP(B6:B10)
y 的標準差 s_y =STDEVP(B6:B10)
貼上後,B1~B5 是 x 的輸入欄,B6~B10 是 y 的輸入欄,綠色粗體的儲存格會自動算出結果。
第 1 個表格的共變異數是 1.6(樣本共變異數是 2),第 2 個表格的相關係數約為 0.8944,第 3 個表格算出斜率 0.8、截距 1.6。
請注意,共變異數的函數有 2 種。COVARIANCE.P 是「除以 n」的共變異數(和本計算機、台灣高中課本相同),COVARIANCE.S 是「除以 n − 1」的樣本共變異數。在舊版 Excel(2007 以前),請改用 COVAR 代替 COVARIANCE.P。
CORREL 和 PEARSON 算出的相關係數相同(r 不論除以 n 或 n − 1 都一樣,所以不必選擇)。
SLOPE 和 INTERCEPT 的引數順序是「y 的範圍,x 的範圍」(注意 x 不是放在前面)。
想改變資料組數時,請增加(或減少)數值的列數,再把公式中的「B1:B5」「B6:B10」改成實際的資料範圍。

用 Google 試算表計算的方法

把下方表格整個複製,貼到 Google 試算表的 A1 儲存格就能直接使用。
求「共變異數 s_xy」的表格
第 1 組的 x 1
第 2 組的 x 2
第 3 組的 x 3
第 4 組的 x 4
第 5 組的 x 5
第 1 組的 y 2
第 2 組的 y 4
第 3 組的 y 4
第 4 組的 y 4
第 5 組的 y 6
共變異數 s_xy(除以 n) =COVAR(B1:B5,B6:B10)
求「相關係數 r」的表格
第 1 組的 x 1
第 2 組的 x 2
第 3 組的 x 3
第 4 組的 x 4
第 5 組的 x 5
第 1 組的 y 2
第 2 組的 y 4
第 3 組的 y 4
第 4 組的 y 4
第 5 組的 y 6
相關係數 r =CORREL(B1:B5,B6:B10)
求「迴歸直線 y = ax + b」的表格
第 1 組的 x 1
第 2 組的 x 2
第 3 組的 x 3
第 4 組的 x 4
第 5 組的 x 5
第 1 組的 y 2
第 2 組的 y 4
第 3 組的 y 4
第 4 組的 y 4
第 5 組的 y 6
斜率 a =SLOPE(B6:B10,B1:B5)
截距 b =INTERCEPT(B6:B10,B1:B5)
可以直接使用和 Excel 幾乎相同的函數。把表格整個複製、貼到 A1 儲存格,再把 B1~B10 改成自己的數值即可。
在 Google 試算表中,「除以 n」的共變異數用 COVAR 函數求出(和本計算機的定義相同;用 COVARIANCE.P 這個名稱也能呼叫同一個函數)。相關係數和 Excel 一樣用 CORREL。

用 Python 計算的方法

import statistics

xs = [1, 2, 3, 4, 5]      # x 的資料(例:讀書時間)
ys = [2, 4, 4, 4, 6]      # y 的資料(例:小考分數)

n = len(xs)
mean_x = statistics.mean(xs)      # x 的平均數
mean_y = statistics.mean(ys)      # y 的平均數

# 共變異數 s_xy(母體的式子:除以 n)
covariance = sum((x - mean_x) * (y - mean_y) for x, y in zip(xs, ys)) / n

sd_x = statistics.pstdev(xs)      # x 的標準差(除以 n)
sd_y = statistics.pstdev(ys)      # y 的標準差(除以 n)

r = covariance / (sd_x * sd_y)    # 相關係數

slope = covariance / statistics.pvariance(xs)   # 迴歸直線的斜率 a
intercept = mean_y - slope * mean_x             # 迴歸直線的截距 b

print(f"共變異數 s_xy:{covariance}")
print(f"相關係數 r:{r}")
# 截距可能出現浮點數誤差(1.5999...),所以四捨五入到有效數字 10 位
print(f"迴歸直線:y = {slope:.10g}x + {intercept:.10g}")
只用標準函式庫(statistics 模組)就能執行。開頭有「p」的 pstdev、pvariance 是除以 n。執行這個例子,會顯示共變異數 1.6、相關係數 0.894…,以及迴歸直線 y = 0.8x + 1.6。在 Python 3.10 以後,statistics.correlation(xs, ys) 也能算出相同的相關係數(r 不論除以 n 或 n − 1 都一樣)。不過 statistics.covariance(xs, ys) 是除以 n − 1 的樣本共變異數,想和本頁的共變異數一致時,請像上面的例子那樣計算。

用 LaTeX 等數學式語言的寫法(可直接複製)

共變異數 \(s_{xy}\)
s_xy = {(x₁ − x̄)(y₁ − ȳ) + … + (xₙ − x̄)(yₙ − ȳ)} ÷ n
s_{xy} = \dfrac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
    <mo>=</mo>
    <mfrac><mn>1</mn><mi>n</mi></mfrac>
    <munderover>
      <mo>&#x2211;</mo>
      <mrow><mi>i</mi><mo>=</mo><mn>1</mn></mrow>
      <mi>n</mi>
    </munderover>
    <mrow>
      <mo>(</mo><msub><mi>x</mi><mi>i</mi></msub><mo>&#x2212;</mo><mover><mi>x</mi><mo>&#x00AF;</mo></mover><mo>)</mo>
      <mo>(</mo><msub><mi>y</mi><mi>i</mi></msub><mo>&#x2212;</mo><mover><mi>y</mi><mo>&#x00AF;</mo></mover><mo>)</mo>
    </mrow>
  </mrow>
</math>
s_(xy) = (1/n) sum_(i=1)^n (x_i - bar x)(y_i - bar y)
Covariance[xdata, ydata]*(Length[xdata] - 1)/Length[xdata]  (* Covariance 是除以 n-1,所以換算成除以 n 的值 *)
s_xy := add((x[i] - x_bar)*(y[i] - y_bar), i = 1 .. n)/n;
s_xy = mean((x - mean(x)).*(y - mean(y)));
s_xy = (1/n) ∑_(i=1)^n (x_i − x̄)(y_i − ȳ)
相關係數 \(r\)
r = s_xy ÷ (s_x × s_y)
r = \dfrac{s_{xy}}{s_x\, s_y}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <mi>r</mi>
    <mo>=</mo>
    <mfrac>
      <msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
      <mrow><msub><mi>s</mi><mi>x</mi></msub><msub><mi>s</mi><mi>y</mi></msub></mrow>
    </mfrac>
  </mrow>
</math>
r = s_(xy) / (s_x s_y)
Correlation[xdata, ydata]
r := s_xy/(s_x*s_y);
R = corrcoef(x, y); r = R(1, 2);
r = s_xy/(s_x s_y)
迴歸直線(最小平方法)\(y = ax + b\)
y = ax + b,  a = s_xy ÷ s_x²,  b = ȳ − a·x̄
y = ax + b, \quad a = \dfrac{s_{xy}}{s_x^{2}}, \quad b = \bar{y} - a\bar{x}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <mi>y</mi><mo>=</mo><mi>a</mi><mi>x</mi><mo>+</mo><mi>b</mi>
    <mo>,</mo><mspace width="1em"/>
    <mi>a</mi><mo>=</mo>
    <mfrac>
      <msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
      <msubsup><mi>s</mi><mi>x</mi><mn>2</mn></msubsup>
    </mfrac>
    <mo>,</mo><mspace width="1em"/>
    <mi>b</mi><mo>=</mo>
    <mover><mi>y</mi><mo>&#x00AF;</mo></mover>
    <mo>&#x2212;</mo>
    <mi>a</mi><mover><mi>x</mi><mo>&#x00AF;</mo></mover>
  </mrow>
</math>
y = a x + b, a = s_(xy)/s_x^2, b = bar y - a bar x
lm = LinearModelFit[Transpose[{xdata, ydata}], t, t]; lm["BestFitParameters"]
a := s_xy/s_x^2; b := y_bar - a*x_bar;
p = polyfit(x, y, 1);  % p(1) 為斜率 a,p(2) 為截距 b
y = ax + b,  a = s_xy/s_x^2,  b = ȳ − ax̄

請 ChatGPT  幫忙計算的方法

你是統計計算的助理。請務必實際執行 Python 程式碼來進行下列計算,並只以執行結果的數值作為回答的依據(請不要用心算或猜測回答)。

請針對下列成對資料,分別求出以下各值。
x:1, 2, 3, 4, 5
y:2, 4, 4, 4, 6
1. x 和 y 的平均數,以及除以 n 的變異數與標準差
2. 共變異數 s_xy(離均差乘積的總和除以組數 n;不要除以 n − 1)
3. 相關係數 r
4. 迴歸直線 y = ax + b(最小平方法)的斜率 a 與截距 b

請列出計算時使用的公式,以及執行結果的數值。

使用方法
  1. 1
    輸入數值
    在輸入欄中輸入要計算的數值
  2. 2
    計算
    按下「計算」按鈕
  3. 3
    查看結果
    計算結果會立即顯示。計算的思路和公式的解說,也都能在同一個頁面查看
  DataChef 的特色
簡單又免費
免費且無使用次數限制
不需專業知識,操作直覺又簡單
免註冊會員
開啟頁面即可立即使用
無須登錄任何個人資料
安全又安心
通訊全程高度加密
按下「下載」後自動刪除檔案
高速
顯示與轉換都快速順暢,毫無等待壓力
無浮水印
沒有浮水印
無須標註來源出處
可商業使用
可免費用於商業用途
亦無須事先取得商用授權