相關係數是一個介於 -1 到 +1 之間的數值,用來量化兩個變數之間線性關係的強度與方向。數值越接近 +1 或 -1,代表線性關聯越強;越接近 0,代表線性關聯越弱。
Pearson 積差相關係數
Pearson 積差相關係數(以 r 表示)適用於兩個變數皆為連續尺度且近似常態分布的情境。其計算公式如下:
白話解讀
公式的核心邏輯是:對於每筆資料,同時看 x 偏離其平均值多少、y 偏離其平均值多少,再將兩者的偏離量相乘。如果 x 高於平均時 y 也傾向高於平均,兩者的乘積就是正數,累加後 r 會趨向正值。反之,如果 x 高於平均時 y 卻傾向低於平均,乘積就是負數,r 會趨向負值。分母則確保 r 不會超出 -1 到 +1 的範圍。
正相關(r > 0)
一個變數增加,另一個也傾向增加。散佈圖呈現左下到右上的趨勢。
例:身高越高,體重傾向越重。
負相關(r < 0)
一個變數增加,另一個傾向減少。散佈圖呈現左上到右下的趨勢。
例:年齡越大,最大舌壓傾向越低。
零相關(r ≈ 0)
兩變數無線性關聯。散佈圖中資料點隨機散布。
注意:不排除非線性關聯的可能。
相關強度的判讀(Portney & Watkins, 2000)
0.00 – 0.25:幾乎沒有相關(little or no correlation)
0.25 – 0.50:低度至中度相關(fair correlation)
0.50 – 0.75:中度至良好相關(moderate to good)
0.75 – 1.00:良好至極佳相關(good to excellent)
以上判讀標準適用於相關係數的絕對值 |r|,無論正負方向皆可使用同一套標準。
Spearman 等級相關係數
Spearman 等級相關係數(以 ρ 或 rs 表示)的做法是:先將兩個變數的原始數值分別轉換為等級(rank),再對等級資料計算 Pearson 相關係數。由於使用的是等級而非原始數值,Spearman 相關對極端值的影響較不敏感,也不要求資料必須呈常態分布。
當資料中沒有相同名次(即「綁結」)時,Spearman 相關可用下列簡式計算:
白話解讀
把兩個變數分別排名次(最小值為 1、最大值為 n),逐筆計算兩個名次的差距,平方後加總起來。如果兩變數的排名完全一致,每筆 d 都是 0,整個分子歸零,ρ 等於 1;如果排名完全相反,d2 加總會達到最大值,ρ 等於 −1。簡式只需 n 與 d2,計算上比一般式直觀許多,常見於統計課本與紙筆計算題;實務分析仍建議用軟體跑,因為真實資料常有綁結需要修正。
適用時機包括:
- 至少有一個變數為順序尺度(如 FOIS 量表)
- 資料分布呈現非常態(偏態或有明顯極端值)
- 小樣本時,常態假設難以驗證
何時選 Pearson,何時選 Spearman?
- 兩個變數都是連續尺度且近似常態分布 → 使用 Pearson r
- 至少一個變數為順序尺度 → 使用 Spearman ρ
- 資料分布明顯偏態或有極端值 → 使用 Spearman ρ
- 兩種方法都可以計算;若結果一致,表示兩變數之間的關聯是穩健的
兩大常見誤區
相關不等於因果
即使 r = 0.90,也不能直接推論「A 導致 B」。高度相關可能源於共同的第三變數(混淆因子)、反向因果,甚至純粹的巧合。經典的例子:冰淇淋銷量與溺水人數高度正相關,但兩者之間並非因果關係,而是炎熱天氣同時促進了這兩件事。
大樣本的陷阱
當樣本量很大時(例如 n = 2000),即使 r 只有 0.05,也可能達到統計顯著(p < .05)。但 r = 0.05 在臨床上幾乎毫無意義。因此,統計顯著不等於實質顯著。除了看 p 值之外,務必依據 Portney & Watkins 的判讀標準來評估 r 的實際大小。
Fisher Z 轉換與信賴區間
相關係數 r 的抽樣分布在 |r| 較大時會呈現偏態,不適合直接用來建構信賴區間。Fisher Z 轉換將 r 轉換為近似常態分布的 Zr,接著即可利用標準誤計算 95% 信賴區間,再反轉回 r 的尺度。
參考文獻:
Portney, L. G., & Watkins, M. P. (2000). Foundations of clinical research: Applications to practice (2nd ed.). Prentice Hall.