迴歸 vs. 相關
相關分析
方向性:雙向(X↔Y),不區分自變數與依變數
結果:一個係數 r(-1 到 +1)
回答:兩個變數的線性關聯有多強?
交換 X、Y:r 值不變
迴歸分析
方向性:單向(X→Y),明確區分自變數與依變數
結果:一條方程式 \(\hat{Y} = a + bX\)
回答:已知 X 時,Y 的預測值是多少?
交換 X、Y:方程式完全不同
迴歸方程式
簡單線性迴歸的目標是找到一條最佳直線,用來描述自變數 X 與依變數 Y 之間的線性關係:
最小平方法(Least Squares Method)
散佈圖上理論上能畫出無數條候選直線都通過資料群,到底哪一條最能代表整體趨勢?
最小平方法給出明確答案:選一條讓「每個資料點到直線的垂直距離」平方相加後最小的那條直線。這個垂直距離就叫做殘差殘差(residual)= 實際觀察值 \(y_i\) 與預測值 \(\hat{y}_i\) 之間的差距,即 \(e_i = y_i - \hat{y}_i\)。(記作 ei),代表迴歸線的「預測值」偏離實際「觀察值」多少。
為什麼要「平方」?直接相加不行嗎?
因為殘差有正有負(觀察值有時高於迴歸線、有時低於),直接相加會互相抵消,結果接近 0,無法分辨「貼得很準」和「偏離很大但剛好正負抵消」兩種情況。
平方後一律變成正值,而且偏離越大的點會被加倍懲罰(殘差 2 平方後是 4、殘差 4 平方後跳到 16),這樣才能逼出一條真正貼合整批資料的直線。
每條紅色虛線就是一個殘差 ei,連接「實際觀察值」(藍點)與「迴歸線上的預測值」(白心圓)。最小平方法的目標是找到一條直線,讓所有紅色虛線「長度平方」加總起來最小。
\[ \min \sum_{i=1}^{n}(y_i - \hat{y}_i)^2 = \min \sum_{i=1}^{n} e_i^2 \]
由此推導出斜率 b 與截距 a 的計算公式:
\[ b = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sum(x_i - \bar{x})^2} = \frac{SS_{xy}}{SS_{xx}} \qquad a = \bar{y} - b\bar{x} \]
判定係數 R²
R²(coefficient of determination)表示自變數 X 能解釋依變數 Y 總變異量的比例。在簡單線性迴歸中,R² = r²。
R² 解讀注意
R² 的大小不能單獨決定模型是否有用。例如,在行為科學中 R² = 0.10 可能已具有實質意義,但在精密工程中 R² = 0.90 可能還不夠。需結合研究領域與臨床脈絡來判斷 R² 是否具有實質意義。
迴歸的四大假設
簡單線性迴歸的推論(p 值、信賴區間)有效的前提是以下四個假設成立:
線性(Linearity)
X 與 Y 之間的關係是線性的。檢驗方式:觀察散佈圖,資料點應大致沿一條直線分布,不應出現明顯的曲線趨勢。
獨立性(Independence)
各觀察值之間彼此獨立,不受其他觀察值影響。檢驗方式:透過研究設計確保,例如避免重複測量或群集資料未處理的情況。
殘差常態性(Normality of Residuals)
殘差應近似常態分布。檢驗方式:檢視殘差直方圖(histogram)或常態機率圖(P-P plot),殘差點應沿對角線分布。
變異數同質性(Homoscedasticity)
殘差的散布程度在不同 X 值處應大致相同,不應出現「漏斗形」(funnel shape)。檢驗方式:檢視殘差對預測值的散佈圖,點的散布寬度應均勻。