跑迴歸之前要先確認資料滿足兩類條件:(一)LINE 四個基本假設,這是所有線性迴歸的共同前提;(二)自變數彼此不能高度重疊,這是複迴歸特有的多元共線性問題。本節把這兩件事一次講完,後續第 7 節 SPSS 實作中的 VIF 表、條件指標、P-P 圖、殘差散點圖等診斷工具,都會回頭引用本節的判讀標準。
一、LINE 四個基本假設
複迴歸的推論統計(p 值、信賴區間)成立的前提,是以下四個假設(統稱 LINE)同樣成立。這與第 13 章簡單線性迴歸的假設相同,只是在多自變數的情境下更需要仔細檢驗。
L 線性(Linearity)
各自變數與依變數之間存在線性關係。檢驗:繪製各自變數與依變數的散佈圖,確認無明顯曲線趨勢;或觀察殘差對預測值的散佈圖。
I 獨立性(Independence)
各觀察值彼此獨立。檢驗:透過研究設計保證。若資料有時間順序(縱貫研究),可用 Durbin-Watson 統計量檢驗殘差的自相關。
N 殘差常態性(Normality of Residuals)
殘差應近似常態分布。檢驗:殘差直方圖(應呈對稱鐘形);P-P plot(點應沿對角線分布)。樣本量大時(n > 100),此假設可適度放寬。
E 變異數同質性(Equal Variance / Homoscedasticity)
殘差的散布在不同預測值處應大致相同,不應出現「漏斗形」。檢驗:殘差(*ZRESID)對預測值(*ZPRED)的散佈圖,點的散布寬度應均勻。
複迴歸比簡單迴歸多了什麼?
除了上述四個 LINE 假設外,複迴歸還需要額外注意:(1)多元共線性(下方詳述)與(2)離群值與影響點(Outliers & Influential Points)。SPSS 可透過「儲存」選項輸出「Cook's distance」「Leverage values」等指標來診斷是否有異常影響的觀察值。
二、多元共線性(Multicollinearity)
多元共線性當兩個或多個自變數之間存在高度線性相關時,就發生多元共線性。例如:握力與骨骼肌指數(SMI)往往高度相關,同時放入模型時會互相干擾。是複迴歸最常見也最容易被忽視的問題。當自變數之間彼此高度相關,迴歸模型就無法有效區分每個變數的獨立效果。
多元共線性的症狀
標準誤膨脹
共線性讓各係數的標準誤大幅增大,t 值變小,原本顯著的變數可能變得不顯著。
係數不穩定
樣本稍有不同,迴歸係數就大幅波動,甚至出現符號相反(正變負)的現象,解讀困難。
R² 高但 t 都不顯著
整體 F 顯著、R² 不低,但幾乎所有個別係數的 t 值都不達顯著,這是多元共線性的典型警訊。
診斷工具:VIF 與允差
最常用的診斷指標是變異數膨脹因子(Variance Inflation Factor, VIF):
VIF 判讀標準
VIF = 1:完全無共線性(該自變數與其他變數完全無關)
1 < VIF < 5:輕度共線性,通常可接受
5 ≤ VIF < 10:中度共線性,需關注
VIF ≥ 10:嚴重共線性,模型係數不可信,需要採取對策
允差 < 0.1:等同 VIF > 10,同樣代表嚴重共線性
📊 本章範例對照(第 7 節 SPSS 實作 · 圖 5):本章 7 個自變數的 VIF 介於 1.010 ~ 1.220,最大為年齡(1.220),允差最小為年齡 0.820,遠低於 5 的警戒線 → 完全無共線性,所有迴歸係數皆可信。
進階檢核:條件指標(Condition Index)
除了 VIF,SPSS 還會輸出「共線性診斷」表(對應第 7 節 SPSS 實作 · 圖 6),其中的條件指標是另一個輔助診斷工具。表頭會看到「維度(Dimension)」「特徵值」「條件指標」「變異數比例」幾欄,逐欄解釋如下:
📐 什麼是「維度」?SPSS 把所有自變數(含常數項)做主成分分解,拆成幾個彼此正交的「方向」,每個方向就是一個「維度(Dimension)」。維度數量 = 自變數個數 + 1(常數項算一個),所以本章 7 個自變數 → 共 8 個維度,編號 1 ~ 8。
每個維度都有:(1)特徵值(Eigenvalue)越小代表該方向上資料變化越少,越像是某幾個變數「擠在一起」;(2)條件指標 = √(最大特徵值 ÷ 該維度特徵值),特徵值最小那一行 CI 最大;(3)變異數比例告訴你「每個自變數在這個維度被分配到多少權重」,數值 0 ~ 1。
白話:把維度想成「把 8 個變數的資訊重新打散成 8 個獨立方向」。如果某個方向上有兩個以上變數都被「擠進去」(變異數比例都 > .50),代表這兩個變數高度重疊 → 共線性。
CI < 15:無共線性
15 ≤ CI < 30:中度警戒
CI ≥ 30:嚴重共線性的可能訊號
注意 1(規則):CI 偏高不一定就有共線性,還要同時滿足「兩個以上『自變數』的變異數比例同時 > .50 集中於同一維度」,才算實質共線性。
⚠️ 注意 2(常見誤解):(常數) 不算「自變數」。SPSS 共線性診斷表第二欄會有「(常數)」一列,這代表模型的截距項,不計入「兩個以上變數」的計算。
如果某維度上 (常數) 與單一自變數同時都 > .50,通常只是因為該自變數的平均數遠離 0(例如「年齡平均 82 歲」),主成分分解把它與常數綁在同一方向。這是「平均數位置」的數值現象,不是自變數之間的共線性。實務上把連續自變數做中心化(減去平均數),這個 (常數) 高比例就會消失。
📊 本章範例對照(圖 6):本章 CI 最大為 31.736(雖略過 30)。第 8 維度雖然 (常數) = 0.98、年齡 = 0.76 兩者都 > .50,但 (常數) 不計入,所以只有「年齡」這一個自變數 > .50,未滿足「兩個以上自變數共擠」的規則 → 結合 VIF < 1.25,可判定不存在實質共線性(此高比例只是因為本章年齡平均 82.22 歲遠離 0)。初次接觸時,把這張表當作圖 5 VIF 的「第二意見」即可。
共線性的解決策略
移除冗餘變數
若兩個高度相關的變數測量的是「相同的構念」,保留其中一個即可。例如:握力和 SMI 都反映肌肉功能,可根據研究目的選擇其中較具代表性的指標。
建立複合指標
將多個相關的變數合併為一個指標(例如透過主成分分析,PCA),以單一向量代表原本多個共線性變數的共同變異。
擴大樣本量
較大的樣本可以在一定程度上緩解共線性帶來的標準誤膨脹問題,但無法根本解決共線性本身。
重新審視研究問題
若共線性反映了現實中兩個概念本就密不可分(如年齡與白髮),可能需要重新考慮研究設計,或改用階層迴歸(hierarchical regression)分析不同理論層次的貢獻。
吞嚥研究範例:研究者同時納入「握力(kg)」和「四肢骨骼肌質量指數 SMI(kg/m²)」作為肌肉功能指標。這兩個變數本身高度相關(r = .78),共同放入模型時,VIF 可能高達 8-12。若發現 VIF ≥ 10,應考慮只保留其中一個,或者用「肌少症診斷(是/否)」的虛擬變數取代兩者。
銜接下一節
概念都齊備了(核心輸出 → 虛擬變數 → LINE 假設 → 共線性)。接下來看:當候選自變數很多時,要怎麼篩選變數?