差異的 95% 信賴區間
單一樣本 t 檢定不僅告訴我們「有沒有差異」,還能透過信賴區間呈現「差異可能有多大」。SPSS 輸出中的「差異的 95% 信賴區間」即為 \(\bar{X} - \mu_0\) 的區間估計。
以本章範例計算:
\[ CI = -10 \pm 2.093 \times 2.236 = -10 \pm 4.68 = [-14.68,\ -5.32] \]
此區間的意義:我們有 95% 的信心認為,此群護理之家長者的平均舌壓與社區長者常模的真實差異介於 -14.68 至 -5.32 kPa 之間。由於整個區間都不包含 0,與 t 檢定的結論一致,支持兩者存在顯著差異。
兩種 CI 別搞混:差異的 CI vs. 樣本平均的 CI
在單一樣本 t 檢定中,常看到兩種不同的 95% 信賴區間,用途不同、數字也不同:
- 差異的 CI:估計 \(\bar{X} - \mu_0\) 這個「差距」的範圍。本例為 [−14.68, −5.32],因樣本比常模低,兩端皆為負。此區間不含 0 即代表差異顯著。SPSS 預設輸出、APA 與論文 t 檢定結果的標準寫法都採用這個 CI。
- 樣本平均的 CI:估計樣本母群體平均值 \(\mu\) 本身的範圍,公式為 \(\bar{X} \pm t_{\alpha/2,\,df} \times s/\sqrt{n}\) = 30 ± 4.68 = [25.32, 34.68]。此區間不含 \(\mu_0\) = 40 同樣表示差異顯著。描述樣本特徵、或想直觀呈現「這群人落在哪個範圍」時使用。
兩者的判讀基準不同:差異的 CI 看是否包含 0,樣本平均的 CI 看是否包含 檢定值 \(\mu_0\)。本章後續報告範例採用期刊慣例,使用「差異的 CI」。
效果量:Cohen's d
p 值只能告訴我們差異是否「統計上顯著」,但無法反映差異的「實際大小」。效果量Effect Size,以標準化方式量化處理效應或差異的實際大小,不受樣本數影響。常用於評估研究結果的臨床或實務意義。(effect size)正是用來填補這個空缺的指標。
Cohen (1988) 提出了效果量的判讀基準:
小效果量
0.2 – 0.5
差異輕微
需仔細觀察才能察覺
中效果量
0.5 – 0.8
差異中等
具有一定的實務意義
這組基準是鐵律嗎?
0.2/0.5/0.8 並非統計「真理」,而是 Cohen (1988) 為當時行為科學領域還沒有自己的效果量基準,依據他對心理學研究常見差異幅度的觀察,所提出的操作性定義。Cohen 自己即明言:這組數字只是暫時性的參考,各學科最好以自己的實證經驗建立本領域的判讀門檻。
在臨床醫學領域,這組門檻常被認為過寬——例如降低死亡率的 d = 0.15 雖屬「小效果量」,但臨床意義可能非常重大;相反地,在雜訊較大的量表研究中,d = 0.8 也可能只是測量誤差的放大。讀到效果量時,除了對照 Cohen 門檻,還應回到研究領域慣例、測量單位、結果可逆轉性與成本等脈絡來判斷實質意義。
本範例的 d = 1.00,超過大效果量的門檻 (0.8),表示此群護理之家長者與社區長者常模之間的舌壓差異不僅統計上顯著,在臨床上也具有重要的實質意義。