假說檢定的決策不可能永遠正確。由於我們是根據樣本(而非母體)做判斷,就有可能犯錯。統計學將這兩種錯誤分別稱為第一型錯誤與第二型錯誤。
|
母體的真實狀態 |
| 檢定的決策 |
H₀ 為真 |
H₀ 為假 |
| 拒絕 H₀ |
第一型錯誤(α) 冤枉好人 |
正確決策 檢定力 = 1 − β |
| 不拒絕 H₀ |
正確決策 信心水準 = 1 − α |
第二型錯誤(β) 放過壞人 |
圖解:兩種錯誤分別長什麼樣?
下面兩張圖分別呈現第一型與第二型錯誤發生的情境。紅色或橘色區域就是「犯錯」的機率面積。
第一型錯誤(Type I Error)
真相:H₀ 為真,卻被我們拒絕
冤枉好人:治療其實沒效,
但樣本恰好極端 → 錯誤拒絕 H₀
第二型錯誤(Type II Error)
真相:H₁ 為真,卻沒被偵測到
放過壞人:治療其實有效,
但樣本不夠極端 → 未能拒絕 H₀
互動圖:α、β 與檢定力的關係
拖動下方滑桿,觀察三個區域面積如何變化(右尾檢定,母體 σ = 12 kPa)
α:H₀ 真 → 卻拒絕(冤枉)
β:H₁ 真 → 卻沒拒絕(漏掉)
1−β:H₁ 真 → 正確拒絕(檢定力)
試試看:
① 只拉 α 滑桿 → α↑ 則 β↓,但冤枉好人的風險也↑(此消彼長);
② 只拉 n 滑桿 → 兩條曲線同時變窄,α 與 β 同時下降(增加樣本數是唯一雙贏策略);
③ 拉大效果量 → 兩條曲線分得更開,β 大幅下降。
第一型錯誤(Type I Error, α)
當 H₀ 其實是真的(舌壓訓練真的沒用),但我們的樣本資料恰好比較極端,導致我們錯誤地拒絕了 H₀。這就像法庭冤枉了一個無辜的人。
- 發生機率:等於顯著水準 α。當我們設定 α = 0.05,就表示願意承擔最多 5% 的第一型錯誤風險。
- 臨床後果範例:宣稱某種新的增稠劑能改善吞嚥安全,但實際上沒有效果。患者可能因此使用了無效的介入方式。
第二型錯誤(Type II Error, β)
當 H₀ 其實是假的(舌壓訓練確實有用),但我們的樣本資料不夠極端,導致我們未能拒絕 H₀。這就像法庭放走了一個真正的罪犯。
- 發生機率:以 β 表示。β 越大,代表越容易「漏掉」真實存在的效果。
- 臨床後果範例:一種有效的舌肌訓練被判定為「無效」,導致患者錯失有益的治療方案。
α 與 β 的拉鋸
在樣本數固定的情況下,α 與 β 之間存在此消彼長的關係。降低 α(例如從 0.05 改為 0.01),會使判定標準更嚴格,第一型錯誤風險降低,但同時 β 會增加,也就是更容易漏掉真實的效果。反過來,放寬 α 雖然能降低 β,但也增加了誤判的風險。唯一能同時降低兩者的方法是增加樣本數。
法庭類比的完整對照
在法庭中,第一型錯誤(冤枉無辜的人)被視為最不能容忍的,因此要求「超越合理懷疑」的高標準。在統計中,我們也優先控制 α(通常固定為 0.05 或 0.01),讓第一型錯誤的風險保持在低水準。至於 β,則透過適當的研究設計(特別是足夠的樣本數)來加以控制。
動手試試:用互動圖驗證 α 與 β 的拉鋸
請捲回上方的「互動圖:α、β 與檢定力的關係」,完成以下三個小任務。建議每次只動一根滑桿,其餘歸回預設值(α = 0.05、Δ = 5.0、n = 30),方便觀察單一因素的影響。
每題請記下數值面板顯示的 α、β、檢定力數值,並截圖留存。
α 的此消彼長
先將 α 從 0.05 拉高到 0.15,記下此時的 β 與檢定力數值並截圖。再將 α 降到 0.01,同樣記下數值並截圖。比較兩組數字,觀察 α 變動時 β 如何反向變化。
點我看你應該觀察到的結果
α = 0.15 時,β 大幅下降、檢定力提高(臨界值左移,紅色面積變大,橙色面積縮小)。
α = 0.01 時,β 明顯上升、檢定力下降(臨界值右移,紅色面積幾乎消失,橙色面積變大)。
結論:在 n 固定時,α 與 β 確實此消彼長,不可能同時都小。
樣本數是唯一的雙贏策略
保持 α = 0.05、Δ = 5.0 不變,把 n 從 30 慢慢拉到 80,記下此時的 β 與檢定力數值並截圖。觀察兩條曲線的寬度與重疊程度有何變化。
點我看你應該觀察到的結果
兩條曲線同時變窄,重疊區域快速減少。α 維持 5% 不變,但 β 大幅下降、檢定力上升。
結論:增加樣本數可以在不放寬 α 的前提下降低 β,是唯一能同時減少兩種錯誤的方法。
思考題:如果你是研究者,怎麼選?
假設你正在設計一項舌壓訓練的臨床試驗,預期效果量 Δ = 3 kPa(較小的效果)。請用互動圖找出:要讓檢定力達到 80% 以上(α = 0.05),至少需要多少樣本數 n?請記下你找到的 n 值與對應的檢定力數值,並截圖留存。
點我看提示
將 Δ 設為 3.0、α 設為 0.05,慢慢拉大 n,直到檢定力面板顯示 ≥ 80%。
效果量越小,需要的樣本數就越多,這正是臨床研究規劃時「樣本數估算(Power Analysis)」的核心概念。
p 值的常見誤解
理解了兩種錯誤與 α 的意義之後,我們來釐清幾個最容易混淆的 p 值觀念。p 值是判斷是否拒絕 H₀ 的關鍵依據,但也是最常被誤讀的統計概念:
- p 值不是「H₀ 為真的機率」。很多人看到 p = 0.03 會直覺認為「訓練沒效的機率只有 3%」,但這是錯的。p 值的計算一開始就假設 H₀ 為真,然後問:「在這個假設下,抽到像我們這樣(或更極端的)資料有多不尋常?」所以 p = 0.03 的正確解讀是「如果訓練真的沒效,出現這種結果的機率只有 3%」,而不是「訓練沒效的機率是 3%」。前者是在已知條件下算資料的機率,後者是在反過來算假說本身的機率,兩者方向完全不同。
- p 值不是「效果大小」的指標。很大的樣本數可以讓微小的差異也產生很小的 p 值。例如 1,000 人的研究中,舌壓平均只多了 0.3 kPa 也可能 p < 0.05。
- 「統計顯著」不等於「臨床重要」。舌壓平均增加 0.5 kPa 可能統計上顯著,但對臨床吞嚥功能改善微乎其微。報告結果時,應同時呈現效果量與信賴區間。