「我的研究需要多少樣本才夠?」這是幾乎每一位碩士生在撰寫研究計畫時都會遇到的核心問題。
這個問題的答案並非一個固定的神奇數字,而是需要在統計的嚴謹性與現實的資源限制之間,進行深思熟慮的權衡。
🎯 統計檢定力 (Statistical Power)
定義:當一個真實的效果(例如,新藥確實比安慰劑有效)確實存在時,
你的研究能夠成功偵測到這個效果的機率。通常以 1−β 表示,
其中 β 是犯下第二類型錯誤(Type II Error)的機率。
第二類型錯誤(偽陰性):研究未能偵測到一個真實存在的效果。
在臨床研究中,這可能意味著一個有效的療法被錯誤地放棄。
學術慣例:可接受的檢定力通常設定在 0.80 或更高,
意味著研究者希望有至少80%的機會,能夠偵測到他們所尋找的真實效果。
樣本量估計的四大要素
1. 統計檢定力 (Power, 1−β)
你希望有多大的把握能偵測到真實效果?通常設定為 0.80 或 0.90。
越高的檢定力要求越大的樣本量。
2. 顯著水準 (α)
你願意承擔犯下第一類型錯誤(偽陽性)的風險。通常設定為 0.05,
意味著接受有5%的機率會做出錯誤的陽性結論。α 值設定得越嚴格(如0.01),所需樣本量就越大。
3. 效應量 (Effect Size)
你所研究現象的效果強度或大小。偵測一個巨大的、明顯的效果只需極小的樣本;
而要偵測一個微小但重要的效果,則需要數以萬計的龐大樣本。通常根據文獻、先導研究或臨床意義的最小差異來估計。
4. 變異性 (Variability)
研究結果測量指標在母群中的離散程度(通常以標準差表示)。母群的異質性越高、個體差異越大,
就需要越大的樣本量才能從數據的「雜訊」中,穩定地偵測出效果的「訊號」。
情境應用對比
情境A:第三期臨床試驗
藥廠測試新型降血壓藥物 vs. 現有標準療法
- 效應量:微小(新藥額外效益不大)
- 檢定力:極高(0.95)
- 顯著水準:嚴格(0.025)
- 變異性:大(血壓個體差異大)
→ 需要數千甚至上萬人的極大規模樣本
情境B:運動科學先導研究
碩士生測試新型本體感覺訓練方案對籃球運動員垂直跳躍高度的影響
- 效應量:巨大(尋找明顯效果)
- 檢定力:中等(0.70)
- 顯著水準:傳統(0.05)
- 變異性:較小(運動員群體同質)
→ 只需要20-30人的小樣本即可初步判斷潛力
樣本量的倫理考量
樣本量不足(underpowered)的研究是極不道德的。它讓參與者承擔了研究的風險與不便,
卻因為統計檢定力過低,而幾乎沒有機會產生任何確切的科學結論,最終浪費了所有人的時間與資源。
反之,樣本量過大(overpowered)的研究,同樣存在倫理上的疑慮。
它不僅浪費了寶貴的研究經費,更讓超出必要數量的參與者暴露在潛在的研究風險之中。
💡 關鍵實踐
在研究計畫階段進行事前檢定力分析(a priori power analysis),
是負責任的研究實踐中不可或缺的一環。它向審查委員會與經費提供單位證明,
研究者已經審慎地在科學的嚴謹性、資源的可行性與參與者的福祉之間,找到了合理的平衡點。
📐 實務案例:運用已發表研究進行樣本量估算
案例情境:中風患者身體活動介入研究
假設你正在規劃一項碩士論文,想測試加速度計回饋系統是否能提升住院中風患者的身體活動量。
你需要估算每組需要招募多少參與者才能有足夠的統計檢定力來偵測效果。
步驟 1:從文獻中尋找相似研究的效應量
你透過系統性文獻搜尋,找到 Kanai et al. (2018) 發表於 Clinical Rehabilitation 的研究:
"Effect of accelerometer-based feedback on physical activity in hospitalized patients with ischemic stroke: a randomized controlled trial"
這篇研究與你的研究設計高度相似:
- 母群:住院缺血性中風患者
- 介入:加速度計回饋 vs. 對照組
- 測量指標:每日身體活動量(步數)
- 研究設計:隨機對照試驗 (RCT)
從該研究報告的結果章節,你提取出兩組之間的平均差異與標準差,
並計算出效應量 (Cohen's d)。假設計算結果為 d = 0.75(中等至大的效應量)。
步驟 2:使用 G*Power 進行樣本量估算
你開啟免費統計軟體 G*Power 3.1,選擇:
-
🔹 Test family: t tests
-
🔹 Statistical test: Means: Difference between two independent means (two groups)
-
🔹 Type of power analysis: A priori (計算樣本量)
輸入以下參數:
-
📊 Effect size d: 0.75(根據文獻)
-
📊 α error probability: 0.05(雙尾檢驗)
-
📊 Power (1-β): 0.80
-
📊 Allocation ratio N2/N1: 1(兩組樣本數相等)
點擊「Calculate」後,軟體顯示:每組需要 29 人(總樣本量 58 人)。
步驟 3:考慮流失率並調整樣本量
你知道住院患者研究的流失率可能較高(提早出院、病情變化、自行退出等),
保守估計流失率約為 10%。因此你決定在每組多招募 3 人:
最終決定:每組招募 32 人
(實驗組 32 人 + 對照組 32 人 = 總共 64 人)
如何在研究計畫中呈現?
"We estimated the sample size per condition required to achieve a 0.8 power in G*Power 3.1
with the two-tailed tests (α error probability of 0.05). Based on the effect size (Cohen's d = 0.75)
reported in a similar study by Kanai et al. (2018), the result of this calculation indicated that
we needed 29 participants in each group. To allow for potential participant drop-out,
we recruited 32 participants in both the experimental- and control groups."
🔍 關鍵學習要點
-
✓ 不是憑空猜測:效應量應基於已發表的相似研究,而非隨意假設
-
✓ 善用免費工具:G*Power 是免費且操作簡單的樣本量計算軟體
-
✓ 預留流失空間:實際招募數應考慮預期流失率,確保最終有效樣本數達標
-
✓ 清楚記錄過程:在研究計畫中詳細說明計算依據,增加審查委員對你研究設計的信心
-
✓ 引用文獻來源:明確註明效應量來源的文獻,展現你的嚴謹性