樣本數要多少才夠?統計檢定力與樣本數估算的實務作法
樣本數不是憑經驗抓的數字,而是由效應量、檢定力與顯著水準三者反推出來的結果。本文說明估算邏輯與投稿時必須交代的內容。
「這個研究要收多少人才夠?」是研究設計階段最常被問、也最常被草率回答的問題。樣本數估算並不是憑經驗抓一個看起來合理的數字,而是由預期效應量、統計檢定力與顯著水準三者反推出來的結果。估算過程若無法交代清楚,方法章節在審查時往往第一個被質疑。
估算樣本數需要先決定四件事
任何樣本數計算都建立在四個參數上,缺一不可:顯著水準(α,慣例為0.05)、統計檢定力(1−β,慣例為0.80或0.90)、預期效應量(兩組平均值差距、勝算比或相關係數等),以及資料的變異程度(標準差)。四者之中,前兩項是研究者依慣例設定的,後兩項則必須有來源——通常來自前人研究、預試資料,或該領域公認的最小臨床重要差異。
這裡有個實務上的關鍵:四個參數固定其中三個,第四個就被決定了。所以「樣本數不夠」從來不是單一問題,它等價於「檢定力不足」或「只能偵測到不切實際的大效應」。
檢定力不足的代價:陰性結果無法解讀
一篇發表於《JAMA》的經典調查檢視了結論為「無顯著差異」的隨機對照試驗,發現其中大量研究的樣本數根本不足以偵測到具臨床意義的差異,也極少報告樣本數計算的依據(PMID: 8015121)。這帶出一個常被誤解的重點:檢定力不足的研究,其陰性結果不能被解讀為「沒有效果」,只能解讀為「這個研究沒有能力回答這個問題」。審稿人若判斷研究屬於後者,通常會直接要求作者收回結論的推論範圍。
常見錯誤:事後檢定力分析(post hoc power)
研究做完、結果不顯著之後,才用實際觀察到的效應量回推檢定力,是投稿時最容易被退回的作法之一。原因在於:事後檢定力與p值之間是數學上的函數關係,不顯著的結果必然算出低檢定力,因此這個數字不提供任何新資訊,也無法為陰性結果辯護。樣本數估算必須在資料收集之前完成並記錄;若研究確實受限於可得樣本,正確的作法是在限制段落誠實說明,並改以信賴區間呈現效應估計的精確度。
在樣本難以擴充的研究領域(如復健、罕見疾病或特定臨床族群),已有文獻討論提高檢定力的替代策略,例如改用重複測量設計、選擇變異較小的測量指標,或改採更有效率的統計模型,而非單純增加受試者人數(PMID: 31655185)。
方法章節應該交代什麼
一段可被接受的樣本數說明,通常包含五個要素:使用的檢定方法、設定的α與檢定力、預期效應量及其來源引用、計算得到的每組樣本數,以及考慮流失率後實際擬收案的人數。舉例來說:「以雙尾獨立樣本t檢定、α=0.05、檢定力0.80,並依據前人研究報告的組間差異與標準差估算,每組需35人;考量20%流失率,實際規劃每組收案44人。」關鍵在於效應量必須有出處,而不是為了讓樣本數看起來可行而反向挑選一個大的效應。
投稿前的自我檢查
檢查三件事:估算是否在收案前完成、效應量的來源是否有引用、實際收案數與計畫數若有落差是否已在限制中說明。若研究是探索性或預試性質,直接說明它是預試、不做正式檢定力計算,反而比硬套一個回推的數字更容易通過審查。Editverse臺灣的統計分析服務,協助研究者依研究設計選擇適當的估算方法,並撰寫符合期刊要求的方法章節敘述。
結語
樣本數估算的本質,是在研究開始之前就誠實面對「這個設計能回答多大的問題」。把四個參數與其來源交代清楚,遠比事後補一個好看的數字更能說服審稿人。