統計檢定怎麼選?從資料型態與研究問題決定的判斷流程
選錯統計檢定是論文最常見的方法學缺失之一。本文以資料型態、分組數與配對與否三個問題,建立一套可依循的判斷順序。
統計方法誤用在生醫與社會科學論文中相當普遍,而多數錯誤並非出在複雜的模型,而是出在最基本的檢定選擇。統計檢定選擇其實有跡可循——只要依序回答三個問題,多數情境都能收斂到一到兩個合適的方法。
第一個問題:依變項是什麼型態
這是決定整個分析路線的分岔點。連續變項(血壓、分數、濃度)走平均數比較或迴歸;類別變項(有無、痊癒與否、分級)走比例比較或勝算比;時間至事件(存活時間、復發時間)則必須走存活分析,不能簡化成「有沒有發生」的二分類,否則會丟掉追蹤時間長短的資訊。
一個常見錯誤是把本質為順序尺度的量表分數(如李克特單題)直接當成連續變項做t檢定。單題順序資料通常應以無母數方法處理,加總後的量表總分才較能視為連續。
第二個問題:要比較幾組、是否配對
確定依變項型態後,接著看設計:兩組獨立樣本、兩組配對(同一批人前後測)、還是三組以上。這決定了在同一條路線上要用哪一個檢定。以連續依變項為例——兩組獨立用獨立樣本t檢定,兩組配對用成對t檢定,三組以上用變異數分析(ANOVA)。把配對資料當成獨立樣本分析,會低估檢定力並使p值偏保守,是審稿時容易被抓到的錯誤。
一份系統整理常用統計檢定與其適用條件的方法學文獻指出,多數誤用源自未先確認資料的尺度與分布假設,就直接套用最熟悉的檢定(PMID: 20532129)。
第三個問題:分布假設是否成立
參數方法(t檢定、ANOVA、皮爾森相關)假設資料近似常態且變異數同質。當樣本數小且明顯偏態、或資料本身是順序尺度時,改用對應的無母數方法:獨立兩組用Mann-Whitney U檢定,配對兩組用Wilcoxon符號等級檢定,三組以上用Kruskal-Wallis檢定,相關則用Spearman等級相關。
要注意的是,無母數方法不是「有疑慮就一律改用」的萬用解——它們的檢定力通常較低,且檢定的是分布位置而非平均數,結果詮釋的措辭也必須跟著調整。
一條可以直接套用的判斷順序
把上述整理成可依循的順序:(1)依變項是連續、類別,還是時間至事件?(2)比較幾組?獨立還是配對?(3)分布假設成立嗎?三題答完,方法幾乎就決定了。舉例:比較兩種衛教方式對三個月後血糖控制的影響,依變項連續、兩組獨立、分布近似常態,即為獨立樣本t檢定;若同時要校正年齡與病程,則改為多元線性迴歸。已有研究將這類決策樹整理成互動式工具,協助研究者依資料特性收斂到合適的檢定(PMID: 26543767)。
投稿前的檢查重點
方法章節應明確寫出使用了哪個檢定、為什麼適用(尤其是選擇無母數方法時的理由)、以及顯著水準與是否進行多重比較校正。若同一份資料做了多次比較卻未校正,審稿人通常會要求補充。Editverse臺灣的統計分析服務,協助研究者確認檢定選擇與研究設計相符,並撰寫可通過審查的統計方法敘述。
結語
統計檢定的選擇不需要記憶大量方法名稱,而是把三個問題依序問完。真正的專業判斷通常出現在假設不成立、或設計較複雜的情境,那時值得在分析前先取得統計上的意見,而不是在被退稿後才重做。
參考文獻
- du Prel JB, Röhrig B, Hommel G, Blettner M. Choosing statistical tests: part 12 of a series on evaluation of scientific publications. Dtsch Arztebl Int. 2010. PMID: 20532129
- Suner A, Karakülah G, Koşaner Ö, Dicle O. StatXFinder: a web-based self-directed tool that provides appropriate statistical test selection for biomedical researchers. SpringerPlus. 2015. PMID: 26543767