論文中的遺漏值怎麼處理?從遺漏機制到多重插補的實務判斷
直接刪除有遺漏的個案是最常見、也最可能造成偏誤的作法。本文說明三種遺漏機制、如何選擇處理方式,以及審稿人期待看到的交代方式。
幾乎每一份實證資料都有遺漏。真正影響結論的,不是遺漏本身,而是遺漏值處理的方式是否與資料遺漏的原因相符。多數論文的預設作法是直接刪除含遺漏的個案(完整個案分析),但這只在特定條件下才不會造成偏誤。
先判斷遺漏機制,再決定方法
方法學文獻將遺漏分為三類,這個分類決定了後續所有選擇:
完全隨機遺漏(MCAR)——遺漏與任何變項都無關,例如儀器隨機故障。此時完整個案分析不會造成偏誤,只會損失檢定力。隨機遺漏(MAR)——遺漏與其他已觀測到的變項有關,例如年長受試者較常漏填某題。此時完整個案分析可能有偏誤,適合使用多重插補。非隨機遺漏(MNAR)——遺漏與該變項本身未觀測到的值有關,例如收入最高者最不願意填答收入。這是最棘手的情況,任何標準方法都無法完全修正,只能透過敏感度分析評估結論的穩健性。
關鍵在於:MCAR可以用資料檢驗,MAR與MNAR的區分無法單靠資料證明,必須依研究者對資料產生過程的理解來論證。這也是方法章節必須交代推論依據的原因。
多重插補:適用條件與常見誤解
多重插補(multiple imputation)是MAR情境下的主流作法:以其他變項的資訊產生多組合理的補值資料集,各自分析後再合併結果,藉此把「補值本身的不確定性」納入最終的標準誤。一篇廣被引用的BMJ方法學文章詳細說明了它的潛力與陷阱,其中最重要的提醒是:插補模型必須包含分析模型中的所有變項,包括依變項——若把依變項排除在插補之外,反而會削弱變項間的關聯(PMID: 19564179)。
另一個常見誤解是把多重插補當成「補得越多越好」。當某個變項的遺漏比例極高,插補出來的值主要反映的是模型假設而非資料本身,此時較誠實的作法是在限制中說明,或將該變項排除於主要分析之外。
單一補值為什麼不建議
以平均數或中位數填補所有遺漏,是實務上仍常見但應避免的作法。它會人為降低變異、使標準誤被低估、信賴區間過窄,進而膨脹顯著性。同樣地,最後觀測值前推(LOCF)在縱貫研究中也已不被視為預設可接受的方法。
審稿人期待看到的交代方式
一份針對觀察性研究的處理與報告架構指出,透明度不足是當前研究可信度的主要威脅之一;作者應明確報告遺漏的數量與分布、對遺漏機制的假設與理由、所採用的處理方法及其細節,以及檢驗結論穩健性的敏感度分析(PMID: 33539930)。一份範圍回顧也發現,實際文獻中多重插補的使用與報告仍存在明顯落差,許多研究並未說明插補模型的設定(PMID: 39232661)。
實務上可直接照抄的結構是:先在結果表中列出各變項的遺漏比例,再於方法中說明「假設為MAR,理由是…;採用多重插補產生m組資料集,插補模型納入…;並以完整個案分析作為敏感度分析,結論一致/不一致」。
結語
遺漏值處理的專業判斷不在於用了多進階的方法,而在於方法與假設是否一致、假設是否被誠實說明。Editverse臺灣的統計分析服務,協助研究者評估遺漏機制、選擇合適的處理方式,並撰寫符合期刊透明度要求的敘述。
參考文獻
- Sterne JAC, White IR, Carlin JB, Spratt M, Royston P, et al. Multiple imputation for missing data in epidemiological and clinical research: potential and pitfalls. BMJ. 2009. PMID: 19564179
- Lee KJ, Tilling KM, Cornish RP, Little RJA, Bell ML, et al. Framework for the treatment and reporting of missing data in observational studies. J Clin Epidemiol. 2021. PMID: 33539930
- Mainzer RM, Moreno-Betancur M, Nguyen CD, Simpson JA, Carlin JB. Gaps in the usage and reporting of multiple imputation for incomplete data. BMC Med Res Methodol. 2024. PMID: 39232661