多重比較
檢定做得夠多,光靠雜訊也會冒出「顯著」。不校正,門檻就名存實亡。
又稱:multiple comparisons、multiple testing、多重檢定、校正
本頁目次
它在說什麼
一個檢定在 下,虛無為真時有 5% 的機會誤報。做 20 個獨立檢定,至少誤報一次的機率是
檢定做得夠多,光靠雜訊也會冒出「顯著」。多重比較校正就是把這件事算進去:要麼壓低族系錯誤率(如 Bonferroni,把門檻除以檢定數),要麼控制錯誤發現率——Benjamini 與 Hochberg 在 1995 年提出的做法,管的是「被宣告顯著的那些結果裡,錯的佔幾成」。
一個具體例子
2009 年,Bennett 等人把一條大西洋鮭放進 fMRI 機器,請牠判讀照片中人物的情緒。這條魚長約 18 吋、重 3.8 磅,而且掃描時已經死了。在未校正的門檻(,)下,8,064 個 voxel 裡有 16 個「顯著」,還漂亮地群聚在魚的腦腔內。做完錯誤發現率或族系錯誤率校正,顯著的 voxel 一個都不剩——連把門檻放寬到 都沒有。
這篇海報拿了 2012 年的搞笑諾貝爾獎,但它的對象不是那條魚,是當年大量不做校正的 fMRI 論文。
它與 p-hacking 的差別
p-hacking 是選擇性報告:做了很多,只報好看的。多重比較是數量問題:全部誠實報告,但檢定太多,門檻就失去了它原本承諾的錯誤率。兩者常常同時發生,而且第一種會讓第二種變得無法校正——因為沒人知道實際上做了幾個檢定。