術語

多重比較

檢定做得夠多,光靠雜訊也會冒出「顯著」。不校正,門檻就名存實亡。

又稱:multiple comparisons、multiple testing、多重檢定、校正

本頁目次

它在說什麼

一個檢定在 α=.05\alpha = .05 下,虛無為真時有 5% 的機會誤報。做 20 個獨立檢定,至少誤報一次的機率是

1(10.05)200.641 - (1 - 0.05)^{20} \approx 0.64

檢定做得夠多,光靠雜訊也會冒出「顯著」。多重比較校正就是把這件事算進去:要麼壓低族系錯誤率(如 Bonferroni,把門檻除以檢定數),要麼控制

一個具體例子

2009 年,Bennett 等人把一條大西洋鮭放進 fMRI 機器,請牠判讀照片中人物的情緒。。在未校正的門檻(t(131)>3.15t(131) > 3.15p<0.001p < 0.001)下,8,064 個 voxel 裡有 16 個「顯著」,還漂亮地群聚在魚的腦腔內。做完錯誤發現率或族系錯誤率校正,顯著的 voxel 一個都不剩——連把門檻放寬到 p=0.25p = 0.25 都沒有。

這篇海報拿了 2012 年的搞笑諾貝爾獎,但它的對象不是那條魚,是當年大量不做校正的 fMRI 論文。

它與 p-hacking 的差別

選擇性報告:做了很多,只報好看的。多重比較是數量問題:全部誠實報告,但檢定太多,門檻就失去了它原本承諾的錯誤率。兩者常常同時發生,而且第一種會讓第二種變得無法校正——因為沒人知道實際上做了幾個檢定。

相鄰術語

  • p-hacking——一邊看結果一邊調分析:多收幾個樣本、換個共變量、換個結果變數,直到 p 掉到門檻底下。
  • 顯著水準——事前選定的門檻:長期而言,你願意讓多少比例的真虛無被錯判為顯著。
  • 陽性預測值——在所有「顯著」的結果裡,真的有效果的佔幾成。它取決於這個領域有多少假說本來就是對的。

出現在