術語

p-hacking

一邊看結果一邊調分析:多收幾個樣本、換個共變量、換個結果變數,直到 p 掉到門檻底下。

又稱:p hacking、選擇性分析、researcher degrees of freedom、研究者自由度

本頁目次

它在說什麼

p-hacking 是一邊看結果、一邊調分析:再多收 20 個樣本看看、把那個不聽話的共變量拿掉、改用另一個結果變數、把離群值的判準換一個。每一步單獨看都有理由,合起來卻是同一件事——用資料來選分析,再假裝分析是事先定好的。

它不需要惡意。多數 p-hacking 是在真誠地「把資料弄乾淨」的過程中發生的。

一個具體例子

:他們讓受試者聽披頭四的〈When I'm Sixty-Four〉或一首對照曲,然後問生日,結論是聽了那首歌的人「年輕了一歲半」(20.1 歲對 21.5 歲,F(1,17)=4.92F(1,17) = 4.92p=.040p = .040)。

聽歌當然不會讓人變年輕。他們是要證明:只要在「收多少樣本、放哪些共變量、報告哪些變數」上保留一點沒說出口的彈性,任何東西都能做到顯著。他們算出這種彈性可以把偽陽性率從 5% 推到六成。他們自己後來也說,這個結果拿掉一個共變量就掉到 p=.33p = .33——這正是重點。

怎麼擋

事前註冊分析計畫(preregistration):把假設、樣本數、分析方法在看資料之前寫死。剩下的探索性分析照做無妨,但要標明它是探索性的,並且不假裝它的 p 值還守得住 5%。

相鄰術語

  • 多重比較——檢定做得夠多,光靠雜訊也會冒出「顯著」。不校正,門檻就名存實亡。
  • 顯著水準——事前選定的門檻:長期而言,你願意讓多少比例的真虛無被錯判為顯著。
  • 複製危機——大量已發表的顯著結果,換一組人重做就做不出來。

出現在