複製危機
大量已發表的顯著結果,換一組人重做就做不出來。
又稱:replication crisis、reproducibility crisis、再現性危機
本頁目次
它在說什麼
複製危機指的是:大量已發表的顯著結果,換一組人、照原方法重做一次,做不出來。它是一個經驗事實,也是一個結構問題——單一研究者沒有犯規,整個系統仍然會生產出這個結果。
一個具體例子
2015 年,270 位研究者組成的 Open Science Collaboration 重做了 100 個心理學實驗:原研究有 97% 是顯著的,重做之後只剩 36%。而且重做出來的效果量平均只有原研究的一半左右。
它是怎麼長出來的
三條線在這裡交會,每一條都可以單獨追:
期刊偏好顯著結果,於是不顯著的抽屜稿從來沒人看見(發表偏誤)。檢定力普遍偏低,於是能過門檻的樣本必然是運氣好的那些,效果量被系統性高估。分析彈性無所不在,於是p-hacking 在不需要任何惡意的情況下持續發生。
三者相乘,陽性預測值就掉到令人不安的水準——這正是 Ioannidis 2005 早就算出來的數字,只是當年沒有人把它當成一個可以被檢驗的預測。2015 年的複製報告,等於把那個預測拿去驗了一次。
相鄰術語
- p-hacking——一邊看結果一邊調分析:多收幾個樣本、換個共變量、換個結果變數,直到 p 掉到門檻底下。
- 檢定力——效果真的存在時,這個研究抓得到它的機率。
- null ritual——把 Fisher 的證據邏輯和 Neyman-Pearson 的決策邏輯焊成一套固定動作,兩邊的代價都不付。