統計學實驗室

為什麼叫虛無假設

「虛無」這個譯名,把 null 讀成了「什麼都沒發生」。Fisher 的 null 講的是可推翻性:實驗設下它,就是為了讓資料有東西可以反駁。這篇追一條線——品茶實驗如何生出第一個 p 值,Neyman 與 Pearson 如何把它改成一套決策規則,課本又如何把兩套邏輯焊成一個誰都沒設計過的東西,以及焊接處會裂在哪裡。

2026-07-13發表2026-07-18更新約 7 分鐘虛無假設p 值觀念史FisherNeyman-Pearson複製危機
本頁目次

統計課上,老師會告訴你:就是那個「準備被拒絕的假設」。這句話沒有錯,我也一直是這樣背的。

但是沒有人告訴我,那個東西為什麼要叫 null。

這不是無聊的字源癖。你如果照字面把 null 讀成「空的、什麼都沒有」,整套邏輯就會歪掉:你會覺得檢定是在證明「什麼都沒發生」,會覺得 p>0.05p > 0.05 等於「證明了沒有效果」,會覺得虛無假設是一個關於世界的主張。這三件事都是錯的,而且錯得很常見。

重點在最後半句。虛無假設是被設計來承受攻擊的那個假設,它的功能是「可以被推翻」——,而不是「空無一物」。

老實說,這個詞的來歷沒有一份權威的字源紀錄。牛津英語辭典的 null hypothesis 條目把首見書證定在 1935 年,指的就是 Fisher 這本書;至於他當初為什麼挑這個字,我沒有找到他本人的說明。我們能確定的,是他怎麼用它。

而中文把它譯成「虛無」,等於把重音壓在「空」上面,正好壓錯地方。

更麻煩的還在後頭:今天課本教的那套「虛無假設檢定」,其實是把兩套彼此不相容的邏輯焊在一起的產物,而焊點正好落在這個詞上。這篇文章要做的,就是把焊點拆開。

一位女士,八杯茶

1920 年代的英國 Rothamsted 實驗站,下午茶時間。藻類學家 Muriel Bristol 說,她喝得出一杯奶茶是先倒茶還是先倒奶。Fisher 沒跟她爭味覺生理學,他設計了一個實驗:

先把虛無假設寫出來,因為整個實驗都靠它站著:

虛無假設:她根本喝不出差別。 她挑的那四杯,跟哪四杯真的先倒奶,沒有任何關係——她做的事情,等於閉著眼睛從八杯裡隨便挑四杯。

注意它的講法。它沒有說「她一定喝不出來」,它是一個被架在那裡等著被推翻的假設。實驗要做的,就是給資料一次機會把它打掉。

這個假設一寫下來,事情就可以事先算清楚:假如她真的在瞎猜,會發生什麼?八選四,七十種挑法,每種機會均等。全中的挑法只有一種。所以一個完全喝不出來的人,靠運氣全中的機率是 1/701/70,大約 0.014。

這就是虛無假設的功用:它把「她喝不出來」這句模糊的話,變成一個可以整個列舉、可以算出機率的具體世界。 沒有它,「她答對四杯」只是一件事實,你不知道那算厲害還是普通。有了它,你才有東西可以比。

自己挑挑看:

挑出你認為先倒牛奶的 4 杯(已挑 0)
0102030挑法數01234猜對杯數
純憑猜測時,70 種挑法機會均等。全中的挑法只有一種,所以全中的機率是 1/70。這個數字是數出來的,不是抽樣估的。

七十分之一就是最早的 。它是數出來的:把她瞎猜時所有可能的結果列出來,數其中有幾種跟她表現得一樣好或更好,再除以七十。這種把所有重排一一列舉、再數的做法,後來叫做。虛無假設的用處就在這裡——它給你一個可以整個數完的世界。少了它,你只知道她答對四杯,不知道那算不算厲害。

順帶一提,她那天到底答對幾杯,Fisher 從頭到尾沒寫。;Fisher 的女兒在傳記裡只說她「答對得夠多,足以證明自己的說法」。如果那意思是八杯裡答對六杯,那麼 p=0.243p = 0.243——照今天的標準,一點也不顯著。這門學問最有名的實驗,結果本身沒有紀錄。

p 值長什麼樣子

品茶實驗小到可以把七十種可能全部數完。真實研究通常做不到,得靠。問的問題還是同一個:虛無如果為真,看到這麼極端的資料,有多常見?

順著這句話推下去,會得到一個很多人沒想過的結論:虛無為真時,p 值是均勻分佈的。p<0.05p < 0.05 的機率剛好 0.05,p<0.01p < 0.01 的機率剛好 0.01。在一個什麼都沒發生的世界裡,每二十次研究就會冒出一次「顯著」。

把效果調成零,重跑兩千次:

門檻 alpha

delta 是兩組真實平均數的差距,用標準差當尺:兩班平均差 2 分、分數標準差 10 分,delta 就是 0.2。delta = 0 代表兩組真的一模一樣,任何看起來的差異都只是抽樣的隨機起伏。

2000 次研究裡,有 5.1% 落在門檻以內。效果是零,這些全是偽陽性,比率就是你設的 0.05。

020406080100120研究數0.000.200.400.600.80p 值p = 0.05
沒有效果時,p 值均勻分佈在 0 到 1 之間。p 小並不稀奇,它本來就有 5% 的機會小於 0.05。把門檻拉到 0.01,偽陽性降到 1%,那是設定出來的,不是發現。

滑桿上那個 delta,是兩組真實平均數的差距,用標準差當尺。這個尺很重要:說「兩班平均差 2 分」沒有意義,得看分數散得多開——如果標準差是 10 分,那 2 分只是 0.2 個標準差,兩班的成績分佈幾乎完全重疊。delta = 0 就是兩組真的一模一樣,你看到的任何差異都只是抽樣的隨機起伏。

把滑桿往右推,分佈開始往左邊堆。堆得多快,就是——真的有效果時,你抓得到它的機率。同一張圖,同一個機制,只是虛無不再為真。

Neyman 與 Pearson 把它改成一個決定

1933 年,Neyman 與 Pearson 提出一套看起來很像、骨子裡完全不同的做法。他們關心的是:如果非得在兩個假設之間選一個,什麼樣的規則能讓你長期犯錯最少?

想像一間工廠在做醫療器材的金屬板。:機器可能故障,抽驗要花錢。誤報一次,代價是白停一次機;漏抓一次,代價是把瑕疵品送進手術室。兩種錯誤的代價不一樣,所以廠長事先把壓得很低、容忍較高的第二類錯誤,再據此算出每天該抽驗幾片。這裡沒有人在問「這批資料的證據有多強」,只在問「照這條規則做,長期下來我會賠多少」。

於是有了 H0H_0H1H_1 成對出現,有了事前固定的 α\alpha,有了第二類錯誤與檢定力。α=0.05\alpha = 0.05 講的是規則的性質:虛無為真的那些場合裡,你會有 5% 的機會誤判。跟眼前這一次的信心強弱無關。

這套做法有它的規矩。門檻要在看到資料之前決定。報告只寫拒絕或不拒絕。p 等於多少不必寫出來——在這套邏輯裡,p 只是拿來跟門檻比大小的中間值,本身不代表證據多強。

Fisher 對此很不滿,兩邊吵了二十年。課本的處理方式是:兩邊都收下。

焊接處

同一組資料,三種讀法:

同一組資料:處理組 12 個觀測,對照組 12 個觀測。t = 2.267,df = 22,雙尾 p = 0.0336。三個學派拿到的是同一批數字。

報告 p = 0.0336,然後停在這裡。

沒有對立假設,沒有事前講好的門檻,沒有「接受」這個動作。p 是證據的刻度,衡量資料跟虛無假設有多不搭。虛無假設的角色是被拿來推翻的那一個,它永遠不會被證明。下一步交給研究者判斷:再做一次實驗,或先把結論收下。

第三個面板,就是今天絕大多數論文寫的那句話。它同時主張了兩件互斥的事。「p 越小證據越強」來自 Fisher,代價是放棄長期錯誤率的保證。「達到、拒絕虛無」來自 Neyman 與 Pearson,代價是事前固定門檻、不准把 p 當證據看。兩邊的代價都不付,兩邊的權威都要。Gigerenzer 稱它為

0.05 這個門檻本身也沒什麼理論地位。,如此而已。方便,而且當年好查表。

焊接處會裂在哪裡

p 值不是「虛無為真的機率」。它是「虛無為真的前提下,看到這種資料的機率」。這兩句話長得很像,條件的方向卻剛好相反。

換個場景就看得很清楚。假設有一種病,一千個人裡有十個人得。檢驗方法不錯:得病的人,十次有八次會驗出陽性;沒病的人,也有 5% 會被誤驗成陽性。現在你驗出陽性。你得病的機率是多少?

不要用公式,就數人頭。一千個人裡:

  • 十個人真的有病。其中八個驗出陽性(另外兩個漏掉了)。
  • 九百九十個人沒病。其中大約五十個被誤判成陽性。

所以陽性的總共有五十八個人,其中真的有病的只有八個。驗出陽性,真的有病的機率是 8/58,大約 14%。 不是 80%,也不是 95%。(這個數字有名字:。)

差別在哪裡?「得病的人有八成會驗出陽性」講的是從病往檢驗看;「驗出陽性的人有多少真的有病」講的是從檢驗往病看。方向反過來,答案就從 80% 掉到 14%。中間差的那個東西,叫做事前機率:這個病本來有多罕見。檢驗方法本身完全不知道這件事。

p 值就是那個「檢驗」。p<0.05p < 0.05 告訴你的是「假如虛無為真,看到這種資料有多罕見」,方向是從虛無往資料看。而你真正想問的是反過來的:「看到這種資料,虛無為假的機率有多大?」要回答它,你得先知道一件 p 值完全不曉得的事——這個領域裡,本來有多少假說是真的。那就是研究版本的「事前機率」。

自己轉轉看。事前勝算 1:10 的意思是,這個領域裡每十一個被拿去檢定的假說,大概只有一個是真的(探索性研究、篩選實驗,大致就是這個光景):

每 1000 個被檢定的假說顯著不顯著
真有效果(91)7318
沒有效果(909)45864

在所有「顯著」的結果裡,真的有效果的佔 62%。 p < 0.05 從來不代表「有 95% 的機會是真的」。那個 95% 是在虛無為真的前提下算出來的,這裡問的卻是反過來的問題。

把檢定力調低一點,你會看到更難堪的畫面:在一個大多數假說都是錯的領域裡,如果檢定力又低,「顯著」的結果會有一大半是假的。 而每一個檢定都做得正確無誤,沒有人犯規。——他沒有指控任何人造假,他只是把上面那個數人頭的算術,套到整個科學文獻上。

p 小也不代表效果大。1988 年那個著名的阿斯匹靈試驗就是現成的例子:。p 小到不能再小。而——用同一批數字算出來的兩個東西,一個看起來像鐵證,一個小到幾乎看不見。

把效果固定在一個小到不值得談的數字,只把樣本數往上加:

d = 0.15 的意思是:兩組的真實平均只差 0.15 個標準差。換算成分數,大約是兩班平均差 1.5 分、而分數標準差有 10 分——小到沒有人會在意。整張圖裡這個差距完全沒有變過,變的只有人數。

每組收 80 個人,重做 400 次研究,其中典型的一次會得到 p = 0.257。還不顯著。多收一點人就會。

每組人數超過大約 500 之後,典型的研究就會跌破 0.05,開始「顯著」。

0.00.10.20.30.40.50.6典型的 p 值20501203208002000每組樣本數(對數刻度)p = 0.05你選的樣本數
曲線上每一點,是在該樣本數下重做 400 次研究、取 p 值的中位數(也就是「典型的一次」會得到的 p)。放大的那個空心點,就是你用滑桿選的樣本數,它一定落在曲線上。橫軸是對數刻度。整張圖裡效果都是 d = 0.15,只有人數在變。

p 值衡量的是資料有多不像虛無。樣本一多,再微小的差距也會變得很不像虛無。p<0.001p < 0.001 有時候只是在說「我們收了很多資料」。

還有一件事:多看幾眼,總會看到東西——這是的老問題。二十個結果變數,真實效果全都是零,每個都用 0.05 檢定一次。至少一個「顯著」的機率是 10.95200.641 - 0.95^{20} \approx 0.64

量 20 個結果變數,每一個的真實效果都是零。

Simmons、Nelson 與 Simonsohn 在 2011 年直接把這件事做給大家看。他們讓受試者聽披頭四的〈When I'm Sixty-Four〉或一首對照曲,然後問出生年月日,。聽歌當然不會讓人變年輕。他們是刻意示範:只要在收多少樣本、放哪些共變量、報告哪些變數上留一點沒說出口的彈性,任何東西都能做到顯著——他們算出這種彈性可以把偽陽性率推到六成。(這個例子連他們自己後來都說不穩健:拿掉一個共變量,pp 就掉到 .33。這正好是重點。)

沒有人造假。每個檢定都合乎規範。壞掉的是「先看資料,再決定報告哪一個」——這件事有個名字:。這麼一做,那個 5% 的保證就消失了,而報告裡不會留下任何痕跡。

十年後帳單來了。。這就是後來被叫做的那件事。

這樣說對,那樣說錯

同一個 p 值,有幾句值得記住的精確說法,也有幾乎人人踩過的誤讀。;下面一邊收精確的說法,一邊列最常撞見的誤讀,每條誤讀都配一句該怎麼改。

這樣說是對的

條件方向是對的——它算的是「資料|虛無」,一句關於資料的話,不是關於假設的話。整排誤讀幾乎都從把這個條件反過來讀開始,所以先把正確的方向記牢,反而是最省事的防身術。

null 講的是可推翻性,不是「什麼都沒發生」。這正是這篇文章的主軸,也是「虛無」這個譯名最容易帶錯的地方。

把「沒證據反對」和「有證據支持」分開。樣本小、變異大、測量粗,都會讓真實存在的效果過不了門檻;虛無假設從不被證明。

顯著水準是一條決策規則的參數,屬於「長期會錯幾成」的層次;它不告訴你眼前這個結果為真的機率。把決策規則讀成證據強度,正是課本把兩套邏輯焊在一起後裂開的地方。

這樣說是錯的

p 值算的是「虛無為真的前提下,看到這種資料的機率」。這句話把條件反過來讀成「看到這種資料的前提下,虛無為真的機率」。兩者可以差很遠,差多遠取決於這個領域裡本來有多少假說是真的——而 p 值對此一無所知。

要回答「這個結果有多大機會是真的」,必須額外引入事前勝算與檢定力(見本文的 2x2 表)。

同一個條件方向的錯誤。p 值的計算從頭到尾只用到虛無假設,對立假設沒有進入這個算式。

把對立假設的可信度納入計算,需要的是貝氏因子或事後機率,那是另一套工具。

沒有拒絕虛無假設,只代表這批資料沒有提供足夠的理由去推翻它。樣本太小、變異太大、測量太粗,都會讓真實存在的效果過不了門檻。虛無假設從不被證明。

報告效果量與信賴區間;若真要正面宣稱「差距小到不重要」,用等價檢定,並事先講清楚多小算不重要。

p 值同時受效果大小與樣本數影響。樣本夠大時,任何微不足道的差距都能得到極小的 p 值。

效果大小要看效果量本身(差值、比值、標準化效果量),不看 p。

0.05 是 Fisher 順手取的一個方便界線,沒有理論地位。它之所以流傳,一部分原因是當年查表方便。

門檻的高低該由這個決策的代價決定:偽陽性有多貴、偽陰性有多貴。

重複研究的成功率取決於真實效果與檢定力,跟這一次的 p 值不是同一回事。單次 p 值對複製機率的資訊量很低。

要談複製,先談檢定力與效果量的估計精度。

那該怎麼辦

2016 年,美國統計學會做了一件它歷史上沒做過的事:替一個統計方法發表正式聲明。列了六條原則,最直白的一條是:科學結論與政策決定,不該只看 p 值有沒有越過某個門檻。

聲明沒有提供替代品,因為問題不在工具。p 值回答的是一個定義清楚的問題,Fisher 的用法與 Neyman-Pearson 的用法各自成立。壞掉的是那個焊接處,它讓人以為做完檢定就等於做完推論。

實務上該做的事很具體。報告,讓讀者看得到「多大」,而不只是「有沒有」——阿斯匹靈那個例子裡,真正該被討論的是 0.03,不是那串零。事前註冊分析計畫,讓那個 5% 的保證真的成立。不顯著的結果也發表出來,否則文獻裡剩下的全是過了門檻的那 5%。虛無真的成立時,用等價檢定正面說出「差距小到不重要」,別再含糊地講「沒有顯著差異」。

回到那個詞。null 講的是可推翻性。它是實驗設下、等著被資料反駁的那個假設,是推論的起點。把「不拒絕虛無」宣布成「證明了沒有效果」的那一刻,這個詞就被用反了。而「虛無」這個譯名,最容易把人帶去的正是那裡。

時間軸

顯著性檢定的操作手冊。二十分之一被說成一個方便的界線,日後成為 0.05。

H0 與 H1 的配對、第一類與第二類錯誤、臨界域。統計檢定被改寫成一套關於長期行為的決策規則。

女士品茶登場。虛無假設被明確界定為那個可能被否證、卻永遠不會被證明的假設。

兩人在期刊與講台上互相攻擊。爭的是統計推論到底在做什麼:衡量證據,還是規範行為。

心理學與社會科學的方法教科書開始教一套混合程序:報告 p 值,同時宣稱長期錯誤率的保證。兩位當事人都不會承認這是自己的東西。

這套程序被指認為一種儀式:機械執行、沒有作者、也沒有人願意為它的邏輯辯護。

大規模重做實驗的計畫顯示,大量已發表的顯著結果重做不出來。p-hacking、發表偏誤、低檢定力被指認為結構性原因。

六條原則。最直白的一條:科學結論不該只建立在 p 值是否越過某個門檻上。同年 Greenland 等人列出二十五條常見誤讀。