統計學實驗室
統計課本教你怎麼算,很少告訴你這些東西當初是為了什麼問題被發明出來,又是在哪裡開始被誤用。這個站一次處理一個看起來理所當然、來歷卻可疑的概念:它為什麼長成這樣,是誰為了什麼發明它,以及它壞掉的時候會壞在哪裡。文章裡的模擬都可以親手轉動,因為有些事情得自己按下去重跑一萬次才會相信。
統計推論
假設檢定、估計、信賴區間——被用得最多、也被誤解得最深的一塊。
大法官站在哪裡:從投票估計理想點
用貝氏分級反應模型把真投票變成一條違憲宣告傾向的軸,檢驗它沿不沿提名總統結構化——一個有紀律的 null,加一層測得到的協作訊號
把一位大法官放到一條「傾向」的軸上,這條軸從哪裡來?本文以憲法法庭 2022 年後官方逐項立場表為真投票,用 Samejima 分級反應模型的貝氏估計逐法官的違憲宣告傾向,再用置換檢定看它沿不沿提名總統排列。四個維度都測不到效果,而這個 null 帶檢定力、等價與規格曲線的紀律;逐法官可信區間普遍很寬、相鄰全部重疊,這屆在稀疏異議下多半彼此不可區分。另一層用 1949 年以來的意見書共同具名網絡、階層二項模型,測到同提名人中等而穩健的正效果。投票層測不到、協作層測得到,兩層各說各的。台灣既有實證研究沒有一篇用過官方逐項真投票——本文補上這個缺口,並對一篇問題意識高度重疊、迄今未取得全文的研究,在新穎性上保留。
2026-07-19 · 約 12 分鐘 · 理想點、項目反應理論、分級反應模型、貝氏估計、置換檢定、司法行為量化、非顯著結果
怎麼證明「沒有差別」
檢定力與等價檢定:把「沒測到差異」變成「差異小到不重要」
一個檢定跑出 p = 0.56,你不能因此說兩者相同——不顯著可能只是這個研究沒力氣把差異看清楚。本文用學名藥的生體相等性當例子,說明檢定力(研究看得見多大的效果)與等價檢定(TOST:把效果正面關進一個事先訂好的邊界),以及為什麼「不顯著」要拆成「能排除任何重要差異」與「只是測不到」兩種。
2026-07-18 · 約 5 分鐘 · 等價檢定、TOST、檢定力、信賴區間、生體相等性、非顯著結果
到底什麼是信賴區間
一則民調的「誤差 ±4 個百分點」,和那句 95% 到底掛在誰身上
民調說某人的支持度是 45%、誤差 ±4 個百分點,於是報紙寫「真實支持度有 95% 的機率落在 41% 到 49% 之間」。這句話幾乎每個人都會講,而它是錯的。這篇從一個平均數把信賴區間親手推一遍,看那句 95% 是怎麼在「代入手上的數字」那一步失去立足點的;再用潛艇、比值區間、六句自測,指出連專家都栽在同一個地方。頻率派的工具沒有壞——它正確回答了一個定義清楚的問題,只是那個問題不是你想問的那個。
2026-07-18 · 約 12 分鐘 · 信賴區間、誤差幅度、頻率派推論、Neyman、可信區間、誤讀
為什麼叫虛無假設
從一位喝茶的女士到一份聯署聲明:p 值爭議的觀念史
「虛無」這個譯名,把 null 讀成了「什麼都沒發生」。Fisher 的 null 講的是可推翻性:實驗設下它,就是為了讓資料有東西可以反駁。這篇追一條線——品茶實驗如何生出第一個 p 值,Neyman 與 Pearson 如何把它改成一套決策規則,課本又如何把兩套邏輯焊成一個誰都沒設計過的東西,以及焊接處會裂在哪裡。
2026-07-13 · 約 7 分鐘 · 虛無假設、p 值、觀念史、Fisher、Neyman-Pearson、複製危機
大法官的差異有多大?
用貝氏階層模型處理小樣本比例與部分匯聚
甲在 4 件參與案件中提出 3 件個別意見書,乙在 100 件中提出 40 件。75% 與 40% 可以描述已觀察的案件,卻不足以支持排名。本文用二項模型、後驗分布與部分匯聚,說明小樣本比例應如何估計與報告。
2026-07-13 · 約 5 分鐘 · 貝氏統計、階層模型、部分匯聚、小樣本、司法院資料、不確定性
每個例子都查得到出處,出處就掛在句子旁邊;模擬用固定的亂數種子,同樣的按鈕在任何一台機器上跑出同樣的數字。整站中英雙語,右上角切換。
本站說明:方法、出處、模擬的紀律