研究統計 指南

95% 信賴區間怎麼看?CI、p 值、包含 0 的意思完整指南

p 值只給你一個顯著性訊號;信賴區間還能告訴你效果可能落在哪裡,以及估計到底精不精確。

更新日期:

論文中常看到:

95% CI [2.10, 7.84]

或:

95% CI [-0.42, 4.51]

很多人只知道「有沒有包含 0」,但 CI 的價值遠不只如此。

速答:95% 信賴區間是什麼?
在傳統頻率學派的解讀中,95% 信賴區間指的是:如果用相同抽樣與計算方法重複研究很多次,長期而言約 95% 這類區間會涵蓋真正的母體參數。對已經算出的單一區間,不宜說「真正參數有 95% 機率在這個區間內」。CI 越窄通常表示估計越精確;在常見雙尾檢定中,平均差的 95% CI 若不包含 0,通常對應 p < .05。

一、為什麼只報一個平均數不夠?

假設樣本平均 M = 75

這只是點估計。

真正母體平均可能不是剛好 75,所以我們會想知道:這個估計的不確定程度有多大?

例如:

95% CI [73, 77]

表示依目前方法,合理的估計範圍相對集中。

如果是:

95% CI [60, 90]

雖然中心同樣是 75,但不確定性大得多。

二、最常見的錯誤:不是「真實值有 95% 機率在區間內」

傳統 frequentist CI 的參數被視為固定,只是我們不知道它。隨機的是抽樣後算出來的區間。

所以更精確的說法是:

如果重複進行同樣的抽樣與區間計算,長期約 95% 的區間會包含真正參數。

教學上常用「我們有 95% 信心」簡化,但正式方法解釋時最好知道它的頻率學派含義。

三、平均數 CI 怎麼算?

當母體標準差未知,常見平均數 CI:

M ± t* × SE

而:

SE = SD / √n

所以區間寬度受到:

  • SD;
  • n;
  • confidence level;
  • t 臨界值

影響。

延伸閱讀:SD 與 SE 差在哪

四、樣本數越大,CI 為什麼通常越窄?

因為 SE = SD / √n

n 越大,SE 越小。

例如 SD 都等於 10:

n = 25

SE = 2

n = 100

SE = 1

因此在其他條件近似相同時,100 人的平均估計通常比 25 人更精確,95% CI 也會較窄。

五、SD 越大,CI 為什麼會變寬?

資料越分散,樣本平均數的估計通常越不穩定。

所以同樣 n = 50:

  • SD = 5 → CI 較窄
  • SD = 20 → CI 較寬

這不是軟體出錯,而是資料本身提供的精度不同。

六、CI 包含 0 到底表示什麼?

當你看的是兩組平均差,虛無假設常是:

差異 = 0

假設平均差 = 4.2。

95% CI [1.1, 7.3]

整段都大於 0,表示目前資料支持正向差異,而且在常見雙尾 α=.05 對應檢定中,通常會 p < .05。

95% CI [-0.6, 9.0]

跨過 0,代表目前合理範圍仍包含小幅負差、零差與正差,因此常見雙尾檢定通常不會達 .05。

七、不是所有 CI 都看「有沒有包含 0」

要先看參數的虛無值。

平均差

虛無值常為 0。

迴歸係數

虛無值常為 0。

correlation

虛無值常為 0。

比值型效果

例如 odds ratio、risk ratio,虛無值通常是 1。

所以 OR 的 95% CI:

[1.20, 2.10]

沒有跨 1。

而:

[0.84, 1.76]

包含 1。

不能全部機械套「看有沒有 0」。

八、CI 和 p 值有什麼關係?

在同一模型、同一雙尾假設、相同 α 的常見情況:

95% CI 是否包含虛無值,通常和 p < .05 的判斷互相對應。

但 CI 比單一 p 值資訊更多。

p 值

更偏向告訴你資料和 H₀ 的不相容程度。

CI

同時告訴你效果估計範圍與精確度。

所以只報「p = .03」不如:

平均差 = 4.2,95% CI [0.4, 8.0],p = .031

更完整。

延伸:p 值怎麼看

九、CI 很寬代表什麼?

代表估計不精確。

可能原因:

  • 樣本小;
  • SD 大;
  • 事件很少;
  • 模型複雜;
  • 資料資訊不足。

例如:

d = 0.50, 95% CI [-0.20, 1.20]

點估計看起來是中等效果,但 CI 從輕微負效果跨到很大的正效果。這時不能只看 d = 0.50 就下結論。

十、CI 很窄就代表研究沒有偏誤嗎?

不是。

非常大的樣本可以讓 CI 很窄,但如果抽樣方式有系統性偏誤,你可能只是很精確地估錯

CI 主要反映模型中的抽樣不確定性,不會自動納入所有研究偏誤。

十一、90%、95%、99% CI 差在哪?

在相同資料下:

  • 90% CI 通常最窄;
  • 95% CI 居中;
  • 99% CI 通常最寬。

因為你希望長期涵蓋率更高,就需要更寬的區間。

不能因為 90% CI 比較窄,就為了讓結果好看臨時改用 90%。信賴水準應依研究計畫或領域規範決定。

十二、CI 不等於「95% 的個體會落在這裡」

假設:

平均身高 170 cm, 95% CI [169, 171]

這不是說 95% 的人身高介於 169~171。

這個 CI 是母體平均身高估計的區間。個體身高的分布範圍通常寬得多。

這是 CI 和 SD 很容易混淆的地方。

十三、Confidence Interval 和 Prediction Interval 不一樣

線性迴歸中可能看到:

confidence interval

估計某個平均反應或模型參數的不確定性。

prediction interval

預測一個新個體可能落在哪。

新個體還有個體誤差,因此 prediction interval 通常比對平均反應的 confidence interval 更寬。

十四、t 檢定實際例子

兩組後測平均差:

Difference = 6.1

95% CI [2.2, 10.0]

p = .003

完整說法:

策略教學組平均高 6.1 分,95% CI 顯示合理差異範圍約為 2.2 到 10.0 分;區間沒有跨 0,且 p = .003,顯示在目前模型下結果達統計顯著。

若再搭配效果量 d = 0.79,資訊更完整。

延伸:效果量完整指南

十五、不顯著結果也可以很有資訊

例如:

Difference = 4.0

95% CI [-0.4, 8.4]

p = .074

如果只寫「沒有顯著差異」,會失去很多資訊。

CI 告訴你目前資料仍容許接近零,也可能有相當程度的正向效果。這可能表示研究需要更多資料,或目前估計精度不足。

十六、等效性研究更不能只靠 p > .05

如果研究目的是證明兩種方法在實務上足夠接近,不能只用傳統差異檢定得到 p > .05 就宣布「等效」。

因為不顯著可能只是樣本不足。

真正的 equivalence testing 需要事先定義等效界值,並用適當方法檢驗區間是否落在可接受範圍內。

十七、Effect Size CI 怎麼看?

如果:

d = 0.70, 95% CI [0.25, 1.15]

代表點估計是 0.70,而合理範圍仍有不小的不確定性。

如果:

d = 0.70, 95% CI [0.62, 0.78]

則精確很多。

因此效果量不只要看「大中小」,也要看 CI。

十八、常見錯誤

錯誤 1

真實平均有 95% 機率在這個已算出的 CI。

頻率學派下不是這樣定義。

錯誤 2

95% CI 是 95% 個體所在範圍。

不是。

錯誤 3

CI 跨 0,所以效果一定是 0。

錯。只代表資料仍與 0 相容。

錯誤 4

CI 不跨 0,所以效果一定很大。

錯。很小但精確的效果也可能不跨 0。

錯誤 5

CI 很窄,所以研究一定沒有偏誤。

錯。CI 不會自動修復抽樣或測量偏誤。

十九、APA 結果句範例

平均差

策略教學組的平均分數高於控制組 6.10 分,95% CI [2.20, 10.00],Welch’s t(57.4) = 3.07, p = .003。

相關

學習投入與閱讀理解呈正相關,r = .36, 95% CI [.18, .52], p < .001。

迴歸係數

出席率正向預測後測成績,B = 0.42, SE = 0.15, 95% CI [0.12, 0.72], p = .007。

正式排版依期刊與課程規範。

二十、常見問題 FAQ

CI 包含 0 就一定 p > .05 嗎?

在相同雙尾模型與對應 95% CI 的常見情況通常如此,但不同方法、單尾檢定、校正方式或非對稱區間不宜簡化套用。

CI 越窄越好嗎?

較窄通常表示估計更精確,但研究品質仍要看偏誤、設計與測量。

95% CI 為什麼不是固定用 ±1.96?

當標準差未知、小樣本時常使用 t 分配臨界值,而不是固定 1.96。其他模型的 CI 公式也不同。

樣本數變大 CI 會怎樣?

在其他條件近似相同時通常會變窄。

CI 可以取代 p 值嗎?

CI 可以提供更豐富的效果與精確度資訊,但研究報告應依分析目的與領域規範決定如何呈現,很多情況會兩者一起報告。

二十一、下一步

下一步

正在整理 t 檢定結果?

先使用 FunnyTools 獨立樣本 t 檢定工具核對 Welch t、df 與 p 值,再把平均差、效果量與 95% CI 一起整理進研究報告。

重點速記

重點:95% CI 不只是「有沒有跨 0」

三點:

  • 區間位置:效果方向
  • 區間寬度:估計精確度
  • 是否跨虛無值:和顯著檢定互相對照

參考資料

  • NIST/SEMATECH e-Handbook of Statistical Methods: Confidence Intervals.
  • NIST Confidence Limits for the Mean.
  • FunnyTools 教育統計工具與既有研究指南。

此頁介紹常見 frequentist confidence interval。其他模型、bootstrap、Bayesian credible interval 的解讀可能不同。