研究統計 指南

p 值怎麼看?從 p < .05、p > .05 到 SPSS p=.000 完整解讀

p 值不是研究假設正確的機率,也不能單獨告訴你效果有多大。這篇從零開始,用研究例子把 p 值、顯著性、效果量與信賴區間一次說清楚。

更新日期:

如果你第一次看 SPSS、R、Jamovi 或論文的統計結果,很容易先被 p = .032p < .001p > .05 搞混。很多課程又會把它簡化成「p < .05 就顯著」,久了就會讓人誤以為 p 值只是研究有沒有成功的開關。

其實,p 值真正要回答的是:假設虛無假設成立,而且統計模型與分析前提合理,得到目前這麼極端或更極端資料的機率有多大。

速答:p 值怎麼看?
常見研究會先設定顯著水準 α = .05。若 p < .05,代表目前資料和虛無假設的不相容程度達到研究者事先設定的判準,通常會寫成「結果達統計顯著」;若 p ≥ .05,通常寫成「未達統計顯著」。但 p 值不能告訴你效果有多大,也不能單靠 p 值判定結果是否重要。

一、先用最白話的方式理解 p 值

假設你想研究:「新的閱讀策略教學,會不會讓學生的閱讀理解成績比一般教學高?」

你通常會先設定虛無假設:

H₀:兩種教學的母體平均表現沒有差異。

接著蒐集資料並進行統計檢定。

如果最後得到:

p = .018

它的意思不是「有 1.8% 的機率兩組其實沒有差」,比較接近正確的說法是:

假設兩組在母體中真的沒有差異,而且統計模型的前提合理,那麼得到目前這麼大的差異或更極端差異的機率約為 1.8%。

因為這樣的資料在 H₀ 成立時相對少見,所以研究者可能選擇拒絕 H₀。

二、p < .05 到底代表什麼?

.05 不是大自然規定的神奇界線,而是研究中很常使用的顯著水準。

如果研究者事先設定 α = .05,常見判讀如下:

p 值 常見判讀
p < .001 達統計顯著
p = .003 達統計顯著
p = .032 達統計顯著
p = .049 達統計顯著
p = .050 依事先規則忠實報告,不宜自行改寫成 p < .05
p = .061 未達 .05 顯著水準
p = .214 未達統計顯著

最重要的是:p = .049 和 p = .051 並不是一個「有真實效果」,另一個「完全沒有任何效果」。 兩者其實非常接近。把 .05 當成絕對斷崖,容易過度簡化研究結果。

三、p > .05 是不是代表「沒有差異」?

不是。

如果 p = .12,較好的說法是:

本研究在目前樣本、測量精度與分析方法下,沒有得到足夠證據拒絕虛無假設。

不能直接改寫成:

「證明兩組完全一樣。」

未達顯著可能有很多原因,例如:

  • 真正效果很小;
  • 樣本數不足;
  • 個體差異很大;
  • 測量誤差較大;
  • 信賴區間很寬;
  • 分析方法不合適;
  • 統計檢定力不足。

因此,比起只看 p 值,更好的做法是一起看平均差、效果量、95% 信賴區間、樣本數、研究設計與實務意義。

四、SPSS 顯示 Sig. = .000 要怎麼寫?

很多 SPSS 初學者第一次看到 Sig. (2-tailed) = .000,會直接在論文寫 p = .000

這樣不理想。

SPSS 顯示 .000 通常是因為介面只顯示到小數第三位,不代表真正的 p 值等於 0。正式報告通常寫:

p < .001

而不是:

p = .000

例如 SPSS 顯示:

  • t = 4.823
  • df = 58
  • Sig. (2-tailed) = .000

可整理成:

A 組成績顯著高於 B 組,t(58) = 4.82, p < .001。

若有平均數、標準差與效果量,建議寫完整:

A 組(M = 82.40, SD = 7.10)高於 B 組(M = 74.30, SD = 8.20),t(58) = 4.82, p < .001, d = 1.24。

五、p 值不是效果量:p 很小不代表效果很大

假設有兩個研究:

研究 A

  • 平均差 0.8 分
  • N = 10,000
  • p < .001

研究 B

  • 平均差 7.5 分
  • N = 20
  • p = .064

只看 p 值,研究 A 看起來「很顯著」。但研究 A 可能只是因樣本非常大,使很小的差異也得到很小的 p 值;研究 B 的差異反而可能更大,只是樣本小、估計不精確。

因此:

p 值回答資料與 H₀ 的不相容程度;效果量回答差異或關係有多大。

延伸閱讀:效果量 Effect Size 完整指南

六、p 值和 95% 信賴區間有什麼關係?

在許多常見的雙尾檢定中,如果使用 α = .05:

  • 95% CI 沒有包含虛無值,通常對應 p < .05;
  • 95% CI 包含虛無值,通常對應 p ≥ .05。

例如比較兩組平均差時,虛無值通常是 0。

例 1

平均差 = 5.2,95% CI [2.1, 8.3]

區間沒有包含 0,常見雙尾檢定通常也會得到 p < .05。

例 2

平均差 = 3.1,95% CI [-0.8, 7.0]

區間跨過 0,代表資料仍與「可能沒有差」相容。

信賴區間比單一 p 值多提供一個重要訊息:效果可能落在哪一段合理範圍,以及估計有多精確。

延伸閱讀:95% 信賴區間完整指南

七、p = .049 和 p = .051 差很多嗎?

沒有理由把這兩個數字理解成完全相反的世界。

  • 研究 A:p = .049
  • 研究 B:p = .051

傳統 .05 門檻會讓 A 被標成「顯著」、B 被標成「不顯著」,但證據強度非常接近。

更好的做法是忠實報告效果估計、CI 和精確 p 值,而不是把 .051 誇大成「完全沒有效果」。

八、單尾 p 值和雙尾 p 值差在哪?

雙尾檢定

問:「A 和 B 是否有差異?」不預先限定方向。

單尾檢定

問:「A 是否明確高於 B?」只關注事先指定方向。

不能因為雙尾 p = .08 不顯著,看到資料方向符合預期後,才臨時改成單尾讓 p 值變小。檢定方向應由研究問題與分析計畫事先決定。

九、做很多次檢定,為什麼會提高誤判風險?

如果每次都用 α = .05,而且一次做很多個假設檢定,就會提高至少出現一次偽陽性結果的機會。

例如有 4 組學生,卻不用 ANOVA,而一直做 A vs B、A vs C、A vs D、B vs C、B vs D、C vs D,就會產生多重比較問題。

三組以上平均數比較通常先考慮 ANOVA,再依整體結果與研究目的做適當的事後比較或多重比較校正。

十、研究結果應該怎麼完整解讀?

看到一個 p 值時,可以按 5 步走:

  1. 確認研究問題:比較、相關、比例,還是預測?
  2. 確認統計方法:t 檢定、ANOVA、卡方、相關、迴歸回答的問題不同。
  3. 看 p 值:依事先設定 α 判斷統計顯著性。
  4. 看效果方向與效果量:顯著不代表效果大。
  5. 看 95% CI:確認合理效果範圍與估計精確度。

不知道該選哪個方法,可以先看:統計方法怎麼選?完整選擇指南

十一、SPSS t 檢定結果範例:不要只盯著 Sig.

假設:

組別 N M SD
閱讀策略組 30 82.4 7.1
一般教學組 30 76.3 8.2

結果:

  • Welch’s t = 3.07
  • df = 57.4
  • p = .003
  • Cohen’s d = 0.79

完整判讀是:

  1. 閱讀策略組平均高 6.1 分;
  2. p = .003,達常用 .05 顯著水準;
  3. d = 0.79,顯示差異幅度不能只當成極小變化;
  4. 最好再檢查平均差的 95% CI;
  5. 是否具有教育實務意義仍需回到測驗尺度與研究情境判斷。

你也可以使用 FunnyTools 的獨立樣本 t 檢定簡易計算器核對摘要統計結果。

十二、論文/作業常見錯誤寫法

錯誤 1

p < .05,所以研究假設有 95% 的機率正確。

問題:p 值不是研究假設為真的機率。

錯誤 2

p > .05,因此證明兩組沒有差異。

問題:未拒絕 H₀ 不等於證明 H₀ 為真。

錯誤 3

p = .000。

建議:若軟體只是因顯示精度呈現 .000,通常報告為 p < .001

錯誤 4

p < .001,所以效果非常大。

問題:統計顯著與效果大小不同。

錯誤 5

p = .051,所以完全沒有研究價值。

問題:應一起檢視效果估計、CI、樣本數與研究設計。

十三、APA 7 結果句可以怎麼寫?

獨立樣本 t 檢定

閱讀策略組(M = 82.40, SD = 7.10)的閱讀理解得分高於一般教學組(M = 76.30, SD = 8.20),Welch’s t(57.4) = 3.07, p = .003, d = 0.79。

相關

學習投入與閱讀理解呈正相關,r(98) = .42, p < .001。

ANOVA

三組教學方式的後測成績存在差異,F(2, 87) = 6.41, p = .003, η² = .13。

正式投稿仍應依期刊、學校或指導教師要求調整格式。

十四、常見問題 FAQ

p 值越小越好嗎?

不能這樣說。p 值越小通常表示資料在 H₀ 成立時越不容易出現,但研究品質不能用 p 值大小排名。

p = .05 算顯著嗎?

若事先規則是 p < .05,精確的 p = .050 並不符合 < .05。依研究計畫或期刊規範忠實報告最重要。

p > .05 可以寫「沒有顯著差異」嗎?

可以寫「未達統計顯著」或「未發現統計上顯著差異」,但避免直接寫成「證明沒有差異」。

SPSS 的 Sig. 就是 p 值嗎?

在常見輸出中,Sig. 欄位通常是該檢定的 p 值,但要確認你讀的是哪個檢定、單尾或雙尾,以及正確的輸出列。

p < .001 要寫成 p = .000 嗎?

通常不要。SPSS 的 .000 是顯示精度造成,正式報告一般寫 p < .001

p 值可以告訴我效果大不大嗎?

不能。效果大小應看 Cohen’s d、r、η²、partial η²、R² 或其他適合研究設計的效果量。

十五、下一步:不要只停在「顯著/不顯著」

推薦繼續看:

統計解讀最安全的習慣不是問「有沒有 p < .05」,而是一起回答:

差多少?方向是什麼?估計有多精確?這個差異在研究情境中重要嗎?

下一步

已經有兩組的 N、平均數和標準差?
使用 FunnyTools 獨立樣本 t 檢定簡易計算器快速核對 Welch t、自由度與雙尾 p 值,再回到本指南一起檢查效果量與信賴區間。

重點速記

重點:p 值不是「假設為真的機率」

四格文字:

  1. p < .05:常見判準下達統計顯著
  2. p > .05:未達顯著 ≠ 證明沒有差異
  3. SPSS .000:通常報告 p < .001
  4. 別只看 p:一起看效果量與 95% CI

參考資料

  • American Statistical Association, Statement on Statistical Significance and P-Values.
  • NIST/SEMATECH e-Handbook of Statistical Methods.
  • FunnyTools 現有教育與統計工具與研究統計指南。

本頁供教育、研究方法學習與統計結果初步判讀使用,不取代研究設計諮詢、正式統計軟體驗證或期刊投稿規範。