研究統計 指南

統計顯著 vs 實務顯著差在哪?p值、效果量與研究意義完整指南

一個差 0.3 分的研究可以 p<.001,一個差 8 分的研究也可能 p>.05。研究價值不能只靠顯著星號判斷。

更新日期:

你看到 p<.001,第一反應可能是:「效果很強!」但 p 值不會告訴你效果大小。

速答:統計顯著和實務顯著差在哪?
統計顯著(statistical significance)主要反映在虛無假設成立時,目前資料是否足以被視為不尋常;實務顯著(practical significance)則問「這個差異到底大不大、值不值得在真實情境中在意」。樣本數很大時,極小效果也可能 p<.05;樣本很小時,實際上很重要的效果也可能未達顯著。因此應一起看 效果量、95% CI、原始尺度差異、成本與風險

一、統計顯著在回答什麼?

假設 H₀:新教學與舊教學平均成績相同。

得到:

p=.01

如果 α=.05,可以說資料在 H₀ 成立時相對不尋常,因此拒絕 H₀。這叫統計顯著。

但它沒有回答:

平均差是 0.2 分還是 20 分?

二、實務顯著在回答什麼?

例如:

  • 新教學平均提高 0.4 分;
  • 測驗滿分 100;
  • 每位學生額外花 40 小時;
  • 每班成本增加 10 萬元。

即使 p<.001,也可能實務價值有限。

反過來,如果提高 6 分、成本低,而且對低成就學生有明顯幫助,即使小型 pilot p=.08,也可能值得進一步研究。

三、大樣本為什麼很容易顯著?

很多檢定統計量都有類似邏輯:

signal / standard error

而 SE 常隨 n 增加而下降。

所以 N 越大,小差異也更容易被檢出。

研究 A

  • N=10,000
  • 平均差=0.5
  • p<.001

研究 B

  • N=20
  • 平均差=7.0
  • p=.07

不能只說 A 比 B 更有價值。

四、p 值不是效果量

這是統計學界長期強調的核心原則。

p 值不衡量:

  • 效果大小;
  • 實務重要性;
  • 研究品質;
  • 假設為真的機率。

延伸:p 值怎麼看

五、效果量怎麼補上資訊?

兩組平均數可看:

  • Cohen’s d;
  • Hedges’ g。

ANOVA 可看:

  • η²;
  • partial η²;
  • ω²。

相關可看 r,迴歸可看 R²、ΔR²。

延伸:效果量完整指南

六、原始單位有時比標準化效果更重要

假設 d=.30,看起來「小」。但原始差異是每晚平均多睡 45 分鐘,對睡眠介入可能很有意義。

另一個研究 d=.80,但只是沒有實際決策價值的反應時間差 8 ms。

所以:

效果量標準化後方便比較,但不要丟掉原始尺度。

七、95% CI 告訴你結果有多確定

研究:

d=.60

如果 CI 是 [.55,.65],估計非常精確;如果是 [-.10,1.30],不確定程度很大。

即使 point estimate 相同,解讀完全不同。

延伸:95% 信賴區間

八、最小重要差異(MID / MCID)是什麼?

某些醫療、心理或教育領域會預先設定:「多大的變化才值得視為有實務意義?」

例如:

  • 量表至少改善 5 分;
  • 正確率至少增加 10 個百分點;
  • 反應時間至少下降 100 ms。

這種 threshold 應來自既有文獻、專業判斷、anchor-based 或 distribution-based 方法,以及利害關係人的實際需求。

不能事後看到結果再挑一條有利門檻。

九、統計不顯著也可能排除重要效果

假設:

Difference=0.2

95% CI [-0.3,0.7]

而你事先定義至少 5 分才有實務重要性。

這個 CI 完全排除了 +5 分。即使 p>.05,你可能很有把握說:大型正向效果不太可能。

所以不顯著結果不能只看「p>.05」。

十、反過來:顯著但 CI 全在微小區域

假設:

Difference=0.3

95% CI [0.2,0.4]

p<.001

統計上非常精確顯著。

但如果低於 3 分都沒有教育意義,那這個結果反而清楚告訴你:

雖有非零差異,但太小。

十一、Practical significance 不是「主觀亂判」

實務重要性需要透明標準。

可以考慮:

  • 現有基準;
  • 利害關係人價值;
  • 成本;
  • 副作用;
  • 可擴散性;
  • 維持效果;
  • population impact;
  • baseline risk。

不能只是:「我覺得很有用。」

十二、教育研究例子

新閱讀策略:

  • 一般組 M=75.1;
  • 介入組 M=76.0;
  • Mean Difference=0.9;
  • p=.002;
  • d=.12。

如果測驗 SD=7.5,差 0.9 分。

此時報告應該說:

統計上有差異,但效果量很小;是否具有教育實務意義需依測驗尺度、成本與最小重要差異判斷。

不要直接說「介入有顯著且有效的成效」。

十三、小樣本 pilot 例子

N=16。

介入差異:

  • +8 分;
  • d=.75;
  • 95% CI [-.10,1.60];
  • p=.07。

這不是「證明沒有效果」,而是:

點估計偏大,但不確定性也非常大,需要更大樣本確認。

十四、統計檢定力 Power 和實務顯著有什麼關係?

Power 是若特定真實效果存在,研究能檢出它的機率。

樣本不足時,真實重要效果也可能不顯著;樣本過大時,極小效果也幾乎都顯著。

所以 power analysis 應基於:

事前值得檢出的最小效果。

不是單純追求「越多人越好」。

十五、多重比較也會讓「顯著」失真

如果做 100 個檢定,總有一些可能 p<.05。

所以研究價值還要看:

  • pre-specification;
  • multiplicity adjustment;
  • replication;
  • effect sizes。

延伸:ANOVA 事後比較

十六、統計顯著和政策決策

政策決策不能只問:「p<.05 嗎?」

還要問:

  • 影響多少人?
  • 每人效果多少?
  • 成本多少?
  • 是否有不平等影響?
  • alternative intervention 如何?
  • 長期持續嗎?

一個效果很小但能低成本影響幾百萬人,population impact 可能巨大。

十七、統計顯著和臨床決策

醫療情境更不能只看 p,還要考慮 absolute risk reduction、NNT、adverse events、patient-important outcomes 與 MCID。

FunnyTools 本頁不提供醫療決策,只說明一般統計概念。

十八、如何完整報告一個結果?

不要只寫:「p=.03」。

至少加入:

  1. 兩組 M/SD;
  2. mean difference;
  3. effect size;
  4. 95% CI;
  5. p;
  6. 實務情境。

十九、APA 結果句示例

介入組(M=76.0, SD=7.4)高於控制組(M=75.1, SD=7.6),MD=0.9, 95% CI [0.3,1.5], p=.002, d=0.12。雖差異達統計顯著,但標準化效果量較小,其教育實務意義仍需配合測驗尺度與介入成本評估。

二十、常見錯誤

  • p<.001 = 效果非常強。 → 錯。
  • p>.05 = 完全沒效果。 → 錯。
  • Cohen d 小 = 一定沒意義。 → 錯。
  • 效果量大 = 一定值得做。 → 還要看成本與風險。
  • 只用「顯著/不顯著」二分報告。 → 會丟失大量資訊。

二十一、常見問題 FAQ

p<.05 就可以說研究有效嗎?

不建議。應報效果量、CI、原始差異與研究設計。

p>.05 是不是代表沒有實務意義?

不一定。可能樣本不足。

效果量大就一定有實務意義嗎?

不一定。實務意義還涉及成本、風險和尺度。

Practical significance 有固定公式嗎?

沒有單一公式;通常依效果量、原始單位與領域閾值評估。

統計顯著可以被大樣本「騙」出來嗎?

不是「騙」,而是大樣本能檢出非常小的效果。因此要避免把可檢出性誤當重要性。

研究是不是最好不要看 p 值?

不是。p 值仍有用途,但不應獨立決定研究結論。

二十二、快速檢查表

看到 p<.05 後,再問:

  • 差多少?
  • CI 多寬?
  • 效果量多大?
  • 原始尺度重要嗎?
  • 樣本數多大?
  • 成本與風險?
  • 是否多重比較?
  • 是否可重現?

二十三、延伸閱讀

下一步

你的結果只有 p 值,還不知道怎麼寫完整?

使用 FunnyTools APA 7 統計結果報告產生器整理檢定統計量,再回到本頁補上效果量、CI 與實務解讀。

重點速記

重點:p<.05 ≠ Important

三問:

  • 差多少?
  • 有多精確?
  • 真實情境重要嗎?

參考資料

  • Penn State STAT 200: Practical Significance。
  • American Statistical Association 關於統計顯著與 p 值的核心原則。
  • FunnyTools p 值、效果量與 CI 指南。

本頁為一般研究解讀,實務重要性門檻必須依具體領域與利害關係人定義。