研究統計 指南
統計顯著 vs 實務顯著差在哪?p值、效果量與研究意義完整指南
一個差 0.3 分的研究可以 p<.001,一個差 8 分的研究也可能 p>.05。研究價值不能只靠顯著星號判斷。
更新日期:
你看到 p<.001,第一反應可能是:「效果很強!」但 p 值不會告訴你效果大小。
速答:統計顯著和實務顯著差在哪?
統計顯著(statistical significance)主要反映在虛無假設成立時,目前資料是否足以被視為不尋常;實務顯著(practical significance)則問「這個差異到底大不大、值不值得在真實情境中在意」。樣本數很大時,極小效果也可能 p<.05;樣本很小時,實際上很重要的效果也可能未達顯著。因此應一起看 效果量、95% CI、原始尺度差異、成本與風險。
一、統計顯著在回答什麼?
假設 H₀:新教學與舊教學平均成績相同。
得到:
p=.01
如果 α=.05,可以說資料在 H₀ 成立時相對不尋常,因此拒絕 H₀。這叫統計顯著。
但它沒有回答:
平均差是 0.2 分還是 20 分?
二、實務顯著在回答什麼?
例如:
- 新教學平均提高 0.4 分;
- 測驗滿分 100;
- 每位學生額外花 40 小時;
- 每班成本增加 10 萬元。
即使 p<.001,也可能實務價值有限。
反過來,如果提高 6 分、成本低,而且對低成就學生有明顯幫助,即使小型 pilot p=.08,也可能值得進一步研究。
三、大樣本為什麼很容易顯著?
很多檢定統計量都有類似邏輯:
signal / standard error
而 SE 常隨 n 增加而下降。
所以 N 越大,小差異也更容易被檢出。
研究 A
- N=10,000
- 平均差=0.5
- p<.001
研究 B
- N=20
- 平均差=7.0
- p=.07
不能只說 A 比 B 更有價值。
四、p 值不是效果量
這是統計學界長期強調的核心原則。
p 值不衡量:
- 效果大小;
- 實務重要性;
- 研究品質;
- 假設為真的機率。
延伸:p 值怎麼看
五、效果量怎麼補上資訊?
兩組平均數可看:
- Cohen’s d;
- Hedges’ g。
ANOVA 可看:
- η²;
- partial η²;
- ω²。
相關可看 r,迴歸可看 R²、ΔR²。
延伸:效果量完整指南
六、原始單位有時比標準化效果更重要
假設 d=.30,看起來「小」。但原始差異是每晚平均多睡 45 分鐘,對睡眠介入可能很有意義。
另一個研究 d=.80,但只是沒有實際決策價值的反應時間差 8 ms。
所以:
效果量標準化後方便比較,但不要丟掉原始尺度。
七、95% CI 告訴你結果有多確定
研究:
d=.60
如果 CI 是 [.55,.65],估計非常精確;如果是 [-.10,1.30],不確定程度很大。
即使 point estimate 相同,解讀完全不同。
延伸:95% 信賴區間
八、最小重要差異(MID / MCID)是什麼?
某些醫療、心理或教育領域會預先設定:「多大的變化才值得視為有實務意義?」
例如:
- 量表至少改善 5 分;
- 正確率至少增加 10 個百分點;
- 反應時間至少下降 100 ms。
這種 threshold 應來自既有文獻、專業判斷、anchor-based 或 distribution-based 方法,以及利害關係人的實際需求。
不能事後看到結果再挑一條有利門檻。
九、統計不顯著也可能排除重要效果
假設:
Difference=0.2
95% CI [-0.3,0.7]
而你事先定義至少 5 分才有實務重要性。
這個 CI 完全排除了 +5 分。即使 p>.05,你可能很有把握說:大型正向效果不太可能。
所以不顯著結果不能只看「p>.05」。
十、反過來:顯著但 CI 全在微小區域
假設:
Difference=0.3
95% CI [0.2,0.4]
p<.001
統計上非常精確顯著。
但如果低於 3 分都沒有教育意義,那這個結果反而清楚告訴你:
雖有非零差異,但太小。
十一、Practical significance 不是「主觀亂判」
實務重要性需要透明標準。
可以考慮:
- 現有基準;
- 利害關係人價值;
- 成本;
- 副作用;
- 可擴散性;
- 維持效果;
- population impact;
- baseline risk。
不能只是:「我覺得很有用。」
十二、教育研究例子
新閱讀策略:
- 一般組 M=75.1;
- 介入組 M=76.0;
- Mean Difference=0.9;
- p=.002;
- d=.12。
如果測驗 SD=7.5,差 0.9 分。
此時報告應該說:
統計上有差異,但效果量很小;是否具有教育實務意義需依測驗尺度、成本與最小重要差異判斷。
不要直接說「介入有顯著且有效的成效」。
十三、小樣本 pilot 例子
N=16。
介入差異:
- +8 分;
- d=.75;
- 95% CI [-.10,1.60];
- p=.07。
這不是「證明沒有效果」,而是:
點估計偏大,但不確定性也非常大,需要更大樣本確認。
十四、統計檢定力 Power 和實務顯著有什麼關係?
Power 是若特定真實效果存在,研究能檢出它的機率。
樣本不足時,真實重要效果也可能不顯著;樣本過大時,極小效果也幾乎都顯著。
所以 power analysis 應基於:
事前值得檢出的最小效果。
不是單純追求「越多人越好」。
十五、多重比較也會讓「顯著」失真
如果做 100 個檢定,總有一些可能 p<.05。
所以研究價值還要看:
- pre-specification;
- multiplicity adjustment;
- replication;
- effect sizes。
延伸:ANOVA 事後比較
十六、統計顯著和政策決策
政策決策不能只問:「p<.05 嗎?」
還要問:
- 影響多少人?
- 每人效果多少?
- 成本多少?
- 是否有不平等影響?
- alternative intervention 如何?
- 長期持續嗎?
一個效果很小但能低成本影響幾百萬人,population impact 可能巨大。
十七、統計顯著和臨床決策
醫療情境更不能只看 p,還要考慮 absolute risk reduction、NNT、adverse events、patient-important outcomes 與 MCID。
FunnyTools 本頁不提供醫療決策,只說明一般統計概念。
十八、如何完整報告一個結果?
不要只寫:「p=.03」。
至少加入:
- 兩組 M/SD;
- mean difference;
- effect size;
- 95% CI;
- p;
- 實務情境。
十九、APA 結果句示例
介入組(M=76.0, SD=7.4)高於控制組(M=75.1, SD=7.6),MD=0.9, 95% CI [0.3,1.5], p=.002, d=0.12。雖差異達統計顯著,但標準化效果量較小,其教育實務意義仍需配合測驗尺度與介入成本評估。
二十、常見錯誤
- p<.001 = 效果非常強。 → 錯。
- p>.05 = 完全沒效果。 → 錯。
- Cohen d 小 = 一定沒意義。 → 錯。
- 效果量大 = 一定值得做。 → 還要看成本與風險。
- 只用「顯著/不顯著」二分報告。 → 會丟失大量資訊。
二十一、常見問題 FAQ
p<.05 就可以說研究有效嗎?
不建議。應報效果量、CI、原始差異與研究設計。
p>.05 是不是代表沒有實務意義?
不一定。可能樣本不足。
效果量大就一定有實務意義嗎?
不一定。實務意義還涉及成本、風險和尺度。
Practical significance 有固定公式嗎?
沒有單一公式;通常依效果量、原始單位與領域閾值評估。
統計顯著可以被大樣本「騙」出來嗎?
不是「騙」,而是大樣本能檢出非常小的效果。因此要避免把可檢出性誤當重要性。
研究是不是最好不要看 p 值?
不是。p 值仍有用途,但不應獨立決定研究結論。
二十二、快速檢查表
看到 p<.05 後,再問:
- 差多少?
- CI 多寬?
- 效果量多大?
- 原始尺度重要嗎?
- 樣本數多大?
- 成本與風險?
- 是否多重比較?
- 是否可重現?
二十三、延伸閱讀
下一步
你的結果只有 p 值,還不知道怎麼寫完整?
使用 FunnyTools APA 7 統計結果報告產生器整理檢定統計量,再回到本頁補上效果量、CI 與實務解讀。
重點速記
重點:p<.05 ≠ Important
三問:
差多少?有多精確?真實情境重要嗎?
參考資料
- Penn State STAT 200: Practical Significance。
- American Statistical Association 關於統計顯著與 p 值的核心原則。
- FunnyTools p 值、效果量與 CI 指南。
本頁為一般研究解讀,實務重要性門檻必須依具體領域與利害關係人定義。