研究統計 指南
效果量 Effect Size 怎麼看?Cohen’s d、η²、r、R² 完整指南
p 值告訴你資料和虛無假設的相容程度,效果量則幫你回答差多少、關係多強、解釋多少。
更新日期:
很多研究結果最後只剩一句:「p < .05,所以有顯著差異。」
但對讀者來說,更重要的問題通常是:到底差多少?這個關係有多強?這個結果在實務上重要嗎?
這就是效果量(effect size)要處理的問題。
速答:效果量是什麼?
效果量是用數值描述「差異大小、關係強度或模型解釋程度」的統計指標。不同分析要使用不同效果量,例如兩組平均數差異常用 Cohen’s d,ANOVA 常見 η² 或 partial η²,相關研究常直接使用 r,迴歸常看 R²。效果量應搭配信賴區間與研究情境解讀,不應只用固定門檻貼上「小、中、大」標籤。
一、為什麼 p 值不夠?
假設兩個研究都比較新教學法和一般教學法。
研究 A
- N = 5,000
- 平均差 = 0.7 分
- p < .001
研究 B
- N = 24
- 平均差 = 6.8 分
- p = .058
如果只看 p 值,很容易說:「A 有效,B 沒有效。」
但這可能忽略最重要的資訊:A 的差異可能非常小,只是樣本很大;B 的差異可能相當可觀,只是估計不夠精確。
因此研究解讀至少應同時回答:
- 結果是否達統計顯著?
- 效果大小是多少?
- 信賴區間有多寬?
- 這個差異在真實情境中有沒有意義?
延伸閱讀:p 值怎麼看?完整指南
二、常見效果量要怎麼選?
| 研究問題 | 常見分析 | 常見效果量 |
|---|---|---|
| 兩組平均數差多少 | 獨立樣本 t 檢定 | Cohen’s d、Hedges’ g |
| 同一群前後測差多少 | paired t test | paired d / standardized mean change |
| 三組以上平均數是否不同 | ANOVA | η²、partial η²、ω² |
| 兩個連續變項關係多強 | Pearson correlation | r |
| 排序/非參數關係多強 | Spearman correlation | ρ |
| 迴歸模型解釋多少變異 | Linear regression | R²、Adjusted R² |
| 類別變項關聯 | Chi-square | φ、Cramér’s V |
沒有一個效果量適用所有研究。
三、Cohen’s d:兩組平均數差異有幾個標準差?
Cohen’s d 常用於比較兩個平均數,概念可以寫成:
d = 平均數差 ÷ 標準差基準
例如:
- A 組 M = 82,SD = 10
- B 組 M = 77,SD = 10
平均差 = 5 分。
若標準差基準約為 10:
d ≈ 5 ÷ 10 = 0.50
可以理解為:兩組平均數大約相差 0.5 個標準差。
Cohen 經典的粗略規則常被整理為:
- d ≈ 0.20:小
- d ≈ 0.50:中
- d ≈ 0.80:大
但請把它當成溝通參考,不要當成自然定律。不同研究領域、結果變項與成本風險,都會影響「實務上是否重要」。
四、Cohen’s d 和 Hedges’ g 差在哪?
Cohen’s d 在小樣本時可能有偏誤。Hedges’ g 會對 d 做小樣本校正,因此小樣本研究常使用 g。
可以先記成:
d 是最常見的標準化平均差;g 是對小樣本偏誤做修正的版本。
若課程、指導教授或期刊指定效果量,就依指定方式報告。
五、相依樣本 t 檢定的效果量不能直接照抄獨立樣本公式
同一群學生前後測具有配對關係。
例如:
- 前測 M = 62
- 後測 M = 72
這 10 分差異來自同一批學生。paired d 的標準化方式可能使用差分分數的 SD、前後測某種 pooled SD,或其他 standardized mean change。
不同版本數值可能不同,因此報告 paired-samples effect size 時,最好說清楚採用哪種計算方式。
六、η²:ANOVA 中總變異有多少與這個效果有關
η²(eta squared)常見於 ANOVA。
概念上可想成:這個效果所對應的變異,占總變異的比例。
例如:
η² = .12
可以直覺理解為:約 12% 的總變異與該因素效果相關。
常見粗略參考值有:
- η² ≈ .01:小
- η² ≈ .06:中
- η² ≈ .14:大
仍然不應機械套用到所有領域。
七、partial η² 和 η² 不是同一個東西
SPSS 的 ANOVA、GLM 輸出常看到 Partial Eta Squared,這是 partial η²,不等於 η²。
- η²:分母通常與總變異有關。
- partial η²:表示某效果相對於「該效果 + 它的誤差」所占比例。
因此 partial η² 往往比 η² 大。不要把不同效果量的數值直接橫向比較。
如果 SPSS 給的是 partial η²,報告時就老實寫 partial η²,不要自行改稱 η²。
八、ω² 為什麼也是 ANOVA 常見選擇?
ω²(omega squared)也是 ANOVA 的效果量。相較於樣本 η²,ω²試圖降低對母體效果的偏高估計,因此有些研究者偏好它作為較保守的估計。
重點仍是:清楚交代你用的是哪一個效果量。
九、相關係數 r 本身就是效果大小的一部分
Pearson r 通常介於 -1 到 +1:
- 正號:正相關;
- 負號:負相關;
- 絕對值越接近 1:線性關係越強;
- 越接近 0:線性關係越弱。
常見粗略經驗值:
- |r| ≈ .10:小
- |r| ≈ .30:中
- |r| ≈ .50:大
但不同領域的典型效應差很多。
例如在教育與社會科學中,r = .20 有時已具實務價值;不能因為沒有到 .50 就說「沒有用」。
r = .42, p < .001 的正確理解是:兩變項具有中等程度的正向線性關係,而且在目前樣本與模型下達統計顯著。
不是:「X 導致 Y 增加 42%。」
相關不代表因果。
十、r² 和 R² 是什麼?
如果簡單線性相關 r = .40,那麼 r² = .16。
在簡單線性模型的語境中,可以說兩變項共享或模型解釋的變異比例約為 16%。
在迴歸分析中常用 R²。
例如 R² = .38,表示目前模型中的預測變項共同解釋依變項約 38% 的樣本變異。
這不代表「模型有 38% 正確率」。
十一、Adjusted R² 為什麼也要看?
加入更多預測變項時,R² 幾乎不會因為加入變項而下降,因此只看 R² 可能讓複雜模型永遠看起來比較好。
Adjusted R² 會對模型複雜度做調整。
如果:
- R² = .51
- Adjusted R² = .39
差距很大,就值得檢查模型是否加入太多貢獻有限的預測變項,或樣本量相對不足。
R² 本身沒有通用的「.1 小、.3 中、.5 大」規則。
十二、效果量有正負號嗎?
有些效果量有方向:
- d = +0.60:第一組平均高於第二組;
- d = -0.60:第一組平均低於第二組;
- r = -.45:負向關係。
大小通常看絕對值,但方向不能丟掉。
十三、效果量越大就一定越重要嗎?
不一定。研究重要性還要考慮:
- 結果涉及什麼行為;
- 成本多少;
- 介入風險;
- 效果持續多久;
- 對誰有效;
- 測量尺度;
- 基線水準。
例如低成本、無副作用的介入,即使 d = 0.25,也可能值得採用。
十四、為什麼效果量最好搭配 95% CI?
假設 d = 0.60。
若 95% CI 是 [-0.05, 1.25],表示估計非常不精確,資料仍容許接近零效果到很大的效果。
另一個研究 d = 0.58, 95% CI [0.42, 0.74],雖然點估計差不多,但精確度高很多。
所以完整解讀應是:
效果量點估計 + 信賴區間。
延伸閱讀:95% 信賴區間怎麼看
十五、t 檢定完整範例
| 組別 | N | M | SD |
|---|---|---|---|
| 策略教學組 | 35 | 84.2 | 8.1 |
| 一般教學組 | 33 | 77.5 | 9.0 |
假設結果:
Welch’s t(64.2) = 3.21, p = .002, d = 0.79
可以分成三層:
- 方向:策略教學組平均高 6.7 分。
- 統計顯著:p = .002,在常見 α = .05 下達統計顯著。
- 效果大小:d = 0.79,表示兩組平均差約接近 0.8 個標準差。
最後仍需看 95% CI 和教育實務意義。
你可以使用 FunnyTools 的獨立樣本 t 檢定簡易計算器核對 Welch t 結果。
十六、ANOVA 完整範例
F(2, 87) = 6.41, p = .003, η² = .13
可寫:
三種教學方式的後測成績存在統計上顯著差異,F(2, 87) = 6.41, p = .003, η² = .13。
但這還沒告訴你哪兩組不同。若整體 ANOVA 顯著,還要依研究設計做適當的事後比較或預先規劃 contrasts。
十七、相關研究完整範例
假設:
r = .36, 95% CI [.18, .52], p < .001
可解讀為:
學習投入和閱讀理解呈正向關係;關係強度約為中小至中等,且 CI 未跨 0。
不要改成:「學習投入可以解釋 36% 的閱讀理解。」
如果要談變異比例,簡單情境下要看 r²:
.36² ≈ .13
約為 13%。
十八、效果量常見錯誤
錯誤 1:p 很小 = 效果很大
錯。p 值受樣本數與精度影響。
錯誤 2:效果量沒達「中」就沒意義
錯。門檻只是粗略參考。
錯誤 3:η² 和 partial η² 當成同一個指標
錯。兩者分母與解讀不同。
錯誤 4:R² = .60 就說模型準確率 60%
錯。R² 是解釋變異比例,不是分類正確率。
錯誤 5:只報 d,不報平均數
這會讓方向和原始尺度資訊不足。
十九、APA 報告句型
t 檢定
A 組(M = 84.20, SD = 8.10)高於 B 組(M = 77.50, SD = 9.00),Welch’s t(64.2) = 3.21, p = .002, d = 0.79。
ANOVA
教學方式對後測成績具有顯著影響,F(2, 87) = 6.41, p = .003, η² = .13。
相關
學習投入與閱讀理解呈正相關,r(98) = .36, p < .001, 95% CI [.18, .52]。
迴歸
整體迴歸模型可解釋 38% 的依變項變異,R² = .38, adjusted R² = .35。
正式格式依期刊或學校規範調整。
二十、常見問題 FAQ
效果量多少算大?
沒有跨領域通用答案。d = 0.2/0.5/0.8、r = .1/.3/.5 等只是常見粗略經驗值,應搭配研究領域與實務意義。
p < .05 還需要效果量嗎?
需要。p 值不告訴你效果大小。
Cohen’s d 可以是負的嗎?
可以。負號通常表示差異方向,大小可看絕對值,但報告時仍應保留方向資訊。
η² 和 partial η² 哪個比較好?
沒有單一答案。應依研究設計、軟體輸出、領域慣例與期刊要求選擇,最重要的是不要混用。
R² 越高模型就一定越好嗎?
不一定。高 R² 可能伴隨過度擬合或模型問題,還要看研究設計、驗證、殘差與模型假設。
效果量一定要有信賴區間嗎?
若軟體與研究規範允許,建議報告,因為 CI 能補充效果估計的不確定性。
二十一、下一步怎麼學?
推薦順序:
- p 值怎麼看
- 效果量(本頁)
- 95% 信賴區間
- 統計方法選擇指南
- 獨立樣本 vs 相依樣本 t 檢定
- 教育與統計工具中心
下一步
已經有兩組樣本的 N、平均數與標準差?
先用 FunnyTools 獨立樣本 t 檢定簡易計算器核對 Welch t 與 p 值,再把效果量、95% CI 與實務意義一起寫進結果段落。
重點速記
重點:統計顯著 ≠ 效果很大
四格:
Cohen’s d:兩組平均差η² / partial η²:ANOVA 效果r:關係方向與強度R²:模型解釋變異比例
參考資料
- American Statistical Association, Statement on Statistical Significance and P-Values.
- NIST/SEMATECH e-Handbook of Statistical Methods.
- Cohen 效果量經驗值僅作粗略參考,實際應用需依領域調整。
本頁用於教學與研究方法學習。效果量選擇與報告方式應以研究設計、統計模型與投稿規範為準。