研究統計 指南

效果量 Effect Size 怎麼看?Cohen’s d、η²、r、R² 完整指南

p 值告訴你資料和虛無假設的相容程度,效果量則幫你回答差多少、關係多強、解釋多少。

更新日期:

很多研究結果最後只剩一句:「p < .05,所以有顯著差異。」

但對讀者來說,更重要的問題通常是:到底差多少?這個關係有多強?這個結果在實務上重要嗎?

這就是效果量(effect size)要處理的問題。

速答:效果量是什麼?
效果量是用數值描述「差異大小、關係強度或模型解釋程度」的統計指標。不同分析要使用不同效果量,例如兩組平均數差異常用 Cohen’s d,ANOVA 常見 η² 或 partial η²,相關研究常直接使用 r,迴歸常看 R²。效果量應搭配信賴區間與研究情境解讀,不應只用固定門檻貼上「小、中、大」標籤。

一、為什麼 p 值不夠?

假設兩個研究都比較新教學法和一般教學法。

研究 A

  • N = 5,000
  • 平均差 = 0.7 分
  • p < .001

研究 B

  • N = 24
  • 平均差 = 6.8 分
  • p = .058

如果只看 p 值,很容易說:「A 有效,B 沒有效。」

但這可能忽略最重要的資訊:A 的差異可能非常小,只是樣本很大;B 的差異可能相當可觀,只是估計不夠精確。

因此研究解讀至少應同時回答:

  1. 結果是否達統計顯著?
  2. 效果大小是多少?
  3. 信賴區間有多寬?
  4. 這個差異在真實情境中有沒有意義?

延伸閱讀:p 值怎麼看?完整指南

二、常見效果量要怎麼選?

研究問題 常見分析 常見效果量
兩組平均數差多少 獨立樣本 t 檢定 Cohen’s d、Hedges’ g
同一群前後測差多少 paired t test paired d / standardized mean change
三組以上平均數是否不同 ANOVA η²、partial η²、ω²
兩個連續變項關係多強 Pearson correlation r
排序/非參數關係多強 Spearman correlation ρ
迴歸模型解釋多少變異 Linear regression R²、Adjusted R²
類別變項關聯 Chi-square φ、Cramér’s V

沒有一個效果量適用所有研究。

三、Cohen’s d:兩組平均數差異有幾個標準差?

Cohen’s d 常用於比較兩個平均數,概念可以寫成:

d = 平均數差 ÷ 標準差基準

例如:

  • A 組 M = 82,SD = 10
  • B 組 M = 77,SD = 10

平均差 = 5 分。

若標準差基準約為 10:

d ≈ 5 ÷ 10 = 0.50

可以理解為:兩組平均數大約相差 0.5 個標準差。

Cohen 經典的粗略規則常被整理為:

  • d ≈ 0.20:小
  • d ≈ 0.50:中
  • d ≈ 0.80:大

但請把它當成溝通參考,不要當成自然定律。不同研究領域、結果變項與成本風險,都會影響「實務上是否重要」。

四、Cohen’s d 和 Hedges’ g 差在哪?

Cohen’s d 在小樣本時可能有偏誤。Hedges’ g 會對 d 做小樣本校正,因此小樣本研究常使用 g。

可以先記成:

d 是最常見的標準化平均差;g 是對小樣本偏誤做修正的版本。

若課程、指導教授或期刊指定效果量,就依指定方式報告。

五、相依樣本 t 檢定的效果量不能直接照抄獨立樣本公式

同一群學生前後測具有配對關係。

例如:

  • 前測 M = 62
  • 後測 M = 72

這 10 分差異來自同一批學生。paired d 的標準化方式可能使用差分分數的 SD、前後測某種 pooled SD,或其他 standardized mean change。

不同版本數值可能不同,因此報告 paired-samples effect size 時,最好說清楚採用哪種計算方式。

六、η²:ANOVA 中總變異有多少與這個效果有關

η²(eta squared)常見於 ANOVA。

概念上可想成:這個效果所對應的變異,占總變異的比例。

例如:

η² = .12

可以直覺理解為:約 12% 的總變異與該因素效果相關。

常見粗略參考值有:

  • η² ≈ .01:小
  • η² ≈ .06:中
  • η² ≈ .14:大

仍然不應機械套用到所有領域。

七、partial η² 和 η² 不是同一個東西

SPSS 的 ANOVA、GLM 輸出常看到 Partial Eta Squared,這是 partial η²,不等於 η²。

  • η²:分母通常與總變異有關。
  • partial η²:表示某效果相對於「該效果 + 它的誤差」所占比例。

因此 partial η² 往往比 η² 大。不要把不同效果量的數值直接橫向比較。

如果 SPSS 給的是 partial η²,報告時就老實寫 partial η²,不要自行改稱 η²。

八、ω² 為什麼也是 ANOVA 常見選擇?

ω²(omega squared)也是 ANOVA 的效果量。相較於樣本 η²,ω²試圖降低對母體效果的偏高估計,因此有些研究者偏好它作為較保守的估計。

重點仍是:清楚交代你用的是哪一個效果量。

九、相關係數 r 本身就是效果大小的一部分

Pearson r 通常介於 -1 到 +1:

  • 正號:正相關;
  • 負號:負相關;
  • 絕對值越接近 1:線性關係越強;
  • 越接近 0:線性關係越弱。

常見粗略經驗值:

  • |r| ≈ .10:小
  • |r| ≈ .30:中
  • |r| ≈ .50:大

但不同領域的典型效應差很多。

例如在教育與社會科學中,r = .20 有時已具實務價值;不能因為沒有到 .50 就說「沒有用」。

r = .42, p < .001 的正確理解是:兩變項具有中等程度的正向線性關係,而且在目前樣本與模型下達統計顯著。

不是:「X 導致 Y 增加 42%。」

相關不代表因果。

十、r² 和 R² 是什麼?

如果簡單線性相關 r = .40,那麼 r² = .16

在簡單線性模型的語境中,可以說兩變項共享或模型解釋的變異比例約為 16%。

在迴歸分析中常用

例如 R² = .38,表示目前模型中的預測變項共同解釋依變項約 38% 的樣本變異。

這不代表「模型有 38% 正確率」。

十一、Adjusted R² 為什麼也要看?

加入更多預測變項時,R² 幾乎不會因為加入變項而下降,因此只看 R² 可能讓複雜模型永遠看起來比較好。

Adjusted R² 會對模型複雜度做調整。

如果:

  • R² = .51
  • Adjusted R² = .39

差距很大,就值得檢查模型是否加入太多貢獻有限的預測變項,或樣本量相對不足。

R² 本身沒有通用的「.1 小、.3 中、.5 大」規則。

十二、效果量有正負號嗎?

有些效果量有方向:

  • d = +0.60:第一組平均高於第二組;
  • d = -0.60:第一組平均低於第二組;
  • r = -.45:負向關係。

大小通常看絕對值,但方向不能丟掉。

十三、效果量越大就一定越重要嗎?

不一定。研究重要性還要考慮:

  • 結果涉及什麼行為;
  • 成本多少;
  • 介入風險;
  • 效果持續多久;
  • 對誰有效;
  • 測量尺度;
  • 基線水準。

例如低成本、無副作用的介入,即使 d = 0.25,也可能值得採用。

十四、為什麼效果量最好搭配 95% CI?

假設 d = 0.60

若 95% CI 是 [-0.05, 1.25],表示估計非常不精確,資料仍容許接近零效果到很大的效果。

另一個研究 d = 0.58, 95% CI [0.42, 0.74],雖然點估計差不多,但精確度高很多。

所以完整解讀應是:

效果量點估計 + 信賴區間。

延伸閱讀:95% 信賴區間怎麼看

十五、t 檢定完整範例

組別 N M SD
策略教學組 35 84.2 8.1
一般教學組 33 77.5 9.0

假設結果:

Welch’s t(64.2) = 3.21, p = .002, d = 0.79

可以分成三層:

  1. 方向:策略教學組平均高 6.7 分。
  2. 統計顯著:p = .002,在常見 α = .05 下達統計顯著。
  3. 效果大小:d = 0.79,表示兩組平均差約接近 0.8 個標準差。

最後仍需看 95% CI 和教育實務意義。

你可以使用 FunnyTools 的獨立樣本 t 檢定簡易計算器核對 Welch t 結果。

十六、ANOVA 完整範例

F(2, 87) = 6.41, p = .003, η² = .13

可寫:

三種教學方式的後測成績存在統計上顯著差異,F(2, 87) = 6.41, p = .003, η² = .13。

但這還沒告訴你哪兩組不同。若整體 ANOVA 顯著,還要依研究設計做適當的事後比較或預先規劃 contrasts。

十七、相關研究完整範例

假設:

r = .36, 95% CI [.18, .52], p < .001

可解讀為:

學習投入和閱讀理解呈正向關係;關係強度約為中小至中等,且 CI 未跨 0。

不要改成:「學習投入可以解釋 36% 的閱讀理解。」

如果要談變異比例,簡單情境下要看

.36² ≈ .13

約為 13%。

十八、效果量常見錯誤

錯誤 1:p 很小 = 效果很大

錯。p 值受樣本數與精度影響。

錯誤 2:效果量沒達「中」就沒意義

錯。門檻只是粗略參考。

錯誤 3:η² 和 partial η² 當成同一個指標

錯。兩者分母與解讀不同。

錯誤 4:R² = .60 就說模型準確率 60%

錯。R² 是解釋變異比例,不是分類正確率。

錯誤 5:只報 d,不報平均數

這會讓方向和原始尺度資訊不足。

十九、APA 報告句型

t 檢定

A 組(M = 84.20, SD = 8.10)高於 B 組(M = 77.50, SD = 9.00),Welch’s t(64.2) = 3.21, p = .002, d = 0.79。

ANOVA

教學方式對後測成績具有顯著影響,F(2, 87) = 6.41, p = .003, η² = .13。

相關

學習投入與閱讀理解呈正相關,r(98) = .36, p < .001, 95% CI [.18, .52]。

迴歸

整體迴歸模型可解釋 38% 的依變項變異,R² = .38, adjusted R² = .35。

正式格式依期刊或學校規範調整。

二十、常見問題 FAQ

效果量多少算大?

沒有跨領域通用答案。d = 0.2/0.5/0.8、r = .1/.3/.5 等只是常見粗略經驗值,應搭配研究領域與實務意義。

p < .05 還需要效果量嗎?

需要。p 值不告訴你效果大小。

Cohen’s d 可以是負的嗎?

可以。負號通常表示差異方向,大小可看絕對值,但報告時仍應保留方向資訊。

η² 和 partial η² 哪個比較好?

沒有單一答案。應依研究設計、軟體輸出、領域慣例與期刊要求選擇,最重要的是不要混用。

R² 越高模型就一定越好嗎?

不一定。高 R² 可能伴隨過度擬合或模型問題,還要看研究設計、驗證、殘差與模型假設。

效果量一定要有信賴區間嗎?

若軟體與研究規範允許,建議報告,因為 CI 能補充效果估計的不確定性。

二十一、下一步怎麼學?

推薦順序:

  1. p 值怎麼看
  2. 效果量(本頁)
  3. 95% 信賴區間
  4. 統計方法選擇指南
  5. 獨立樣本 vs 相依樣本 t 檢定
  6. 教育與統計工具中心

下一步

已經有兩組樣本的 N、平均數與標準差?
先用 FunnyTools 獨立樣本 t 檢定簡易計算器核對 Welch t 與 p 值,再把效果量、95% CI 與實務意義一起寫進結果段落。

重點速記

重點:統計顯著 ≠ 效果很大

四格:

  • Cohen’s d:兩組平均差
  • η² / partial η²:ANOVA 效果
  • r:關係方向與強度
  • R²:模型解釋變異比例

參考資料

  • American Statistical Association, Statement on Statistical Significance and P-Values.
  • NIST/SEMATECH e-Handbook of Statistical Methods.
  • Cohen 效果量經驗值僅作粗略參考,實際應用需依領域調整。

本頁用於教學與研究方法學習。效果量選擇與報告方式應以研究設計、統計模型與投稿規範為準。