研究統計 指南
平均數、中位數、眾數怎麼選?偏態、離群值與例子完整比較
三個都在描述『典型位置』,但遇到薪資偏態、極端高分、Likert 或類別資料時,答案完全不同。
更新日期:
一組資料:
50, 52, 55, 57, 200
平均數是 82.8,但 5 個人裡有 4 個都不到 60。
這就是為什麼:
平均數不一定等於「最典型的人」。
速答:平均數、中位數、眾數怎麼選?
平均數(mean)使用所有數值,適合連續或等距資料,對離群值敏感;中位數(median)是排序後的中間位置,對極端值較穩健,常用於偏態分布;眾數(mode)是最常出現的類別或數值,甚至可以用於名目資料。選哪一個應看 資料尺度、分布形狀、離群值與研究目的。
一、平均數怎麼算?
資料:
60, 70, 80
平均數:
(60+70+80)/3 = 70
Mean 使用每一個數值,所以資料任一點改變,都會影響平均數。
二、中位數怎麼算?
先排序。
奇數筆資料
60, 70, 80
中間是 70,所以 Median=70。
偶數筆資料
60, 70, 80, 90
中間兩筆是 70 和 80:
Median = (70+80)/2 = 75
三、眾數是什麼?
資料:
1, 2, 2, 2, 3, 4
最常出現的是 2,所以 Mode=2。
資料也可能:
- 沒有明顯眾數;
- 只有一個眾數;
- 有兩個或多個眾數。
例如 1,1,2,2,3,1 和 2 都是最高頻率。
四、為什麼平均數怕離群值?
原資料:
50,52,55,57,60
Mean=54.8,Median=55。
如果最後一個值變成 500:
50,52,55,57,500
Mean=142.8,Median=55。
Median 幾乎沒有被極端值拉走。
所以高度偏態的薪資、房價、住院天數、網站流量等資料,常會報 median 和 IQR,而不是只報 mean。
五、薪資為什麼常看中位數?
假設公司 10 個員工:
- 9 人月薪 4~6 萬;
- CEO 月薪 300 萬。
平均薪資會被 CEO 大幅拉高。
如果研究問題是「一般員工典型薪資多少?」Median 通常更具代表性。
六、成績應該看平均還是中位?
如果分布大致對稱、沒有極端值,Mean 很有資訊。
如果考卷有:
- 大量滿分;
- 一些 0 分缺考;
- 嚴重偏態;
- 特殊極端值;
Median 可以補充更穩健的中心位置。
最好還一起報 SD、IQR 或分布圖,而不是只選一個中心值就結束。
七、平均數、中位數與偏態方向
右偏(positive skew)
右側有長尾,常見:
Mean > Median
典型例子是收入。
左偏(negative skew)
左側有長尾,常見:
Mean < Median
例如很簡單的測驗,大多數人高分,只有少數低分。
這不是絕對鐵律,但可以作為判讀線索。
八、眾數什麼時候最重要?
如果資料是類別:
- 最常見血型;
- 最常用瀏覽器;
- 最常選答案;
- 最常見顏色;
- 最多人選的活動。
這些不能合理計算平均。
例如:
Chrome, Safari, Chrome, Edge
眾數是 Chrome。
九、名目資料可以算 Median 嗎?
通常不行。
名目資料沒有自然排序,例如:
- 台北;
- 台中;
- 高雄。
你不能說「台中是中位數」。但可以找哪個類別最常出現,也就是眾數。
十、Ordinal 資料適合 Median 嗎?
可以。
例如:
- 非常不同意
- 不同意
- 普通
- 同意
- 非常同意
這些有順序,所以 median 有明確意義。
至於單一 Likert 題是否計算 mean,取決於研究慣例與尺度假設,不能一概而論。
十一、平均數需要什麼尺度?
嚴格測量理論常將 mean 用於 interval/ratio data。
但現代應用研究常對多題 Likert scale composite 使用 mean。重點是:
- 量尺是否可合理視為近似連續;
- 分布情況;
- 文獻慣例;
- 研究問題。
十二、幾何平均和算術平均不一樣
成長率、倍數資料有時更適合 geometric mean。
例如投資報酬:
- Year 1:+100% → ×2
- Year 2:−50% → ×0.5
最後回到原點。
如果單純計算:
(100% − 50%) / 2 = 25%
會誤解複合成長。
因此「平均」本身也有不同定義,本頁主要談 arithmetic mean。
十三、加權平均又是什麼?
如果不同項目重要性不同,例如:
- 筆試 40%;
- 面試 30%;
- 試教 30%;
就應使用 weighted mean,而不是直接三項相加除以三。
FunnyTools 已有加權平均相關工具;網站功能 使用前應核對 網站目前版本 的真實 route 後建立連結。
十四、Trimmed Mean 是什麼?
Trimmed mean 會先移除兩端一定比例,再算平均。
例如 10% trimmed mean:
- 去掉最低 10%;
- 去掉最高 10%;
- 對剩餘資料算 mean。
它在某些情境中兼具 mean 的效率和 median 的 robust 性,是處理極端值的選擇之一。
十五、實例:五個薪資
35,000
38,000
40,000
42,000
500,000
Mean=131,000。
Median=40,000。
如果新聞只寫「平均薪資 13.1 萬」,會讓讀者誤以為多數人收入很高。Median 明顯更接近典型員工。
十六、實例:考試成績
60,68,72,75,78,80,82
Mean 和 Median 都落在中間,而且資料相對對稱。
這種資料使用 Mean 很自然,再搭配 SD 描述分散程度。
十七、實例:最常選的方案
問卷:
- A:50 人;
- B:20 人;
- C:10 人。
不能算「平均選項=B」。
應說:
Mode=A。
十八、何時應該同時報 Mean 和 Median?
例如:
- 可能偏態;
- 有 outliers;
- 讀者需要完整分布資訊;
- 樣本小;
- 不確定哪個中心值最具代表性。
你可以同時報:
Mean=82.8, Median=55
這個巨大差距本身就是重要訊號。
十九、集中趨勢不能取代分散程度
兩組:
A:50,50,50,50,50
B:10,30,50,70,90
兩組 Mean 都是 50,但分散完全不同。
所以還要搭配:
- SD;
- IQR;
- range;
- plot。
延伸:SD vs SE
二十、Mean 和 Median 很接近就一定常態嗎?
不一定。
Mean≈Median 只能提供一點分布對稱性的線索,不能證明常態。
例如雙峰但對稱的資料,Mean 和 Median 可能相同,卻完全不是 normal distribution。
若研究需要檢查常態性,應看 Q-Q Plot、分布圖與適合的檢定。
二十一、平均數容易被哪些資料問題誤導?
- 缺失值錯編成 0;
- 單位不一致;
- 輸入錯誤;
- 極端值;
- 不同群體被混在一起;
- 天花板/地板效果。
所以描述統計前,資料清理很重要。
二十二、常見錯誤
- 所有資料都用平均數。 → 錯。
- Mean 比 Median 大就一定有 outlier。 → 不一定,也可能只是右偏。
- 類別資料算平均。 → 沒有意義。
- 平均一樣就代表兩組相同。 → 分布可能完全不同。
- Median 不受任何 outlier 影響。 → 它較 robust,但仍受資料結構影響。
- Mean≈Median 就證明常態。 → 錯。
二十三、常見問題 FAQ
平均數和中位數哪個比較準?
沒有誰永遠比較準,要看你想描述的中心與資料分布。
有離群值一定用中位數嗎?
中位數是常見 robust 選擇,但也應先判斷離群是否資料錯誤、真實值,以及研究問題是否關心平均。
Likert 量表可以算平均嗎?
單題本質 ordinal;多題總分/平均分在許多研究中常近似連續處理,但需依量尺與領域慣例。
中位數可以有小數嗎?
可以,例如偶數筆資料中間兩個值平均後可能是小數。
眾數可以有兩個嗎?
可以,稱 bimodal;更多則可稱 multimodal。
平均數一定介於最小與最大值嗎?
算術平均一定介於資料最小值與最大值之間。
沒有眾數是什麼意思?
如果所有值出現次數都一樣,就沒有一個特別「最常出現」的值。
二十四、快速選擇表
| 資料情境 | 優先考慮 |
|---|---|
| 對稱連續資料 | Mean |
| 明顯偏態 | Median |
| 很多 extreme values | Median / robust summary |
| 名目類別 | Mode |
| 次序資料 | Median / Mode |
| 權重不同 | Weighted Mean |
| 成長率/倍數 | 視問題考慮 Geometric Mean |
二十五、延伸閱讀
下一步
有一組原始數字,不知道分布長什麼樣?
使用 FunnyTools 標準差計算器先查看 N、平均數、中位數、變異數與標準差,再依本頁決定應如何描述中心位置。
重點速記
重點:
Mean:用全部數值Median:排序後中間Mode:最常出現
提示:偏態 / Outlier → 不要只報 Mean
參考資料
- NIST/SEMATECH 描述統計與 exploratory data analysis 原則。
- FunnyTools 標準差、加權平均與教育統計工具。
描述統計的目標是忠實呈現資料,不是固定套用一個「最好的平均數」。