115年:骨科物治(2)
下列何種情況最不適合假設資料近似常態分佈?
A樣本數大且分布對稱
B平均數與中位數差異極小
C資料明顯偏斜且離群值多
DShapiro–Wilk 檢定未達顯著
詳細解析
本題觀念
判斷資料能否近似常態分布,不能只看單一統計量或單一次檢定,而要綜合觀察分布形狀、偏態、離群值、樣本數與常態性檢定。若資料呈現明顯不對稱,且有多個遠離主要資料群的極端值,常態模型通常就不再是合理的第一選擇。
選項分析
A 可作為支持線索。樣本數較大時,平均數的抽樣分布可能較穩定;若原始資料同時呈現對稱形狀,代表它較有機會接近常態。不過樣本數大本身不能保證原始資料常態,仍要搭配圖形與其他指標判斷。
B 可作為支持線索。對稱分布的平均數與中位數通常相近,因此兩者差異極小可提示資料沒有明顯偏斜。然而這只是初步觀察,許多不同形狀的分布也可能有相近的平均數與中位數,不能單獨當成常態證明。
C 錯誤。明顯偏斜表示資料左右兩側的分布不對稱,多個離群值則可能造成厚尾或極端尾端。這些特徵會使平均數與標準差容易受影響,也會降低以常態分布描述資料的合理性,因此這是最不適合直接假設近似常態的情況。
D 可作為支持線索。Shapiro–Wilk 檢定未達顯著,通常表示目前沒有足夠證據拒絕常態性的虛無假設;但它不是「證明資料一定常態」。樣本數過小可能缺乏偵測偏離的能力,樣本數很大又可能對微小偏離過度敏感,所以仍需看圖形與實質差異。
答案解析
答案為 C。常態近似最需要警覺的不是平均數與中位數接近或檢定未達顯著,而是資料本身已明顯偏斜且離群值很多。遇到這種資料,應重新檢視資料來源、離群值成因與分布模型,必要時考慮轉換資料或使用較健壯的統計方法。
核心知識點
常態性判斷可依「圖形優先、檢定輔助、情境整合」整理:常態機率圖或直方圖可直接查看偏斜、厚尾與離群值;Shapiro–Wilk 等檢定提供形式化參考,但結果會受樣本數影響;平均數與中位數相近只能當作對稱的線索。偏斜與離群值同時明顯時,應避免未檢查就套用常態分布假設。
參考資料
- NIST/SEMATECH Normal Probability Plot:https://www.itl.nist.gov/div898/handbook/eda/section3/normprpl.htm
- NIST/SEMATECH Detection of Outliers:https://itl.nist.gov/div898/handbook/eda/section3/eda35h.htm
- NIST/SEMATECH Measures of Skewness and Kurtosis:https://www.itl.nist.gov/div898/handbook/eda/section3/eda35b.htm
- Normality test:https://en.wikipedia.org/wiki/Normality_test
- Wilk–Shapiro Normal Test:https://itl.nist.gov/div898/software/dataplot/refman1/auxillar/wilkshap.htm
- Testing experimental data for univariate normality(PMID: 16388793):https://pubmed.ncbi.nlm.nih.gov/16388793/