データの『広がり』を表す指標。分散・標準偏差・四分位範囲は計算問題で必出です。
平均が同じでも、データのバラつきが違うとイメージ全然違うよね。
そう、それを定量化するのが分散と標準偏差。
バラつきが大きいほど、これらの値は大きくなるの。
分散 = Σ(xᵢ - 平均)² / n、標準偏差 = √分散。
標準偏差は分散と単位を合わせるため平方根を取った値ね。
二乗するの、忘れちゃいそうですぅ…。
どうして二乗するんですかぁ?
符号を打ち消して、大きな差を強調するためよ。
絶対値だと数学的に扱いにくいから、二乗が使われているの。
標準偏差って、よく『SD』とか『σ』って書かれてるやつだよね!
母集団の標準偏差をσ(シグマ)、標本の標準偏差を s と表記することが多いわ。
サンプルから計算するときは不偏分散(n-1で割る)を使うこともあるので注意。
n-1とnって、何が違うんですかぁ?
母集団全体を扱うときは n、標本から母集団のバラつきを推定するときは n-1 を使うの。
後者を不偏分散と呼ぶわ。
本番では問題文の指定に従えば大丈夫よ。
あ、四分位ってのも聞いたことある!
四分位はデータを下から1/4・2/4・3/4の位置で区切る値のこと。
第1四分位Q1・第2四分位Q2=中央値・第3四分位Q3と呼ぶわ。
Q3-Q1を四分位範囲(IQR)と呼ぶの。
IQRは外れ値に強いバラつき指標。
箱ひげ図でビジュアル化できるわ。
がんばって覚えますぅ♪
データ: {2, 4, 4, 6, 6, 8} (n = 6)
平均 μ = (2+4+4+6+6+8) / 6 = 30/6 = 5
分散 σ² = ((2-5)² + (4-5)² + (4-5)² + (6-5)² + (6-5)² + (8-5)²) / 6
= (9 + 1 + 1 + 1 + 1 + 9) / 6
= 22/6 ≈ 3.67
標準偏差 σ = √3.67 ≈ 1.91
Q1=4, Q2(中央値)=5, Q3=6 → IQR = 6 - 4 = 2
確認クイズ
データ {1, 3, 5, 7, 9} の標準偏差(母標準偏差)として最も近いのはどれか。
- 1.41
- 2.83
- 5.00
- 8.00
こたえを見る
正解: 2. 2.83
2.83。平均=5、各偏差の二乗和=(16+4+0+4+16)=40、分散=40/5=8、標準偏差=√8≈2.83 です。問題で母 or 不偏のどちらか不明な場合は問題文をよく読みましょう。