過学習・未学習とバイアス・バリアンス

機械学習の2大敵を、バイアス・バリアンス分解で根本理解。対策5パターンも紹介します。

機械学習の最大の敵、過学習と未学習。バイアス・バリアンス分解で理解します。

白峰 リリ(しょんぼり) 白峰 リリ

訓練データだと99%正解なのに、テストだと60%しかなかったんだけど…なんで?

神楽 モニカ 先生(普段) 神楽 モニカ 先生

それは典型的な過学習(overfitting)。 モデルが訓練データの細部や偶然のノイズまで覚え込んでしまい、未知データに対応できなくなる現象よ。

紅林 かえで(普段) 紅林 かえで

反対に、未学習(underfitting)は『訓練データもテストデータも精度が悪い』状態。 モデルがデータのパターンを十分に捉えられていない。

藍沢 しずく(普段) 藍沢 しずく

どっちも困りますねぇ…見分け方ってあるんですかぁ?

紅林 かえで(普段) 紅林 かえで

訓練精度↑↑でテスト精度↓なら過学習。 訓練もテストも精度↓なら未学習。 両方の精度を比べるのがポイントね。

白峰 リリ(普段) 白峰 リリ

じゃあ過学習ってどうやって防ぐの?

神楽 モニカ 先生(普段) 神楽 モニカ 先生

対策は (1)データを増やす、(2)モデルを単純にする、(3)正則化を入れる、(4)交差検証で性能を確認、(5)早期打ち切り(Early Stopping)、など。

紅林 かえで(普段) 紅林 かえで

その背景にある理論がバイアス・バリアンス分解。 予測誤差は『バイアス²+バリアンス+ノイズ』に分解できる。 バイアス=モデルの単純さによる誤差、バリアンス=訓練データへの過敏さによる誤差。

藍沢 しずく(普段) 藍沢 しずく

両方下げられたら一番なんですけどぉ…

神楽 モニカ 先生(普段) 神楽 モニカ 先生

バイアス・バリアンスのトレードオフがあるの。 モデルを複雑にするとバイアスは下がるがバリアンスが上がる。 両者のバランスがいい点を探すのが学習の目標。

白峰 リリ(笑い) 白峰 リリ

要は、過学習=バリアンス過大、未学習=バイアス過大、ってこと?

紅林 かえで(普段) 紅林 かえで

その理解でばっちり。 補足すると、DS検定では『これは過学習か未学習か』を判断する問題と、『バイアス・バリアンスのトレードオフ』の概念問題が頻出ですよ。

確認クイズ

訓練データでの精度95%、テストデータでの精度60%という結果が出た。最も考えられる状態はどれか。

  1. 未学習(underfitting)
  2. 過学習(overfitting)
  3. 汎化性能が良好
  4. データリークが発生
こたえを見る

正解: 2. 過学習(overfitting)

過学習(overfitting)です。 訓練精度↑↑、テスト精度↓ という典型的な過学習パターン。 モデルが訓練データの細部やノイズまで覚え込み、未知データに汎化できていません。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。