SVM・k近傍法・ナイーブベイズ

3種の分類アルゴリズムの直感と特徴。マージン最大化・距離ベース・ベイズ+独立仮定。

分類アルゴリズム3つ、SVM・k-NN・ナイーブベイズの直感と用途。

白峰 リリ(普段) 白峰 リリ

他にも分類アルゴリズムってたくさんあるよね?

神楽 モニカ 先生(笑顔) 神楽 モニカ 先生

代表的なのはSVM・k近傍法・ナイーブベイズの3つ。 直感を押さえましょう。

紅林 かえで(普段) 紅林 かえで

SVM(Support Vector Machine)は『2クラスを分ける境界』を最大マージンで引く手法。 境界に近いサンプル(サポートベクター)だけが境界を決める、という巧妙な方法。

藍沢 しずく(普段) 藍沢 しずく

境界が一直線じゃないときは?

紅林 かえで(普段) 紅林 かえで

カーネル法を使うと、データを高次元に写像することで非線形な境界を引ける。 RBFカーネルが最も汎用的。

白峰 リリ(普段) 白峰 リリ

k近傍法(k-NN)は?

神楽 モニカ 先生(普段) 神楽 モニカ 先生

『新しいサンプルから最も近い k 個の既存サンプルを見て、多数決で分類する』というシンプルな手法。 学習なしで予測時に距離計算するだけ。

藍沢 しずく(びっくり) 藍沢 しずく

学習なしって、すごいシンプルですねぇ。

紅林 かえで(普段) 紅林 かえで

シンプルだけど距離計算が高コストで、大規模データには向かない。 また{kw('特徴量のスケーリング')}が結果に大きく影響するので前処理必須。

白峰 リリ(普段) 白峰 リリ

ナイーブベイズは?

神楽 モニカ 先生(普段) 神楽 モニカ 先生

ベイズの定理を使う分類器で、『各特徴量が独立』というナイーブな仮定を置く。 仮定は厳しいけれど、テキスト分類(スパム判定等)で実用的に強い。

紅林 かえで(普段) 紅林 かえで

学習・予測ともに高速で、メモリも少なく済むのがメリット。 特徴量が独立に近い問題で力を発揮するの。

藍沢 しずく(しょんぼり) 藍沢 しずく

覚えるのが大変ですぅ…

神楽 モニカ 先生(普段) 神楽 モニカ 先生

DS検定★では『SVMはマージン最大化』『k-NNは距離ベースの多数決』『ナイーブベイズはベイズ+独立仮定』を押さえれば十分よ。

確認クイズ

ナイーブベイズ分類器の『ナイーブ』とは何が単純だと仮定しているのか。

  1. 全特徴量が同じ値をとる
  2. 全特徴量が互いに独立
  3. 全クラスの事前確率が等しい
  4. 全データが正規分布に従う
こたえを見る

正解: 2. 全特徴量が互いに独立

全特徴量が互いに独立と仮定するのがナイーブベイズの『ナイーブ』な部分です。 現実にはこの仮定はあまり成り立たないものの、テキスト分類等では実用的に強い結果を出します。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。