機械学習カテゴリの総まとめ。状況に応じたモデル選択ガイドを提示します。
結局さ、どんな時にどのモデル選べばいいの?
いい質問ね。 課題タイプ別にガイドを作りましょう。
(1)解釈性が必要 → 線形回帰/ロジスティック回帰/決定木。 (2)精度最優先・表データ → LightGBM/XGBoost。 (3)画像 → CNN。 (4)テキスト → Transformer/LLM。 (5)クラスタリング → k-means/DBSCAN。 (6)次元削減 → PCA。
迷ったらどうすればいいんですかぁ?
表データで迷ったら『まずは線形/ロジスティック回帰でベースライン → LightGBM で精度向上』が定石ですね。 シンプルから始めて複雑化、が鉄則です。
評価指標ってどう選べばいいの?
回帰なら R²/RMSE。 分類は不均衡なら F1/AUC、均衡なら Accuracy も可。 ビジネスコストが Precision/Recall のどちらに偏るかで閾値を調整。
過学習対策の優先順位は (1)シンプルなモデル、(2)交差検証、(3)正則化、(4)Early Stopping、(5)データ追加、という感じで段階的に試すといいですよ。
段階的に考えていくんですねぇ。
DS検定では何がよく出るの?
(1)シナリオから手法を選ぶ問題、(2)混同行列からPrecision/Recall/F1を計算、(3)過学習vs未学習の判定、(4)交差検証の仕組み、(5)PCAやk-meansの基本。 これらは確実に押さえて。
そして全カテゴリ通じて言えるのが、{kw('シンプルから始める')}『計算問題は手で書く』『公式は使う場面とセットで覚える』、この3つよ。
次はデータエンジニアリングなんですねぇ♪
確認クイズ
表形式データの2クラス分類問題で、まず最初に試すべきモデルとして最も適切なのはどれか。
- ResNet-50(CNN)
- ロジスティック回帰
- GPT-4
- k-meansクラスタリング
こたえを見る
正解: 2. ロジスティック回帰
ロジスティック回帰。 表データでまずシンプルなベースラインを作るのが定石。 ロジスティック回帰は学習・予測が高速、解釈しやすく、過学習も起きにくいので最初の比較対象として最適です。 そこから LightGBM 等で精度向上を図ります。