深層学習の主要アーキテクチャ、CNN・RNN・Transformerの違いと用途。
CNNとかRNNとかTransformerとか、よく聞くけど何が違うの?
得意な用途が違うのよ。 CNNは画像、RNNは時系列やテキスト、Transformerはテキスト中心で画像にも広がってきている、と覚えておきましょう。
CNN(畳み込みニューラルネット)は畳み込み層とプーリング層を組み合わせた構造ね。 画像の局所的なパターンを階層的に抽出するのが得意なの。
畳み込みって何ですかぁ?
小さなフィルタ(カーネル)を画像上でスライドさせて、各位置で内積を取る操作のこと。 これでエッジやコーナーといった局所的な特徴を抽出できるの。
RNNは?
再帰型ニューラルネットのことね。 隠れ状態を次のステップに渡すことで、時系列や系列データを扱えるのよ。 ただ長期依存に弱くて、LSTMやGRUという改良版が登場したの。
Transformerは2017年に登場したアーキテクチャ。 RNNの逐次処理をやめて、Self-Attentionで全位置間の関係を一度に学習するの。 並列計算に向いていて、BERTやGPT、LLM全般の基盤になっているわ。
Self-Attentionって何ですかぁ?
文中の各単語が、文中の他の単語にどれくらい注意を向けるかを学習する仕組み。 これにより長距離依存を効率的に扱える。
今のLLM(ChatGPT等)は全部Transformerベースなんだね。
そうなの。 GPTもBERTもClaudeもGeminiも、全部Transformerをベースにしているのよ。 本当に革命的なアーキテクチャね。
DS検定★レベルでは『CNN=画像、RNN=系列、Transformer=Self-Attention・LLMの基盤』を押さえれば十分。 細部の数式は問われないわ。
確認クイズ
画像認識のタスクで最も伝統的に使われるアーキテクチャはどれか。
- RNN(再帰型ニューラルネット)
- CNN(畳み込みニューラルネット)
- Transformer
- 全結合ネット(MLP)のみ
こたえを見る
正解: 2. CNN(畳み込みニューラルネット)
CNN(畳み込みニューラルネット)が画像認識の伝統的な主役です。 畳み込み層で局所的特徴を抽出し、プーリングで位置不変性を獲得。 近年は画像にもTransformer(ViT等)が進出していますが、基本はCNNです。