ディープラーニング概論(CNN・RNN・Transformer)

深層学習の主要3アーキテクチャ。画像のCNN、系列のRNN/LSTM、テキストのTransformer。

深層学習の主要アーキテクチャ、CNN・RNN・Transformerの違いと用途。

白峰 リリ(普段) 白峰 リリ

CNNとかRNNとかTransformerとか、よく聞くけど何が違うの?

神楽 モニカ 先生(笑顔) 神楽 モニカ 先生

得意な用途が違うのよ。 CNNは画像、RNNは時系列やテキスト、Transformerはテキスト中心で画像にも広がってきている、と覚えておきましょう。

紅林 かえで(普段) 紅林 かえで

CNN(畳み込みニューラルネット)は畳み込み層とプーリング層を組み合わせた構造ね。 画像の局所的なパターンを階層的に抽出するのが得意なの。

藍沢 しずく(普段) 藍沢 しずく

畳み込みって何ですかぁ?

紅林 かえで(普段) 紅林 かえで

小さなフィルタ(カーネル)を画像上でスライドさせて、各位置で内積を取る操作のこと。 これでエッジやコーナーといった局所的な特徴を抽出できるの。

白峰 リリ(普段) 白峰 リリ

RNNは?

神楽 モニカ 先生(普段) 神楽 モニカ 先生

再帰型ニューラルネットのことね。 隠れ状態を次のステップに渡すことで、時系列や系列データを扱えるのよ。 ただ長期依存に弱くて、LSTMやGRUという改良版が登場したの。

紅林 かえで(普段) 紅林 かえで

Transformerは2017年に登場したアーキテクチャ。 RNNの逐次処理をやめて、Self-Attentionで全位置間の関係を一度に学習するの。 並列計算に向いていて、BERTやGPT、LLM全般の基盤になっているわ。

藍沢 しずく(普段) 藍沢 しずく

Self-Attentionって何ですかぁ?

神楽 モニカ 先生(普段) 神楽 モニカ 先生

文中の各単語が、文中の他の単語にどれくらい注意を向けるかを学習する仕組み。 これにより長距離依存を効率的に扱える。

白峰 リリ(普段) 白峰 リリ

今のLLM(ChatGPT等)は全部Transformerベースなんだね。

紅林 かえで(普段) 紅林 かえで

そうなの。 GPTもBERTもClaudeもGeminiも、全部Transformerをベースにしているのよ。 本当に革命的なアーキテクチャね。

紅林 かえで(普段) 紅林 かえで

DS検定★レベルでは『CNN=画像、RNN=系列、Transformer=Self-Attention・LLMの基盤』を押さえれば十分。 細部の数式は問われないわ。

確認クイズ

画像認識のタスクで最も伝統的に使われるアーキテクチャはどれか。

  1. RNN(再帰型ニューラルネット)
  2. CNN(畳み込みニューラルネット)
  3. Transformer
  4. 全結合ネット(MLP)のみ
こたえを見る

正解: 2. CNN(畳み込みニューラルネット)

CNN(畳み込みニューラルネット)が画像認識の伝統的な主役です。 畳み込み層で局所的特徴を抽出し、プーリングで位置不変性を獲得。 近年は画像にもTransformer(ViT等)が進出していますが、基本はCNNです。

神楽モニカ先生、紅林かえで、藍沢しずく、白峰リリがカラオケで歌うを楽しむ様子

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。