従来CNN(Convolutional Neural Network)が独占していた画像認識タスクで、 ViT(Vision Transformer)が大規模データセットでCNNを超える性能を示すケースが増えています。
Self-Attention機構を画像のパッチに適用するという発想は、テキストで成功したTransformerの自然な拡張です。 DS検定★ でも『画像はCNN、テキストはTransformer』という従来の対応関係に加え、近年の動向として押さえておくべきポイントです。
TransformerアーキテクチャがついにCNNの牙城だった画像認識タスクで主流になりつつあります。 DS検定★ でも頻出概念です。
従来CNN(Convolutional Neural Network)が独占していた画像認識タスクで、 ViT(Vision Transformer)が大規模データセットでCNNを超える性能を示すケースが増えています。
Self-Attention機構を画像のパッチに適用するという発想は、テキストで成功したTransformerの自然な拡張です。 DS検定★ でも『画像はCNN、テキストはTransformer』という従来の対応関係に加え、近年の動向として押さえておくべきポイントです。