トランスフォーマーとは?
とらんすふぉーまー
トランスフォーマーとは、自己注意機構を中心とした深層学習モデルの構造で、自然言語処理を中心に現代AIの基盤となっています。
トランスフォーマー(Transformer)は、2017年にGoogleの研究者らが論文「Attention is All You Need」で発表したニューラルネットワークのアーキテクチャです。それまで主流だったRNN(再帰型ニューラルネットワーク)やLSTMに代わり、自然言語処理(NLP)の標準的な構造として急速に普及しました。
最大の革新は自己注意機構(Self-Attention)の導入です。入力列の各要素が他のすべての要素との関連度(注意重み)を並列に計算することで、文中の長距離依存関係を効率的に捉えられます。RNNのような逐次処理が不要なため、GPUを用いた大規模並列学習が可能です。
トランスフォーマーの主な構成要素は以下のとおりです。
- マルチヘッド注意機構: 異なる注意パターンを複数の「ヘッド」で同時に学習
- 位置エンコーディング: 順序情報を埋め込む仕組み
- フィードフォワード層: 各位置で独立した全結合変換を適用
BERTやGPTシリーズをはじめ、現在の大規模言語モデル(LLM)のほぼすべてがトランスフォーマーをベースとしており、画像認識(Vision Transformer)や音声認識にも応用が広がっています。
使い方・例文
ChatGPTや翻訳サービスなど、現在のAI言語サービスはほぼすべてトランスフォーマー構造をベースに構築されています。
この用語をシェア
最終更新: