データ拡張とは?
でーたかくちょう
データ拡張とは、既存の学習データに変換処理を加えてデータ量を人工的に増やす手法で、機械学習モデルの汎化性能を高めるために広く使われます。
データ拡張(Data Augmentation)とは、機械学習・深層学習において手元の訓練データに対してさまざまな変換を施し、実質的なデータ量を増やす手法です。大量のラベル付きデータを収集するコストを抑えながら、モデルの過学習を防ぎ汎化性能を向上させることができます。
画像認識分野では最も活用が進んでおり、代表的な変換処理には以下があります。
- 水平・垂直反転(フリップ)
- ランダムクリッピング・拡大縮小
- 回転・せん断変換
- 明るさ・コントラスト・色相の変化
- ガウシアンノイズの付加・ぼかし処理
自然言語処理(NLP)においてもデータ拡張は有効で、同義語への置き換え・文章の言い換え生成・逆翻訳(英語→日本語→英語)などが使われます。音声認識では、音声速度変換・ピッチシフト・背景ノイズ付加などが一般的です。
近年はMixup(2つのデータを混合)やCutMix(画像の一部を別データで置き換え)のように、より高度な合成手法も提案されています。また生成AIを使ってリアルなデータを人工生成する「生成的データ拡張」も注目されています。データが少ない医療画像診断や希少言語のNLPなどで特に重要な技術です。
使い方・例文
猫の画像1,000枚の学習データを反転・回転・色変換などで10倍に拡張することで、より多様な見た目の猫を認識できる画像分類モデルを効率よく訓練できます。
この用語をシェア
最終更新: