確率的勾配降下法とは?
かくりつてきこうばいこうかほう
確率的勾配降下法とは、機械学習モデルの誤差を最小化するパラメータ更新を、全データの代わりに少数のサンプルを使って効率的に行う最適化手法です。
確率的勾配降下法(Stochastic Gradient Descent / SGD)は、機械学習・深層学習モデルのパラメータ最適化に用いられる代表的なアルゴリズムです。損失関数の勾配を用いてパラメータを反復更新するという点は通常の勾配降下法と同じですが、全訓練データの勾配平均を使う代わりに、ランダムに選んだ1件または少数のデータ(ミニバッチ)の勾配でパラメータを更新します。
更新式はパラメータをθ、学習率をη、損失勾配を∇Lとすると「θ ← θ − η∇L(θ; xᵢ, yᵢ)」と表されます。
通常の勾配降下法(バッチGD)と比較したSGDの特徴は以下のとおりです。
- 計算効率: 大規模データセットでも1回の更新が高速
- 収束のノイズ: 勾配推定にばらつきがあるため、局所最適解から抜け出しやすい
- メモリ効率: 全データをメモリに乗せる必要がない
実際の深層学習では、SGDを改良したAdagrad・RMSprop・Adam(Adaptive Moment Estimation)などの最適化アルゴリズムが広く使われています。Adamは学習率を各パラメータに応じて自動調整し、多くの場合で安定した収束を示すため特に普及しています。
使い方・例文
ニューラルネットワークの学習では確率的勾配降下法を用い、ミニバッチ単位で重みを更新しながら損失を徐々に下げていきます。
この用語をシェア
最終更新: