本文へスキップ

知識蒸留とは?

ちしきじょうりゅう

知識蒸留とは、大きくて高精度な教師モデルの「知識」を、小型の生徒モデルに転移させることで、軽量でも高性能なモデルを作る技術です。

知識蒸留(Knowledge Distillation)は、2015年にGeoffrey Hintonらが提案したモデル圧縮手法です。精度の高い大規模なモデル(教師モデル)が持つ知識を、軽量な小規模モデル(生徒モデル)に「蒸留」するように移し取ることが名前の由来です。

通常の学習では正解ラベル(ハードラベル)を使います。知識蒸留では、教師モデルが出力する確率分布(ソフトラベル)を目標として生徒モデルを学習させます。例えば「猫」の画像に対して教師モデルが「猫80%・トラ15%・犬5%」と出力した場合、この分布そのものが生徒モデルの学習信号になります。各クラスへの「相対的な類似度」の情報が含まれるため、単純な正解ラベルよりも豊かな情報を生徒に与えられます。

知識蒸留には主に次のバリエーションがあります。

  • 応答ベース:教師の最終出力(ソフトラベル)を模倣する基本的な手法
  • 特徴ベース:中間層の特徴マップも含めて模倣する
  • 関係ベース:サンプル間の関係性(類似度)を保つように学習する

知識蒸留により、スマートフォンやIoT機器といった計算資源が限られた環境でも高精度なAI推論が可能になります。大規模言語モデルの軽量化にも広く使われており、実用的なAI応用において重要な技術となっています。

使い方・例文

スマートフォン上でオフライン動作する音声認識アプリや翻訳アプリは、クラウド上の大規模モデルの知識を蒸留した軽量モデルが動いていることが多いです。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語