RLHF(人間のフィードバックによる強化学習)とは?
あーるえるえいちえふ
RLHFとは、人間の評価・フィードバックを報酬信号として使い、AIモデルの出力を人間の意図に沿うよう訓練する強化学習手法です。
RLHF(Reinforcement Learning from Human Feedback)は「人間のフィードバックによる強化学習」と訳される機械学習の手法で、人間の評価をAIモデルのトレーニングに直接組み込むことを特徴とします。大規模言語モデル(LLM)の性能・安全性・有用性を高める技術として注目を集めています。
RLHFのプロセスは概ね次の3段階で構成されます。
- 教師あり事前学習(SFT):人間が作成した質の高い回答例でモデルを初期学習させる
- 報酬モデルの訓練:人間の評価者がモデルの複数の出力に対して優劣を付けたデータをもとに、「どんな出力が良いか」を予測する報酬モデルを構築する
- 強化学習による最適化:報酬モデルを使ってAIが高評価な出力を生成するよう、PPO(近接方策最適化)などの強化学習アルゴリズムで本体モデルを更新する
RLHFはOpenAIのChatGPT・GPTシリーズ、AnthropicのClaudeなど、現在主流の対話型AIの訓練において重要な役割を果たしています。単に正しい情報を出力するだけでなく、人間にとって安全で役立つ形で応答できるよう調整するための技術として位置づけられています。
課題としては、人間のフィードバック収集にコストと時間がかかること、評価者の主観・バイアスがモデルに反映されるリスク、報酬ハッキング(報酬モデルを不正に最大化しようとする挙動)などが挙げられます。これらを改善するためにRLAIF(AIフィードバックによる強化学習)などの派生手法も研究されています。
使い方・例文
「ChatGPTがユーザーにとって有害・不適切な内容を出力しないよう調整されているのは、RLHFを使って人間の好みに合わせたトレーニングが行われているためです」のように説明される技術です。
この用語をシェア
最終更新: