本文へスキップ

ランダムフォレストとは?

らんだむふぉれすと

ランダムフォレストとは、多数の決定木をランダムに構築してその予測を集約するアンサンブル学習手法で、高い精度と過学習への強さで広く使われています。

ランダムフォレスト(Random Forest)とは、多数決定木独立学習させ、それらの予測を多数決(分類)や平均(回帰)で集約するアンサンブル学習手法です。2001年にLeo Breimanによって提案されました。

通常の決定木は、訓練データに過剰適合(過学習)しやすいという欠点があります。ランダムフォレストはこれを克服するために二つのランダム化を組み合わせます。

  • バギング:各決定木を異なるブートストラップサンプル(復元抽出)で学習させる
  • 特徴量のランダムサブサンプリング:各分岐点でランダムに選んだ特徴量の中から最良の分割を選ぶ

この二重のランダム化により、各木の相関が低下し、アンサンブル全体としての分散が大幅に減少します。結果として、単一の決定木よりも精度が高く汎化性能に優れたモデルが得られます。

ランダムフォレストは特徴量重要度の算出、欠損値への対応、外れ値への頑健性など多くの利点を持ちます。医療診断・金融リスク評価・生態学・リモートセンシングなど幅広い分野で標準的な手法として使われており、Pythonのscikit-learnなどで容易に実装できます。

使い方・例文

「患者のデータを使った疾患予測モデルにランダムフォレストを適用したところ、単一決定木より精度が大幅に向上した」という形で使われます。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語