本文へスキップ

特徴量エンジニアリングとは?

とくちょうりょうえんじにありんぐ

特徴エンジニアリングとは、機械学習モデルの予測精度を高めるために、生データから有用な特徴量(入力変数)を選択・変換・作成する一連の作業プロセスのことです。

特徴エンジニアリング(Feature Engineering)とは、機械学習統計モデルに入力するデータ(特徴量・フィーチャー)を、問題に適した形に整形・変換・生成する技術と工程の総称です。どれほど優秀なアルゴリズムを使っても、入力データの質が低ければ良い予測は得られないため、特徴量エンジニアリングはモデルの性能を左右する最も重要な工程の一つとされています。

主な作業内容には以下のものが含まれます。

  • 特徴量の選択(Selection):予測に有効な変数を絞り込み、ノイズとなる変数を除去する
  • 特徴量の変換(Transformation):対数変換・標準化・正規化など、分布やスケールを調整する
  • 特徴量の作成(Creation):既存の変数を組み合わせて新しい指標を生成する(例:年齢と収入から「年収÷年齢」など)
  • カテゴリ変数の数値化:One-hotエンコーディングなど
  • 欠損値の補完や外れ値の処理

特徴量エンジニアリングは、データサイエンティストの経験・ドメイン知識・創造性が強く問われる工程です。近年はディープラーニングが特徴量を自動的に学習する「表現学習」を得意とすることから、一部の分野では人手による特徴量エンジニアリングの重要性が低下していますが、表形式データ(テーブルデータ)や業務データでは依然として不可欠な技術です。

使い方・例文

住宅価格予測モデルを作る際に、「築年数」と「最寄り駅からの距離」から「築年数×駅距離」という交互作用特徴量を新たに作成し、モデルの精度向上を図るような場面で特徴量エンジニアリングが行われます。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語