本文へスキップ

合成データとは?

ごうせいでーた

合成データとは、実際の観測や収集ではなく、アルゴリズムや生成モデルによって人工的に作り出されたデータのことです。

合成データ(synthetic data)とは、実際の事象から収集・観測したデータではなく、統計的手法や機械学習モデルなどを用いてコンピューター上で人工的に生成されたデータのことです。

合成データが注目されている背景には、AI・機械学習モデルの開発に必要な大量のデータを収集・整備するコストと時間の問題があります。また、医療記録・個人情報・金融データなどプライバシー上の制約から実データが使いにくい場合でも、合成データであれば個人を特定できない形でデータの統計的性質を保持しつつ活用できます。

合成データの生成方法や用途は多岐にわたります。

  • GAN(敵対的生成ネットワーク):画像や音声などのリアルな合成データを生成
  • シミュレーション:自動運転の訓練用に仮想環境での走行データを生成
  • 統計的合成:実データの分布を模した表形式データを生成
  • 大規模言語モデル:テキストデータの拡張やテスト用データ生成

一方で、合成データが実データの特性を正確に反映しているかどうかの検証が課題であり、偏りや誤った統計的性質が含まれるリスクもあります。AI開発においてデータプライバシーと利便性を両立するための重要なアプローチとして、今後さらに普及が見込まれます。

使い方・例文

自動運転システムの開発において、実道路での収集が困難な豪雨や積雪時の走行シーンをシミュレーターで生成し、学習データとして使用するケースが合成データの代表的な活用例です。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語