合成データとは?
ごうせいでーた
合成データとは、実際の観測や収集ではなく、アルゴリズムや生成モデルによって人工的に作り出されたデータのことです。
合成データ(synthetic data)とは、実際の事象から収集・観測したデータではなく、統計的手法や機械学習モデルなどを用いてコンピューター上で人工的に生成されたデータのことです。
合成データが注目されている背景には、AI・機械学習モデルの開発に必要な大量のデータを収集・整備するコストと時間の問題があります。また、医療記録・個人情報・金融データなどプライバシー上の制約から実データが使いにくい場合でも、合成データであれば個人を特定できない形でデータの統計的性質を保持しつつ活用できます。
合成データの生成方法や用途は多岐にわたります。
- GAN(敵対的生成ネットワーク):画像や音声などのリアルな合成データを生成
- シミュレーション:自動運転の訓練用に仮想環境での走行データを生成
- 統計的合成:実データの分布を模した表形式データを生成
- 大規模言語モデル:テキストデータの拡張やテスト用データ生成
一方で、合成データが実データの特性を正確に反映しているかどうかの検証が課題であり、偏りや誤った統計的性質が含まれるリスクもあります。AI開発においてデータプライバシーと利便性を両立するための重要なアプローチとして、今後さらに普及が見込まれます。
使い方・例文
自動運転システムの開発において、実道路での収集が困難な豪雨や積雪時の走行シーンをシミュレーターで生成し、学習データとして使用するケースが合成データの代表的な活用例です。
この用語をシェア
最終更新: