本文へスキップ

データレイクハウスとは?

でーたれいくはうす

データレイクハウスとは、データレイクの柔軟なストレージとデータウェアハウスの高性能な分析機能を統合した、次世代のデータ管理アーキテクチャです。

データレイクハウス(Data Lakehouse)とは、大量の生データを安価に格納できるデータレイの特性と、構造化データを高速に分析できるデータウェアハウスの特性を一つのプラットフォームに統合したデータ管理アーキテクチャです。2020年代に入りDatabricksやApache Icebergの普及とともに広まりました。

従来のデータ管理では、データレイク(低コスト・非構造化データ対応)とデータウェアハウス(高速クエリ・構造化データ向け)を別々に運用し、その間でETL処理によるデータ移行が必要でした。この二重管理はコストの増大と整合性の複雑化を招いていました。

データレイクハウスが解決する主な課題は以下の通りです。

  • 単一のストレージ上でBIレポートから機械学習まで対応
  • ACIDトランザクションのサポートによるデータの整合性保証
  • スキーマ管理とデータカタログの一元化
  • オープンフォーマット(Parquet・Delta Lake等)による相互運用性
  • 構造化・半構造化・非構造化データの同一基盤での処理

主要な実装技術として、Delta Lake、Apache Iceberg、Apache Hudiが知られています。クラウドのオブジェクトストレージを基盤として低コストを維持しながら、BI・機械学習・リアルタイム分析を統一的に行える点が最大の強みです。

使い方・例文

マーケティングデータ・IoTセンサーログ・顧客行動ログをすべてデータレイクハウスに集約し、BIツールでのダッシュボード表示と機械学習モデルの学習をひとつの基盤で行う、といった活用が典型例です。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語