データレイクハウスとは?
でーたれいくはうす
データレイクハウスとは、データレイクの柔軟なストレージとデータウェアハウスの高性能な分析機能を統合した、次世代のデータ管理アーキテクチャです。
データレイクハウス(Data Lakehouse)とは、大量の生データを安価に格納できるデータレイクの特性と、構造化データを高速に分析できるデータウェアハウスの特性を一つのプラットフォームに統合したデータ管理アーキテクチャです。2020年代に入りDatabricksやApache Icebergの普及とともに広まりました。
従来のデータ管理では、データレイク(低コスト・非構造化データ対応)とデータウェアハウス(高速クエリ・構造化データ向け)を別々に運用し、その間でETL処理によるデータ移行が必要でした。この二重管理はコストの増大と整合性の複雑化を招いていました。
データレイクハウスが解決する主な課題は以下の通りです。
- 単一のストレージ上でBIレポートから機械学習まで対応
- ACIDトランザクションのサポートによるデータの整合性保証
- スキーマ管理とデータカタログの一元化
- オープンフォーマット(Parquet・Delta Lake等)による相互運用性
- 構造化・半構造化・非構造化データの同一基盤での処理
主要な実装技術として、Delta Lake、Apache Iceberg、Apache Hudiが知られています。クラウドのオブジェクトストレージを基盤として低コストを維持しながら、BI・機械学習・リアルタイム分析を統一的に行える点が最大の強みです。
使い方・例文
マーケティングデータ・IoTセンサーログ・顧客行動ログをすべてデータレイクハウスに集約し、BIツールでのダッシュボード表示と機械学習モデルの学習をひとつの基盤で行う、といった活用が典型例です。
この用語をシェア
最終更新: