本文へスキップ

Databricksとは?

でーたぶりっくす

Databricksとは、Apache Sparkを基盤とした統合データ分析・AI開発プラットフォームで、データエンジニアリングから機械学習まで一貫して扱えるサービスです。

Databricks(データブリックス)は、Apache Sparkの開発者たちが2013年に創業した企業およびその同名のクラウドデータプラットフォームです。Apache Sparkのマネージドサービスを核としつつ、データエンジニアリング・データサイエンス・機械学習・BIを一つの統合環境で実現することを目的としています。AWS・Azure・Google Cloudの3大クラウドすべてで利用できます。

Databricksの主な機能・特徴は以下のとおりです。

  • Lakehouse アーキテクチャ:データレイクの柔軟性とデータウェアハウスの管理性を統合した「レイクハウス」を実現するDelta Lakeフォーマットを標準採用
  • Unified Analytics Platform:Jupyter形式のノートブック上でPython・Scala・SQL・Rを使い、ETL処理から機械学習モデルの開発・デプロイまで一貫して行える
  • MLflow統合:機械学習の実験管理・モデルのバージョン管理・デプロイを管理するMLflowをネイティブに統合
  • AutoLoader:S3やADLSなどに到着したファイルを自動検出してストリーム取り込みする機能

大規模データの並列処理性能と、PythonやSQL経由の使いやすさを兼ね備えているため、データエンジニアとデータサイエンティストが同じプラットフォームで協業しやすい点が強みです。特に生成AI・LLMの開発基盤としても注目を集めており、2024年以降はAI開発用途での採用が急速に広がっています。

使い方・例文

製造業の企業がセンサーデータをDelta Lake形式でDatabricksに蓄積し、データエンジニアがETL処理を行った後、データサイエンティストが同じプラットフォーム上でPythonを使って異常検知モデルを開発・デプロイする運用が典型例です。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語