Apache Pinotとは?
あぱっちぴのっと
Apache Pinotとは、LinkedInが開発した大規模リアルタイム分散OLAPデータストアで、超低レイテンシでユーザー向けアナリティクスを提供するために設計されたオープンソースシステムです。
Apache Pinotは、LinkedInが内部で開発し、その後Apache Software Foundationに寄贈したオープンソースのリアルタイム分散OLAPシステムです。スケールと低レイテンシを両立したユーザー向けアナリティクス(User-Facing Analytics)のために設計されており、数十億行規模のデータに対しても数十ミリ秒以下でクエリ結果を返せることが大きな特徴です。
Pinotのアーキテクチャは以下の主要コンポーネントで構成されています。
- Controller:クラスターの管理と設定を担うコントロールプレーン
- Broker:クエリのルーティングと結果の集約を行うコンポーネント
- Server:実際にセグメントを格納しクエリを実行するノード
- Minion:バックグラウンドタスク(圧縮・変換など)を処理
データの取り込みはバッチ(HadoopやS3経由)とリアルタイム(Kafka経由)の両方に対応しており、列指向ストレージと多様なインデックス(転置インデックス、スターツリーインデックス、ブルームフィルタなど)を組み合わせることで高速なクエリを実現しています。
LinkedInではユーザーのプロフィール閲覧数や採用担当者向けのインサイト表示に利用されており、その他にもUberのRider Analytics、Walmartのサプライチェーンダッシュボードなどリアルタイムでのユーザー直接提供型分析に幅広く採用されています。Apache DruidやClickHouseと競合するシステムとして位置づけられます。
使い方・例文
「1億件のイベントデータからユーザーごとの直近30日の行動サマリーをリアルタイムダッシュボードで表示する」ような、大規模かつ低レイテンシが求められるユーザー向け分析基盤にApache Pinotが採用される場面で登場します。
この用語をシェア
最終更新: