Apache Hadoopとは?
あぱっちはどぅーぷ
Apache Hadoopとは、大規模データを複数のサーバーに分散して並列処理するためのオープンソースフレームワークです。
Apache Hadoopは、大量のデータを安価な汎用サーバー群に分散して保存・処理するために設計されたオープンソースのソフトウェアフレームワークです。Googleが発表した分散ファイルシステムと並列処理モデルに関する論文にインスパイアされ、Doug CuttingらによってApacheプロジェクトとして開発されました。
Hadoopの中核を構成するコンポーネントは主に以下の2つです。
- HDFS(Hadoop Distributed File System): 大容量ファイルをブロック単位に分割し、複数のノードに冗長保存する分散ファイルシステムです。ノード障害が発生しても別ノードのレプリカからデータを復元できるため、高い耐障害性を実現します。
- MapReduce: データ処理をMap(分割して並列処理)とReduce(集約)の2段階に分ける並列計算モデルです。処理ロジックを各データノードで同時実行することで、単一サーバーでは非現実的な規模のデータ処理を可能にします。
現在はYARN(リソース管理)やHive(SQL的クエリ)、Spark(高速インメモリ処理)など多くのエコシステムと連携し、ビッグデータ基盤の中核として広く活用されています。ログ解析、機械学習データ準備、大規模ETL処理など、ペタバイト級データを扱う企業の情報基盤において重要な役割を担っています。
使い方・例文
ECサイトが数十億件の購買履歴ログを日次で集計してレコメンドモデルを再学習する際、Apache Hadoopクラスターにデータを分散配置してMapReduceジョブを投入することで、単一サーバーでは処理しきれない大規模な集計を現実的な時間内に完了させることができます。
この用語をシェア
最終更新: