Outil · Data Engineering & Big Data

Hadoop

Framework open source pour le stockage et le traitement distribué de très grands volumes de données sur des clusters de machines standards.

Définition

Apache Hadoop est un framework open source pour le stockage et le traitement distribué de très grands volumes de données, répartis sur des clusters de machines standards plutôt que sur du matériel spécialisé coûteux.

Pionnier historique du Big Data dans les années 2000, Hadoop repose sur son système de fichiers distribué (HDFS) et le paradigme de calcul MapReduce ; il est aujourd'hui souvent complété, voire remplacé sur les nouveaux projets, par Apache Spark, plus rapide pour de nombreux cas d'usage.

Questions fréquentes

Qu'est-ce que Hadoop ?

Framework open source pour le stockage et le traitement distribué de très grands volumes de données sur des clusters de machines standards.

Quelles formations Sparks abordent Hadoop ?

Hadoop, Pig, Hive et Impala avec Hadoop, HBase : mise en œuvre et administration, Big Data Foundation (avec certification du CCC), Spark, Big Data : mise en œuvre.