Outil · Data Science & Machine Learning

Spark

Moteur de traitement de données distribué, conçu pour analyser de très grands volumes de données en mémoire, plus rapidement que Hadoop MapReduce.

Définition

Apache Spark est un moteur de traitement de données distribué, conçu pour analyser de très grands volumes de données en s'appuyant sur la mémoire vive plutôt que sur le disque, ce qui le rend nettement plus rapide que l'approche historique Hadoop MapReduce.

Spark unifie sur une même plateforme le traitement par lots (batch), le streaming en temps réel, le machine learning (via sa bibliothèque MLlib) et les requêtes SQL, ce qui en fait un outil central de nombreuses architectures Big Data modernes.

Aussi appelé : Apache Spark

Questions fréquentes

Qu'est-ce que Spark ?

Moteur de traitement de données distribué, conçu pour analyser de très grands volumes de données en mémoire, plus rapidement que Hadoop MapReduce.

Comment appelle-t-on aussi Spark ?

Spark est aussi appelé : Apache Spark.

Quelles formations Sparks abordent Spark ?

Spark, Spark SQL, PySpark, Data Streaming : traitement des données en temps réel, Mettre en œuvre une solution d’analyse de données avec Azure Databricks (DP-3011), Construire des solutions de Machine Learning avec Azure Databricks (DP-3014).