Définition
Apache Spark est un moteur de traitement de données distribué, conçu pour analyser de très grands volumes de données en s'appuyant sur la mémoire vive plutôt que sur le disque, ce qui le rend nettement plus rapide que l'approche historique Hadoop MapReduce.
Spark unifie sur une même plateforme le traitement par lots (batch), le streaming en temps réel, le machine learning (via sa bibliothèque MLlib) et les requêtes SQL, ce qui en fait un outil central de nombreuses architectures Big Data modernes.
Aussi appelé : Apache Spark
Formations intégrant Spark
Spark
Traitez les données massives en un temps record grâce au moteur d'analyse Apache Spark et à notre formation Spark !
Spark SQL
2 journées de formation pour maîtriser le module Spark pour le traitement des données structurées !
PySpark
Maîtrisez PySpark pour traiter et analyser des volumes massifs de données !
Data Streaming : traitement des données en temps réel
4 jours de formation pour apprendre à traiter des flux continus de données !
Mettre en œuvre une solution d’analyse de données avec Azure Databricks (DP-3011)
Exploitez les performances d’Apache Spark sur Azure Databricks pour exécuter des charges de travail analytiques à grande échelle dans le cloud !
Construire des solutions de Machine Learning avec Azure Databricks (DP-3014)
Apprenez à concevoir, entraîner et déployer des modèles de Machine Learning à grande échelle en exploitant la puissance d’Azure Databricks !
Questions fréquentes
Qu'est-ce que Spark ?
Moteur de traitement de données distribué, conçu pour analyser de très grands volumes de données en mémoire, plus rapidement que Hadoop MapReduce.
Comment appelle-t-on aussi Spark ?
Spark est aussi appelé : Apache Spark.
Quelles formations Sparks abordent Spark ?
Spark, Spark SQL, PySpark, Data Streaming : traitement des données en temps réel, Mettre en œuvre une solution d’analyse de données avec Azure Databricks (DP-3011), Construire des solutions de Machine Learning avec Azure Databricks (DP-3014).
