Accueil > Formations > Intelligence artificielle & Data Science > Data Science & Machine Learning > PySpark
Formation PySpark
Maîtrisez PySpark pour traiter et analyser des volumes massifs de données !
Vue d'ensemble
Notions de base sur le langage Python ; notions sur les environnements data (modèle en étoile, Azure)
Objectifs pédagogiques
Programme détaillé
Environnement Python et prise en main
– Présentation du langage Python : positionnement, écosystème et cas d’usage en data engineering
– Installation de Python et des bibliothèques : mise en place de PySpark, pandas et des dépendances nécessaires
– Environnement virtuel : création et gestion d’un environnement isolé pour le projet
– Jupyter Notebooks : introduction à l’outil interactif pour l’exploration de données
– Bases de Python : rappel des fondamentaux du langage pour le traitement de données
Architecture et DataFrames PySpark
– DataFrames en Big Data : rôle central des DataFrames dans le traitement de données volumineuses
– Chargement des données : lecture de fichiers CSV, JSON et Parquet via PySpark
– Connexion aux systèmes de stockage : accès aux données depuis Azure Data Lake
– Filtrage, tri et agrégation : opérations de sélection et de regroupement sur les DataFrames
– Jointures entre DataFrames : croisement de plusieurs jeux de données
– Création de colonnes et transformations : enrichissement et restructuration des données
– Traitement des valeurs manquantes : détection et gestion des données incomplètes
Connexion à Azure Data Lake et SQL Server
– Architecture Azure Data Lake : présentation des couches de stockage et de leur organisation
– Lecture et écriture de fichiers : manipulation de données dans Azure Data Lake avec PySpark
– Authentification et clés d’accès : configuration sécurisée de la connexion aux ressources Azure
– Connexion SQL Server via JDBC : lecture et écriture de données dans une base relationnelle
– Exécution de requêtes SQL : sélection, transformation et extraction de données avec PySpark
– Sauvegarde des résultats : persistance des traitements dans les bases de données relationnelles
Pipeline de transformation de données
– Conception d’un pipeline complet : architecture du flux de données de bout en bout
– Chargement multi-sources : ingestion de données depuis Azure Data Lake et fichiers CSV
– Nettoyage des données : détection et correction des anomalies et incohérences
– Transformations avancées : jointures, agrégations et enrichissement des données
– Enregistrement en base de données : chargement des résultats transformés dans SQL Server
– Optimisations et bonnes pratiques : amélioration des performances et maintenabilité du pipeline
Prochaines sessions
Ils nous font confiance
Cette année notre filière Data Science & Machine Learning a accompagné plus de 55 entreprises dont :
Avis des participants
Formation très bien organisée, très claire Alison explique très clairement et est très à l'écoute, avec toujours une approche pratique essentielle. je n'avais jamais fait de Python et j'ai pu coder finalement assez rapidement grâce à une progression bien articulée des exercices. Comme c'est très…
François-Marie est un excellent formateur ! Un grand merci à lui d'avoir été aussi pédagogue et clair dans ses explications du début à la fin de la formation, en plus d'être extremement sympathique, ce qui ne gâche rien :) Merci également à Sparks pour l'organisation…
L'intervenante est d'une qualité rare dans son domaine, son expertise est vraiment remarquable Par contre, j'ai suivi cette formation par curiosité mais elle s'avèrera peu utile dans mon métier Avec mon expérience "has been", et mon peu de connaissance en langage de programmation, j'ai eu…
Formation très intéressante, j'ai appris beaucoup de chose. Un grand merci au formateur.
Excellent rythme avec beaucoup de pratique. Des exercices permettant de comprendre le fonctionnement. Des réponses à toutes les questions posées ou pistes proposées pour trouver des réponses. Je recommande vivement cette formation avec cette formatrice.
Des formateurs experts, reconnus par nos apprenants
Chez Sparks Formation, la qualité de nos formations repose sur l'expertise de nos formateurs et la satisfaction de nos apprenants.
Note moyenne attribuée par les participants à nos formateurs
formateurs experts partenaires
Sparks Formation
sujets IT délivrés chaque jour partout en France
Financement
Cette formation est éligible aux financements OPCO et FNE-Formation. Nos équipes vous accompagnent dans le montage de votre dossier.
Questions fréquentes
Combien de temps dure la formation PySpark ?
Cette formation se déroule sur 2 jours.
Quels sont les prérequis pour suivre la formation PySpark ?
Notions de base sur le langage Python ; notions sur les environnements data (modèle en étoile, Azure)
Quel est le prix de la formation PySpark ?
En inter-entreprises, elle est à 1 400 € HT par participant. Un tarif sur-mesure est également disponible sur devis.
La formation PySpark délivre-t-elle une certification ?
Cette formation ne délivre pas de certification. Une attestation de fin de formation vous sera remise à l'issue de la session.
La formation PySpark est-elle éligible à un financement OPCO ?
Oui, cette formation est éligible aux financements OPCO et FNE-Formation. Nos équipes vous accompagnent dans le montage de votre dossier.
Choisissez votre formation
Mon contact chez SPARKS est professionnel et très réactif. Les échanges sont simples, efficaces, et la collaboration se déroule dans d'excellentes conditions.
