Plan du cours
Fondamentaux de la plateforme Databricks et du Lakehouse
- Architecture Databricks Lakehouse et composants
- Organisation des espaces de travail et catalogues
Espace de travail Databricks et notebooks
- Navigation dans l'espace de travail et développement basé sur les notebooks
- Structuration du code en notebooks réutilisables
Architecture d'Apache Spark et exécution
- Architecture du runtime Spark et modèle d'exécution
- Évaluation paresseuse et DAG de job
DataFrames PySpark et DataFrame API
- Abstractions DataFrames et schémas
- Opérations DataFrame de base et expressions de colonnes
Traduction du SQL vers les DataFrames PySpark
- Traduction des clauses SQL principales en opérations DataFrame
- Fonctions fenêtrées et agrégations dans PySpark
Lecture et écriture de données dans Databricks
- Lecture à partir de sources de fichiers et bases de données courantes
- Écriture et partitionnement des données dans le Lakehouse
Delta Lake et gestion des tables
- Tables Delta et transactions ACID
- Voyage dans le temps et évolution du schéma
Patterns de nettoyage et transformation des données
- Nettoyage des données et conversion de types
- Construction de logique de transformation réutilisable
Fonctions définies par l'utilisateur (UDFs) et code modulaire
- UDF Python et pandas UDFs
- Modularisation de la logique procédurale en fonctions
Amélioration des performances et optimisation
- Stratégies de partitionnement et mise en cache
- Diagnostic des goulots d'étranglement avec l'interface utilisateur Spark
Fondamentaux du streaming structuré
- Traitement par lots versus traitement en streaming
- DataFrames de streaming et agrégations de base
Jobs Databricks et orchestration des workflows
- Planification des notebooks comme jobs et tâches
- Construction de workflows multi-étapes avec dépendances
Unity Catalog et gouvernance des données
- Architecture Unity Catalog et espaces de noms
- Contrôle d'accès et lignée des données
Tests, débogage et bonnes pratiques de production
- Tests unitaires de la logique PySpark
- Débogage et normes de qualité du code
Cas d'utilisation complets dans les services financiers
- Construction d'un pipeline ETL bancaire de bout en bout
- Traduction des processus SQL hérités vers PySpark
Migration des charges de travail SQL vers PySpark
- Stratégie de migration et patterns de planification
- Conversion incrémentale des workflows SQL vers PySpark
Pré requis
- Expérience avec la programmation Python, incluant les fonctions et les types de données.
- Compréhension du SQL, y compris les jointures, les agrégations et les sous-requêtes.
- Aucune expérience préalable avec Databricks ou PySpark n'est requise.
Public cible
- Ingénieurs des données, analystes de données et professionnels des données.
- Équipes migrant leurs workflows SQL existants vers Databricks et PySpark.
Nos clients témoignent (1)
J'ai aimé qu'il soit pratique. J'ai adoré appliquer les connaissances théoriques avec des exemples pratiques.
Aurelia-Adriana - Allianz Services Romania
Formation - Python and Spark for Big Data (PySpark)
Traduction automatique