Prenez contact avec nous

Plan du cours

Fondamentaux de la plateforme Databricks et du Lakehouse

  • Architecture Databricks Lakehouse et composants
  • Organisation des espaces de travail et catalogues

Espace de travail Databricks et notebooks

  • Navigation dans l'espace de travail et développement basé sur les notebooks
  • Structuration du code en notebooks réutilisables

Architecture d'Apache Spark et exécution

  • Architecture du runtime Spark et modèle d'exécution
  • Évaluation paresseuse et DAG de job

DataFrames PySpark et DataFrame API

  • Abstractions DataFrames et schémas
  • Opérations DataFrame de base et expressions de colonnes

Traduction du SQL vers les DataFrames PySpark

  • Traduction des clauses SQL principales en opérations DataFrame
  • Fonctions fenêtrées et agrégations dans PySpark

Lecture et écriture de données dans Databricks

  • Lecture à partir de sources de fichiers et bases de données courantes
  • Écriture et partitionnement des données dans le Lakehouse

Delta Lake et gestion des tables

  • Tables Delta et transactions ACID
  • Voyage dans le temps et évolution du schéma

Patterns de nettoyage et transformation des données

  • Nettoyage des données et conversion de types
  • Construction de logique de transformation réutilisable

Fonctions définies par l'utilisateur (UDFs) et code modulaire

  • UDF Python et pandas UDFs
  • Modularisation de la logique procédurale en fonctions

Amélioration des performances et optimisation

  • Stratégies de partitionnement et mise en cache
  • Diagnostic des goulots d'étranglement avec l'interface utilisateur Spark

Fondamentaux du streaming structuré

  • Traitement par lots versus traitement en streaming
  • DataFrames de streaming et agrégations de base

Jobs Databricks et orchestration des workflows

  • Planification des notebooks comme jobs et tâches
  • Construction de workflows multi-étapes avec dépendances

Unity Catalog et gouvernance des données

  • Architecture Unity Catalog et espaces de noms
  • Contrôle d'accès et lignée des données

Tests, débogage et bonnes pratiques de production

  • Tests unitaires de la logique PySpark
  • Débogage et normes de qualité du code

Cas d'utilisation complets dans les services financiers

  • Construction d'un pipeline ETL bancaire de bout en bout
  • Traduction des processus SQL hérités vers PySpark

Migration des charges de travail SQL vers PySpark

  • Stratégie de migration et patterns de planification
  • Conversion incrémentale des workflows SQL vers PySpark

Pré requis

  • Expérience avec la programmation Python, incluant les fonctions et les types de données.
  • Compréhension du SQL, y compris les jointures, les agrégations et les sous-requêtes.
  • Aucune expérience préalable avec Databricks ou PySpark n'est requise.

Public cible

  • Ingénieurs des données, analystes de données et professionnels des données.
  • Équipes migrant leurs workflows SQL existants vers Databricks et PySpark.
 35 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (1)

Cours à venir

Catégories Similaires