Prenez contact avec nous

Plan du cours

Introduction :

  • Apache Spark dans l'écosystème Hadoop
  • Présentation concise de Python et de Scala

Fondamentaux (théorie) :

  • Architecture
  • RDD
  • Transformations et Actions
  • Stage, Tâche, Dépendances

Comprendre les bases dans un environnement Databricks (atelier pratique) :

  • Exercices avec l'API RDD
  • Fonctions de base : actions et transformations
  • PairRDD
  • Jointures (Join)
  • Stratégies de mise en cache
  • Exercices avec l'API DataFrame
  • SparkSQL
  • DataFrame : select, filter, group, sort
  • UDF (Fonction définie par l'utilisateur)
  • Découverte de l'API DataSet
  • Streaming

Comprendre le déploiement dans un environnement AWS (atelier pratique) :

  • Bases d'AWS Glue
  • Différences entre AWS EMR et AWS Glue
  • Exemples de jobs dans les deux environnements
  • Avantages et inconvénients

En plus :

  • Introduction à l'orchestration Apache Airflow

Pré requis

Compétences en programmation (de préférence Python, Scala)

Notions de base en SQL

 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (3)

Cours à venir

Catégories Similaires