Prenez contact avec nous

Plan du cours

Fondamentaux de NiFi et des flux de données

  • Données en mouvement vs données statiques : concepts et défis
  • Architecture de NiFi : noyaux, contrôleur de flux, provenance et bulletin
  • Composants clés : processeurs, connexions, contrôleurs et provenance

Contexte Big Data et intégration

  • Rôle de NiFi dans les écosystèmes Big Data (Hadoop, Kafka, stockage cloud)
  • Présentation de HDFS, MapReduce et des alternatives modernes
  • Cas d'usage : ingestion de flux, transfert de journaux, pipelines d'événements

Installation, configuration et mise en place du cluster

  • Installation de NiFi en mode mononœud et en mode cluster
  • Configuration du cluster : rôles des nœuds, Zookeeper et équilibrage de charge
  • Orchestration des déploiements NiFi : utilisation d'Ansible, Docker ou Helm

Conception et gestion des flux de données

  • Routage, filtrage, découpage et fusion des flux
  • Configuration des processeurs (InvokeHTTP, QueryRecord, PutDatabaseRecord, etc.)
  • Gestion du schéma, de l'enrichissement et des opérations de transformation
  • Gestion des erreurs, relations de nouvelle tentative (retry) et backpressure

Scénarios d'intégration

  • Connexion aux bases de données, aux systèmes de messagerie et aux API REST
  • Streaming vers des systèmes analytiques : Kafka, Elasticsearch ou stockage cloud
  • Intégration avec Splunk, Prometheus ou des pipelines de journaux

Supervision, récupération et provenance

  • Utilisation de l'interface NiFi, des métriques et du visualiseur de provenance
  • Conception de la récupération autonome et de la gestion des pannes appropriée
  • Sauvegarde, versionnage des flux et gestion des modifications

Ajustement des performances et optimisation

  • Ajustement du JVM, de l'espace mémoire (heap), des pools de threads et des paramètres de clustering
  • Optimisation de la conception des flux pour réduire les goulets d'étranglement
  • Isolation des ressources, priorisation des flux et contrôle du débit

Bonnes pratiques et gouvernance

  • Documentation des flux, normes de nommage, conception modulaire
  • Sécurité : TLS, authentification, contrôle d'accès, chiffrement des données
  • Contrôle des modifications, versionnage, accès basé sur les rôles, pistes d'audit

Résolution des problèmes et réponse aux incidents

  • Problèmes courants : blocages (deadlocks), fuites de mémoire, erreurs de processeur
  • Analyse des journaux, diagnostic des erreurs et investigation des causes racines
  • Stratégies de récupération et retour en arrière (rollback) des flux

Travail pratique : Implémentation réaliste d'un pipeline de données

  • Construction d'un flux de bout en bout : ingestion, transformation, livraison
  • Mise en œuvre de la gestion des erreurs, de la backpressure et de la scalabilité
  • Tests de performance et ajustement du pipeline

Résumé et prochaines étapes

Pré requis

  • Expérience avec la ligne de commande Linux
  • Compréhension de base des réseaux et des systèmes de données
  • Notions de streaming de données ou de concepts ETL

Public cible

  • Administrateurs systèmes
  • Ingénieurs en données
  • Développeurs
  • Professionnels DevOps
 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (7)

Cours à venir

Catégories Similaires