Formation Talend Big Data Integration
Talend Open Studio for Big Data est un outil ETL open source pour le traitement des big data. Il inclut un environnement de développement pour interagir avec les sources et cibles de big data, et exécuter des tâches sans avoir à écrire de code.
Cette formation en direct (en ligne ou sur site) est destinée aux personnes techniques qui souhaitent déployer Talend Open Studio for Big Data pour simplifier le processus de lecture et d'analyse des big data.
À la fin de cette formation, les participants seront capables de :
- Installer et configurer Talend Open Studio for Big Data.
- Se connecter à des systèmes de big data tels que Cloudera, HortonWorks, MapR, Amazon EMR et Apache.
- Comprendre et configurer les composants et connecteurs de big data d'Open Studio.
- Configurer des paramètres pour générer automatiquement du code MapReduce.
- Utiliser l'interface de glisser-déposer d'Open Studio pour exécuter des tâches Hadoop.
- Prototyper des pipelines de big data.
- Automatiser des projets d'intégration de big data.
Format du cours permettant d'évaluer les participants
- Conférence interactive et discussion.
- Nombreux exercices et pratiques.
- Mise en œuvre pratique dans un environnement de laboratoire live.
Options de personnalisation du cours
- Pour demander une formation personnalisée pour ce cours, veuillez nous contacter pour organiser.
Plan du cours
Introduction
Aperçu des fonctionnalités et de l'architecture de "Open Studio for Big Data"
Configuration d'Open Studio pour le big data
Navigation dans l'interface utilisateur
Compréhension des composants et connecteurs de big data
Connexion à un cluster Hadoop
Lecture et écriture de données
Traitement des données avec Hive et MapReduce
Analyse des résultats
Amélioration de la qualité du big data
Création d'un pipeline de big data
Gestion des utilisateurs, groupes, rôles et projets
Déploiement d'Open Studio en production
Surveillance d'Open Studio
Dépannage
Résumé et conclusion
Pré requis
- Une compréhension des bases de données relationnelles
- Une compréhension des entrepôts de données
- Une compréhension des concepts ETL (Extract, Transform, Load)
Public cible
- Spécialistes de l'intelligence d'affaires
- Professionnels des bases de données
- Développeurs SQL
- Développeurs ETL
- Architectes de solutions
- Architectes de données
- Professionnels des entrepôts de données
- Administrateurs et intégrateurs systèmes
Les formations ouvertes requièrent plus de 3 participants.
Formation Talend Big Data Integration - Réservation
Formation Talend Big Data Integration - Demande de renseignements
NobleProg propose des formations professionnelles conçues spécifiquement pour les entreprises et les organisations. Ces formations ne sont pas destinées aux particuliers.
Talend Big Data Integration - Demande d'informations consulting
Nos clients témoignent (1)
Exercices pratiques. La formation aurait dû durer 5 jours, mais les 3 jours ont permis de clarifier beaucoup de questions que je me posais déjà en travaillant avec NiFi.
James - BHG Financial
Formation - Apache NiFi for Administrators
Traduction automatique
Cours à venir
Cours Similaires
Avancé Apache Iceberg
21 HeuresCette formation dirigée par un instructeur, en direct à France (en ligne ou sur site), est destinée aux professionnels de données de niveau avancé qui souhaitent optimiser les flux de travail de traitement des données, assurer l'intégrité des données et mettre en œuvre des solutions robustes de data lakehouse capables de gérer les complexités des applications de big data modernes.
À la fin de cette formation, les participants seront en mesure de :
- Acquérir une compréhension approfondie de l'architecture d'Iceberg, y compris la gestion des métadonnées et la disposition des fichiers.
- Configurer Iceberg pour un rendement optimal dans divers environnements et l'intégrer à plusieurs moteurs de traitement des données.
- Gérer les tables d'Iceberg à grande échelle, effectuer des modifications complexes du schéma et gérer l'évolution des partitions.
- Maîtriser les techniques pour optimiser la performance des requêtes et l'efficacité de la lecture des données pour des ensembles de données volumineux.
- Mettre en œuvre des mécanismes pour assurer la cohérence des données, gérer les garanties transactionnelles et gérer les échecs dans des environnements distribués.
Fondements d'Apache Iceberg
14 HeuresCette formation dirigée par un instructeur et en direct à France (en ligne ou sur site) est destinée aux professionnels des données débutants qui souhaitent acquérir les connaissances et compétences nécessaires pour utiliser efficacement Apache Iceberg dans la gestion de jeux de données de grande taille, assurer l'intégrité des données et optimiser les workflows de traitement des données.
À la fin de cette formation, les participants seront capables de :
- Acquérir une compréhension approfondie de l'architecture, des fonctionnalités et des avantages d'Apache Iceberg.
- Apprendre les formats de table, la partition, l'évolution du schéma et les capacités de voyage dans le temps.
- Installer et configurer Apache Iceberg dans différents environnements.
- Créer, gérer et manipuler des tables Iceberg.
- Comprendre le processus de migration des données d'autres formats de table vers Iceberg.
Big Data Analytics avec Google Colab et Apache Spark
14 HeuresCe formation en direct (en ligne ou sur site) est destinée aux scientifiques des données et ingénieurs de niveau intermédiaire qui souhaitent utiliser Google Colab et Apache Spark pour le traitement et l'analyse de grandes masses de données.
À la fin de cette formation, les participants seront capables de :
- Configurer un environnement big data en utilisant Google Colab et Spark.
- Traiter et analyser des jeux de données volumineux efficacement avec Apache Spark.
- Visualiser les grands ensembles de données dans un environnement collaboratif.
- Intégrer Apache Spark avec des outils basés sur le cloud.
Apache NiFi pour les Administrateurs
21 HeuresApache NiFi est une plateforme open-source, basée sur le flux de données, pour l'intégration et le traitement d'événements. Elle permet un routage, une transformation et une médiation en temps réel entre des systèmes disparates, avec une interface utilisateur web et un contrôle granulaire.
Cette formation dirigée par un instructeur (sur site ou à distance) est destinée aux administrateurs et ingénieurs de niveau intermédiaire qui souhaitent déployer, gérer, sécuriser et optimiser les flux de données NiFi dans des environnements de production.
À la fin de cette formation, les participants seront en mesure de :
- Installer, configurer et maintenir des clusters Apache NiFi.
- Concevoir et gérer des flux de données provenant de sources et de récepteurs variés.
- Mettre en œuvre l'automatisation du flux, le routage et la logique de transformation.
- Optimiser les performances, surveiller les opérations et dépanner les problèmes.
Format du cours permettant d'évaluer les participants
- Cours interactif avec discussion sur l'architecture réelle.
- Laboratoires pratiques : construction, déploiement et gestion des flux.
- Exercices basés sur des scénarios dans un environnement de laboratoire en direct.
Options de personnalisation du cours
- Pour demander une formation personnalisée pour ce cours, veuillez nous contacter pour organiser.
PySpark et Machine Learning
21 HeuresCette formation offre une introduction pratique à la construction de workflows évolutifs de traitement de données et de Machine Learning utilisant PySpark. Les participants découvrent le fonctionnement d'Apache Spark au sein des écosystèmes modernes de Big Data et apprennent à traiter efficacement de grands volumes de données grâce aux principes du calcul distribué.
Fondamentaux d'Apache Spark
21 HeuresCette formation en direct (en ligne ou sur site) s'adresse aux ingénieurs qui souhaitent mettre en place et déployer un système Apache Spark de traitement de très grandes quantités de données.
A l'issue de cette formation, les participants seront capables de :
- Installer et configurer Apache Spark.
- Traiter et analyser rapidement de très grands ensembles de données.
- Comprendre la différence entre Apache Spark et Hadoop MapReduce et savoir quand utiliser l'un ou l'autre.
- Intégrer Apache Spark avec d'autres outils d'apprentissage automatique.
Administration d'Apache Spark
35 HeuresCette formation en direct avec instructeur à France (en ligne ou sur site) s'adresse aux administrateurs système de niveau débutant à intermédiaire qui souhaitent déployer, maintenir et optimiser les clusters Spark.
A l'issue de cette formation, les participants seront capables de :
- Installer et configurer Apache Spark dans différents environnements.
- Gérer les ressources du cluster et surveiller les applications Spark.
- Optimiser les performances des clusters Spark.
- Mettre en place des mesures de sécurité et assurer la haute disponibilité.
- Déboguer et résoudre les problèmes courants liés à Spark.
Apache Spark dans le Cloud
21 HeuresL'apprentissage d'Apache Spark présente une courbe d'apprentissage qui s'accélère lentement au début, nécessitant beaucoup d'efforts pour obtenir les premiers résultats. Ce cours vise à franchir la première partie difficile. Après avoir suivi ce cours, les participants comprendront les bases d'Apache Spark, distingueront clairement RDD de DataFrame, apprendront l'API Python et Scala, comprendront les exécuteurs et les tâches, etc. En suivant les meilleures pratiques, ce cours se concentre fortement sur le déploiement dans le cloud, Databricks et AWS. Les étudiants comprendront également les différences entre AWS EMR et AWS Glue, l'un des derniers services Spark d'AWS.
PUBLIC :
Data Engineer, DevOps, Data Scientist
Python et Spark pour les Grandes Données (PySpark)
21 HeuresAu cours de cette formation en direct avec instructeur à France, les participants apprendront à utiliser Python et Spark ensemble pour analyser les données volumineuses (big data) en travaillant sur des exercices pratiques.
A la fin de cette formation, les participants seront capables de :
- Apprendre à utiliser Spark avec Python pour analyser Big Data.
- Travailler sur des exercices qui imitent des cas réels.
- Utiliser différents outils et techniques pour l'analyse des big data en utilisant PySpark.
Python, Spark et Hadoop pour les grands volumes de données
21 HeuresCette formation en France (en ligne ou sur site) est destinée aux développeurs qui souhaitent utiliser et intégrer Spark, Hadoop et Python pour traiter, analyser et transformer des ensembles de données complexes et volumineux.
A l'issue de cette formation, les participants seront capables de :
- Mettre en place l'environnement nécessaire pour commencer à traiter les big data avec Spark, Hadoop et Python.
- Comprendre les fonctionnalités, les composants de base et l'architecture de Spark et Hadoop.
- Apprendre à intégrer Spark, Hadoop et Python pour le traitement des big data.
- Explorer les outils de l'écosystème Spark (Spark MlLib, Spark Streaming, Kafka, Sqoop, Kafka et Flume).
- Construire des systèmes de recommandation par filtrage collaboratif similaires à Netflix, YouTube, Amazon, Spotify et Google.
- Utiliser Apache Mahout pour mettre à l'échelle des algorithmes d'apprentissage automatique.
Stratio : Modules Rocket et Intelligence avec PySpark
14 HeuresStratio est une plateforme axée sur les données qui intègre le big data, l'IA et la gouvernance dans une seule solution. Ses modules Rocket et Intelligence permettent des explorations de données rapides, des transformations et des analyses avancées dans des environnements d'entreprise.
Cette formation dirigée par un instructeur (en ligne ou sur site) est destinée aux professionnels des données de niveau intermédiaire qui souhaitent utiliser efficacement les modules Rocket et Intelligence de Stratio avec PySpark, en se concentrant sur les structures de boucle, les fonctions définies par l'utilisateur et la logique de données avancée.
À la fin de cette formation, les participants seront capables de :
- Naviguer et travailler dans la plateforme Stratio en utilisant les modules Rocket et Intelligence.
- Appliquer PySpark dans le contexte de l'ingestion, de la transformation et de l'analyse des données.
- Utiliser les boucles et la logique conditionnelle pour contrôler les flux de travail de données et les tâches d'ingénierie des caractéristiques.
- Créer et gérer des fonctions définies par l'utilisateur (UDFs) pour des opérations de données réutilisables en PySpark.
Format du cours permettant d'évaluer les participants
- Cours interactif avec discussion.
- Nombreux exercices et pratiques.
- Mise en œuvre pratique dans un environnement de laboratoire en direct.
Options de personnalisation du cours
- Pour demander une formation personnalisée pour ce cours, veuillez nous contacter pour organiser.
Talend Administration Center (TAC)
14 HeuresCette formation encadrée par un instructeur (en ligne ou sur site) est destinée aux administrateurs système, scientifiques de données et analystes commerciaux qui souhaitent configurer Talend Administration Center pour déployer et gérer les rôles et tâches de l'organisation.
À la fin de cette formation, les participants seront en mesure de :
- Installer et configurer Talend Administration Center.
- Comprendre et mettre en œuvre les fondamentaux de la gestion Talend.
- Construire, déployer et exécuter des projets ou tâches commerciales dans Talend.
- Surveiller la sécurité des jeux de données et développer des routines commerciales basées sur le cadre TAC.
- Acquérir une compréhension plus large des applications Big Data.
Talend Data Stewardship
14 HeuresCette formation dirigée par un instructeur, en ligne ou sur site à France, est destinée aux analystes de données débutants ou intermédiaires qui souhaitent approfondir leur compréhension et leurs compétences dans la gestion et l'amélioration de la qualité des données à l'aide de Talend Data Stewardship.
À la fin de cette formation, les participants seront en mesure de :
- Acquérir une compréhension complète du rôle de la gestion des données dans le maintien de la qualité des données.
- Utiliser Talend Data Stewardship pour gérer les tâches liées à la qualité des données.
- Créer, attribuer et gérer des tâches au sein de Talend Data Stewardship, y compris la personnalisation des flux de travail.
- Utiliser les capacités de reporting et de surveillance de l'outil pour suivre la qualité des données et les efforts de gestion des données.
Talend Open Studio for ESB
21 HeuresDans cette formation en direct, dirigée par un instructeur, les participants apprendront à utiliser Talend Open Studio for ESB pour créer, connecter, médiatiser et gérer des services et leurs interactions.
A l'issue de cette formation, les participants seront en mesure de
- Intégrer, améliorer et fournir les technologies ESB sous forme de paquets uniques dans une variété d'environnements de déploiement.
- Comprendre et utiliser Talend les composants les plus utilisés d'Open Studio.
- Intégrer n'importe quelle application, base de données, API ou services Web.
- Intégrer de manière transparente des systèmes et des applications hétérogènes.
- Intégrer les bibliothèques de code Java existantes pour étendre les projets.
- Mettre à profit les composants et le code de la communauté pour étendre les projets.
- Intégrer rapidement des systèmes, des applications et des sources de données dans un environnement Eclipse de type "glisser-déposer".
- Réduire le temps de développement et les coûts de maintenance en générant un code optimisé et réutilisable.