Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Chaque session dure 2 heures
Jour-1 : Session -1 : Aperçu métier des raisons d'adopter l'Intelligence économique sur les méga-données dans le gouvernement
- Études de cas du NIH, DoE
- Taux d'adaptation du Big Data dans les agences gouvernementales et comment elles alignent leurs opérations futures autour de l'analyse prédictive Big Data
- Domainses d'application à grande échelle dans le DoD, la NSA, l'IRS, l'USDA, etc.
- Interopérabilité du Big Data avec les données héritées (legacy)
- Compréhension de base des technologies habilitantes en analyse prédictive
- Intégration des données & visualisation par tableaux de bord
- Gestion de la fraude
- Génération de règles métier / détection de fraude
- Détection de menaces et profilage
- Analyse des coûts et avantages pour la mise en œuvre du Big Data
Jour-1 : Session-2 : Introduction au Big Data-1
- Caractéristiques principales du Big Data : volume, variété, vélocité et véracité. Architecture MPP pour le volume.
- Entrepôts de données – schéma statique, jeu de données évoluant lentement
- Bases de données MPP comme Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Solutions basées sur Hadoop – aucune condition sur la structure du jeu de données.
- Modèle typique : HDFS, MapReduce (crunch), récupération depuis HDFS
- Batch – adapté à l'analyse / non interactif
- Volume : données de streaming CEP
- Choix typiques – produits CEP (par exemple Infostreams, Apama, MarkLogic, etc.)
- Moins prêts pour la production – Storm/S4
- Bases de données NoSQL – (colonnaires et clé-valeur) : Les mieux adaptées comme adjoint analytique à l'entrepôt de données/base de données
Jour-1 : Session -3 : Introduction au Big Data-2
Solutions NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hiérarchique) - GT.m, Cache
- KV Store (Trié) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Base de données objets - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variétés de Données : Introduction aux problèmes de nettoyage de données en Big Data
- RDBMS – structure/schéma statique, ne favorise pas un environnement agile et exploratoire.
- NoSQL – semi-structuré, assez structuré pour stocker les données sans schéma exact avant le stockage
- Problèmes de nettoyage des données
Jour-1 : Session-4 : Introduction au Big Data-3 : Hadoop
- Quand choisir Hadoop ?
- STRUCTURÉ - Les entrepôts de données/bases de données d'entreprise peuvent stocker des données massives (au prix fort) mais imposent une structure (pas bon pour l'exploration active)
- Données SEMI-STRUCTURÉES – difficile à gérer avec les solutions traditionnelles (DW/DB)
- Entreposage de données = énorme effort et statique même après la mise en œuvre
- Pour la variété & le volume de données, traité sur du matériel grand public – HADOOP
- Matériel grand public (H/W) nécessaire pour créer un cluster Hadoop
Introduction à MapReduce /HDFS
- MapReduce – distribution du calcul sur plusieurs serveurs
- HDFS – met les données à disposition localement pour le processus de calcul (avec redondance)
- Données – peuvent être non structurées/sans schéma (contrairement aux RDBMS)
- Responsabilité du développeur de donner du sens aux données
- Programmation de MapReduce = travail avec Java (avantages/inconvénients), chargement manuel des données dans HDFS
Jour-2: Session-1: Écosystème Big Data – Construire le ETL Big Data : univers des outils Big Data – lequel utiliser et quand ?
- Hadoop vs. Autres solutions NoSQL
- Pour l'accès interactif et aléatoire aux données
- Hbase (base de données orientée colonnes) sur Hadoop
- Accès aléatoire aux données mais avec restrictions (max 1 Po)
- Pas bon pour l'analyse ad hoc, bon pour la journalisation, le comptage, les séries temporelles
- Sqoop - Import depuis des bases de données vers Hive ou HDFS (accès JDBC/ODBC)
- Flume – flux de données (par exemple données de journalisation) vers HDFS
Jour-2: Session-2: Système de gestion Big Data
- Parties mobiles, démarrage/échec des nœuds de calcul : ZooKeeper - Pour les services de configuration/coordination/nommage
- Complexité pipeline/workflow : Oozie – gérer les workflows, dépendances, enchaînement
- Déployer, configurer, gérer le cluster, mettre à jour, etc. (admin système) : Ambari
- Dans le Cloud : Whirr
Jour-2: Session-3: Analyse prédictive en Intelligence économique -1 : Techniques fondamentales & BI basée sur l'apprentissage automatique :
- Introduction à l'apprentissage automatique
- Techiques d'apprentissage de classification
- Prédiction bayésienne – préparation du fichier d'entraînement
- Machine à vecteurs de support
- KNN p-Tree Algèbre & mining vertical
- Réseau de neurones
- Problème de grandes variables en Big Data – Forêt aléatoire (RF)
- Problème d'automatisation en Big Data – Ensembles multi-modèles RF
- Automatisation via Soft10-M
- Outil d'analyse texte - Treeminer
- Apprentissage agile
- Apprentissage basé sur des agents
- Apprentissage distribué
- Introduction aux outils open source pour l'analyse prédictive : R, Rapidminer, Mahut
Jour-2: Session-4: Écosystème d'analyse prédictive -2 : Problèmes d'analyse prédictive courants dans le gouvernement
- Analyse d'insight
- Analyse de visualisation
- Analyse prédictive structurée
- Analyse prédictive non structurée
- Profilage des menaces/fraudeurs/fournisseurs
- Moteur de recommandation
- Détection de motifs
- Découverte de règles/scénarios – échec, fraude, optimisation
- Découverte de la cause première
- Analyse des sentiments
- Analyse CRM
- Analyse de réseau
- Analyse de texte
- Assistance à la révision par la technologie
- Analyse de la fraude
- Analyse en temps réel
Jour-3 : Session-1 : Analyse en temps réel et scalable sur Hadoop
- Pourquoi les algorithmes d'analyse courants échouent sur Hadoop/HDFS
- Apache Hama - pour le calcul distribué synchrone par lot
- Apache SPARK - pour le calcul cluster pour l'analyse en temps réel
- CMU Graphics Lab2 - Approche asynchrone basée sur les graphes pour le calcul distribué
- Approche basée sur KNN p-Algèbre de Treeminer pour réduire le coût matériel des opérations
Jour-3: Session-2: Outils pour l'eDiscovery et la forensique
- eDiscovery sur Big Data vs données héritées – comparaison des coûts et des performances
- Prédiction par codage et assistance à la révision par la technologie (TAR)
- Démonstration live d'un produit TAR (vMiner) pour comprendre comment le TAR fonctionne pour une découverte plus rapide
- Indexation plus rapide via HDFS – vélocité des données
- NLP ou Traitement du langage naturel – diverses techniques et produits open source
- eDiscovery en langues étrangères – technologie pour le traitement des langues étrangères
Jour-3 : Session 3: Big Data BI pour la Cybersécurité – Compréhension de la vue à 360 degrés de la collecte rapide des données à l'identification des menaces
- Compréhension des bases de l'analyse de la sécurité – surface d'attaque, mauvaise configuration de la sécurité, défenses de l'hôte
- Infrastructure réseau / Grande canal de données / ETL de réponse pour l'analyse en temps réel
- Prescriptif vs prédictif – Règles fixes basées sur des règles vs découverte automatique des règles de menaces depuis les métadonnées
Jour-3: Session 4: Big Data dans l'USDA : Application dans l'Agriculture
- Introduction à l'IoT (Internet des Objets) pour l'agriculture – Big Data basé sur des capteurs et contrôle
- Introduction à l'imagerie par satellite et son application dans l'agriculture
- Intégration des données de capteurs et d'images pour la fertilité du sol, les recommandations de culture et les prévisions
- Assurance agricole et Big Data
- Prévision des pertes de récolte
Jour-4 : Session-1: BI de prévention de la fraude depuis le Big Data dans le gouvernement – Analyse de la fraude:
- Classification de base des analyses de fraude – basée sur des règles vs analyse prédictive
- Apprentissage automatique supervisé vs non supervisé pour la détection de motifs de fraude
- Fraude fournisseur / facturation excessive pour des projets
- Fraude Medicare et Medicaid – techniques de détection de fraude pour le traitement des réclamations
- Fraudes de remboursement de voyage
- Fraudes de remboursement IRS
- Des études de cas et des démonstrations live seront données là où des données sont disponibles.
Jour-4 : Session-2: Analyse des Réseaux Sociaux – Collecte et analyse de renseignement
- API ETL Big Data pour l'extraction de données des réseaux sociaux
- Texte, image, métadonnées et vidéo
- Analyse des sentiments à partir des flux de réseaux sociaux
- Filtrage contextuel et non contextuel des flux de réseaux sociaux
- Tableau de bord des réseaux sociaux pour intégrer les divers réseaux sociaux
- Profilage automatisé des profils de réseaux sociaux
- Une démonstration live de chaque analyse sera donnée via l'outil Treeminer.
Jour-4 : Session-3: Analyse Big Data dans le traitement d'images et les flux vidéo
- Techniques de stockage d'images en Big Data – Solution de stockage pour des données dépassant les pétaoctets
- LTFS et LTO
- GPFS-LTFS (Solution de stockage en couches pour de grandes données d'images)
- Fondamentaux de l'analyse d'images
- Reconnaissance d'objets
- Segmentation d'images
- Suivi du mouvement
- Reconstruction d'images 3D
Jour-4: Session-4: Applications du Big Data dans le NIH:
- Développement des domaines de la Bio-informatique
- Métapénomique et problèmes de mining de Big Data
- Analyse prédictive Big Data pour la Pharmacogénomique, la Métabolomique et la Protéomique
- Big Data dans le processus génomique en aval
- Application de l'analyse prédictive Big Data en santé publique
Tableau de bord Big Data pour l'accessibilité rapide de données diverses et leur affichage :
- Intégration de la plateforme d'application existante avec le Tableau de bord Big Data
- Gestion du Big Data
- Étude de cas de Tableau de bord Big Data : Tableau et Pentaho
- Utilisation de l'app Big Data pour pousser les services basés sur la localisation dans le gouvernement.
- Système de suivi et de gestion
Jour-5 : Session-1: Comment justifier la mise en œuvre de la BI Big Data au sein d'une organisation:
- Définition du ROI pour la mise en œuvre du Big Data
- Études de cas pour l'économie du temps des analystes pour la collecte et la préparation des données – augmentation du gain de productivité
- Études de cas de gains de revenus grâce à l'économie des coûts des bases de données sous licence
- Gains de revenus grâce aux services basés sur la localisation
- Économies grâce à la prévention de la fraude
- Une approche de tableur intégrée pour calculer approximativement les dépenses vs les gains de revenus/économies de la mise en œuvre du Big Data.
Jour-5 : Session-2: Procédure étape par étape pour remplacer un système de données hérité par un système Big Data:
- Compréhension d'une feuille de route pratique de migration Big Data
- Quelles sont les informations importantes nécessaires avant l'architecture d'une mise en œuvre Big Data
- Quelles sont les différentes façons de calculer le volume, la vélocité, la variété et la véracité des données
- Comment estimer la croissance des données
- Études de cas
Jour-5: Session 4: Revue des fournisseurs Big Data et revue de leurs produits. Session questions/réponses:
- Accenture
- APTEAN (anciennement CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anciennement 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Partie d'EMC)
Pré requis
- Connaissances de base des opérations commerciales et des systèmes de données du gouvernement dans leur domaine
- Compréhension de base de SQL/Oracle ou des bases de données relationnelles
- Compréhension de base de la Statistique (au niveau des tableurs)
35 Heures
Nos clients témoignent (1)
La capacité du formateur à aligner le cours sur les exigences de l'organisation, et non simplement à le dispenser pour le principe de sa livraison.
Masilonyane - Revenue Services Lesotho
Formation - Big Data Business Intelligence for Govt. Agencies
Traduction automatique