Prenez contact avec nous

Plan du cours

Chaque session dure 2 heures

Jour-1 : Session -1 : Aperçu métier des raisons d'adopter l'Intelligence économique sur les méga-données dans le gouvernement

  • Études de cas du NIH, DoE
  • Taux d'adaptation du Big Data dans les agences gouvernementales et comment elles alignent leurs opérations futures autour de l'analyse prédictive Big Data
  • Domainses d'application à grande échelle dans le DoD, la NSA, l'IRS, l'USDA, etc.
  • Interopérabilité du Big Data avec les données héritées (legacy)
  • Compréhension de base des technologies habilitantes en analyse prédictive
  • Intégration des données & visualisation par tableaux de bord
  • Gestion de la fraude
  • Génération de règles métier / détection de fraude
  • Détection de menaces et profilage
  • Analyse des coûts et avantages pour la mise en œuvre du Big Data

Jour-1 : Session-2 : Introduction au Big Data-1

  • Caractéristiques principales du Big Data : volume, variété, vélocité et véracité. Architecture MPP pour le volume.
  • Entrepôts de données – schéma statique, jeu de données évoluant lentement
  • Bases de données MPP comme Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Solutions basées sur Hadoop – aucune condition sur la structure du jeu de données.
  • Modèle typique : HDFS, MapReduce (crunch), récupération depuis HDFS
  • Batch – adapté à l'analyse / non interactif
  • Volume : données de streaming CEP
  • Choix typiques – produits CEP (par exemple Infostreams, Apama, MarkLogic, etc.)
  • Moins prêts pour la production – Storm/S4
  • Bases de données NoSQL – (colonnaires et clé-valeur) : Les mieux adaptées comme adjoint analytique à l'entrepôt de données/base de données

Jour-1 : Session -3 : Introduction au Big Data-2

Solutions NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hiérarchique) - GT.m, Cache
  • KV Store (Trié) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Base de données objets - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variétés de Données : Introduction aux problèmes de nettoyage de données en Big Data

  • RDBMS – structure/schéma statique, ne favorise pas un environnement agile et exploratoire.
  • NoSQL – semi-structuré, assez structuré pour stocker les données sans schéma exact avant le stockage
  • Problèmes de nettoyage des données

Jour-1 : Session-4 : Introduction au Big Data-3 : Hadoop

  • Quand choisir Hadoop ?
  • STRUCTURÉ - Les entrepôts de données/bases de données d'entreprise peuvent stocker des données massives (au prix fort) mais imposent une structure (pas bon pour l'exploration active)
  • Données SEMI-STRUCTURÉES – difficile à gérer avec les solutions traditionnelles (DW/DB)
  • Entreposage de données = énorme effort et statique même après la mise en œuvre
  • Pour la variété & le volume de données, traité sur du matériel grand public – HADOOP
  • Matériel grand public (H/W) nécessaire pour créer un cluster Hadoop

Introduction à MapReduce /HDFS

  • MapReduce – distribution du calcul sur plusieurs serveurs
  • HDFS – met les données à disposition localement pour le processus de calcul (avec redondance)
  • Données – peuvent être non structurées/sans schéma (contrairement aux RDBMS)
  • Responsabilité du développeur de donner du sens aux données
  • Programmation de MapReduce = travail avec Java (avantages/inconvénients), chargement manuel des données dans HDFS

Jour-2: Session-1: Écosystème Big Data – Construire le ETL Big Data : univers des outils Big Data – lequel utiliser et quand ?

  • Hadoop vs. Autres solutions NoSQL
  • Pour l'accès interactif et aléatoire aux données
  • Hbase (base de données orientée colonnes) sur Hadoop
  • Accès aléatoire aux données mais avec restrictions (max 1 Po)
  • Pas bon pour l'analyse ad hoc, bon pour la journalisation, le comptage, les séries temporelles
  • Sqoop - Import depuis des bases de données vers Hive ou HDFS (accès JDBC/ODBC)
  • Flume – flux de données (par exemple données de journalisation) vers HDFS

Jour-2: Session-2: Système de gestion Big Data

  • Parties mobiles, démarrage/échec des nœuds de calcul : ZooKeeper - Pour les services de configuration/coordination/nommage
  • Complexité pipeline/workflow : Oozie – gérer les workflows, dépendances, enchaînement
  • Déployer, configurer, gérer le cluster, mettre à jour, etc. (admin système) : Ambari
  • Dans le Cloud : Whirr

Jour-2: Session-3: Analyse prédictive en Intelligence économique -1 : Techniques fondamentales & BI basée sur l'apprentissage automatique :

  • Introduction à l'apprentissage automatique
  • Techiques d'apprentissage de classification
  • Prédiction bayésienne – préparation du fichier d'entraînement
  • Machine à vecteurs de support
  • KNN p-Tree Algèbre & mining vertical
  • Réseau de neurones
  • Problème de grandes variables en Big Data – Forêt aléatoire (RF)
  • Problème d'automatisation en Big Data – Ensembles multi-modèles RF
  • Automatisation via Soft10-M
  • Outil d'analyse texte - Treeminer
  • Apprentissage agile
  • Apprentissage basé sur des agents
  • Apprentissage distribué
  • Introduction aux outils open source pour l'analyse prédictive : R, Rapidminer, Mahut

Jour-2: Session-4: Écosystème d'analyse prédictive -2 : Problèmes d'analyse prédictive courants dans le gouvernement

  • Analyse d'insight
  • Analyse de visualisation
  • Analyse prédictive structurée
  • Analyse prédictive non structurée
  • Profilage des menaces/fraudeurs/fournisseurs
  • Moteur de recommandation
  • Détection de motifs
  • Découverte de règles/scénarios – échec, fraude, optimisation
  • Découverte de la cause première
  • Analyse des sentiments
  • Analyse CRM
  • Analyse de réseau
  • Analyse de texte
  • Assistance à la révision par la technologie
  • Analyse de la fraude
  • Analyse en temps réel

Jour-3 : Session-1 : Analyse en temps réel et scalable sur Hadoop

  • Pourquoi les algorithmes d'analyse courants échouent sur Hadoop/HDFS
  • Apache Hama - pour le calcul distribué synchrone par lot
  • Apache SPARK - pour le calcul cluster pour l'analyse en temps réel
  • CMU Graphics Lab2 - Approche asynchrone basée sur les graphes pour le calcul distribué
  • Approche basée sur KNN p-Algèbre de Treeminer pour réduire le coût matériel des opérations

Jour-3: Session-2: Outils pour l'eDiscovery et la forensique

  • eDiscovery sur Big Data vs données héritées – comparaison des coûts et des performances
  • Prédiction par codage et assistance à la révision par la technologie (TAR)
  • Démonstration live d'un produit TAR (vMiner) pour comprendre comment le TAR fonctionne pour une découverte plus rapide
  • Indexation plus rapide via HDFS – vélocité des données
  • NLP ou Traitement du langage naturel – diverses techniques et produits open source
  • eDiscovery en langues étrangères – technologie pour le traitement des langues étrangères

Jour-3 : Session 3: Big Data BI pour la Cybersécurité – Compréhension de la vue à 360 degrés de la collecte rapide des données à l'identification des menaces

  • Compréhension des bases de l'analyse de la sécurité – surface d'attaque, mauvaise configuration de la sécurité, défenses de l'hôte
  • Infrastructure réseau / Grande canal de données / ETL de réponse pour l'analyse en temps réel
  • Prescriptif vs prédictif – Règles fixes basées sur des règles vs découverte automatique des règles de menaces depuis les métadonnées

Jour-3: Session 4: Big Data dans l'USDA : Application dans l'Agriculture

  • Introduction à l'IoT (Internet des Objets) pour l'agriculture – Big Data basé sur des capteurs et contrôle
  • Introduction à l'imagerie par satellite et son application dans l'agriculture
  • Intégration des données de capteurs et d'images pour la fertilité du sol, les recommandations de culture et les prévisions
  • Assurance agricole et Big Data
  • Prévision des pertes de récolte

Jour-4 : Session-1: BI de prévention de la fraude depuis le Big Data dans le gouvernement – Analyse de la fraude:

  • Classification de base des analyses de fraude – basée sur des règles vs analyse prédictive
  • Apprentissage automatique supervisé vs non supervisé pour la détection de motifs de fraude
  • Fraude fournisseur / facturation excessive pour des projets
  • Fraude Medicare et Medicaid – techniques de détection de fraude pour le traitement des réclamations
  • Fraudes de remboursement de voyage
  • Fraudes de remboursement IRS
  • Des études de cas et des démonstrations live seront données là où des données sont disponibles.

Jour-4 : Session-2: Analyse des Réseaux Sociaux – Collecte et analyse de renseignement

  • API ETL Big Data pour l'extraction de données des réseaux sociaux
  • Texte, image, métadonnées et vidéo
  • Analyse des sentiments à partir des flux de réseaux sociaux
  • Filtrage contextuel et non contextuel des flux de réseaux sociaux
  • Tableau de bord des réseaux sociaux pour intégrer les divers réseaux sociaux
  • Profilage automatisé des profils de réseaux sociaux
  • Une démonstration live de chaque analyse sera donnée via l'outil Treeminer.

Jour-4 : Session-3: Analyse Big Data dans le traitement d'images et les flux vidéo

  • Techniques de stockage d'images en Big Data – Solution de stockage pour des données dépassant les pétaoctets
  • LTFS et LTO
  • GPFS-LTFS (Solution de stockage en couches pour de grandes données d'images)
  • Fondamentaux de l'analyse d'images
  • Reconnaissance d'objets
  • Segmentation d'images
  • Suivi du mouvement
  • Reconstruction d'images 3D

Jour-4: Session-4: Applications du Big Data dans le NIH:

  • Développement des domaines de la Bio-informatique
  • Métapénomique et problèmes de mining de Big Data
  • Analyse prédictive Big Data pour la Pharmacogénomique, la Métabolomique et la Protéomique
  • Big Data dans le processus génomique en aval
  • Application de l'analyse prédictive Big Data en santé publique

Tableau de bord Big Data pour l'accessibilité rapide de données diverses et leur affichage :

  • Intégration de la plateforme d'application existante avec le Tableau de bord Big Data
  • Gestion du Big Data
  • Étude de cas de Tableau de bord Big Data : Tableau et Pentaho
  • Utilisation de l'app Big Data pour pousser les services basés sur la localisation dans le gouvernement.
  • Système de suivi et de gestion

Jour-5 : Session-1: Comment justifier la mise en œuvre de la BI Big Data au sein d'une organisation:

  • Définition du ROI pour la mise en œuvre du Big Data
  • Études de cas pour l'économie du temps des analystes pour la collecte et la préparation des données – augmentation du gain de productivité
  • Études de cas de gains de revenus grâce à l'économie des coûts des bases de données sous licence
  • Gains de revenus grâce aux services basés sur la localisation
  • Économies grâce à la prévention de la fraude
  • Une approche de tableur intégrée pour calculer approximativement les dépenses vs les gains de revenus/économies de la mise en œuvre du Big Data.

Jour-5 : Session-2: Procédure étape par étape pour remplacer un système de données hérité par un système Big Data:

  • Compréhension d'une feuille de route pratique de migration Big Data
  • Quelles sont les informations importantes nécessaires avant l'architecture d'une mise en œuvre Big Data
  • Quelles sont les différentes façons de calculer le volume, la vélocité, la variété et la véracité des données
  • Comment estimer la croissance des données
  • Études de cas

Jour-5: Session 4: Revue des fournisseurs Big Data et revue de leurs produits. Session questions/réponses:

  • Accenture
  • APTEAN (anciennement CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (anciennement 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Partie d'EMC)

Pré requis

  • Connaissances de base des opérations commerciales et des systèmes de données du gouvernement dans leur domaine
  • Compréhension de base de SQL/Oracle ou des bases de données relationnelles
  • Compréhension de base de la Statistique (au niveau des tableurs)
 35 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (1)

Cours à venir

Catégories Similaires