Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Introduction à la multimodalité de Gemini 3
- Capacités à travers le texte, les images, l'audio et la vidéo
- Sélection des modèles et aperçu des points de terminaison
- Concepts clés du raisonnement multimodal
Travailler avec le texte et les entrées structurées
- Stratégies de prompting pour la génération de texte
- Métadonnées, fenêtres de contexte et intégrations (embeddings)
- Orchestration basée sur le texte des tâches multimodales
Compréhension des images et flux de travail visuels
- Analyse et interprétation d'images avec Gemini 3
- Création d'outils de recherche visuelle et de balisage
- Construction d'interactions image-versus-texte et texte-versus-image
Traitement des entrées audio
- Flux de travail de reconnaissance et de transcription vocale
- Détection et interprétation d'événements audio
- Intégration de l'audio avec les entrées textuelles et visuelles
Intelligence vidéo et analyse de scènes
- Raisonnement vidéo image par image et continu
- Création d'outils de résumés et d'extraction de points forts
- Automatisation et flux de contenu basés sur la vidéo
Conception d'architectures d'applications multimodales
- Combinaison de plusieurs types d'entrée dans un pipeline unique
- Considérations liées à la latence, aux coûts et aux capacités de calcul
- Meilleures pratiques pour les systèmes multimodaux évolutifs
Prototypage d'applications multimodales
- Création pratique de prototypes multimodaux
- Itération rapide par ingénierie de prompts
- Test et affinage des flux d'expérience utilisateur
Déploiement de solutions multimodales
- Stratégies de déploiement et configuration de l'environnement
- Suivi de la performance en conditions réelles
- Considérations en matière de sécurité et de conformité
Synthèse et prochaines étapes
Pré requis
- Compréhension des concepts modernes de l'IA
- Expérience avec Python ou JavaScript
- Connaissance des API REST
Public cible
- Concepteurs
- Créateurs de contenu
- Équipes produit techniques
Nos clients témoignent (1)
Fluidez, ambiance et thème de la présentation
Lukasz Kowalczyk - Allegro Sp. z o.o.
Formation - Google Gemini AI for Data Analysis
Traduction automatique