Texte, image, vidéo et audio : évolution des modèles génératifs, multimodalité, agents et limites pour un usage professionnel responsable.
Résumé de la veille
L'IA générative est devenue multimodale et industrielle : en moins de six mois, OpenAI enchaîne
GPT-Image-1.5 (décembre 2025) puis ChatGPT Images 2.0 (avril 2026), tandis que Google déploie Veo 3.1 pour la vidéo
avec son natif et l'extension de scènes via l'API Gemini. La course OpenAI / Google pousse des cycles de mise à jour
très courts ; LMArena sert d'antenne pour détecter les modèles avant annonce officielle.
Les progrès les plus visibles concernent le texte dans l'image (infographies, manga, 4K) et la
vidéo courte professionnelle (storyboards, teasers). Les limites restent réelles : hallucinations,
coûts API, droits d'auteur et risque de désinformation. En BTS SIO, l'IA générative est un accélérateur de prototypage
et de documentation, jamais un substitut à la validation technique et à la responsabilité du développeur.
Contexte et problématique
Depuis ChatGPT (fin 2022), l'IA générative a élargi son spectre : aujourd'hui un même écosystème peut produire
du code, des images photoréalistes, des vidéos avec son natif
et de la synthèse vocale. Les cycles de mise à jour se sont raccourcis : GPT-Image-1.5 en décembre 2025,
puis ChatGPT Images 2.0 en avril 2026 ; Veo 3.1 côté Google en fin 2025.
Ma veille analyse comment ces outils transforment la création numérique (design, prototypage, marketing, développement),
quelles limites techniques persistent (hallucinations, texte dans l'image, cohérence des personnages)
et quelles bonnes pratiques adopter en contexte scolaire et professionnel.
Multimodal
GPT / Gemini
Image
Vidéo
Agents
API
Synthèse personnelle
En 2026, l'IA générative n'est plus un simple « générateur d'images » : c'est une chaîne de production
multimodale accessible via API. La compétence d'un futur développeur SLAM n'est pas de tout générer automatiquement,
mais de orchestrer les bons modèles, vérifier les sorties, respecter les licences et garder la
responsabilité métier (accessibilité, vérité des contenus, performance). La veille sur ce sujet est indispensable
tant que les modèles changent plusieurs fois par an.