Médias génératifs : IA d'image, d'audio et de vidéo
L'essentiel d'AILmanac concerne l'IA qui écrit et raisonne — les modèles de texte comme Claude. Mais toute une autre branche de l'IA fabrique des médias : images, vidéos, voix et musique à partir d'un prompt. Cette page est une carte neutre vis-à-vis des fournisseurs de ce paysage : les archétypes, les outils notables (chacun vérifié comme existant), en quoi ils diffèrent des LLM de texte, les compétences qui se transfèrent, et les règles de droits et d'éthique que vous ne pouvez pas ignorer.
- Connaître les principaux archétypes des médias génératifs — image, vidéo, voix/musique, reconnaissance vocale — et un outil réel dans chacun
- Comprendre en quoi les modèles de médias diffèrent d'un modèle de chat textuel comme Claude
- Apprendre les compétences durables : le prompting pour les médias, l'itération et les entrées de référence
- Respecter les incontournables : droits d'usage, provenance/filigrane, et éthique des deepfakes/du consentement
En quoi les modèles de médias diffèrent d'un LLM de texte
Si vous n'avez utilisé qu'un modèle de chat, quatre différences comptent :
- Sortie différente, « correct » différent. Un modèle de texte renvoie une seule meilleure réponse, en grande partie déterministe. Un modèle de médias renvoie un artefact (une image, un clip, une prise de voix) où il n'y a pas de bonne réponse unique — seulement celles que vous aimez plus ou moins. Vous en générez plusieurs et vous choisissez.
- On ne peut généralement pas modifier la sortie en modifiant le prompt seul. Changer un mot peut transformer toute l'image. Le vrai contrôle vient des entrées de référence (une image de départ, une image de style, une voix de référence) plus des contrôles propres à l'outil, pas seulement des mots.
- Les seeds et la variation font partie du workflow. Beaucoup d'outils vous permettent de relancer, de faire varier ou de verrouiller un « seed » pour la reproductibilité. L'itération est la norme, pas un échec.
- L'unité de coût est différente. Le texte se facture par tokens ; les médias se facturent par image, seconde de vidéo, ou caractère/minute d'audio — et la vidéo en particulier peut vite devenir coûteuse.
- Modèle mental : un modèle de texte est un rédacteur qui vous donne la réponse ; un modèle de médias est une machine à sous avec un volant — vous tirez, puis vous dirigez avec des références et des relances jusqu'à ce que ce soit juste.
- Générez un lot et sélectionnez. Votre goût — savoir laquelle de 4 sorties est la meilleure — représente la moitié de la compétence.
La carte : archétypes et outils notables
Pensez en archétypes — les compositions changent constamment, les catégories sont stables. Chaque outil nommé ci-dessous a été vérifié comme existant avec une vraie URL (dans les Sources) ; les versions spécifiques sont volontairement laissées vagues car elles évoluent sans cesse.
Génération d'images (texte vers image)
Transformez un prompt textuel — et, en option, des images de référence — en une image fixe.
- Midjourney — fermé, hébergé ; connu pour une esthétique par défaut affirmée et des contrôles de style/référence.
- Génération d'images d'OpenAI (la lignée DALL·E / GPT Image) — fermée, hébergée ; étroitement intégrée à ChatGPT et à l'API.
- La génération d'images Gemini de Google (« Nano Banana ») et Imagen — fermées, hébergées ; intégrées à Gemini et à Google Cloud.
- Adobe Firefly — fermé, hébergé ; conçu pour les workflows créatifs et entraîné en pensant à l'usage commercial (voir les droits, plus bas).
- Stable Diffusion (Stability AI) et FLUX (Black Forest Labs) — familles de modèles à poids ouverts que vous pouvez télécharger et exécuter vous-même, l'épine dorsale de l'écosystème d'images local/ouvert.
Génération de vidéos (texte/image vers vidéo)
Générez de courts clips — de plus en plus avec un audio synchronisé — à partir d'un prompt ou d'une image de départ.
- OpenAI Sora — un modèle vidéo de pointe (note : l'application grand public autonome a été abandonnée ; le modèle a continué via l'API — un exemple classique de la raison pour laquelle les versions/disponibilités deviennent obsolètes).
- Google Veo — vidéo de pointe, avec audio natif dans les versions récentes.
- Runway — une suite créative construite autour de ses modèles vidéo de la série Gen.
- Kling (par Kuaishou) et Pika — outils vidéo en évolution rapide, populaires pour le contenu social/format court.
Voix, parole et musique (audio)
- ElevenLabs — fermé, hébergé ; synthèse vocale réaliste et outils de voix (le clonage de voix a de réelles implications de consentement — voir l'éthique).
- Suno et Udio — génèrent des chansons complètes (voix + instrumentation) à partir d'un prompt textuel.
- OpenAI Whisper — la direction inverse : reconnaissance vocale (transcription). Il est à poids ouverts (sous licence MIT), vous pouvez donc l'exécuter vous-même ou appeler une API hébergée. La reconnaissance vocale est la discrète bête de somme derrière les sous-titres, les notes vocales et les transcriptions de réunions.
- La plus grande bifurcation (identique à celle des modèles de texte) : les outils hébergés FERMÉS (souvent la meilleure qualité, le moins de configuration) contre les modèles à POIDS OUVERTS comme Stable Diffusion, FLUX et Whisper que vous pouvez auto-héberger pour la confidentialité, le contrôle et un coût plus bas à grande échelle.
- Ne choisissez pas par classement. Pour votre rendu/son réel, générez quelques exemples concrets dans 2-3 outils et jugez avec vos propres yeux et oreilles.
Comment obtenir un bon résultat d'un modèle de médias
Le workflow ressemble davantage à une séance photo qu'à une recherche Google. Ces étapes sont indépendantes de l'outil :
- Commencez par le sujet principal, puis ajoutez le décor, l'action et l'ambiance. « Un renard roux » est faible ; « un renard roux endormi en boule dans la neige fraîche, douce lumière du matin » donne au modèle de quoi travailler.
- Dites de QUEL TYPE d'image/vidéo/voix il s'agit : photo contre illustration contre rendu 3D ; caméra/objectif ou style artistique ; pour l'audio, le genre, le tempo et le ton émotionnel. Le style est là où réside l'essentiel du rendu.
- Une image de départ, une image de référence de style ou un extrait de voix de référence contrôle le résultat bien plus fiablement que des adjectifs. C'est la compétence durable que les prompteurs limités au texte manquent.
- Produisez plusieurs variations. Choisissez la plus proche — votre goût fait partie de l'outil. Ne vous attendez pas à ce que la première tentative soit la bonne.
- Changez UNE chose à la fois (l'éclairage, ou la pose, ou la palette) et relancez, ou utilisez les fonctions d'édition/variation/inpainting de l'outil. Réécrire tout le prompt à chaque fois perd ce qui fonctionnait.
- Confirmez que la licence couvre votre usage (commercial ?), et conservez/attachez la provenance (Content Credentials) pour que l'actif soit traçable. Indiquez qu'il est généré par IA là où cela compte.
Exemple de prompt de génération d'image (médium → sujet → style → détails)
A cinematic wide-angle photograph of a lighthouse on a rocky cliff at golden hour, waves crashing below, dramatic storm clouds parting. Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field. Mood: hopeful, epic. Aspect ratio 16:9. Tip: if the result is close, change ONE element next pass (e.g. "blue hour" instead of "golden hour") and re-roll — or add a reference image to lock the look.
Droits, provenance et éthique — les incontournables
L'IA de médias soulève des questions que le chat textuel ne pose généralement pas. Traitez-les comme faisant partie du travail, pas comme une réflexion après coup.
Droits d'usage et commerciaux. Chaque outil a sa propre licence, et elles diffèrent beaucoup. Certaines restreignent l'usage commercial, certaines ne l'accordent que sur les paliers payants, et les sorties peuvent ressembler à des œuvres protégées par droit d'auteur ou marque déposée. Adobe Firefly, par exemple, s'appuie sur des données d'entraînement choisies avec la sécurité commerciale à l'esprit — mais vous devriez tout de même lire la véritable licence de l'outil et du palier que vous utilisez plutôt que de supposer.
Provenance et filigrane. Une norme grandissante, C2PA / Content Credentials, attache des métadonnées de type « étiquette nutritionnelle » infalsifiables consignant comment un actif a été fabriqué et modifié. Beaucoup d'outils majeurs d'image et de vidéo l'intègrent désormais. Gardez cette provenance intacte, et privilégiez les outils qui la prennent en charge — elle devient la norme pour des médias dignes de confiance.
Deepfakes, voix et consentement. La génération réaliste de visages et de voix peut usurper l'identité de personnes réelles. Ne clonez pas une voix ou une apparence sans consentement explicite, n'utilisez jamais de médias générés pour tromper, et respectez la loi de votre juridiction. Le consentement au clonage de voix et la divulgation du contenu généré par IA ne relèvent pas seulement de l'étiquette — ce sont de plus en plus des obligations légales.
- Les médias générés peuvent comporter des limites de droits d'usage et des risques de deepfake/consentement — vérifiez la licence de chaque outil et signalez le contenu généré par IA.
Ce qui se transfère de vos compétences en IA de texte
Bonne nouvelle : une grande partie de ce que vous savez déjà se transfère.
- Un prompting clair et spécifique — être concret sur ce que vous voulez l'emporte sur les souhaits vagues, dans toutes les modalités.
- L'itération plutôt que le coup unique — la même boucle « brouillon, critique, affinage » que vous utiliseriez avec Claude s'applique, simplement avec des relances et des images de référence au lieu de messages de suivi. Voir Les bases du prompting.
- Choisir le bon outil pour la tâche — le cadre de Choisir un modèle (les contraintes d'abord, puis un petit test dans le monde réel) fonctionne tout aussi bien pour les médias.
- Comprendre ce que le modèle est réellement — savoir que ce sont des apprenants de motifs, pas de la magie, garde vos attentes et votre éthique en ordre. Voir Fondamentaux.
Testez-vous
Testez-vous
0/4Flashcards
- Les médias génératifs constituent une branche de l'IA distincte du chat textuel : elle fabrique des images, des vidéos, des voix et de la musique, et vous la dirigez avec des références et des relances, pas seulement des mots.
- Pensez en archétypes — image, vidéo, voix/musique, reconnaissance vocale — et souvenez-vous de la bifurcation fermé/poids ouverts (par ex. Midjourney contre Stable Diffusion/FLUX ; synthèse vocale hébergée contre Whisper ouvert).
- Les compétences durables se transfèrent depuis l'IA de texte : un prompting spécifique, l'itération, et le choix du bon outil pour la tâche.
- Les droits et l'éthique font partie du travail : vérifiez la licence de votre outil et de votre palier, gardez la provenance (C2PA/Content Credentials), obtenez le consentement pour les voix/apparences, et signalez les médias générés par IA.
- Les spécificités se périment vite — vérifiez les versions, les prix et les capacités par rapport à la page propre à chaque outil avant de vous y fier.
Sources et lectures complémentaires
- Midjourney — https://www.midjourney.com/
- Génération d'images OpenAI (DALL·E 3) — https://openai.com/index/dall-e-3/
- Guide de l'API de génération d'images OpenAI — https://platform.openai.com/docs/guides/image-generation
- Google — génération d'images Gemini (« Nano Banana ») — https://gemini.google/overview/image-generation/
- Google DeepMind — Veo (vidéo) — https://deepmind.google/models/veo/
- Adobe Firefly — https://firefly.adobe.com/
- Black Forest Labs — FLUX — https://bfl.ai/
- OpenAI Sora — https://openai.com/index/sora/
- Runway — https://runwayml.com/
- Kling (Kuaishou) — https://kling.ai/
- Pika — https://pika.art/
- ElevenLabs — https://elevenlabs.io/
- Suno — https://suno.com/
- Udio — https://www.udio.com/
- OpenAI Whisper (reconnaissance vocale open source) — https://github.com/openai/whisper
- C2PA — Coalition for Content Provenance and Authenticity — https://c2pa.org/
- Content Credentials — https://contentcredentials.org/
- Artificial Analysis (traqueur indépendant de modèles/prix) — https://artificialanalysis.ai/