Aller au contenu principal

Médias génératifs : IA d'image, d'audio et de vidéo

Débutant

L'essentiel d'AILmanac concerne l'IA qui écrit et raisonne — les modèles de texte comme Claude. Mais toute une autre branche de l'IA fabrique des médias : images, vidéos, voix et musique à partir d'un prompt. Cette page est une carte neutre vis-à-vis des fournisseurs de ce paysage : les archétypes, les outils notables (chacun vérifié comme existant), en quoi ils diffèrent des LLM de texte, les compétences qui se transfèrent, et les règles de droits et d'éthique que vous ne pouvez pas ignorer.

What you'll learn
  • Connaître les principaux archétypes des médias génératifs — image, vidéo, voix/musique, reconnaissance vocale — et un outil réel dans chacun
  • Comprendre en quoi les modèles de médias diffèrent d'un modèle de chat textuel comme Claude
  • Apprendre les compétences durables : le prompting pour les médias, l'itération et les entrées de référence
  • Respecter les incontournables : droits d'usage, provenance/filigrane, et éthique des deepfakes/du consentement

En quoi les modèles de médias diffèrent d'un LLM de texte

Si vous n'avez utilisé qu'un modèle de chat, quatre différences comptent :

  • Sortie différente, « correct » différent. Un modèle de texte renvoie une seule meilleure réponse, en grande partie déterministe. Un modèle de médias renvoie un artefact (une image, un clip, une prise de voix) où il n'y a pas de bonne réponse unique — seulement celles que vous aimez plus ou moins. Vous en générez plusieurs et vous choisissez.
  • On ne peut généralement pas modifier la sortie en modifiant le prompt seul. Changer un mot peut transformer toute l'image. Le vrai contrôle vient des entrées de référence (une image de départ, une image de style, une voix de référence) plus des contrôles propres à l'outil, pas seulement des mots.
  • Les seeds et la variation font partie du workflow. Beaucoup d'outils vous permettent de relancer, de faire varier ou de verrouiller un « seed » pour la reproductibilité. L'itération est la norme, pas un échec.
  • L'unité de coût est différente. Le texte se facture par tokens ; les médias se facturent par image, seconde de vidéo, ou caractère/minute d'audio — et la vidéo en particulier peut vite devenir coûteuse.
Pro tip
  • Modèle mental : un modèle de texte est un rédacteur qui vous donne la réponse ; un modèle de médias est une machine à sous avec un volant — vous tirez, puis vous dirigez avec des références et des relances jusqu'à ce que ce soit juste.
  • Générez un lot et sélectionnez. Votre goût — savoir laquelle de 4 sorties est la meilleure — représente la moitié de la compétence.

La carte : archétypes et outils notables

Pensez en archétypes — les compositions changent constamment, les catégories sont stables. Chaque outil nommé ci-dessous a été vérifié comme existant avec une vraie URL (dans les Sources) ; les versions spécifiques sont volontairement laissées vagues car elles évoluent sans cesse.

Génération d'images (texte vers image)

Transformez un prompt textuel — et, en option, des images de référence — en une image fixe.

  • Midjourney — fermé, hébergé ; connu pour une esthétique par défaut affirmée et des contrôles de style/référence.
  • Génération d'images d'OpenAI (la lignée DALL·E / GPT Image) — fermée, hébergée ; étroitement intégrée à ChatGPT et à l'API.
  • La génération d'images Gemini de Google (« Nano Banana ») et Imagen — fermées, hébergées ; intégrées à Gemini et à Google Cloud.
  • Adobe Firefly — fermé, hébergé ; conçu pour les workflows créatifs et entraîné en pensant à l'usage commercial (voir les droits, plus bas).
  • Stable Diffusion (Stability AI) et FLUX (Black Forest Labs) — familles de modèles à poids ouverts que vous pouvez télécharger et exécuter vous-même, l'épine dorsale de l'écosystème d'images local/ouvert.

Génération de vidéos (texte/image vers vidéo)

Générez de courts clips — de plus en plus avec un audio synchronisé — à partir d'un prompt ou d'une image de départ.

  • OpenAI Sora — un modèle vidéo de pointe (note : l'application grand public autonome a été abandonnée ; le modèle a continué via l'API — un exemple classique de la raison pour laquelle les versions/disponibilités deviennent obsolètes).
  • Google Veo — vidéo de pointe, avec audio natif dans les versions récentes.
  • Runway — une suite créative construite autour de ses modèles vidéo de la série Gen.
  • Kling (par Kuaishou) et Pika — outils vidéo en évolution rapide, populaires pour le contenu social/format court.

Voix, parole et musique (audio)

  • ElevenLabs — fermé, hébergé ; synthèse vocale réaliste et outils de voix (le clonage de voix a de réelles implications de consentement — voir l'éthique).
  • Suno et Udio — génèrent des chansons complètes (voix + instrumentation) à partir d'un prompt textuel.
  • OpenAI Whisper — la direction inverse : reconnaissance vocale (transcription). Il est à poids ouverts (sous licence MIT), vous pouvez donc l'exécuter vous-même ou appeler une API hébergée. La reconnaissance vocale est la discrète bête de somme derrière les sous-titres, les notes vocales et les transcriptions de réunions.
Pro tip
  • La plus grande bifurcation (identique à celle des modèles de texte) : les outils hébergés FERMÉS (souvent la meilleure qualité, le moins de configuration) contre les modèles à POIDS OUVERTS comme Stable Diffusion, FLUX et Whisper que vous pouvez auto-héberger pour la confidentialité, le contrôle et un coût plus bas à grande échelle.
  • Ne choisissez pas par classement. Pour votre rendu/son réel, générez quelques exemples concrets dans 2-3 outils et jugez avec vos propres yeux et oreilles.

Comment obtenir un bon résultat d'un modèle de médias

Le workflow ressemble davantage à une séance photo qu'à une recherche Google. Ces étapes sont indépendantes de l'outil :

Guided walkthrough1 of 6
  1. Commencez par le sujet principal, puis ajoutez le décor, l'action et l'ambiance. « Un renard roux » est faible ; « un renard roux endormi en boule dans la neige fraîche, douce lumière du matin » donne au modèle de quoi travailler.

Exemple de prompt de génération d'image (médium → sujet → style → détails)

A cinematic wide-angle photograph of a lighthouse on a rocky cliff
at golden hour, waves crashing below, dramatic storm clouds parting.
Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field.
Mood: hopeful, epic. Aspect ratio 16:9.

Tip: if the result is close, change ONE element next pass
(e.g. "blue hour" instead of "golden hour") and re-roll —
or add a reference image to lock the look.

Droits, provenance et éthique — les incontournables

L'IA de médias soulève des questions que le chat textuel ne pose généralement pas. Traitez-les comme faisant partie du travail, pas comme une réflexion après coup.

Droits d'usage et commerciaux. Chaque outil a sa propre licence, et elles diffèrent beaucoup. Certaines restreignent l'usage commercial, certaines ne l'accordent que sur les paliers payants, et les sorties peuvent ressembler à des œuvres protégées par droit d'auteur ou marque déposée. Adobe Firefly, par exemple, s'appuie sur des données d'entraînement choisies avec la sécurité commerciale à l'esprit — mais vous devriez tout de même lire la véritable licence de l'outil et du palier que vous utilisez plutôt que de supposer.

Provenance et filigrane. Une norme grandissante, C2PA / Content Credentials, attache des métadonnées de type « étiquette nutritionnelle » infalsifiables consignant comment un actif a été fabriqué et modifié. Beaucoup d'outils majeurs d'image et de vidéo l'intègrent désormais. Gardez cette provenance intacte, et privilégiez les outils qui la prennent en charge — elle devient la norme pour des médias dignes de confiance.

Deepfakes, voix et consentement. La génération réaliste de visages et de voix peut usurper l'identité de personnes réelles. Ne clonez pas une voix ou une apparence sans consentement explicite, n'utilisez jamais de médias générés pour tromper, et respectez la loi de votre juridiction. Le consentement au clonage de voix et la divulgation du contenu généré par IA ne relèvent pas seulement de l'étiquette — ce sont de plus en plus des obligations légales.

Watch out
  • Les médias générés peuvent comporter des limites de droits d'usage et des risques de deepfake/consentement — vérifiez la licence de chaque outil et signalez le contenu généré par IA.

Ce qui se transfère de vos compétences en IA de texte

Bonne nouvelle : une grande partie de ce que vous savez déjà se transfère.

  • Un prompting clair et spécifique — être concret sur ce que vous voulez l'emporte sur les souhaits vagues, dans toutes les modalités.
  • L'itération plutôt que le coup unique — la même boucle « brouillon, critique, affinage » que vous utiliseriez avec Claude s'applique, simplement avec des relances et des images de référence au lieu de messages de suivi. Voir Les bases du prompting.
  • Choisir le bon outil pour la tâche — le cadre de Choisir un modèle (les contraintes d'abord, puis un petit test dans le monde réel) fonctionne tout aussi bien pour les médias.
  • Comprendre ce que le modèle est réellement — savoir que ce sont des apprenants de motifs, pas de la magie, garde vos attentes et votre éthique en ordre. Voir Fondamentaux.

Testez-vous

Testez-vous

0/4
  1. Quel est le moyen le plus fiable de contrôler le rendu de la sortie d'un modèle de médias — au-delà des mots ?
  2. Lequel de ceux-ci est un outil à POIDS OUVERTS que vous pouvez télécharger et exécuter vous-même ?
  3. Qu'est-ce que C2PA / Content Credentials ?
  4. Avant d'utiliser des médias générés par IA à des fins commerciales, la démarche la plus sûre est de :

Flashcards

Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 6
Key takeaways
  • Les médias génératifs constituent une branche de l'IA distincte du chat textuel : elle fabrique des images, des vidéos, des voix et de la musique, et vous la dirigez avec des références et des relances, pas seulement des mots.
  • Pensez en archétypes — image, vidéo, voix/musique, reconnaissance vocale — et souvenez-vous de la bifurcation fermé/poids ouverts (par ex. Midjourney contre Stable Diffusion/FLUX ; synthèse vocale hébergée contre Whisper ouvert).
  • Les compétences durables se transfèrent depuis l'IA de texte : un prompting spécifique, l'itération, et le choix du bon outil pour la tâche.
  • Les droits et l'éthique font partie du travail : vérifiez la licence de votre outil et de votre palier, gardez la provenance (C2PA/Content Credentials), obtenez le consentement pour les voix/apparences, et signalez les médias générés par IA.
  • Les spécificités se périment vite — vérifiez les versions, les prix et les capacités par rapport à la page propre à chaque outil avant de vous y fier.

Sources et lectures complémentaires