Medios generativos: IA de imagen, audio y vídeo
La mayor parte de AILmanac trata sobre la IA que escribe y razona — modelos de texto como Claude. Pero toda otra rama de la IA crea medios: imágenes, vídeo, voces y música a partir de un prompt. Esta página es un mapa neutral respecto al proveedor de ese panorama: los arquetipos, las herramientas notables (cada una verificada como existente), en qué se diferencian de los LLM de texto, las habilidades que se transfieren y las reglas de derechos y ética que no puedes saltarte.
- Conocer los principales arquetipos de los medios generativos — imagen, vídeo, voz/música, voz-a-texto — y una herramienta real en cada uno
- Entender cómo se diferencian los modelos de medios de un modelo de chat de texto como Claude
- Aprender las habilidades duraderas: prompting para medios, iteración y entradas de referencia
- Respetar las líneas rojas: derechos de uso, procedencia/marcas de agua y la ética de deepfakes/consentimiento
En qué se diferencian los modelos de medios de un LLM de texto
Si solo has usado un modelo de chat, importan cuatro diferencias:
- Salida diferente, "correcto" diferente. Un modelo de texto devuelve una única mejor respuesta, en su mayoría determinista. Un modelo de medios devuelve un artefacto (una imagen, un clip, una toma de voz) donde no hay una única respuesta correcta — solo unas que te gustan más o menos. Generas varias y eliges.
- Normalmente no puedes editar la salida editando solo el prompt. Cambiar una palabra puede cambiar toda la imagen. El control real proviene de entradas de referencia (una imagen inicial, una imagen de estilo, una voz de referencia) más los controles específicos de la herramienta, no solo de las palabras.
- Las semillas y la variación forman parte del flujo de trabajo. Muchas herramientas te permiten volver a tirar, variar o bloquear una "semilla" para la reproducibilidad. La iteración es la norma, no un fracaso.
- La unidad de coste es diferente. El texto factura por tokens; los medios facturan por imagen, segundo de vídeo o carácter/minuto de audio — y el vídeo en particular puede volverse caro muy rápido.
- Modelo mental: un modelo de texto es un escritor que te da la respuesta; un modelo de medios es una máquina tragamonedas con un volante — tiras de la palanca y luego diriges con referencias y nuevas tiradas hasta que quede bien.
- Genera un lote y cúralo. Tu buen gusto — saber cuál de 4 salidas es la mejor — es la mitad de la habilidad.
El mapa: arquetipos y herramientas notables
Piensa en arquetipos — las alineaciones se barajan constantemente, las categorías son estables. Cada herramienta mencionada a continuación fue verificada como existente con una URL real (en Fuentes); las versiones concretas se dejan deliberadamente vagas porque cambian sin cesar.
Generación de imágenes (texto-a-imagen)
Convierte un prompt de texto — y opcionalmente imágenes de referencia — en una imagen fija.
- Midjourney — cerrado, alojado; conocido por una fuerte estética por defecto y controles de estilo/referencia.
- Generación de imágenes de OpenAI (la línea DALL·E / GPT Image) — cerrado, alojado; estrechamente integrado en ChatGPT y la API.
- Generación de imágenes de Gemini de Google ("Nano Banana") e Imagen — cerrado, alojado; integrado en Gemini y Google Cloud.
- Adobe Firefly — cerrado, alojado; construido para flujos de trabajo creativos y entrenado con el uso comercial en mente (ver derechos, más abajo).
- Stable Diffusion (Stability AI) y FLUX (Black Forest Labs) — familias de modelos de peso abierto que puedes descargar y ejecutar tú mismo, la columna vertebral del ecosistema local/abierto de imágenes.
Generación de vídeo (texto/imagen-a-vídeo)
Genera clips cortos — cada vez más con audio sincronizado — a partir de un prompt o de una imagen inicial.
- OpenAI Sora — un modelo de vídeo de frontera (nota: la app de consumo independiente fue discontinuada; el modelo continuó a través de la API — un ejemplo de manual de por qué las versiones/disponibilidad quedan obsoletas).
- Google Veo — vídeo de frontera, con audio nativo en versiones recientes.
- Runway — una suite creativa construida alrededor de sus modelos de vídeo de la serie Gen.
- Kling (de Kuaishou) y Pika — herramientas de vídeo de rápida evolución populares para contenido social/de formato corto.
Voz, habla y música (audio)
- ElevenLabs — cerrado, alojado; texto-a-voz realista y herramientas de voz (la clonación de voz tiene implicaciones reales de consentimiento — ver ética).
- Suno y Udio — generan canciones completas (voces + instrumentación) a partir de un prompt de texto.
- OpenAI Whisper — la dirección contraria: voz-a-texto (transcripción). Es de peso abierto (con licencia MIT), así que puedes ejecutarlo tú mismo o llamar a una API alojada. La voz-a-texto es el caballo de batalla silencioso detrás de los subtítulos, las notas de voz y las transcripciones de reuniones.
- La mayor bifurcación (igual que con los modelos de texto): herramientas alojadas CERRADAS (a menudo la mejor calidad, la menor configuración) frente a modelos de PESO ABIERTO como Stable Diffusion, FLUX y Whisper que puedes autoalojar por privacidad, control y menor coste a escala.
- No elijas por la tabla de clasificación. Para tu aspecto/sonido real, genera unos pocos ejemplos reales en 2-3 herramientas y juzga con tus propios ojos y oídos.
Cómo obtener un buen resultado de un modelo de medios
El flujo de trabajo se parece más a una sesión de fotos que a una búsqueda en Google. Estos pasos son independientes de la herramienta:
- Empieza por el sujeto principal, luego añade escenario, acción y ambiente. 'Un zorro rojo' es débil; 'un zorro rojo acurrucado dormido sobre nieve fresca, suave luz de la mañana' le da al modelo algo con lo que trabajar.
- Di QUÉ TIPO de imagen/vídeo/voz es: foto vs ilustración vs render 3D; cámara/objetivo o estilo artístico; para audio, el género, el tempo y el tono emocional. El estilo es donde reside la mayor parte del aspecto.
- Una imagen inicial, una imagen de referencia de estilo o un clip de voz de referencia controla el resultado mucho más fiablemente que los adjetivos. Esta es la habilidad duradera que se pierden quienes solo hacen prompts de texto.
- Produce varias variaciones. Elige la más cercana — tu buen gusto forma parte de la herramienta. No esperes que la primera tirada sea la definitiva.
- Cambia UNA cosa a la vez (la iluminación, o la pose, o la paleta) y vuelve a tirar, o usa las funciones de editar/variar/inpaint de la herramienta. Reescribir todo el prompt cada vez pierde lo que estaba funcionando.
- Confirma que la licencia cubre tu uso (¿comercial?), y conserva/adjunta la procedencia (Content Credentials) para que el activo sea rastreable. Revela que es generado por IA donde importe.
Prompt de ejemplo de generación de imágenes (medio → sujeto → estilo → detalles)
A cinematic wide-angle photograph of a lighthouse on a rocky cliff at golden hour, waves crashing below, dramatic storm clouds parting. Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field. Mood: hopeful, epic. Aspect ratio 16:9. Tip: if the result is close, change ONE element next pass (e.g. "blue hour" instead of "golden hour") and re-roll — or add a reference image to lock the look.
Derechos, procedencia y ética — las líneas rojas
La IA de medios plantea problemas que el chat de texto normalmente no. Trátalos como parte del trabajo, no como algo secundario.
Derechos de uso y comerciales. Cada herramienta tiene su propia licencia, y difieren mucho. Algunas restringen el uso comercial, algunas lo conceden solo en niveles de pago, y las salidas pueden parecerse a obras con derechos de autor o registradas. Adobe Firefly, por ejemplo, se apoya en datos de entrenamiento elegidos con la seguridad comercial en mente — pero aun así deberías leer la licencia real de la herramienta y el nivel en el que estás en lugar de suponer.
Procedencia y marcas de agua. Un estándar en crecimiento, C2PA / Content Credentials, adjunta metadatos de "etiqueta nutricional" a prueba de manipulaciones que registran cómo se creó y editó un activo. Muchas herramientas importantes de imagen y vídeo ahora lo incorporan. Mantén intacta esa procedencia, y prefiere herramientas que la soporten — se está convirtiendo en la norma para los medios fiables.
Deepfakes, voces y consentimiento. La generación realista de rostros y voces puede suplantar a personas reales. No clones una voz o un parecido sin consentimiento explícito, nunca uses medios generados para engañar, y cumple con la ley de tu jurisdicción. El consentimiento para la clonación de voz y la divulgación de contenido generado por IA no son solo etiqueta — cada vez más son requisitos legales.
- Los medios generados pueden llevar límites de derechos de uso y riesgos de deepfake/consentimiento — comprueba la licencia de cada herramienta y revela el contenido generado por IA.
Qué se transfiere de tus habilidades con la IA de texto
Buenas noticias: mucho de lo que ya sabes se transfiere.
- Prompting claro y específico — ser concreto sobre lo que quieres supera a los deseos vagos, en todas las modalidades.
- Iteración por encima del disparo único — el mismo bucle de "borrador, crítica, refinamiento" que usarías con Claude aplica, solo que con nuevas tiradas e imágenes de referencia en lugar de mensajes de seguimiento. Ver Fundamentos del prompting.
- Elegir la herramienta adecuada para la tarea — el marco de Elegir un modelo (primero las restricciones, luego una pequeña prueba del mundo real) funciona igual de bien para los medios.
- Entender qué es realmente el modelo — saber que son aprendices de patrones, no magia, mantiene rectas tus expectativas y tu ética. Ver Fundamentos.
Ponte a prueba
Ponte a prueba
0/4Tarjetas de memoria
- Los medios generativos son una rama de la IA separada del chat de texto: crea imágenes, vídeo, voz y música, y lo diriges con referencias y nuevas tiradas, no solo con palabras.
- Piensa en arquetipos — imagen, vídeo, voz/música, voz-a-texto — y recuerda la bifurcación cerrado-vs-peso-abierto (p. ej. Midjourney vs Stable Diffusion/FLUX; TTS alojado vs Whisper abierto).
- Las habilidades duraderas se transfieren desde la IA de texto: prompting específico, iteración y elegir la herramienta adecuada para la tarea.
- Los derechos y la ética son parte del trabajo: comprueba la licencia de tu herramienta y nivel, mantén la procedencia (C2PA/Content Credentials), obtén consentimiento para voces/parecidos y revela los medios generados por IA.
- Los detalles caducan rápido — verifica versiones, precios y capacidades contra la propia página de cada herramienta antes de confiar en ellos.
Fuentes y lecturas adicionales
- Midjourney — https://www.midjourney.com/
- Generación de imágenes de OpenAI (DALL·E 3) — https://openai.com/index/dall-e-3/
- Guía de la API de generación de imágenes de OpenAI — https://platform.openai.com/docs/guides/image-generation
- Google — Generación de imágenes de Gemini ("Nano Banana") — https://gemini.google/overview/image-generation/
- Google DeepMind — Veo (vídeo) — https://deepmind.google/models/veo/
- Adobe Firefly — https://firefly.adobe.com/
- Black Forest Labs — FLUX — https://bfl.ai/
- OpenAI Sora — https://openai.com/index/sora/
- Runway — https://runwayml.com/
- Kling (Kuaishou) — https://kling.ai/
- Pika — https://pika.art/
- ElevenLabs — https://elevenlabs.io/
- Suno — https://suno.com/
- Udio — https://www.udio.com/
- OpenAI Whisper (voz-a-texto de código abierto) — https://github.com/openai/whisper
- C2PA — Coalition for Content Provenance and Authenticity — https://c2pa.org/
- Content Credentials — https://contentcredentials.org/
- Artificial Analysis (rastreador independiente de modelos/precios) — https://artificialanalysis.ai/