Saltar al contenido principal

Medios generativos: IA de imagen, audio y vídeo

Principiante

La mayor parte de AILmanac trata sobre la IA que escribe y razona — modelos de texto como Claude. Pero toda otra rama de la IA crea medios: imágenes, vídeo, voces y música a partir de un prompt. Esta página es un mapa neutral respecto al proveedor de ese panorama: los arquetipos, las herramientas notables (cada una verificada como existente), en qué se diferencian de los LLM de texto, las habilidades que se transfieren y las reglas de derechos y ética que no puedes saltarte.

What you'll learn
  • Conocer los principales arquetipos de los medios generativos — imagen, vídeo, voz/música, voz-a-texto — y una herramienta real en cada uno
  • Entender cómo se diferencian los modelos de medios de un modelo de chat de texto como Claude
  • Aprender las habilidades duraderas: prompting para medios, iteración y entradas de referencia
  • Respetar las líneas rojas: derechos de uso, procedencia/marcas de agua y la ética de deepfakes/consentimiento

En qué se diferencian los modelos de medios de un LLM de texto

Si solo has usado un modelo de chat, importan cuatro diferencias:

  • Salida diferente, "correcto" diferente. Un modelo de texto devuelve una única mejor respuesta, en su mayoría determinista. Un modelo de medios devuelve un artefacto (una imagen, un clip, una toma de voz) donde no hay una única respuesta correcta — solo unas que te gustan más o menos. Generas varias y eliges.
  • Normalmente no puedes editar la salida editando solo el prompt. Cambiar una palabra puede cambiar toda la imagen. El control real proviene de entradas de referencia (una imagen inicial, una imagen de estilo, una voz de referencia) más los controles específicos de la herramienta, no solo de las palabras.
  • Las semillas y la variación forman parte del flujo de trabajo. Muchas herramientas te permiten volver a tirar, variar o bloquear una "semilla" para la reproducibilidad. La iteración es la norma, no un fracaso.
  • La unidad de coste es diferente. El texto factura por tokens; los medios facturan por imagen, segundo de vídeo o carácter/minuto de audio — y el vídeo en particular puede volverse caro muy rápido.
Pro tip
  • Modelo mental: un modelo de texto es un escritor que te da la respuesta; un modelo de medios es una máquina tragamonedas con un volante — tiras de la palanca y luego diriges con referencias y nuevas tiradas hasta que quede bien.
  • Genera un lote y cúralo. Tu buen gusto — saber cuál de 4 salidas es la mejor — es la mitad de la habilidad.

El mapa: arquetipos y herramientas notables

Piensa en arquetipos — las alineaciones se barajan constantemente, las categorías son estables. Cada herramienta mencionada a continuación fue verificada como existente con una URL real (en Fuentes); las versiones concretas se dejan deliberadamente vagas porque cambian sin cesar.

Generación de imágenes (texto-a-imagen)

Convierte un prompt de texto — y opcionalmente imágenes de referencia — en una imagen fija.

  • Midjourney — cerrado, alojado; conocido por una fuerte estética por defecto y controles de estilo/referencia.
  • Generación de imágenes de OpenAI (la línea DALL·E / GPT Image) — cerrado, alojado; estrechamente integrado en ChatGPT y la API.
  • Generación de imágenes de Gemini de Google ("Nano Banana") e Imagen — cerrado, alojado; integrado en Gemini y Google Cloud.
  • Adobe Firefly — cerrado, alojado; construido para flujos de trabajo creativos y entrenado con el uso comercial en mente (ver derechos, más abajo).
  • Stable Diffusion (Stability AI) y FLUX (Black Forest Labs) — familias de modelos de peso abierto que puedes descargar y ejecutar tú mismo, la columna vertebral del ecosistema local/abierto de imágenes.

Generación de vídeo (texto/imagen-a-vídeo)

Genera clips cortos — cada vez más con audio sincronizado — a partir de un prompt o de una imagen inicial.

  • OpenAI Sora — un modelo de vídeo de frontera (nota: la app de consumo independiente fue discontinuada; el modelo continuó a través de la API — un ejemplo de manual de por qué las versiones/disponibilidad quedan obsoletas).
  • Google Veo — vídeo de frontera, con audio nativo en versiones recientes.
  • Runway — una suite creativa construida alrededor de sus modelos de vídeo de la serie Gen.
  • Kling (de Kuaishou) y Pika — herramientas de vídeo de rápida evolución populares para contenido social/de formato corto.

Voz, habla y música (audio)

  • ElevenLabs — cerrado, alojado; texto-a-voz realista y herramientas de voz (la clonación de voz tiene implicaciones reales de consentimiento — ver ética).
  • Suno y Udio — generan canciones completas (voces + instrumentación) a partir de un prompt de texto.
  • OpenAI Whisper — la dirección contraria: voz-a-texto (transcripción). Es de peso abierto (con licencia MIT), así que puedes ejecutarlo tú mismo o llamar a una API alojada. La voz-a-texto es el caballo de batalla silencioso detrás de los subtítulos, las notas de voz y las transcripciones de reuniones.
Pro tip
  • La mayor bifurcación (igual que con los modelos de texto): herramientas alojadas CERRADAS (a menudo la mejor calidad, la menor configuración) frente a modelos de PESO ABIERTO como Stable Diffusion, FLUX y Whisper que puedes autoalojar por privacidad, control y menor coste a escala.
  • No elijas por la tabla de clasificación. Para tu aspecto/sonido real, genera unos pocos ejemplos reales en 2-3 herramientas y juzga con tus propios ojos y oídos.

Cómo obtener un buen resultado de un modelo de medios

El flujo de trabajo se parece más a una sesión de fotos que a una búsqueda en Google. Estos pasos son independientes de la herramienta:

Guided walkthrough1 of 6
  1. Empieza por el sujeto principal, luego añade escenario, acción y ambiente. 'Un zorro rojo' es débil; 'un zorro rojo acurrucado dormido sobre nieve fresca, suave luz de la mañana' le da al modelo algo con lo que trabajar.

Prompt de ejemplo de generación de imágenes (medio → sujeto → estilo → detalles)

A cinematic wide-angle photograph of a lighthouse on a rocky cliff
at golden hour, waves crashing below, dramatic storm clouds parting.
Style: moody, high dynamic range, shot on a 24mm lens, shallow depth of field.
Mood: hopeful, epic. Aspect ratio 16:9.

Tip: if the result is close, change ONE element next pass
(e.g. "blue hour" instead of "golden hour") and re-roll —
or add a reference image to lock the look.

Derechos, procedencia y ética — las líneas rojas

La IA de medios plantea problemas que el chat de texto normalmente no. Trátalos como parte del trabajo, no como algo secundario.

Derechos de uso y comerciales. Cada herramienta tiene su propia licencia, y difieren mucho. Algunas restringen el uso comercial, algunas lo conceden solo en niveles de pago, y las salidas pueden parecerse a obras con derechos de autor o registradas. Adobe Firefly, por ejemplo, se apoya en datos de entrenamiento elegidos con la seguridad comercial en mente — pero aun así deberías leer la licencia real de la herramienta y el nivel en el que estás en lugar de suponer.

Procedencia y marcas de agua. Un estándar en crecimiento, C2PA / Content Credentials, adjunta metadatos de "etiqueta nutricional" a prueba de manipulaciones que registran cómo se creó y editó un activo. Muchas herramientas importantes de imagen y vídeo ahora lo incorporan. Mantén intacta esa procedencia, y prefiere herramientas que la soporten — se está convirtiendo en la norma para los medios fiables.

Deepfakes, voces y consentimiento. La generación realista de rostros y voces puede suplantar a personas reales. No clones una voz o un parecido sin consentimiento explícito, nunca uses medios generados para engañar, y cumple con la ley de tu jurisdicción. El consentimiento para la clonación de voz y la divulgación de contenido generado por IA no son solo etiqueta — cada vez más son requisitos legales.

Watch out
  • Los medios generados pueden llevar límites de derechos de uso y riesgos de deepfake/consentimiento — comprueba la licencia de cada herramienta y revela el contenido generado por IA.

Qué se transfiere de tus habilidades con la IA de texto

Buenas noticias: mucho de lo que ya sabes se transfiere.

  • Prompting claro y específico — ser concreto sobre lo que quieres supera a los deseos vagos, en todas las modalidades.
  • Iteración por encima del disparo único — el mismo bucle de "borrador, crítica, refinamiento" que usarías con Claude aplica, solo que con nuevas tiradas e imágenes de referencia en lugar de mensajes de seguimiento. Ver Fundamentos del prompting.
  • Elegir la herramienta adecuada para la tarea — el marco de Elegir un modelo (primero las restricciones, luego una pequeña prueba del mundo real) funciona igual de bien para los medios.
  • Entender qué es realmente el modelo — saber que son aprendices de patrones, no magia, mantiene rectas tus expectativas y tu ética. Ver Fundamentos.

Ponte a prueba

Ponte a prueba

0/4
  1. ¿Cuál es la forma más fiable de controlar el aspecto de la salida de un modelo de medios — más allá de las palabras?
  2. ¿Cuál de estas es una herramienta de PESO ABIERTO que puedes descargar y ejecutar tú mismo?
  3. ¿Qué es C2PA / Content Credentials?
  4. Antes de usar medios generados por IA comercialmente, lo más seguro es:

Tarjetas de memoria

Pulsa Intro o Espacio para girar la tarjeta. Usa las flechas izquierda y derecha para moverte entre las tarjetas.Término mostrado.
1 / 6
Key takeaways
  • Los medios generativos son una rama de la IA separada del chat de texto: crea imágenes, vídeo, voz y música, y lo diriges con referencias y nuevas tiradas, no solo con palabras.
  • Piensa en arquetipos — imagen, vídeo, voz/música, voz-a-texto — y recuerda la bifurcación cerrado-vs-peso-abierto (p. ej. Midjourney vs Stable Diffusion/FLUX; TTS alojado vs Whisper abierto).
  • Las habilidades duraderas se transfieren desde la IA de texto: prompting específico, iteración y elegir la herramienta adecuada para la tarea.
  • Los derechos y la ética son parte del trabajo: comprueba la licencia de tu herramienta y nivel, mantén la procedencia (C2PA/Content Credentials), obtén consentimiento para voces/parecidos y revela los medios generados por IA.
  • Los detalles caducan rápido — verifica versiones, precios y capacidades contra la propia página de cada herramienta antes de confiar en ellos.

Fuentes y lecturas adicionales