Aller au contenu principal

MiniMax H3 (Hailuo 3.0) : le modèle vidéo omni open-weight

Intermédiaire

Le 3 août 2026 MiniMax a poussé les poids de MiniMax-H3 (nom consommateur : Hailuo 3.0) sur Hugging Face — un Transformer single-stream de 33 milliards de paramètres qui transforme texte, images, vidéo et références audio en clips de 4–15 secondes à jusqu'à 2K/24fps avec audio stéréo natif, tout généré en une passe. Cette dernière partie est l'intéressante : il n'y a pas d'étape TTS séparée, pas de pipeline SFX rapporté. Dialogue, ambiance et image sortent ensemble, du même modèle.

Trois jours plus tôt l'API payante avait ouvert à 0,1625 $/seconde pour la 2K (~9,75 $/minute de vidéo), grossièrement la moitié du coût de Kling 3.0 ou Seedance 2.0 à résolution comparable. Sur les classements Artificial Analysis les scores single-run mettent H3 #1 en édition vidéo avec audio, top-trois en text-to-video et image-to-video. Cette combinaison — qualité vidéo frontier-tier, poids ouverts, et pricing honnête sous 10 $/minute — est ce qui a mis H3 sur chaque feed de médias génératifs cette semaine.

Cette page est ce que la plupart des autres écrits ratent : les parties qui déterminent si H3 vous est réellement utile à vous.

What you'll learn
  • Comprendre l'architecture H3 — Transformer single-stream, H3-VAE, MM-RoPE — et pourquoi il produit vidéo et audio en une seule passe avant
  • Connaître les trois pièges d'auto-hébergement que personne ne met sur la page d'accueil : la licence géo-restreinte, le plafond 768p sur la base ouverte, et l'astuce du saut de paramètres AdaLN
  • Obtenir un chemin auto-hébergé fonctionnel : minimum 42,5 GB de poids, choix de quantization, et comment une carte 12 GB le fait tourner avec offloading
  • Essayer H3 depuis l'API avec un vrai cURL à copier, et connaître les limites de forme d'entrée (12 fichiers max, corps ≤64 MB, URLs publiques uniquement)
  • Choisir entre H3 et les alternatives fermées (Kling 3.0, Seedance 2.0, Veo, Sora) avec des tie-breakers clairs sur prix, contrôle et licence

Trois choses sur H3 qui ne sont pas évidentes depuis les titres

1. La Community License bloque l'auto-hébergement aux US, EU, UK et Corée du Sud

La carte de modèle Hugging Face lie un MiniMax H3 Community License Agreement dont le texte est gaté par application pour quatre régions : les États-Unis, l'Union Européenne, le Royaume-Uni et la République de Corée. En pratique cela signifie : si vous ou votre organisation êtes dans un de ces endroits et voulez exécuter H3 sur votre propre hardware (ou le servir à vos utilisateurs), vous devez d'abord compléter l'application de licence H3 à platform.minimax.io/h3-license. La restriction s'étend aux outputs, pas seulement aux poids — un détail que la plupart des reblogs sautent.

Si vous êtes hors de ces régions la Community License standard s'applique. Si vous y êtes, traitez l'API comme votre chemin par défaut jusqu'à ce que votre application soit approuvée, ou utilisez le reviewer de licence dans votre org avant de livrer quoi que ce soit qui touche les poids. C'est une restriction réelle et applicable — pas la clause habituelle « merci de ne pas faire de mauvaises choses ».

2. La base ouverte plafonne à 768p — la 2K n'existe qu'à l'intérieur de l'API

Chaque titre « jusqu'à 2K » sur H3 élide un détail clé : les modèles de base à poids ouverts (Base FL2VA pour text-to-video / first-last-frame, Base Ref2VA pour multi-référence) génèrent à 768p. La sortie 2K que les gens admirent sur l'app Hailuo vient de H3-Regenerate-2K, un upsampler in-context qui tourne après le modèle de base et que MiniMax n'a pas open-sourcé. H3-Context-IR, le préprocesseur d'instructions multimodal, est aussi API-only.

La conséquence pour les auto-hébergeurs est simple : vous obtenez la même qualité de génération sur laquelle le système frontier est construit, mais vous plafonnez à 768p sauf si vous chaînez votre propre upscaler (Topaz, ESRGAN, un upsampler diffusion) après coup. C'est fine pour beaucoup de cas d'usage — 768p à 24fps est plus que suffisant pour les clips sociaux, storyboards, et itération rapide — mais ce n'est pas le même produit que le tier payant.

3. Environ 13 B des 33 B paramètres sont des branches AdaLN que vous pouvez précalculer et sauter

La carte de modèle décompose le H3-Omni-Transformer comme un Transformer single-stream 33 B dense dont environ 13 B paramètres vivent dans les branches liées à AdaLN. AdaLN (Adaptive Layer Norm) est comment les transformers de style diffusion absorbent les signaux de conditionnement (timestep, classe, embedding texte) — et ses sorties, par slot de conditionnement, sont précalculables. C'est comment les fournisseurs tiers atteignent une configuration de travail minimum de 42,5 GB même si les poids BF16 naïfs sont beaucoup plus grands : ils combinent un checkpoint INT8 pruné (~20 GB) avec un encodeur texte NVFP4 AWQ (~16 GB) et les deux VAEs (~5,8 GB), et sautent les poids des branches cachées à l'inférence.

La règle du pouce de l'écosystème ComfyUI : une carte 12 GB peut faire tourner H3 avec offloading CPU/RAM, au coût de temps de rendu plus longs par clip. Si vous avez 24 GB ou plus, l'offload n'est pas nécessaire.

Ce qu'est vraiment H3 (l'architecture en une page)

H3 est un Transformer single-stream, agnostique en modalité. Il y a une stack d'attention, une stack FFN, et les tokens vidéo/audio/texte passent tous à travers elle. Les quatre composants que vous chargez réellement sont :

ComposantRôleOpen-sourcé ?
H3-Omni-TransformerGénérateur dense 33 B (vidéo + audio)✅ (BF16, INT8, INT8 pruné)
H3-EncoderEncodeur multimodal texte/vision — réutilise les hidden states layer-50 de Qwen3-VL-32B
H3-VisualVAEAutoencodeur vidéo temporal-causal, compression f16t4d24
H3-AudioVAEAudio stéréo, sortie 32 kHz, taux temporel 40 Hz
H3-Context-IRPréprocesseur d'instructions multimodal❌ API-only
H3-Regenerate-2KUpscaler in-context vers 2K❌ API-only

Deux choix de design méritent d'être soulignés pour quiconque compare H3 à d'autres modèles vidéo :

  • Embeddings positionnels 3-D MM-RoPE. Les positions rotatives sont étendues à trois axes (x spatial, y spatial, temps), donc la cohérence temporelle est cuite dans le pattern d'attention plutôt qu'ajoutée par un module temporel séparé. C'est une des raisons principales pour lesquelles H3 garde l'identité du sujet et l'éclairage stables sur des clips de 15 secondes.
  • H3-VAE donne un gain de 4× en longueur de séquence effective. Le tokenizer custom pack plus de pixels par token que les VAEs standards utilisés par les modèles vidéo ouverts précédents — c'est ce qui rend la sortie 2K traitable du tout dans cette classe de paramètres.

La passe audio native est l'autre différenciateur. Parce que dialogue, SFX et ambiance sont générés dans la même passe avant que l'image, le lip-sync et l'audio diégétique sortent cohérents par défaut. L'audio de référence (WAV/MP3, 2–15s par clip, jusqu'à 3 clips) active le clonage de voix ; mais les références audio doivent accompagner une référence image ou vidéo — l'API rejette les entrées audio-only.

Le calcul de l'auto-hébergement

Si vous planifiez d'exécuter H3 localement, ce sont les chiffres qui déterminent ce qui rentre :

CheckpointModèle diffusionEncodeur texteLes deux VAEsTotal de travail minimum
BF16 (référence)61,7 GB48,0 GB5,82 GB~115 GB
INT831,7 GB25,3 GB5,82 GB~63 GB
INT8 pruné + TE NVFP4 AWQ19,5 GB14,6 GB5,82 GB~42,5 GB

VRAM : 24 GB confortablement, 12 GB avec offload (plus lent par clip). Les exemples de config SGLang utilisent 4 GPUs pour servir.

Guided walkthrough1 of 4
  1. Le support natif H3 a été mergé dans ComfyUI le jour même où les poids ont atterri (3 août 2026). Pullez le dernier et les nouveaux nodes H3 apparaissent automatiquement.

Appeler H3 via l'API

L'API est REST + polling. Vous postez un job, recevez un task_id, et pollez un endpoint query jusqu'à status == "succeeded". Seules les URLs publiques fonctionnent — les payloads Base64 sont rejetés, et le corps total de requête est plafonné à 64 MB. Limites de références : ≤9 images, ≤3 clips vidéo, ≤3 clips audio, 12 fichiers total, prompt ≤7 000 caractères.

H3 text-to-video avec une référence vocale (Python)

import os, time, requests

headers = {"Authorization": f"Bearer {os.environ['MINIMAX_API_KEY']}"}

payload = {
  "model": "MiniMax-H3",
  "content": [
      {"type": "text",
       "text": "Wide shot: a lighthouse keeper walks onto the balcony and says, 'Follow the wind, live free.' Voice follows reference audio 1."},
      {"type": "audio_url",
       "audio_url": {"url": "https://example.com/voice-ref.mp3"},
       "role": "reference_audio"},
      {"type": "image_url",
       "image_url": {"url": "https://example.com/lighthouse.jpg"},
       "role": "reference_image"},
  ],
  "resolution": "2K",   # 2K is the only value the API accepts right now
  "duration": 8,        # seconds, 4–15
  "ratio": "16:9",
}

task_id = requests.post(
  "https://api.minimax.io/v2/video_generation",
  headers=headers, json=payload,
).json()["task_id"]

while True:
  time.sleep(10)
  task = requests.get(
      f"https://api.minimax.io/v2/query/video_generation/{task_id}",
      headers=headers,
  ).json()["task"]
  if task["status"] == "succeeded":
      print(task["video_url"])
      break
  if task["status"] == "failed":
      raise RuntimeError(task)

H3 localement via diffusers (auto-hébergé, 768p)

from diffusers import DiffusionPipeline
import torch

pipe = DiffusionPipeline.from_pretrained(
  "MiniMaxAI/MiniMax-H3",
  dtype=torch.bfloat16,
  device_map="cuda",
)

video, audio = pipe(
  prompt="Slow dolly-in on a neon-lit ramen shop at night; steam rising; jazz sax outside.",
  num_frames=24 * 8,   # 8 seconds at 24 fps
  height=768, width=1344,
  generator=torch.manual_seed(42),
)
video.save("ramen.mp4"); audio.save("ramen.wav")

H3 vs les APIs vidéo fermées — quand chacun gagne

MiniMax H3Kling 3.0Dreamina Seedance 2.0Sora / Veo (frontier fermé)
Résolution max (API)2K/24fps1080p1080p1080p–4K (variante)
Audio natif✅ dialogue + SFX + ambianceÉtape séparéeÉtape séparée✅ (Sora 2), ✅ (Veo)
Poids ouverts✅ (Community, géo-restreint)
Coût par minute (tier comparable)~9,75 $ (2K + audio)~20 $ (1080p)~22 $ (1080p)Plus cher & rate-limité
Contrôle de référence≤9 images, ≤3 vidéo, ≤3 audioSimilaireMoins de slotsMoins de slots
Meilleur pourSortie la plus haute fidélité au coût $/min le plus bas ; on-prem/auto-hébergé si hors régions restreintesStabilité de style sur longs plansLook cinématique, fidélité au promptQuand vous ne pouvez pas leaker des prompts à un vendeur chinois et avez besoin de polissage frontier

Tournez-vous vers H3 quand vous avez besoin d'audio-dans-le-cadre en 2K, quand votre coût/minute compte et que les APIs fermées feraient sauter votre budget, ou quand la conformité vous force à garder la génération on-prem et que votre situation légale approuve la Community License. Sautez H3 quand votre équipe vit dans une des régions restreintes et que vous n'avez pas approuvé l'application, quand votre workflow dépend de 4K natif, ou quand vous ne pouvez pas envoyer des prompts à une API mainland-China (le tier payant est hébergé par MiniMax ; il n'y a pas de miroirs région US au lancement).

Quiz

Check yourself

0/4
  1. Les checkpoints de base H3 à poids ouverts sur Hugging Face génèrent la vidéo à quelle résolution maximum ?
  2. Selon la MiniMax H3 Community License, quelles régions nécessitent actuellement une application pour auto-héberger les poids ?
  3. Le H3-Omni-Transformer a 33 B paramètres. Qu'est-ce qui est spécial à propos d'environ 13 B d'entre eux ?
  4. Laquelle de celles-ci est une vraie limite de l'API H3 payante aujourd'hui ?
Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 9

Sources et lectures complémentaires