Zum Hauptinhalt springen

MiniMax H3 (Hailuo 3.0): Das Open-Weight-Omni-Videomodell

Fortgeschritten

Am 3. August 2026 hat MiniMax die Weights von MiniMax-H3 (Consumer-Name: Hailuo 3.0) auf Hugging Face hochgeschoben — ein 33-Milliarden-Parameter Single-Stream-Transformer, der Text-, Bild-, Video- und Audio-Referenzen in 4–15 Sekunden lange Clips bis zu 2K/24fps mit nativem Stereo-Audio verwandelt, alles in einem Durchlauf generiert. Der letzte Teil ist der interessante: es gibt keine separate TTS-Stufe, keine angeklebte SFX-Pipeline. Dialog, Raumklang und Bild kommen zusammen heraus, aus demselben Modell.

Drei Tage früher öffnete die bezahlte API bei $0,1625/Sekunde für 2K (~$9,75/Videominute), grob die Hälfte der Kosten von Kling 3.0 oder Seedance 2.0 bei vergleichbarer Auflösung. Auf den Artificial-Analysis-Leaderboards setzen Single-Run-Scores H3 auf Platz 1 im Videoschnitt mit Audio, Top 3 in Text-to-Video und Image-to-Video. Diese Kombination — Frontier-Tier-Videoqualität, offene Weights und ehrliche Sub-$10/Minuten-Preise — ist das, was H3 diese Woche in jeden Generative-Media-Feed gebracht hat.

Diese Seite ist das, was die meisten anderen Beiträge übersehen: die Teile, die entscheiden, ob H3 tatsächlich nützlich für dich ist.

What you'll learn
  • Die H3-Architektur verstehen — Single-Stream-Transformer, H3-VAE, MM-RoPE — und warum sie Video und Audio in einem Forward-Pass erzeugt
  • Die drei Self-Hosting-Fallstricke kennen, die niemand auf die Landing Page setzt: die geo-eingeschränkte Lizenz, die 768p-Obergrenze auf der offenen Basis und den AdaLN-Parameter-Skip-Trick
  • Einen funktionierenden Self-Hosted-Pfad bekommen: mindestens 42,5 GB Weights, Quantisierungsentscheidungen und wie eine 12-GB-Karte es mit Offloading ausführt
  • H3 aus der API mit einem echten cURL ausprobieren, das du kopieren kannst, und die Input-Shape-Limits kennen (max. 12 Dateien, ≤64 MB Body, nur öffentliche URLs)
  • Zwischen H3 und den geschlossenen Alternativen (Kling 3.0, Seedance 2.0, Veo, Sora) mit klaren Tie-Breakern bei Preis, Kontrolle und Lizenzierung wählen

Drei Dinge über H3, die aus den Schlagzeilen nicht offensichtlich sind

1. Die Community-Lizenz blockiert Self-Hosting in den USA, der EU, UK und Südkorea

Die Model Card auf Hugging Face verlinkt ein MiniMax H3 Community License Agreement, dessen Text für vier Regionen anwendungsgesteuert ist: die Vereinigten Staaten, die Europäische Union, das Vereinigte Königreich und die Republik Korea. In der Praxis heißt das: wenn du oder deine Organisation an einem dieser Orte sitzt und H3 auf eigener Hardware laufen lassen willst (oder deinen Usern anbieten), musst du zuerst den H3-Lizenzantrag unter platform.minimax.io/h3-license durchführen. Die Beschränkung erstreckt sich auf Outputs, nicht nur auf die Weights — ein Detail, das die meisten Reblog-Posts überspringen.

Bist du außerhalb dieser Regionen, gilt die Standard-Community-Lizenz. Bist du drin, behandle die API als Standardpfad, bis dein Antrag durch ist, oder nutze den Lizenz-Reviewer in deiner Organisation, bevor du irgendetwas ausrollst, das die Weights berührt. Das ist eine echte, durchsetzbare Beschränkung — nicht die übliche "please don't do bad things"-Klausel.

2. Die offene Basis endet bei 768p — 2K existiert nur innerhalb der API

Jede "bis zu 2K"-Schlagzeile über H3 überspringt ein Schlüsseldetail: die Open-Weight-Basismodelle (Base FL2VA für Text-to-Video / First-Last-Frame, Base Ref2VA für Multi-Reference) generieren bei 768p. Der 2K-Output, über den die Leute auf der Hailuo-App staunen, kommt von H3-Regenerate-2K, einem In-Context-Upsampler, der nach dem Basismodell läuft und den MiniMax nicht als Open Source veröffentlicht hat. H3-Context-IR, der Multimodal-Instruktions-Preprocessor, ist ebenfalls API-only.

Die Konsequenz für Self-Hoster ist einfach: du bekommst dieselbe Generierungsqualität, auf der das Frontier-System aufbaut, aber du endest bei 768p, es sei denn, du hängst deinen eigenen Upscaler dahinter (Topaz, ESRGAN, ein Diffusion-Upsampler). Das ist okay für viele Use Cases — 768p bei 24fps reicht für Social Clips, Storyboards und schnelles Iterieren — aber es ist nicht dasselbe Produkt wie die bezahlte Stufe.

3. Etwa 13 B der 33 B Parameter sind AdaLN-Branches, die man vorberechnen und überspringen kann

Die Model Card zerlegt den H3-Omni-Transformer als 33 B dichten Single-Stream-Transformer, von dem etwa 13 B Parameter in AdaLN-bezogenen Branches leben. AdaLN (Adaptive Layer Norm) ist, wie diffusion-artige Transformer Konditionierungssignale (Timestep, Klasse, Text-Embedding) aufnehmen — und seine Outputs sind pro Konditionierungs-Slot vorberechenbar. So erreichen Drittanbieter eine Mindest-Arbeitskonfiguration von 42,5 GB, selbst wenn naive BF16-Weights viel größer sind: sie kombinieren einen prunned INT8-Checkpoint (~20 GB) mit einem NVFP4 AWQ Text-Encoder (~16 GB) und beiden VAEs (~5,8 GB) und überspringen die gecachten Branch-Weights zur Inferenzzeit.

Die Faustregel aus dem ComfyUI-Ökosystem: eine 12-GB-Karte kann H3 mit CPU/RAM-Offloading ausführen, zu Preisen von längeren Renderzeiten pro Clip. Hast du 24 GB oder mehr, ist Offload nicht nötig.

Was H3 wirklich ist (die Architektur auf einer Seite)

H3 ist ein Single-Stream, modalitätsagnostischer Transformer. Es gibt einen Attention-Stack, einen FFN-Stack, und Video-/Audio-/Text-Tokens passieren alle diesen. Die vier Komponenten, die du tatsächlich lädst, sind:

KomponenteRolleOpen-Sourced?
H3-Omni-Transformer33 B dichter Generator (Video + Audio)✅ (BF16, INT8, prunned INT8)
H3-EncoderMultimodaler Text-/Vision-Encoder — nutzt Qwen3-VL-32B Layer-50-Hidden-States wieder
H3-VisualVAETemporal-kausaler Video-Autoencoder, f16t4d24 Kompression
H3-AudioVAEStereo-Audio, 32 kHz Output, 40 Hz temporale Rate
H3-Context-IRMultimodaler Instruktions-Preprocessor❌ API-only
H3-Regenerate-2KIn-Context-Upscaler auf 2K❌ API-only

Zwei Design-Entscheidungen sind für alle erwähnenswert, die H3 mit anderen Videomodellen vergleichen:

  • 3-D MM-RoPE Positional Embeddings. Rotary Positions werden auf drei Achsen erweitert (räumliches x, räumliches y, Zeit), sodass temporale Kohärenz ins Attention-Muster eingebrannt statt durch ein separates Temporal-Modul hinzugefügt wird. Das ist einer der Hauptgründe, warum H3 Subject-Identity und Beleuchtung über 15-Sekunden-Clips stabil hält.
  • H3-VAE bringt einen 4×-Effective-Sequence-Length-Gewinn. Der Custom-Tokenizer packt mehr Pixel pro Token als die Standard-VAEs, die von früheren Open-Video-Modellen verwendet werden — das macht 2K-Output in dieser Parameterklasse überhaupt handhabbar.

Der native Audio-Pass ist der andere Unterschied. Weil Dialog, SFX und Raumklang im selben Forward-Pass wie das Bild generiert werden, kommen Lip-Sync und diegetischer Audio standardmäßig kohärent heraus. Referenz-Audio (WAV/MP3, 2–15s pro Clip, bis zu 3 Clips) ermöglicht Voice-Cloning; aber Audio-Referenzen müssen von einer Bild- oder Videoreferenz begleitet sein — die API lehnt Audio-only Inputs ab.

Die Self-Hosting-Mathematik

Wenn du planst, H3 lokal auszuführen, sind das die Zahlen, die bestimmen, was passt:

CheckpointDiffusion-ModellText-EncoderBeide VAEsMindest-Arbeitsvolumen
BF16 (Referenz)61,7 GB48,0 GB5,82 GB~115 GB
INT831,7 GB25,3 GB5,82 GB~63 GB
Prunned INT8 + NVFP4 AWQ TE19,5 GB14,6 GB5,82 GB~42,5 GB

VRAM: 24 GB komfortabel, 12 GB mit Offload (langsamer pro Clip). SGLang-Beispielkonfigs nutzen 4 GPUs fürs Serving.

Guided walkthrough1 of 4
  1. Native H3-Unterstützung wurde am selben Tag in ComfyUI gemerged, an dem die Weights fielen (3. August 2026). Zieh die neueste Version und die neuen H3-Nodes erscheinen automatisch.

H3 über die API aufrufen

Die API ist REST + Polling. Du postest einen Job, erhältst eine task_id und pollst einen Query-Endpoint, bis status == "succeeded". Nur öffentliche URLs funktionieren — Base64-Payloads werden abgelehnt, und der gesamte Request-Body ist auf 64 MB begrenzt. Referenzlimits: ≤9 Bilder, ≤3 Videoclips, ≤3 Audioclips, insgesamt 12 Dateien, ≤7 000-Zeichen-Prompt.

H3 Text-to-Video mit einer Voice-Referenz (Python)

import os, time, requests

headers = {"Authorization": f"Bearer {os.environ['MINIMAX_API_KEY']}"}

payload = {
  "model": "MiniMax-H3",
  "content": [
      {"type": "text",
       "text": "Wide shot: a lighthouse keeper walks onto the balcony and says, 'Follow the wind, live free.' Voice follows reference audio 1."},
      {"type": "audio_url",
       "audio_url": {"url": "https://example.com/voice-ref.mp3"},
       "role": "reference_audio"},
      {"type": "image_url",
       "image_url": {"url": "https://example.com/lighthouse.jpg"},
       "role": "reference_image"},
  ],
  "resolution": "2K",   # 2K is the only value the API accepts right now
  "duration": 8,        # seconds, 4–15
  "ratio": "16:9",
}

task_id = requests.post(
  "https://api.minimax.io/v2/video_generation",
  headers=headers, json=payload,
).json()["task_id"]

while True:
  time.sleep(10)
  task = requests.get(
      f"https://api.minimax.io/v2/query/video_generation/{task_id}",
      headers=headers,
  ).json()["task"]
  if task["status"] == "succeeded":
      print(task["video_url"])
      break
  if task["status"] == "failed":
      raise RuntimeError(task)

H3 lokal via diffusers (Self-Host, 768p)

from diffusers import DiffusionPipeline
import torch

pipe = DiffusionPipeline.from_pretrained(
  "MiniMaxAI/MiniMax-H3",
  dtype=torch.bfloat16,
  device_map="cuda",
)

video, audio = pipe(
  prompt="Slow dolly-in on a neon-lit ramen shop at night; steam rising; jazz sax outside.",
  num_frames=24 * 8,   # 8 seconds at 24 fps
  height=768, width=1344,
  generator=torch.manual_seed(42),
)
video.save("ramen.mp4"); audio.save("ramen.wav")

H3 vs. die geschlossenen Video-APIs — wann jede gewinnt

MiniMax H3Kling 3.0Dreamina Seedance 2.0Sora / Veo (Frontier geschlossen)
Max-Auflösung (API)2K/24fps1080p1080p1080p–4K (Variante)
Natives Audio✅ Dialog + SFX + RaumklangSeparate StufeSeparate Stufe✅ (Sora 2), ✅ (Veo)
Open Weights✅ (Community, geo-eingeschränkt)
Kosten pro Minute (vergleichbare Stufe)~$9,75 (2K + Audio)~$20 (1080p)~$22 (1080p)Höher & rate-limitiert
Referenzkontrolle≤9 Bilder, ≤3 Video, ≤3 AudioÄhnlichWeniger SlotsWeniger Slots
Am besten fürHöchste Fidelity bei niedrigsten $/min; On-Prem/Self-Host außerhalb eingeschränkter RegionenStilstabilität über lange ShotsKinematischer Look, Prompt-FidelityWenn du keine Prompts an einen chinesischen Anbieter leaken darfst und Frontier-Politur brauchst

Greif zu H3, wenn du Audio-im-Bild bei 2K brauchst, wenn deine Kosten/Minute wichtig sind und die geschlossenen APIs dein Budget sprengen würden, oder wenn Compliance dich zwingt, Generierung on-prem zu halten und deine rechtliche Situation die Community-Lizenz klärt. Skip H3, wenn dein Team in einer der eingeschränkten Regionen lebt und du den Antrag nicht durch hast, wenn dein Workflow von nativem 4K abhängt, oder wenn du keine Prompts an eine Mainland-China-API senden darfst (die bezahlte Stufe wird von MiniMax gehostet; es gibt beim Launch keine US-Region-Mirrors).

Quiz

Check yourself

0/4
  1. Die Open-Weight-Basis-H3-Checkpoints auf Hugging Face generieren Video bei welcher maximalen Auflösung?
  2. Laut der MiniMax H3 Community License, welche Regionen erfordern derzeit einen Antrag, um die Weights selbst zu hosten?
  3. Der H3-Omni-Transformer hat 33 B Parameter. Was ist das Besondere an ungefähr 13 B davon?
  4. Welches davon ist eine echte Beschränkung der bezahlten H3-API heute?
Drücke Enter oder die Leertaste, um die Karte umzudrehen. Nutze die Pfeiltasten links und rechts, um zwischen den Karten zu wechseln.Begriff angezeigt.
1 / 9

Quellen & weiterführende Lektüre