メインコンテンツまでスキップ

MiniMax H3 (Hailuo 3.0): オープンウェイトのオムニ動画モデル

中級

2026 年 8 月 3 日、MiniMax は MiniMax-H3 (消費者向け名称: Hailuo 3.0) のウェイトを Hugging Face にプッシュしました — 330 億パラメータの単一ストリーム Transformer で、テキスト、画像、動画、音声のリファレンスから 最大 2K/24fps でネイティブなステレオ音声付きの 4〜15 秒のクリップ を、すべて 1 パスで生成します。その最後の部分が興味深いところです: 別個の TTS ステージも、後付けの SFX パイプラインもありません。台詞、部屋の環境音、そして映像が、同じモデルから一緒に出てきます。

3 日前、有料 API は 2K で 1 秒あたり $0.1625 (~$9.75/分) で開放されており、同等の解像度における Kling 3.0 や Seedance 2.0 のおよそ半分のコスト です。Artificial Analysis のリーダーボードでは、シングルラン スコアで H3 は 音声付き動画編集で第 1 位、テキストから動画および画像から動画では上位 3 位に入りました。その組み合わせ — フロンティア級の動画品質、オープンウェイト、そして正直な 1 分あたり $10 未満の価格 — が今週、H3 をすべての生成メディア フィードに載せた理由です。

このページは、他の記事のほとんどが見逃しているものです: H3 が あなた にとって実際に役立つかを決める部分。

What you'll learn
  • H3 のアーキテクチャ — 単一ストリーム Transformer、H3-VAE、MM-RoPE — を理解し、なぜそれが 1 回のフォワードパスで動画と音声を生成するのかを知る
  • ランディングページには誰も載せない 3 つのセルフホスティングの落とし穴を知る: 地理的に制限されたライセンス、オープンベースの 768p 上限、そして AdaLN パラメータのスキップの技
  • 動作するセルフホストの経路を得る: 最低 42.5 GB のウェイト、量子化の選択肢、そして 12 GB カードがオフロードでどう動かすか
  • コピーできる実物の cURL で API から H3 を試し、入力形状の制限 (最大 12 ファイル、≤64 MB のボディ、公開 URL のみ) を知る
  • H3 とクローズドな代替 (Kling 3.0、Seedance 2.0、Veo、Sora) の間で、価格、制御、ライセンスの明確なタイブレーカーで選ぶ

H3 について見出しからは明らかにならない 3 つのこと

1. Community License は US、EU、UK、韓国での自前ホスティングをブロックする

Hugging Face のモデルカードは、MiniMax H3 Community License Agreement にリンクしています。その本文は 4 つの地域について申請ゲート付きです: 米国、欧州連合、英国、大韓民国。実際には次のことを意味します: あなたまたはあなたの組織がこれらの場所のいずれかにあり、H3 を自分のハードウェアで実行 (またはユーザーに提供) したい場合、まず platform.minimax.io/h3-license で H3 ライセンス申請を完了する必要があります。制限は アウトプット にも及びます — ウェイトだけではありません — これはほとんどの再投稿記事がスキップする詳細です。

これらの地域の外にいる場合は、標準の Community License が適用されます。これらの地域にいる場合は、申請がクリアされるまで API をデフォルトの経路として扱うか、ウェイトに触れるものを出荷する前に組織のライセンスレビュアーを使ってください。これは実質的で執行可能な制限です — よくある「悪いことはしないでください」的な条項ではありません。

2. オープンなベースは 768p が上限 — 2K は API 内にしか存在しない

H3 についての「最大 2K」という見出しはすべて、重要な詳細を省いています: オープンウェイトのベースモデル (テキスト から 動画 / 最初 最後 のフレーム用の Base FL2VA、複数リファレンス用の Base Ref2VA) は 768p で生成します。人々が Hailuo アプリで驚いている 2K のアウトプットは、ベースモデルの で実行される in-context アップサンプラーである H3-Regenerate-2K から来ており、MiniMax はこれを オープンソース化していません。マルチモーダル指示のプリプロセッサである H3-Context-IR も API 限定です。

セルフホスターにとっての結果はシンプルです: フロンティアシステムが構築されているのと同じ生成品質を得られますが、独自のアップスケーラーを後段に連結しない限り 768p が上限 です (Topaz、ESRGAN、拡散アップサンプラーなど)。これは多くのユースケースには問題ありません — 24fps の 768p はソーシャルクリップ、絵コンテ、迅速な反復には十分以上です — が、有料ティアと同じプロダクトではありません。

3. 33B パラメータの約 13B は、事前計算してスキップできる AdaLN 分岐

モデルカードは H3-Omni-Transformer を 33B の dense な単一ストリーム Transformer と説明しており、そのうち およそ 13B パラメータが AdaLN 関連の分岐に存在 します。AdaLN (Adaptive Layer Norm) は、拡散スタイルの transformer が条件付け信号 (タイムステップ、クラス、テキスト埋め込み) を吸収する方法であり — そのアウトプットは、条件付けスロットごとに 事前計算可能 です。素朴な BF16 ウェイトははるかに大きいにも関わらず、サードパーティのプロバイダが 最低 42.5 GB の動作構成 に到達するのはこの方法です: 剪定された INT8 チェックポイント (~20 GB) を NVFP4 AWQ のテキストエンコーダ (~16 GB) と両方の VAE (~5.8 GB) と組み合わせ、推論時にキャッシュされた分岐のウェイトをスキップします。

ComfyUI エコシステムからの目安: 12 GB カードは CPU/RAM オフロードで H3 を実行できる、代償はクリップあたりのレンダリング時間が長くなること。24 GB 以上あればオフロードは不要です。

H3 が実際に何なのか (1 ページで見るアーキテクチャ)

H3 は 単一ストリームでモダリティに依存しない Transformer です。1 つの attention スタック、1 つの FFN スタックがあり、動画/音声/テキストのトークンはすべてそれを通過します。実際にロードする 4 つのコンポーネント:

コンポーネント役割オープンソース?
H3-Omni-Transformer33B dense ジェネレータ (動画 + 音声)✅ (BF16、INT8、剪定 INT8)
H3-Encoderマルチモーダル テキスト/ビジョン エンコーダ — Qwen3-VL-32B のレイヤー 50 隠れ状態を再利用
H3-VisualVAE時間的因果動画オートエンコーダ、f16t4d24 圧縮
H3-AudioVAEステレオ音声、32 kHz アウトプット、40 Hz の時間レート
H3-Context-IRマルチモーダル指示プリプロセッサ❌ API 限定
H3-Regenerate-2K2K への in-context アップスケーラー❌ API 限定

H3 を他の動画モデルと比較する人にとって、指摘に値する 2 つの設計選択があります:

  • 3-D MM-RoPE 位置埋め込み。 Rotary 位置が 3 つの軸 (空間 x、空間 y、時間) に拡張されるので、時間的整合性は別個の時間モジュールで加えるのではなく attention パターンに組み込まれています。これは H3 が 15 秒のクリップにわたって被写体のアイデンティティとライティングを安定に保つ主な理由の 1 つです。
  • H3-VAE は 4 倍の実効シーケンス長のゲインを与える。 カスタム トークナイザは、以前のオープン動画モデルで使われていた標準の VAE よりもトークンあたりのピクセルを多く詰め込みます — これがこのパラメータクラスで 2K のアウトプットをそもそもトラクタブルにする理由です。

ネイティブな音声パス はもう 1 つの差別化要因です。台詞、SFX、部屋の環境音が映像と同じフォワードパスで生成されるので、リップシンクとダイエジェティック音声はデフォルトで整合してきます。リファレンス音声 (WAV/MP3、クリップあたり 2〜15 秒、最大 3 クリップ) は音声クローニングを可能にします; ただし音声リファレンスは 画像または動画のリファレンスに伴わなければならない — API は音声のみの入力を拒否します。

セルフホスティングの計算

H3 をローカルで実行することを計画しているなら、これらが何が収まるかを決める数字です:

チェックポイント拡散モデルテキストエンコーダ両方の VAE最低動作合計
BF16 (リファレンス)61.7 GB48.0 GB5.82 GB~115 GB
INT831.7 GB25.3 GB5.82 GB~63 GB
剪定 INT8 + NVFP4 AWQ TE19.5 GB14.6 GB5.82 GB~42.5 GB

VRAM: 24 GB で快適12 GB でオフロード付き (クリップあたりが遅くなる)。SGLang の例の設定はサービス提供に 4 GPU を使います。

Guided walkthrough1 of 4
  1. H3 のネイティブサポートは、ウェイトがドロップされたのと同じ日 (2026 年 8 月 3 日) に ComfyUI にマージされました。最新をプルすれば、新しい H3 ノードが自動的に現れます。

API 経由で H3 を呼び出す

API は REST + ポーリングです。ジョブを POST し、task_id を受け取り、status == "succeeded" になるまでクエリエンドポイントをポーリングします。公開 URL のみが機能します — Base64 ペイロードは拒否され、リクエスト本文の合計は 64 MB で上限に達します。リファレンス制限: ≤9 画像、≤3 動画クリップ、≤3 音声クリップ、合計 12 ファイル、≤7,000 文字のプロンプト

音声リファレンス付きの H3 テキスト to 動画 (Python)

import os, time, requests

headers = {"Authorization": f"Bearer {os.environ['MINIMAX_API_KEY']}"}

payload = {
  "model": "MiniMax-H3",
  "content": [
      {"type": "text",
       "text": "Wide shot: a lighthouse keeper walks onto the balcony and says, 'Follow the wind, live free.' Voice follows reference audio 1."},
      {"type": "audio_url",
       "audio_url": {"url": "https://example.com/voice-ref.mp3"},
       "role": "reference_audio"},
      {"type": "image_url",
       "image_url": {"url": "https://example.com/lighthouse.jpg"},
       "role": "reference_image"},
  ],
  "resolution": "2K",   # 2K is the only value the API accepts right now
  "duration": 8,        # seconds, 4–15
  "ratio": "16:9",
}

task_id = requests.post(
  "https://api.minimax.io/v2/video_generation",
  headers=headers, json=payload,
).json()["task_id"]

while True:
  time.sleep(10)
  task = requests.get(
      f"https://api.minimax.io/v2/query/video_generation/{task_id}",
      headers=headers,
  ).json()["task"]
  if task["status"] == "succeeded":
      print(task["video_url"])
      break
  if task["status"] == "failed":
      raise RuntimeError(task)

diffusers 経由でローカルの H3 (セルフホスト、768p)

from diffusers import DiffusionPipeline
import torch

pipe = DiffusionPipeline.from_pretrained(
  "MiniMaxAI/MiniMax-H3",
  dtype=torch.bfloat16,
  device_map="cuda",
)

video, audio = pipe(
  prompt="Slow dolly-in on a neon-lit ramen shop at night; steam rising; jazz sax outside.",
  num_frames=24 * 8,   # 8 seconds at 24 fps
  height=768, width=1344,
  generator=torch.manual_seed(42),
)
video.save("ramen.mp4"); audio.save("ramen.wav")

H3 対 クローズドな動画 API — それぞれが勝つとき

MiniMax H3Kling 3.0Dreamina Seedance 2.0Sora / Veo (フロンティア クローズド)
最大解像度 (API)2K/24fps1080p1080p1080p〜4K (バリアント)
ネイティブ音声✅ 台詞 + SFX + 環境音別ステージ別ステージ✅ (Sora 2)、✅ (Veo)
オープン ウェイト✅ (Community、地理制限)
1 分あたりのコスト (同等ティア)~$9.75 (2K + 音声)~$20 (1080p)~$22 (1080p)高価かつレート制限
リファレンス制御≤9 画像、≤3 動画、≤3 音声同様少ないスロット少ないスロット
最適な用途最低の $/分 で最高の忠実度のアウトプット; 制限地域外なら on-prem/セルフホスト長いショットでのスタイルの安定性映画的なルック、プロンプトの忠実度中国のベンダーにプロンプトを漏らせず、フロンティアの磨きが必要なとき

H3 に手を伸ばすとき: 2K でフレーム内音声が必要なとき、1 分あたりのコストが重要でクローズド API が予算を吹き飛ばすとき、あるいはコンプライアンスが生成を on-prem に保つことを強制する かつ Community License について法的状況がクリアなとき。H3 をスキップするとき: チームが制限地域に住んでいて申請をクリアしていないとき、ワークフローがネイティブな 4K に依存するとき、あるいは中国本土の API にプロンプトを送れないとき (有料ティアは MiniMax でホストされる; ローンチ時点で US リージョンのミラーはない)。

クイズ

Check yourself

0/4
  1. Hugging Face のオープンウェイト ベース H3 チェックポイントは、動画をどの最大解像度で生成しますか?
  2. MiniMax H3 Community License によると、現在ウェイトのセルフホスティングに申請を必要とする地域はどれですか?
  3. H3-Omni-Transformer は 33B パラメータを持ちます。そのうち約 13B について何が特別ですか?
  4. 以下のうち、有料 H3 API の今日の実際の制限はどれですか?
Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 9

ソースとさらなる読み物