MiniMax H3 (Hailuo 3.0): オープンウェイトのオムニ動画モデル
2026 年 8 月 3 日、MiniMax は MiniMax-H3 (消費者向け名称: Hailuo 3.0) のウェイトを Hugging Face にプッシュしました — 330 億パラメータの単一ストリーム Transformer で、テキスト、画像、動画、音声のリファレンスから 最大 2K/24fps でネイティブなステレオ音声付きの 4〜15 秒のクリップ を、すべて 1 パスで生成します。その最後の部分が興味深いところです: 別個の TTS ステージも、後付けの SFX パイプラインもありません。台詞、部屋の環境音、そして映像が、同じモデルから一緒に出てきます。
3 日前、有料 API は 2K で 1 秒あたり $0.1625 (~$9.75/分) で開放されており、同等の解像度における Kling 3.0 や Seedance 2.0 のおよそ半分のコスト です。Artificial Analysis のリーダーボードでは、シングルラン スコアで H3 は 音声付き動画編集で第 1 位、テキストから動画および画像から動画では上位 3 位に入りました。その組み合わせ — フロンティア級の動画品質、オープンウェイト、そして正直な 1 分あたり $10 未満の価格 — が今週、H3 をすべての生成メディア フィードに載せた理由です。
このページは、他の記事のほとんどが見逃しているものです: H3 が あなた にとって実際に役立つかを決める部分。
- H3 のアーキテクチャ — 単一ストリーム Transformer、H3-VAE、MM-RoPE — を理解し、なぜそれが 1 回のフォワードパスで動画と音声を生成するのかを知る
- ランディングページには誰も載せない 3 つのセルフホスティングの落とし穴を知る: 地理的に制限されたライセンス、オープンベースの 768p 上限、そして AdaLN パラメータのスキップの技
- 動作するセルフホストの経路を得る: 最低 42.5 GB のウェイト、量子化の選択肢、そして 12 GB カードがオフロードでどう動かすか
- コピーできる実物の cURL で API から H3 を試し、入力形状の制限 (最大 12 ファイル、≤64 MB のボディ、公開 URL のみ) を知る
- H3 とクローズドな代替 (Kling 3.0、Seedance 2.0、Veo、Sora) の間で、価格、制御、ライセンスの明確なタイブレーカーで選ぶ
H3 について見出しからは明らかにならない 3 つのこと
1. Community License は US、EU、UK、韓国での自前ホスティングをブロックする
Hugging Face のモデルカードは、MiniMax H3 Community License Agreement にリンクしています。その本文は 4 つの地域について申請ゲート付きです: 米国、欧州連合、英国、大韓民国。実際には次のことを意味します: あなたまたはあなたの組織がこれらの場所のいずれかにあり、H3 を自分のハードウェアで実行 (またはユーザーに提供) したい場合、まず platform.minimax.io/h3-license で H3 ライセンス申請を完了する必要があります。制限は アウトプット にも及びます — ウェイトだけではありません — これはほとんどの再投稿記事がスキップする詳細です。
これらの地域の外にいる場合は、標準の Community License が適用されます。これらの地域にいる場合は、申請がクリアされるまで API をデフォルトの経路として扱うか、ウェイトに触れるものを出荷する前に組織のライセンスレビュアーを使ってください。これは実質的で執行可能な制限です — よくある「悪いことはしないでください」的な条項ではありません。
2. オープンなベースは 768p が上限 — 2K は API 内にしか存在しない
H3 についての「最大 2K」という見出しはすべて、重要な詳細を省いています: オープンウェイトのベースモデル (テキスト から 動画 / 最初 最後 のフレーム用の Base FL2VA、複数リファレンス用の Base Ref2VA) は 768p で生成します。人々が Hailuo アプリで驚いている 2K のアウトプットは、ベースモデルの 後 で実行される in-context アップサンプラーである H3-Regenerate-2K から来ており、MiniMax はこれを オープンソース化していません。マルチモーダル指示のプリプロセッサである H3-Context-IR も API 限定です。
セルフホスターにとっての結果はシンプルです: フロンティアシステムが構築されているのと同じ生成品質を得られますが、独自のアップスケーラーを後段に連結しない限り 768p が上限 です (Topaz、ESRGAN、拡散アップサンプラーなど)。これは多くのユースケースには問題ありません — 24fps の 768p はソーシャルクリップ、絵コンテ、迅速な反復には十分以上です — が、有料ティアと同じプロダクトではありません。
3. 33B パラメータの約 13B は、事前計算してスキップできる AdaLN 分岐
モデルカードは H3-Omni-Transformer を 33B の dense な単一ストリーム Transformer と説明しており、そのうち およそ 13B パラメータが AdaLN 関連の分岐に存在 します。AdaLN (Adaptive Layer Norm) は、拡散スタイルの transformer が条件付け信号 (タイムステップ、クラス、テキスト埋め込み) を吸収する方法であり — そのアウトプットは、条件付けスロットごとに 事前計算可能 です。素朴な BF16 ウェイトははるかに大きいにも関わらず、サードパーティのプロバイダが 最低 42.5 GB の動作構成 に到達するのはこの方法です: 剪定された INT8 チェックポイント (~20 GB) を NVFP4 AWQ のテキストエンコーダ (~16 GB) と両方の VAE (~5.8 GB) と組み合わせ、推論時にキャッシュされた分岐のウェイトをスキップします。
ComfyUI エコシステムからの目安: 12 GB カードは CPU/RAM オフロードで H3 を実行できる、代償はクリップあたりのレンダリング時間が長くなること。24 GB 以上あればオフロードは不要です。
H3 が実際に何なのか (1 ページで見るアーキテクチャ)
H3 は 単一ストリームでモダリティに依存しない Transformer です。1 つの attention スタック、1 つの FFN スタックがあり、動画/音声/テキストのトークンはすべてそれを通過します。実際にロードする 4 つのコンポーネント:
| コンポーネント | 役割 | オープンソース? |
|---|---|---|
| H3-Omni-Transformer | 33B dense ジェネレータ (動画 + 音声) | ✅ (BF16、INT8、剪定 INT8) |
| H3-Encoder | マルチモーダル テキスト/ビジョン エンコーダ — Qwen3-VL-32B のレイヤー 50 隠れ状態を再利用 | ✅ |
| H3-VisualVAE | 時間的因果動画オートエンコーダ、f16t4d24 圧縮 | ✅ |
| H3-AudioVAE | ステレオ音声、32 kHz アウトプット、40 Hz の時間レート | ✅ |
| H3-Context-IR | マルチモーダル指示プリプロセッサ | ❌ API 限定 |
| H3-Regenerate-2K | 2K への in-context アップスケーラー | ❌ API 限定 |
H3 を他の動画モデルと比較する人にとって、指摘に値する 2 つの設計選択があります:
- 3-D MM-RoPE 位置埋め込み。 Rotary 位置が 3 つの軸 (空間 x、空間 y、時間) に拡張されるので、時間的整合性は別個の時間モジュールで加えるのではなく attention パターンに組み込まれています。これは H3 が 15 秒のクリップにわたって被写体のアイデンティティとライティングを安定に保つ主な理由の 1 つです。
- H3-VAE は 4 倍の実効シーケンス長のゲインを与える。 カスタム トークナイザは、以前のオープン動画モデルで使われていた標準の VAE よりもトークンあたりのピクセルを多く詰め込みます — これがこのパラメータクラスで 2K のアウトプットをそもそもトラクタブルにする理由です。
ネイティブな音声パス はもう 1 つの差別化要因です。台詞、SFX、部屋の環境音が映像と同じフォワードパスで生成されるので、リップシンクとダイエジェティック音声はデフォルトで整合してきます。リファレンス音声 (WAV/MP3、クリップあたり 2〜15 秒、最大 3 クリップ) は音声クローニングを可能にします; ただし音声リファレンスは 画像または動画のリファレンスに伴わなければならない — API は音声のみの入力を拒否します。
セルフホスティングの計算
H3 をローカルで実行することを計画しているなら、これらが何が収まるかを決める数字です:
| チェックポイント | 拡散モデル | テキストエンコーダ | 両方の VAE | 最低動作合計 |
|---|---|---|---|---|
| BF16 (リファレンス) | 61.7 GB | 48.0 GB | 5.82 GB | ~115 GB |
| INT8 | 31.7 GB | 25.3 GB | 5.82 GB | ~63 GB |
| 剪定 INT8 + NVFP4 AWQ TE | 19.5 GB | 14.6 GB | 5.82 GB | ~42.5 GB |
VRAM: 24 GB で快適、12 GB でオフロード付き (クリップあたりが遅くなる)。SGLang の例の設定はサービス提供に 4 GPU を使います。
- H3 のネイティブサポートは、ウェイトがドロップされたのと同じ日 (2026 年 8 月 3 日) に ComfyUI にマージされました。最新をプルすれば、新しい H3 ノードが自動的に現れます。
- 24 GB+ カード → INT8 または BF16。12〜16 GB カード → 剪定 INT8 + NVFP4 AWQ テキストエンコーダ + CPU オフロード。12 GB 未満は API を使うこと — 楽しい時間にはなりません。
- 3 つのローカル (テキスト から 動画、画像 から 動画、リファレンス から 動画) と 3 つの API バック (テキスト から 動画、リファレンス から 動画、最初/最後 フレーム から 動画) が ComfyUI 組み込みのギャラリーに同梱されています。自分でノードを配線するよりテンプレートから始めましょう。
- 組織が US、EU、UK、韓国にある場合、H3 をユーザーに面するものにデプロイする前に platform.minimax.io/h3-license で申請を完了してください。
API 経由で H3 を呼び出す
API は REST + ポーリングです。ジョブを POST し、task_id を受け取り、status == "succeeded" になるまでクエリエンドポイントをポーリングします。公開 URL のみが機能します — Base64 ペイロードは拒否され、リクエスト本文の合計は 64 MB で上限に達します。リファレンス制限: ≤9 画像、≤3 動画クリップ、≤3 音声クリップ、合計 12 ファイル、≤7,000 文字のプロンプト。
音声リファレンス付きの H3 テキスト to 動画 (Python)
import os, time, requests
headers = {"Authorization": f"Bearer {os.environ['MINIMAX_API_KEY']}"}
payload = {
"model": "MiniMax-H3",
"content": [
{"type": "text",
"text": "Wide shot: a lighthouse keeper walks onto the balcony and says, 'Follow the wind, live free.' Voice follows reference audio 1."},
{"type": "audio_url",
"audio_url": {"url": "https://example.com/voice-ref.mp3"},
"role": "reference_audio"},
{"type": "image_url",
"image_url": {"url": "https://example.com/lighthouse.jpg"},
"role": "reference_image"},
],
"resolution": "2K", # 2K is the only value the API accepts right now
"duration": 8, # seconds, 4–15
"ratio": "16:9",
}
task_id = requests.post(
"https://api.minimax.io/v2/video_generation",
headers=headers, json=payload,
).json()["task_id"]
while True:
time.sleep(10)
task = requests.get(
f"https://api.minimax.io/v2/query/video_generation/{task_id}",
headers=headers,
).json()["task"]
if task["status"] == "succeeded":
print(task["video_url"])
break
if task["status"] == "failed":
raise RuntimeError(task)diffusers 経由でローカルの H3 (セルフホスト、768p)
from diffusers import DiffusionPipeline
import torch
pipe = DiffusionPipeline.from_pretrained(
"MiniMaxAI/MiniMax-H3",
dtype=torch.bfloat16,
device_map="cuda",
)
video, audio = pipe(
prompt="Slow dolly-in on a neon-lit ramen shop at night; steam rising; jazz sax outside.",
num_frames=24 * 8, # 8 seconds at 24 fps
height=768, width=1344,
generator=torch.manual_seed(42),
)
video.save("ramen.mp4"); audio.save("ramen.wav")H3 対 クローズドな動画 API — それぞれが勝つとき
| MiniMax H3 | Kling 3.0 | Dreamina Seedance 2.0 | Sora / Veo (フロンティア クローズド) | |
|---|---|---|---|---|
| 最大解像度 (API) | 2K/24fps | 1080p | 1080p | 1080p〜4K (バリアント) |
| ネイティブ音声 | ✅ 台詞 + SFX + 環境音 | 別ステージ | 別ステージ | ✅ (Sora 2)、✅ (Veo) |
| オープン ウェイト | ✅ (Community、地理制限) | ❌ | ❌ | ❌ |
| 1 分あたりのコスト (同等ティア) | ~$9.75 (2K + 音声) | ~$20 (1080p) | ~$22 (1080p) | 高価かつレート制限 |
| リファレンス制御 | ≤9 画像、≤3 動画、≤3 音声 | 同様 | 少ないスロット | 少ないスロット |
| 最適な用途 | 最低の $/分 で最高の忠実度のアウトプット; 制限地域外なら on-prem/セルフホスト | 長いショットでのスタイルの安定性 | 映画的なルック、プロンプトの忠実度 | 中国のベンダーにプロンプトを漏らせず、フロンティアの磨きが必要なとき |
H3 に手を伸ばすとき: 2K でフレーム内音声が必要なとき、1 分あたりのコストが重要でクローズド API が予算を吹き飛ばすとき、あるいはコンプライアンスが生成を on-prem に保つことを強制する かつ Community License について法的状況がクリアなとき。H3 をスキップするとき: チームが制限地域に住んでいて申請をクリアしていないとき、ワークフローがネイティブな 4K に依存するとき、あるいは中国本土の API にプロンプトを送れないとき (有料ティアは MiniMax でホストされる; ローンチ時点で US リージョンのミラーはない)。
クイズ
Check yourself
0/4ソースとさらなる読み物
- MiniMax-H3 on Hugging Face — モデルカード、コンポーネント リスト、ライセンス、ダウンロード数
- Open General Intelligence: MiniMax H3 is Now Open Source — MiniMax News — アーキテクチャの詳細とシステム コンポーネントを含む公式ローンチ ポスト
- ComfyUI Wiki: MiniMax H3 open weights & ComfyUI — 6 つの公式ワークフロー テンプレートと、BF16、INT8、剪定 INT8、NVFP4 AWQ にわたる拡散 / テキスト エンコーダ ファイル サイズ
- AtlasCloud: MiniMax H3 open source weights — 42.5 GB and 4 excluded countries — ライセンス地域の内訳と剪定 INT8 + AdaLN キャッシュの理由付け
- ExplainX: MiniMax H3 open weights — license excludes US/EU/UK/SK — 地理制限とライセンス本文の独立した読み解き
- Hugging Face community blog: What is MiniMax H3? — API 形状、入力制限、Kling / Seedance と対比した価格計算の独立した概要
- Segmind blog: H3 release, open weights and API pricing — 7 月 30〜31 日のティーザーとローンチのタイムライン
- 関連: 生成メディア: 画像、音声、動画 AI — H3 が幅広いメディア AI マップの中でどこに位置するか
- 関連: DeepSeek、Qwen とオープン ウェイトの波 — オープン ウェイトのテキスト/コーディング波の関連概要
- 関連: Kimi K3: 世界最大のオープン ウェイト モデル — 同月の並行するオープン ウェイト フロンティア リリース