メインコンテンツまでスキップ

Qwen3.8-Max:初のオープンウェイトMaxクラスモデル(重みが公開されたら)

中級

2026年8月3日、AlibabaのQwenチームはQwen3.8-Maxを発表した ― 2.4兆パラメータのMixture-of-Experts、アクティブパラメータ95B、1Mトークンのコンテキスト、OSWorld-VerifiedでGPT-5.6 Sol Maxをわずかに上回るベンチマーク数値を持つモデルだ。Alibabaはこの発表をオープンウェイトになる初のQwen「Max」クラスモデルと位置づけた ― 過去のMaxクラスQwenはすべてAPI専用だったため、これは方針転換だ。重みは2026年8月10日の週にHugging FaceとModelScopeで公開されると約束された。

依存する前に読んでおく価値がある落とし穴がある。ローンチ時とその後数日間、Hugging Faceのページは空だった。このページでは、2026年8月初旬時点でのQwen3.8-Maxの実際の状態を追う ― アーキテクチャ、価格、ClaudeまたはOpenAIクライアントに差し込めるデュアル仕様API、「ベンダー報告」の注釈付きベンチマーク表、そしてコードをコミットする前に問うべき恒久的な質問だ。

What you'll learn
  • 8月3日に何が公開され、何が約束されただけだったのかを理解する ― APIアクセス vs オープンウェイト
  • 2.4T / 95BアクティブのMoEスパース性計算を正しく読む、特にセルフホストデプロイの価格試算をする前に
  • Qwen3.8-MaxはOpenAI仕様とAnthropic仕様の両方のAPIを公開している ― 移植性を変える珍しい特性
  • ローンチ時のベンチマーク(OSWorld 86.1、PaperBench 93.0)を適切な懐疑心を持って解釈する ― ベンダー報告、モデルカードなし、第三者による実行結果はまだない
  • 「オープンウェイトを約束 ≠ オープンウェイトが公開済み」パターンを認識し、待っている間に何をすべきか

一文で言うと

Qwen3.8-Maxは2.4兆パラメータのスパースMoE(トークンごとにアクティブ95B)で、1Mトークンのコンテキスト、テキスト+ビジョンのネイティブ入力、OpenAI仕様とAnthropic仕様のデュアルAPI、入出力100万トークンあたり$2/$6の価格 ― 2026年8月3日にAPI専用として発表され、重みと兄弟モデルQwen3.8-27Bは2026年8月10日の週にオープンリリースが約束された。

ヘッドラインからは明らかでないQwen3.8-Maxに関する3つのこと

1.「オープンウェイト」は発表されたが、まだ公開されていない

Alibabaのローンチ発表とほとんどの報道は、Qwen3.8-Maxを初のオープンウェイト「Max」クラスQwenとして説明した。これは本当の方針転換だ ― Qwen3-Max、Qwen3.5-Max、Qwen3.6-Max、Qwen3.7-MaxはすべてAPI専用だった。しかしローンチ時、そして最初の週を通じて、Hugging FaceのQwen組織にはQwen3.8-MaxリポジトリもQwen3.8-27Bリポジトリもなく、ライセンスも宣言されていなかった。約束は「8月10日の週に重み」だった。それを軸にコンプライアンスケースを計画する前に確認すること。

ローンチ最初の1時間のコミュニティ反応は、ほぼすべてベンチマークではなく重みに関するものだった。ユーザーは、アーティファクトが公開されていないのにAlibabaが「オープンソース」と表現していることに反発した。内面化すべき有用な区別:

  • 「利用可能な」モデルは、ベンダーの条件で借りるサービスだ。APIが非推奨になると、依存関係が壊れる。
  • 「オープンウェイト」モデルは、ダウンロードして保持するアーティファクトだ。監査でき、エアギャップクラスタで実行でき、ベンダーが方針転換しても保持できる。

これらは異なるリスクプロファイルを持つ異なる製品だ。以前のQwenオープンウェイトリリース(Qwen 3.5、Qwen 3.6)はApache-2.0の下で公開された ― これは強いパターンだが、Qwen3.8への約束ではない。ライセンスが公開された日に読むこと。仮定しないこと。

2. 4%のスパース性は4%のハードウェアを意味しない

Qwen3.8-MaxはMixture-of-Expertsだ。2.4T総パラメータのうち、トークンごとにアクティブになるのは~95Bのみ ― およそ4%のスパース性。これがトークンあたりの価格が競争力を持ち、レイテンシが妥当な理由だ:2.4Tではなく~95Bのフォワードパス計算に対して支払っている。

罠は、重みメモリはそのようには動作しないということだ。モデルを実行するには、ルーターが適切なエキスパートを引き出せるよう、2.4T全パラメータを十分に速い場所に常駐させる必要がある。fp8ではおよそ2.4TBの重みメモリ。fp16では~4.8TB。積極的なMXFP4や同等の4-bit量子化を使っても、KVキャッシュを1Mトークンのコンテキスト用に数える前に、重みだけで**≥1.2 TB**を見込む必要がある。つまり:

  • 単一H100(80 GB)― 4-bitでもフルモデルには不十分。
  • 8×H100ノード(640 GB)― フル2.4Tには4-bitでもまだ不足。重いCPUオフロードで可能だが、大きなレイテンシコスト。
  • マルチノード推論(16以上のH100または同等)― リアルタイム提供の現実的なフットプリント。

「アクティブが95Bだけだから単一マシンで実行できる」と誰かが言ったら ― 間違った数字を数えている。兄弟モデルQwen3.8-27B密モデルが存在する理由の一部はこれだ:英雄的なことをせずに単一の8-GPUノードで実際に実行できるのはこれだ。

3. OpenAI互換とAnthropic互換の両方のAPI ― 同じエンドポイントから

Qwen3.8-MaxのAPIはOpenAI /v1/chat/completions形式とAnthropic /v1/messages形式の両方をサポートする。ほとんどのベンダーは1つだけ、少数はOpenAI互換シムを提供するが、Qwenが第一級のAnthropic仕様サポートを提供するのは本当に珍しく、計画する価値がある。

実用的な結果:Claude用にAnthropic Python SDKに対して書いたコード ― messages.create()、ツールブロック、システムプロンプト処理、ストリーミングを含む ― は、base URLの変更だけでQwen3.8-Maxを指せる。メッセージ形式の書き直しはない。OpenAI SDKコードも同じ。これにより、ClaudeやGPTに対するA/Bテストが通常の「ツールスキーマを移植する」作業よりもずっと安価になる。

Anthropic互換API経由のQwen3.8-Max(Python)

from anthropic import Anthropic

client = Anthropic(
  api_key="YOUR_DASHSCOPE_KEY",
  base_url="https://dashscope.aliyuncs.com/api/v1",  # verify current base URL in Qwen docs
)

response = client.messages.create(
  model="qwen3.8-max",
  max_tokens=1024,
  messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)

OpenAI互換API経由のQwen3.8-Max(Python)

import openai

client = openai.OpenAI(
  api_key="YOUR_DASHSCOPE_KEY",
  base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
  model="qwen3.8-max",
  messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)

ローンチベンチマークが示すこと ― そして注釈が意味すること

Alibabaのローンチ数値(自己申告、ローンチ時にモデルカードや再現可能な評価トレースなし):

ベンチマークQwen3.8-MaxGPT-5.6 Sol MaxClaude Fable 5Gemini 3.1 Pro
OSWorld-Verified(エージェント的OS使用)86.183.285.076.2
PaperBench(研究統合)93.0
Frontend Code Arena4位

これらを誰かに引用する前に覚えておくべき具体的な注釈:

  • ベンダー報告。 ローンチ時にモデルカードなし、eval harnessコミットなし、第三者複製なし ― 通常数日以内に独立したスコアを公開するArtificial Analysisからも。
  • OSWorld-Verifiedは上位ではわずかな差。 Qwen 86.1、Claude Fable 5 85.0、GPT-5.6 Sol Max 83.2は1〜3ポイントの差。多くのエージェントベンチマークのノイズバンド内。「1つのベンチマークでフロンティアを1.1ポイント上回る」は「フロンティアを置き換える」ではない。
  • PaperBenchはSWE-benchやGPQAより確立されていない。 93.0のヘッドラインは印象的だが、決定的ではなく方向的なものとして扱うべき。
  • Frontend Code ArenaではQwen3.8-Maxを4位に置いた ― 複数のAnthropicモデルとFable 5バリアントの後ろ。異なるタスクは異なる訓練シグナルに報酬を与える。あるベンチマークで#1、別のベンチマークで#4は矛盾ではなく正常な結果だ。

独立した評価(Artificial Analysis、LMArena、第三者学術実行)を待ってからモデル選択のデフォルトを書き直すのが冷静な選択だ。

知る価値のある価格計算

APIの価格表:

ティア100万トークンあたり価格
入力$2.00
出力$6.00
キャッシュ入力$0.25

これは現在のAnthropic Maxティアより8倍安い入力コストで、GPT-5.6 Sol Maxの出力コストの約半分。キャッシュ入力$0.25/MTokが興味深い部分だ:同じシステムプロンプトでの繰り返しのエージェント的ツールループでは、キャッシュヒット率は通常80%を超えるため、動作中のエージェントの実効入力コストは$2.00ではなく$0.35〜$0.60/MTokに近くなる。

Kimi K3の経済性と比較すると ― キャッシュヒット入力が$0.30/MTok ― Qwen3.8-Maxは同じ低キャッシュ価格帯にある。これにより、同じプロンプトの足場がすべてのツールステップで再送信されるコスト敏感な長時間エージェント的ワークロードの両方が実行可能になる。

Qwen3.8-Maxを始める(今日、API経由で)

Guided walkthrough1 of 4
  1. Qwen APIはDashScope(中国リージョン)およびModel Studio(国際)経由で提供される。ワークスペースでモデルを有効にしAPIキーを生成すると、両方がqwen3.8-maxモデルIDを公開する。

Qwen3.8-Max vs 競合モデル

Qwen3.8-MaxKimi K3GLM-5.2Claude Fable 5GPT-5.6 Sol Max
総パラメータ数2.4T MoE2.8T MoE753B非公開非公開
トークンあたりアクティブ~95B16/896 エキスパート
コンテキストウィンドウ1M1M1M+400K+
ネイティブビジョンYesYesテキストのみYesYes
オープンウェイト発表済み(8月10日の週)公開済み 2026年7月27日公開済みNoNo
入力価格 / MTok$2.00(キャッシュ$0.25)$3.00(キャッシュ$0.30)無料(セルフホスト)ベンダーティアベンダーティア
出力価格 / MTok$6.00$15.00無料(セルフホスト)ベンダーティアベンダーティア
API仕様OpenAI + AnthropicOpenAI互換様々AnthropicOpenAI

Qwen3.8-Maxを選ぶタイミング:後でセルフホストもできるフロンティアティアAPIが欲しい、予算がAnthropic/OpenAI Maxティアより厳しい、または(Anthropic仕様サポートのおかげで)最小限のコード変更でClaudeに対してA/Bテストしたい。

Kimi K3を選ぶタイミング:今日オープンウェイトが必要(K3は2026年7月27日に公開)、またはすでにMoonshotツールを使っている。

GLM-5.2を選ぶタイミング:セルフホスティングが今必須の要件で、ビジョンが重要でない。

Claude Fable 5またはGPT-5.6 Sol Maxを維持するタイミング:最も深い第三者ベンチマーク記録、正式なエンタープライズベンダーコミットメント、またはそれらのモデルが調整された特定のツール使用/安全性動作が必要。

参照:より広範な状況コンテキストはDeepSeek、Qwen & オープンウェイトの波、一般的なフレームワークはモデル選択

Qwen3.8-Maxにコミットする前の実用的チェックリスト

  1. コンプライアンス文書に「オープンウェイト」と書く前に、重みが実際にHugging FaceまたはModelScopeで公開されていることを確認する
  2. 公開された日にライセンスを読む。 Apache-2.0はQwen 3.5と3.6からの強いパターンで、3.8への保証ではない。
  3. 自分でeval実行を行う。 ベンダーのOSWorld-Verified数値は方向的。そのベンチマークの上位1〜3ポイントの差はノイズバンド内。
  4. キャッシュを注意深くコストモデルする。 $0.25/MTokのキャッシュ入力価格は経済性が興味深くなる部分。キャッシュヒットなしでは$2/$6のヘッドラインが実効価格。
  5. セルフホスティングフットプリントを正直に計画する。 アクティブパラメータ4% ≠ GPUメモリ4%。2.4T MoEの完全重み常駐は本格的なデプロイで、ラップトッププロジェクトではない。
  6. どの仕様に対してコードを書くか決める。 OpenAI仕様とAnthropic仕様は両方とも第一級 ― 既存のコードパスに合うものを選び、3つ目の抽象化を発明しない。

クイズ

Check yourself

0/5
  1. Qwen3.8-Maxは2026年8月3日に「オープンウェイト」として発表された。ローンチ時に実際に利用可能だったものは何か?
  2. Qwen3.8-Maxは総パラメータ2.4T、トークンごとにアクティブ95B。これはセルフホスティングハードウェアにとって何を意味するか?
  3. ほとんどの競合モデルと比較して、Qwen3.8-MaxのAPIについて珍しいのは何か?
  4. AlibabaのローンチはQwen3.8-MaxをOSWorld-Verifiedで86.1、GPT-5.6 Sol Maxを83.2と示した。これをどう読むのが正しいか?
  5. Qwen3.8-Maxは入出力100万トークンあたり$2/$6、キャッシュ入力$0.25/MTokをリストしている。大きな安定したシステムプロンプトを持つ長時間実行のエージェント的ループの実用的な実効入力コストは?
Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 8

ソースと参考文献