Qwen3.8-Max:初のオープンウェイトMaxクラスモデル(重みが公開されたら)
2026年8月3日、AlibabaのQwenチームはQwen3.8-Maxを発表した ― 2.4兆パラメータのMixture-of-Experts、アクティブパラメータ95B、1Mトークンのコンテキスト、OSWorld-VerifiedでGPT-5.6 Sol Maxをわずかに上回るベンチマーク数値を持つモデルだ。Alibabaはこの発表をオープンウェイトになる初のQwen「Max」クラスモデルと位置づけた ― 過去のMaxクラスQwenはすべてAPI専用だったため、これは方針転換だ。重みは2026年8月10日の週にHugging FaceとModelScopeで公開されると約束された。
依存する前に読んでおく価値がある落とし穴がある。ローンチ時とその後数日間、Hugging Faceのページは空だった。このページでは、2026年8月初旬時点でのQwen3.8-Maxの実際の状態を追う ― アーキテクチャ、価格、ClaudeまたはOpenAIクライアントに差し込めるデュアル仕様API、「ベンダー報告」の注釈付きベンチマーク表、そしてコードをコミットする前に問うべき恒久的な質問だ。
- 8月3日に何が公開され、何が約束されただけだったのかを理解する ― APIアクセス vs オープンウェイト
- 2.4T / 95BアクティブのMoEスパース性計算を正しく読む、特にセルフホストデプロイの価格試算をする前に
- Qwen3.8-MaxはOpenAI仕様とAnthropic仕様の両方のAPIを公開している ― 移植性を変える珍しい特性
- ローンチ時のベンチマーク(OSWorld 86.1、PaperBench 93.0)を適切な懐疑心を持って解釈する ― ベンダー報告、モデルカードなし、第三者による実行結果はまだない
- 「オープンウェイトを約束 ≠ オープンウェイトが公開済み」パターンを認識し、待っている間に何をすべきか
一文で言うと
Qwen3.8-Maxは2.4兆パラメータのスパースMoE(トークンごとにアクティブ95B)で、1Mトークンのコンテキスト、テキスト+ビジョンのネイティブ入力、OpenAI仕様とAnthropic仕様のデュアルAPI、入出力100万トークンあたり$2/$6の価格 ― 2026年8月3日にAPI専用として発表され、重みと兄弟モデルQwen3.8-27Bは2026年8月10日の週にオープンリリースが約束された。
ヘッドラインからは明らかでないQwen3.8-Maxに関する3つのこと
1.「オープンウェイト」は発表されたが、まだ公開されていない
Alibabaのローンチ発表とほとんどの報道は、Qwen3.8-Maxを初のオープンウェイト「Max」クラスQwenとして説明した。これは本当の方針転換だ ― Qwen3-Max、Qwen3.5-Max、Qwen3.6-Max、Qwen3.7-MaxはすべてAPI専用だった。しかしローンチ時、そして最初の週を通じて、Hugging FaceのQwen組織にはQwen3.8-MaxリポジトリもQwen3.8-27Bリポジトリもなく、ライセンスも宣言されていなかった。約束は「8月10日の週に重み」だった。それを軸にコンプライアンスケースを計画する前に確認すること。
ローンチ最初の1時間のコミュニティ反応は、ほぼすべてベンチマークではなく重みに関するものだった。ユーザーは、アーティファクトが公開されていないのにAlibabaが「オープンソース」と表現していることに反発した。内面化すべき有用な区別:
- 「利用可能な」モデルは、ベンダーの条件で借りるサービスだ。APIが非推奨になると、依存関係が壊れる。
- 「オープンウェイト」モデルは、ダウンロードして保持するアーティファクトだ。監査でき、エアギャップクラスタで実行でき、ベンダーが方針転換しても保持できる。
これらは異なるリスクプロファイルを持つ異なる製品だ。以前のQwenオープンウェイトリリース(Qwen 3.5、Qwen 3.6)はApache-2.0の下で公開された ― これは強いパターンだが、Qwen3.8への約束ではない。ライセンスが公開された日に読むこと。仮定しないこと。
2. 4%のスパース性は4%のハードウェアを意味しない
Qwen3.8-MaxはMixture-of-Expertsだ。2.4T総パラメータのうち、トークンごとにアクティブになるのは~95Bのみ ― およそ4%のスパース性。これがトークンあたりの価格が競争力を持ち、レイテンシが妥当な理由だ:2.4Tではなく~95Bのフォワードパス計算に対して支払っている。
罠は、重みメモリはそのようには動作しないということだ。モデルを実行するには、ルーターが適切なエキスパートを引き出せるよう、2.4T全パラメータを十分に速い場所に常駐させる必要がある。fp8ではおよそ2.4TBの重みメモリ。fp16では~4.8TB。積極的なMXFP4や同等の4-bit量子化を使っても、KVキャッシュを1Mトークンのコンテキスト用に数える前に、重みだけで**≥1.2 TB**を見込む必要がある。つまり:
- 単一H100(80 GB)― 4-bitでもフルモデルには不十分。
- 8×H100ノード(640 GB)― フル2.4Tには4-bitでもまだ不足。重いCPUオフロードで可能だが、大きなレイテンシコスト。
- マルチノード推論(16以上のH100または同等)― リアルタイム提供の現実的なフットプリント。
「アクティブが95Bだけだから単一マシンで実行できる」と誰かが言ったら ― 間違った数字を数えている。兄弟モデルQwen3.8-27B密モデルが存在する理由の一部はこれだ:英雄的なことをせずに単一の8-GPUノードで実際に実行できるのはこれだ。
3. OpenAI互換とAnthropic互換の両方のAPI ― 同じエンドポイントから
Qwen3.8-MaxのAPIはOpenAI /v1/chat/completions形式とAnthropic /v1/messages形式の両方をサポートする。ほとんどのベンダーは1つだけ、少数はOpenAI互換シムを提供するが、Qwenが第一級のAnthropic仕様サポートを提供するのは本当に珍しく、計画する価値がある。
実用的な結果:Claude用にAnthropic Python SDKに対して書いたコード ― messages.create()、ツールブロック、システムプロンプト処理、ストリーミングを含む ― は、base URLの変更だけでQwen3.8-Maxを指せる。メッセージ形式の書き直しはない。OpenAI SDKコードも同じ。これにより、ClaudeやGPTに対するA/Bテストが通常の「ツールスキーマを移植する」作業よりもずっと安価になる。
Anthropic互換API経由のQwen3.8-Max(Python)
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope.aliyuncs.com/api/v1", # verify current base URL in Qwen docs
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=1024,
messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)OpenAI互換API経由のQwen3.8-Max(Python)
import openai
client = openai.OpenAI(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)ローンチベンチマークが示すこと ― そして注釈が意味すること
Alibabaのローンチ数値(自己申告、ローンチ時にモデルカードや再現可能な評価トレースなし):
| ベンチマーク | Qwen3.8-Max | GPT-5.6 Sol Max | Claude Fable 5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| OSWorld-Verified(エージェント的OS使用) | 86.1 | 83.2 | 85.0 | 76.2 |
| PaperBench(研究統合) | 93.0 | — | — | — |
| Frontend Code Arena | 4位 | — | — | — |
これらを誰かに引用する前に覚えておくべき具体的な注釈:
- ベンダー報告。 ローンチ時にモデルカードなし、eval harnessコミットなし、第三者複製なし ― 通常数日以内に独立したスコアを公開するArtificial Analysisからも。
- OSWorld-Verifiedは上位ではわずかな差。 Qwen 86.1、Claude Fable 5 85.0、GPT-5.6 Sol Max 83.2は1〜3ポイントの差。多くのエージェントベンチマークのノイズバンド内。「1つのベンチマークでフロンティアを1.1ポイント上回る」は「フロンティアを置き換える」ではない。
- PaperBenchはSWE-benchやGPQAより確立されていない。 93.0のヘッドラインは印象的だが、決定的ではなく方向的なものとして扱うべき。
- Frontend Code ArenaではQwen3.8-Maxを4位に置いた ― 複数のAnthropicモデルとFable 5バリアントの後ろ。異なるタスクは異なる訓練シグナルに報酬を与える。あるベンチマークで#1、別のベンチマークで#4は矛盾ではなく正常な結果だ。
独立した評価(Artificial Analysis、LMArena、第三者学術実行)を待ってからモデル選択のデフォルトを書き直すのが冷静な選択だ。
知る価値のある価格計算
APIの価格表:
| ティア | 100万トークンあたり価格 |
|---|---|
| 入力 | $2.00 |
| 出力 | $6.00 |
| キャッシュ入力 | $0.25 |
これは現在のAnthropic Maxティアより8倍安い入力コストで、GPT-5.6 Sol Maxの出力コストの約半分。キャッシュ入力$0.25/MTokが興味深い部分だ:同じシステムプロンプトでの繰り返しのエージェント的ツールループでは、キャッシュヒット率は通常80%を超えるため、動作中のエージェントの実効入力コストは$2.00ではなく$0.35〜$0.60/MTokに近くなる。
Kimi K3の経済性と比較すると ― キャッシュヒット入力が$0.30/MTok ― Qwen3.8-Maxは同じ低キャッシュ価格帯にある。これにより、同じプロンプトの足場がすべてのツールステップで再送信されるコスト敏感な長時間エージェント的ワークロードの両方が実行可能になる。
Qwen3.8-Maxを始める(今日、API経由で)
- Qwen APIはDashScope(中国リージョン)およびModel Studio(国際)経由で提供される。ワークスペースでモデルを有効にしAPIキーを生成すると、両方がqwen3.8-maxモデルIDを公開する。
- OpenAI仕様:openai SDKでbase URL https://dashscope-intl.aliyuncs.com/compatible-mode/v1。Anthropic仕様:Model Studioに文書化されたQwenのAnthropic互換エンドポイントを使用。既存のコードベースに合うものを選ぶ ― メッセージ形式を書き直す必要はない。
- 既存のツールスキーマを使ってQwen3.8-Maxを通じた短いエージェント的タスクを実行する。コスト、レイテンシ、ツール選択品質を現在のデフォルトと比較する。ベンダーベンチマークは方向的だ。自分のワークロードがグラウンドトゥルースだ。
- Qwen3.8-MaxとQwen3.8-27Bリポジトリは2026年8月10日の週に予定されていた。公開された日にライセンスを読む ― 以前のQwenからの強いApache-2.0パターンはこのリリースへの約束ではない。
Qwen3.8-Max vs 競合モデル
| Qwen3.8-Max | Kimi K3 | GLM-5.2 | Claude Fable 5 | GPT-5.6 Sol Max | |
|---|---|---|---|---|---|
| 総パラメータ数 | 2.4T MoE | 2.8T MoE | 753B | 非公開 | 非公開 |
| トークンあたりアクティブ | ~95B | 16/896 エキスパート | — | — | — |
| コンテキストウィンドウ | 1M | 1M | — | 1M+ | 400K+ |
| ネイティブビジョン | Yes | Yes | テキストのみ | Yes | Yes |
| オープンウェイト | 発表済み(8月10日の週) | 公開済み 2026年7月27日 | 公開済み | No | No |
| 入力価格 / MTok | $2.00(キャッシュ$0.25) | $3.00(キャッシュ$0.30) | 無料(セルフホスト) | ベンダーティア | ベンダーティア |
| 出力価格 / MTok | $6.00 | $15.00 | 無料(セルフホスト) | ベンダーティア | ベンダーティア |
| API仕様 | OpenAI + Anthropic | OpenAI互換 | 様々 | Anthropic | OpenAI |
Qwen3.8-Maxを選ぶタイミング:後でセルフホストもできるフロンティアティアAPIが欲しい、予算がAnthropic/OpenAI Maxティアより厳しい、または(Anthropic仕様サポートのおかげで)最小限のコード変更でClaudeに対してA/Bテストしたい。
Kimi K3を選ぶタイミング:今日オープンウェイトが必要(K3は2026年7月27日に公開)、またはすでにMoonshotツールを使っている。
GLM-5.2を選ぶタイミング:セルフホスティングが今必須の要件で、ビジョンが重要でない。
Claude Fable 5またはGPT-5.6 Sol Maxを維持するタイミング:最も深い第三者ベンチマーク記録、正式なエンタープライズベンダーコミットメント、またはそれらのモデルが調整された特定のツール使用/安全性動作が必要。
参照:より広範な状況コンテキストはDeepSeek、Qwen & オープンウェイトの波、一般的なフレームワークはモデル選択。
Qwen3.8-Maxにコミットする前の実用的チェックリスト
- コンプライアンス文書に「オープンウェイト」と書く前に、重みが実際にHugging FaceまたはModelScopeで公開されていることを確認する。
- 公開された日にライセンスを読む。 Apache-2.0はQwen 3.5と3.6からの強いパターンで、3.8への保証ではない。
- 自分でeval実行を行う。 ベンダーのOSWorld-Verified数値は方向的。そのベンチマークの上位1〜3ポイントの差はノイズバンド内。
- キャッシュを注意深くコストモデルする。 $0.25/MTokのキャッシュ入力価格は経済性が興味深くなる部分。キャッシュヒットなしでは$2/$6のヘッドラインが実効価格。
- セルフホスティングフットプリントを正直に計画する。 アクティブパラメータ4% ≠ GPUメモリ4%。2.4T MoEの完全重み常駐は本格的なデプロイで、ラップトッププロジェクトではない。
- どの仕様に対してコードを書くか決める。 OpenAI仕様とAnthropic仕様は両方とも第一級 ― 既存のコードパスに合うものを選び、3つ目の抽象化を発明しない。
クイズ
Check yourself
0/5ソースと参考文献
- Qwen3.8-Max: Features, Benchmarks, and Pricing — DataCamp ― ローンチ要約、アーキテクチャ、価格概要
- Qwen 3.8-Max: Release Date, Specs, and How to Access It (2026) — Yotta Labs ― API互換性とティア別価格の内訳
- Qwen3.8 Open Weights: Check This Before Downloading — Digital Applied ― ハードウェアサイジング考察とライセンスリスク分析
- Alibaba's New AI Was Called Open-Source. Its Model Page Is Empty. — Cherry Creek News ― 「発表 ≠ 公開」の現実チェック
- Hugging FaceのQwenチーム ― 実際の重み公開とライセンスをここで確認
- 関連: DeepSeek、Qwen & オープンウェイトの波 ― オープンウェイトの状況と3.8以前のQwenファミリーの恒久的概観
- 関連: Kimi K3: 世界最大のオープンウェイトモデル ― 現在公開されている2.8Tオープンウェイト競合
- 関連: GLM-5.2: オープンウェイトフロンティア ― 別のオープンウェイトオプション、テキストのみだが今日公開中
- 関連: モデル選択 ― オープンウェイト vs クローズドフロンティアのトレードオフの決定フレームワーク
- 関連: プロバイダー間のAIコスト ― フロンティアでの価格比較