メインコンテンツまでスキップ

Inkling: Thinking Machines のオープンウェイトモデル

中級

2026年7月15日、Mira Murati のラボである Thinking Machines Lab は、自社初のモデル Inkling を Apache 2.0 のオープンウェイトとして公開しました。一晩で Hacker News のトップページに達しましたが、報道は二つの安易な型に落ち着きました。「1兆パラメータのオープンモデル!」と、負けている姿を示すベンチマーク表です。

どちらも的を外しています。Inkling は意図的にリーダーボード首位を狙っていない異例のリリースであり、その最も興味深い特徴 — ウェイトに学習込みで組み込まれた連続的な思考エフォート・ダイヤル — は第一波の報道で広く誤って説明されました。このページはその実務的な読み解きです。

What you'll learn
  • Inkling の実体を理解する: 総パラメータ9,750億・アクティブ410億のスパース MoE、Apache 2.0、100万トークンのコンテキスト、テキスト/画像/音声/動画にネイティブ対応するマルチモーダル
  • 思考エフォート・ダイヤルの正体を学ぶ — API ラッパーが見せる low/medium/high という離散的な列挙型ではなく、RL で学習された連続的な浮動小数点値
  • 「オープンウェイト」が「自分のマシンで動く」を意味しない理由を理解する — 量子化しても VRAM の下限は約 600 GB
  • Inkling がわざとベンチマークで負ける理由と、どの見出しにも載らなかった唯一の勝ち指標を知る

一文でいえば

Inkling は総パラメータ9,750億・トークンあたりアクティブ410億の Mixture-of-Experts トランスフォーマーで、テキスト・画像・音声・動画からなる 45兆トークンで事前学習され、100万トークンのコンテキストウィンドウに対応し、Apache 2.0 で公開されています。位置づけは「入手可能な最良のモデル」ではなく、「カスタマイズするための最良のベース」です。

その最後の一節こそが戦略のすべてです。Thinking Machines 自身がはっきりこう述べています。Inkling は「オープン・クローズドを問わず、今日入手できる中で総合的に最強のモデルではない」。この一文を添えてモデルを出荷するのは謙遜ではなくポジショニングであり、以下のあらゆる設計判断を説明します。

人を驚かせる4つのこと

1. エフォート・ダイヤルは浮動小数点値であり、報道はその範囲を取り違えた

これは目玉機能であり、ローンチで最も誤報された細部です。複数のメディアはエフォート・パラメータを「0.2 から 0.99」の範囲、あるいは none | minimal | low | medium | high | xhigh という名前付き列挙型として説明しました。

公式の Tinker ドキュメントは別のことを述べています。エフォートは連続的な推論エフォート条件付けであり、0.0 以上 1.0 未満の任意の浮動小数点値を取ります。既定値は 0.9 です。名前付きレベルは単なる推奨スイープ値であって、実際のインターフェースではありません。

プリセット
none0.0
minimal0.1
low0.2
medium0.7
high0.9
xhigh0.99

報じられた 0.2 という下限は、単に low プリセットの値にすぎず、制限ではありません。0.45 を渡すことを妨げるものは何もありません。またプリセットが非線形である点にも注目してください。low から medium までの差は 0.5 なのに対し、high から xhigh0.09 です。有用な解像度は範囲の上端に密集しています。

これが重要なのは、ほとんどの人が reasoning_effort="high" を公開する OpenAI 互換ラッパー経由で Inkling に出会うからです。その列挙型は連続的なつまみに対する非可逆アダプタです。コストと品質を調整したいなら、列挙型はダイヤルの大半を隠してしまいます。

Tinker レンダラーでエフォートを直接指定する

renderer = TmlV0Renderer(get_tokenizer("thinkingmachines/Inkling"))
messages = [Message(role="user", content="Solve this problem step by step.")]
prompt = renderer.build_generation_prompt(messages, effort=0.9)

同じ effort 引数はファインチューニングにも引き継がれます。ここが立ち止まる価値のある部分です — 選んだエフォートレベルで学習できるのです。

固定エフォートレベルでファインチューニングする

model_input, weights = renderer.build_supervised_example(
  messages_with_assistant_response,
  effort=0.9,
)

2. エフォートはプロンプトの小技ではない — トークン税とともに学習に組み込まれた

ダイヤルが連続的なのは、推論時に後付けされたものではないからです。強化学習の最中、チームはシステムメッセージを変更しトークンあたりのコストを調整することでエフォートを設定しました — 文字どおり、考えることに課税したのです。モデルはロールアウトごとに異なるトークン予算を費やすことを学習し、ダイヤルはその学習の残滓です。

これは「ステップごとに、ただし簡潔に考えてください」とは本質的に異なる仕組みであり、だからこそ見返りが本物なのです。Thinking Machines は、Inkling が Terminal Bench 2.1 で Nemotron 3 Ultra に匹敵しつつ、推論トークン数はおよそ3分の1であると報告しています。

またこれは、ドキュメントが慎重に明記している注意点も説明します。真に受けるべき一節です。「値を大きくすると一般的により多くの推論を促しますが、すべてのサンプルで応答が長くなることや精度が上がることを保証するものではありません」。エフォートは学習された傾向であって、保証ではありません。0.99 に振り切って単調な改善を期待するのは、その正体の読み違えです。さらに高いエフォートは「切り詰めを避けるためにより大きな生成予算を必要とする場合があります」— 最大トークン数を上げずにエフォートだけ上げれば、思考の途中でモデルを打ち切ることになります。

3. オープンウェイトだが、ほぼ確実にあなたには動かせない

「9,750億パラメータ、Apache 2.0、Hugging Face にウェイトあり」はある思い込みを誘いますが、ハードウェア表がそれを打ち砕きます。

数値形式合計 VRAM 下限構成例
BF16最低 2 TBNVIDIA B300 × 8、または NVIDIA H200 × 16
NVFP4 (W4A4)最低 600 GBNVIDIA B300 × 4
NVFP4 (W4A16)最低 600 GBNVIDIA H200 × 8

4ビットまで完全に量子化しても、下限はおよそ 600 GB の合計 VRAM です。これはマルチ GPU クラスタ向けのモデルであってワークステーション向けではなく、ましてやラップトップ向けでは到底ありません。410億のアクティブパラメータはトークンを1つ通すコストを安くしますが、メモリに保持しなければならない量を減らしはしません。ルーターはどのトークンでもいずれのエキスパートに手を伸ばしうるため、9,750億すべてが常駐している必要があるのです。

オープンウェイトへの関心が「ローカルで動かす」ことなら、Inkling は誤った選択であり、Ollama でモデルをローカル実行するが正しいページです。関心が改変・商用化する法的自由にあるなら — Apache 2.0 は本当に寛容です — Inkling は条件を満たしますし、GPU は TogetherAI、Fireworks、Modal、Databricks、Baseten から借りることになります。オープンウェイトを求める理由としてこの二つは別物であり、このリリースが応えるのは後者だけです。

4. わざとベンチマークで負け、誰も報じなかった一つで勝つ

ベンチマーク表は見栄えが悪く、それでも Thinking Machines は公開しました。

ベンチマークInklingより強い競合
Terminal Bench 2.163.8%GLM 5.2: 82.7%
SWEBench Verified77.6%Kimi K2.6: 80.2%
SimpleQA Verified43.9%DeepSeek V4 Pro: 57.0%
FORTRESS Adversarial78.0%Nemotron 3 Ultra: 77.6%

3敗、そして僅差の1勝。しかし興味深い結果はその表にはまったくありません — キャリブレーションです。チームは**厳密な採点規則(proper scoring rules)**に基づく強化学習で訓練しました。これは「70% の確信がある」と述べて実際に 70% 正しいことに報酬を与えるものであり、自信ありげに聞こえることには報酬を与えません。モデルは自信たっぷりに誤答を出すのではなく、自らの不確実性をうまく見積もることに報酬を与えられ、その成果は ForecastBench や Prophet Arena といった予測評価に現れます。

自信に満ちた誤答が、ぼかした答えよりも高くつくあらゆる場面 — トリアージ、リサーチ、ルーティング、下流に人間のレビュアーがいる抽出 — では、よくキャリブレーションされた 44% は、過信した 57% より価値があります。この性質はリーダーボードの列には収まりません。だからこそ、誰もそれを見出しにしなかったのです。

アーキテクチャ、手短に

パラメータ数の先で、知っておく価値のある要素です。

Guided walkthrough1 of 5
  1. 66層のデコーダ専用トランスフォーマー。各層は256のルーテッド・エキスパートと2つの共有エキスパートを持ち、トークンごとに6つのルーテッド・エキスパートが活性化します。共有エキスパートは常に発火して汎用的な能力を担い、ルーターはトークンごとに専門家を選びます。

正直なところ、何のためのモデルか

次のような場合に Inkling を選んでください。

  • 能力の高いマルチモーダルモデルを所有し、改変する必要がある。 Apache 2.0 と本物のマルチモーダル性、そして Tinker 上のファーストクラスなファインチューニング対応という組み合わせは稀です。これが想定用途です。
  • ピーク性能よりタスクあたりのコストが重要。 推論トークン3分の1でのエフォート・ダイヤルは実在するレバーであり、3段階ではなく連続的に調整できます。
  • キャリブレーションが重要。 パイプラインが「モデルは確信していない」を受けて動けるなら、これは異例なほど適しています。

最強のコーディングエージェントが欲しいとき(表のとおり GLM 5.2 と Kimi K2.6 が上回ります)、自前ハードウェアでセルフホストしたいとき(VRAM 下限を参照)、最大の事実想起が欲しいとき(SimpleQA 43.9% は競争力がありません)には選ばないでください。

モデルカードが直接述べている安全面の注意が一つあります。Inkling には「有害な話題に関するロールプレイや間接的に構成されたプロンプトに応じてしまう時折の傾向」が残存しており、カードは組み込みの拒否に頼るのではなく外部モデレーションを重ねることを明示的に推奨しています — Llama Guard を名指ししています。VentureBeat はこのモデルの姿勢を「検閲への耐性」と表現しましたが、実務上の指針としてはモデルカード自身の文言を読んでください。そしてこれをデプロイするならモデレーション層の予算を見込んでください。カードは残る限界として、ハルシネーション、不完全な指示追従、長いマルチターン会話での性能低下という通例の項目も挙げています。

Check yourself

0/4
  1. Inkling の思考エフォート・パラメータの実際の有効範囲は?
  2. Inkling は総パラメータ9,750億のうちアクティブが410億です。これはメモリにとって何を意味しますか?
  3. Thinking Machines が Inkling を RL で厳密な採点規則を用いて訓練したのはなぜですか?
  4. effort を 0.9 ではなく 0.99 に設定すると何が保証されますか?

既知のモデルとの位置関係

すでに Claude ユーザーのための Kimi K2 を読んでいるなら、形は見慣れたものでしょう — 寛容なライセンスを持つ1兆規模のスパース MoE です — が、意図は異なります。Kimi K2 は長いエージェント的ツールチェーンに最適化されています。Inkling は作り変えられることに最適化されています。マルチモーダル入力、調整可能なエフォート予算、そしてファーストクラスの経路としてのファインチューニングです。

より広い全体像については、モデルの選び方、オープンウェイト陣営の残りを見るなら DeepSeek と Qwen のオープンモデル、そしてエフォート・ダイヤルが狙う経済性については 各プロバイダーの AI 費用 を参照してください。

出典と参考資料