メインコンテンツまでスキップ

トークン速度:なぜAI推論は突然10〜15倍速くなったのか

中級

今週、OpenAIはGPT-5.6 Solをプレビューしました。Cerebrasのウェハースケールハードウェア上で最大毎秒750出力トークンで提供されるフロンティアモデルで — これはGPUで提供されるフロンティアモデルがユーザーごとに通常出す毎秒70〜150トークンのおよそ5〜10倍です。見出しはこれを魔法と呼びました。魔法ではありません。2年かけて積み上がってきたボトルネックの移り変わりの成果であり、推論エンジニアリングの外にいるほとんど誰もそのメカニズムを理解していません。このレッスンはその明快な説明版です:トークン速度を実際に制限するもの、その限界をたった今突破した専用ハードウェアのレース、それをさらに何倍にもするソフトウェアの技、そしてなぜ高速トークンがAI製品のあり方を静かに変えるのか。

What you'll learn
  • LLM推論が生の演算力ではなくメモリ帯域幅によって制限される理由 — そしてそれが物理的に何を意味するかを説明する
  • Cerebrasのウェハースケールチップ、Groq LPU、SambaNova RDUがそれぞれメモリの壁にどう挑むかを述べる
  • 3つのソフトウェア乗数 — 投機的デコード、量子化、バッチ処理 — と、それぞれが行うトレードオフを挙げる
  • 高速トークンが最初に変える製品を予測する:エージェント、推論モデル、音声
  • 自分のワークロードに合わせて推論速度を正しくベンチマークする:毎秒トークン数と最初のトークンまでの時間の両方、決して一方だけではなく

誰も予想しないボトルネック:演算力ではなくメモリ帯域幅

ほかのすべてを組み替える事実がここにあります:1つのトークンを生成するために、モデルは(アクティブな)重みのほぼすべてをメモリから読み出さなければならない。 一部ではなく、すべてを、トークンごとに1回です。

70億パラメータではなく、700億(70B)パラメータのモデルは16ビット精度で約140GBの重みです。1トークン生成する:140GBをメモリから計算ユニットへストリームする。次のトークンを生成する:同じ140GBを再びストリームする。行列演算そのものは、比べればほぼ些細です — 現代のチップは演算力に余裕があります。飽和しているのは、メモリと計算の間のパイプです。

計算してみれば、「遅いAI」の体験は自ずと説明されます。NVIDIA H100のHBMメモリ帯域幅は約3.35TB/sです。3.35TB/sを140GB/トークンで割ると、他のオーバーヘッドを一切考えないでも、1つのGPU上で1ユーザーあたり毎秒およそ24トークンという硬い上限が得られます。だからチャットボットは読む速度でタイプするのです:チップが十分速く掛け算できないからではなく、自分の脳を十分速く読めないからです。推論エンジニアはこれをメモリの壁と呼び、CerebrasGroqも、これを生成AIの根本的な制約と表現しています。

しかもそれは複合します:重みと並んで、新しいトークンごとにKVキャッシュ — すでにコンテキストにあるすべてのトークンについて保存された注意のキーと値 — も読みます。長いコンテキストは、後続のトークンをすべてより高コストにします。

Guided walkthrough1 of 4
  1. プロンプト全体が1回の並列パスで処理される。このフェーズは演算律速(多くの演算、多数のトークンにつき重みは1回読む)で、最初のトークンまでの時間を決める。

したがって高速推論のレースは、実際には重みのバイトをより速く動かすレースです。勝つ道はちょうど2つあります:抜本的に速いメモリを作るか、動かさなければならないバイトを縮めるか。ハードウェア企業は前者の道を選びました。(下記の)ソフトウェアの技は後者を選びました。現在の速度爆発は、その両方が同時に起きたものです。

ハードウェアのレース:重みをチップの上に置く

どんなコンピュータでも最速のメモリはSRAM — 計算と同じダイ上のメモリ — です。GPUの隣に積まれたHBMより桁違いに速いですが、小さい:ギガバイトではなくメガバイト単位です。3つの専用推論企業はいずれも同じ大胆な賭けをしました — オンチップメモリを(あるいはチップ数を)モデル全体をSRAMに保持できるほど大きくする — そしてそれぞれ異なる工学で実現しました。

Cerebras:ディナープレートほどの大きさの1つのチップ

CerebrasはWafer-Scale Engine(WSE-3)を作ります:シリコンウェハーを数百の小さなチップに切り分ける代わりに、300mmウェハー全体1つのチップです — 46,225mm²、4兆トランジスタ、900,000コア、44GBのオンチップSRAM、そしておよそ毎秒21ペタバイトのメモリ帯域幅。CerebrasはそれをH100の約7,000倍のメモリ帯域幅と謳っており、それが全部の仕掛けです:SRAMに住む重みは、決して遅いオフチップバスを渡りません。公開結果には、Llama 3.1-405Bが毎秒969トークン、最初のトークンまで240ms、Llama 3.1 70Bが毎秒2,100トークン超が含まれます。

GPT-5.6 Solのニュースを解読する

それが今週の発表の背後にある機構です。OpenAIのGPT-5.6 Solプレビューは、フロンティアモデルをCerebras提供と組み合わせ、最大毎秒750トークンで提供します — 同クラスのモデルがH100クラスのGPU提供でユーザーごとに出す約毎秒70トークンに対して、10倍の飛躍です(最も遅い主流デプロイメントに対しては約15倍)。Solは、3モデルファミリー(Sol、Terra、Luna)の旗艦として、入力100万トークンあたり5ドル / 出力30ドルでローンチし、一般提供は2026年7月中旬で、それまでの早期アクセスは少数の組織に限られます。コミュニティのアナリストは、Solがおよそ70〜100枚のウェハーにまたがって提供されている — おおよそウェハー1枚あたり1つのトランスフォーマー層 — と推定していますが、OpenAIはトポロジを確認していないため、そのレイアウトは情報に基づく推測として扱ってください。いずれにせよそれが示すのは:オープンウェイトモデルだけでなく、フロンティアクラスのモデルが、初めて専用ハードウェア速度で提供されているということです。

Groq:数百の小さな決定論的チップ

GroqのLPU(Language Processing Unit)は正反対の形をとります。各LPUには外部DRAMがまったくなく — 約80TB/s(H100の3.35TB/sに対して)のオンチップSRAMがわずか数百メガバイトあるだけです。大きなモデルは数百のチップにまたがってシャーディングされます:Llama 3 70BはFP8で300以上のLPUのラックにまたがり、各々が約230MBのスライスを保持します。魔法の材料は決定論です:キャッシュも動的スケジューリングもなく — コンパイラがチップ間通信を含む実行全体を個々のクロックサイクル単位で計画するので、何かが予測不能な何かを待つことは決してありません。Groqの言い回しは「決定論こそ速度」で、投機的デコードとともにLlama 3 70Bを毎秒1,660トークン超で示しています。

SambaNova:3つのメモリ階層、巨大なモデル

SambaNovaの**RDU(Reconfigurable Dataflow Unit)**は、3階層メモリシステム(SRAM + HBM + DRAM)でアプローチを融合し、それが最大のモデルを効率的に提供する方法です:フルの671億ではなく6,710億(671B)パラメータのDeepSeek-R1をわずか16枚のSN40Lチップで毎秒約198〜250トークンで提供 — 典型的なGPU提供では毎秒30〜80トークンにとどまるモデルです — さらにLlama 3 8Bを毎秒1,000トークンで、Artificial Analysisが独立に検証しています。

アプローチ核心的アイデア重みのメモリ検証済み速度の例
GPU(H100クラス)汎用、スループット優先オフチップHBM、約3.35TB/sフロンティアモデルでユーザーあたり約70〜150トークン/秒
Cerebras WSE-3ウェハー全体 = 1つのチップ44GBオンチップSRAM、約21PB/sLlama 3.1-405Bが969トークン/秒;GPT-5.6 Solが最大750トークン/秒
Groq LPU決定論的データフロー、コンパイラスケジュールSRAMのみ(約230MB/チップ)、モデルは300以上のチップにシャーディングLlama 3 70Bが1,660トークン/秒超(投機的デコードあり)
SambaNova RDU再構成可能データフロー、3階層メモリSRAM + HBM + DRAMDeepSeek-R1 671Bが16チップで約250トークン/秒
What you'll learn
  • これらの数値はどれも魔法の演算力ではない:この表のすべての項目は、同じ問いへの異なる答えである — 計算ユニットへ重みのバイトをどうすればより速くストリームできるか。
  • 速度記録はユーザーごと(セッションごと)の速度である。データセンター全体のスループットは別の指標で、GPUは依然として優秀である — その区別が、下記のバッチ処理のトレードオフである。

ソフトウェア乗数:どんなハードウェアでもトークンを速くする

ハードウェアだけがレバーではありません。3つのソフトウェア技法が、GPUでも専用チップでも同じように速度を何倍にもし — 今年は普通のGPU提供さえ速くなった理由の多くを説明します。

投機的デコード — 直感に反するものです。小さくて速いドラフトモデルが次のいくつかのトークンを推測し、大きなモデルが1回のフォワードパスでそれらすべてを検証します。N個のドラフトトークンの検証は、1トークンを生成するのとほぼ同じ重みストリーミングコストで済みます — なので推測が当たると(そして予測可能なテキストでは通常当たります)、1トークン分のメモリ代金で複数のトークンが得られます。ほとんど知られていない部分:出力は、大きなモデルが単独で生成したはずのものと証明可能に同一である。 それは近似ではありません — 間違った推測は単に拒否され、再生成されます。これがGroqの1,660トークン/秒という数字の背後にある技法で、今や主要プロバイダはみな何らかの変種を使っています。

量子化 — 直接的なものです。ボトルネックがトークンあたりに動かすバイト数なら、バイトを半分にする:重みを16ビットではなく8ビットや4ビットで保存すると、文字通りデータの半分(あるいは4分の1)をストリームするので、デコード速度がほぼ比例して上がります。トレードオフは、通常小さく、時に本当に問題になる精度コストです — 感覚ではなく、あなたのタスクで測定してください。

バッチ処理 — トレードオフのものです。GPUは1回のパスで多くのユーザーを提供することで効率を取り戻します:重みは一度ストリームされ、バッチ全体で再利用されるので、スループットが跳ね上がります。しかし各ユーザーのトークンは依然として共有された逐次レートで出てきます — 大きなバッチは高いデータセンタースループットと平凡なユーザーごとの速度を意味します。これは推論マーケティングで最も誤読される数字です:「毎秒数千トークン」を謳うプロバイダは、あなたが1セッションで体験するものではなく、集約スループットを意味しているかもしれません。

なぜ高速トークンがすべてを変えるのか

速度は快適性の機能に聞こえます。実際には能力のしきい値です。なぜなら、いくつかの製品カテゴリは、一定の実時間レイテンシを下回って初めて機能するからです。

エージェントは最大の乗数を得ます。 エージェントループは逐次的です:モデルを呼び、ツールを走らせ、結果を戻す、を繰り返す — 20回のモデル呼び出しを順番に行うのは日常茶飯事です。毎秒70トークンでは、各々平均800出力トークンの20回の呼び出しは、純粋な生成だけで約230秒:コーヒーブレイクです。だからエージェントはバックグラウンドジョブに追いやられます。毎秒750トークンでは同じループが約21秒:インタラクティブです。スピードアップはループのすべてのステップにわたって掛け算されるので、10倍速いトークンはエージェントを10%良くするのではなく — バッチツールから会話パートナーへと一線を越えさせます。(エージェントを構築中? モデルを選ぶから始めてください。)

推論モデルは毎秒より多く考えます。 推論モデルの品質は、費やせる思考トークン数に比例します。GPU速度では「高い努力」は数分の待ち時間を意味するので、ユーザーは思考を絞ります。ウェハースケール速度では、同じ思考予算が数秒で完了します — 同じ実時間レイテンシでより多くの知性が得られます。これはおそらくOpenAI–Cerebras提携の本当の戦略的要点です。

音声が真にリアルタイムになります。 人間の会話は約500msの応答間隙に耐えます。最初のトークンまで300ms未満(CerebrasはLlama 405Bで240msを実証)の高速提供に、話す速度をはるかに超える生成が加わると、自然な話し言葉の往復が — 小さな蒸留モデルではなくフロンティアモデルで — ついに実現可能になります。

コストの力学が興味深くなります。 速いことは自動的に安いことではありません:専用提供はプレミアム価格を要求し(Solの出力100万トークンあたり30ドルは最上位)、ユーザーを喜ばせるのと同じ速度がエージェントにもトークンをより速く燃やさせます。しかしウェハースケールプロバイダは、トークンあたりのコストが規模でGPUを下回るとも主張しているので、速達便のように、速度ティアが標準的な価格軸になると予想してください。予算のコンテキストはプロバイダ間のAIコストにあります。

速度を評価する方法 — あなたのワークロードに合わせて

最もよくあるベンチマークの間違い:「毎秒トークン数」を全体像として扱うこと。数字は2つあり、2つの異なるボトルネックから生まれます:

  • 最初のトークンまでの時間(TTFT) — 出力が始まるまでの時間。演算律速のプレフィルフェーズが支配的なので、プロンプト長とともに増えます。これはチャットと音声のユーザーが感じるものです。
  • 毎秒出力トークン数 — いったん始まった後、テキストがどれだけ速く流れるか。メモリ律速のデコードフェーズが支配的です。これは長い生成とエージェントループが感じるものです。

プロバイダは一方に勝ち、もう一方に負けることがあります。異なるハードウェア限界に負荷をかけるからです。5万トークンのコンテキストを詰め込むRAGアプリはTTFTに生死を懸け、長いコードファイルを書くエージェントはデコード速度に生死を懸けます。Artificial Analysisのような独立リーダーボードは両方を報告します — が、あなたのプロンプトの形、コンテキスト長、トラフィックパターンはあなたのものなので、自分のワークロードで測定してください。(ストリーミングは体感レイテンシを総時間ではなくTTFTに近づけます — ストリーミングを参照。)

Guided walkthrough1 of 5
  1. 製品から実際のプロンプトを10〜20個選ぶ — 実際のシステムプロンプト、実際のコンテキスト長。速度は入力サイズで大きく変わる。おもちゃのプロンプトはおもちゃの数字を生む。

実際の生成速度を測るためのベンチマークタスク

Write a complete Python module implementing a rate limiter with three strategies
(fixed window, sliding window, token bucket), a shared abstract base class,
type hints throughout, docstrings, and a pytest test suite covering edge cases
(burst traffic, clock skew, zero-capacity buckets). Target roughly 2,000 tokens
of output. Do not truncate or summarize - produce the full code.

--- How to use this prompt as a benchmark ---
1. Send it with streaming enabled and your production system prompt attached.
2. Record TTFT = time from request to first streamed chunk.
3. Record decode speed = output_tokens / (total_time - TTFT).
4. Repeat 5 times at 3 different times of day; report medians, not best runs.
5. Re-run the same prompt with 30K tokens of context pasted above it -
 watch what happens to TTFT. That difference is your prefill cost.

理解度チェック

0/5
  1. 今日、LLMがトークンを生成する速度に対する主たる物理的制限は何ですか?
  2. Cerebrasのウェハースケールアプローチはどうやってメモリの壁を破りますか?
  3. 投機的デコードの落とし穴は?
  4. プロバイダが毎秒3,000トークンを謳っています。あなたのユーザーがそれを見ると仮定する前に、何を確認しなければなりませんか?
  5. なぜ高速トークンは単純なチャットよりエージェントに恩恵をもたらすのですか?
高速推論の語彙
Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 10
Key takeaways
  • 推論速度はメモリ帯域幅の問題:各トークンがすべてのアクティブな重みのストリームを必要とするので、70B FP16モデルはトークンあたり約140GBの読み出しを意味する — それが全部のボトルネックだ。
  • 専用ハードウェアのレース(CerebrasのウェハースケールSRAM、GroqのDRAMなし決定論的LPU、SambaNovaの3階層RDU)は、重みをオンチップメモリに保つことで壁を破る — そして750トークン/秒のGPT-5.6 Solが、その速度をフロンティアモデルにもたらしたばかりだ。
  • ソフトウェアがそれをさらに何倍にもする:投機的デコード(出力は同一、マルチトークン検証)、量子化(トークンあたりのバイトが少ない)、バッチ処理(スループットは上がるがユーザーごとの速度は下がる — プロバイダの主張は注意深く読む)。
  • 高速トークンは快適性の機能ではなく能力のしきい値:逐次エージェントループがインタラクティブになり、推論モデルが実時間の秒あたりより多く考え、フロンティアモデルの音声がリアルタイムになる。
  • 2つの数字で評価する — TTFT(プレフィル、プロンプト長に敏感)と毎秒出力トークン数(デコード) — 自分のプロンプトで、自分の同時実行数で測定し、毎月再チェックする。

モデルが内部でどう動くかに初めて触れる? Foundationsセクションが、このレッスンが土台にするトークン、コンテキストウィンドウ、モデルの基礎をカバーします。

出典とさらに読む