본문으로 건너뛰기

토큰 속도: AI 추론이 갑자기 10-15배 빨라진 이유

중급

이번 주 OpenAI가 GPT-5.6 Sol을 프리뷰했습니다. Cerebras 웨이퍼 스케일 하드웨어에서 초당 최대 750 출력 토큰으로 서빙되는 프런티어 모델로, GPU로 서빙되는 프런티어 모델이 사용자당 통상 내는 초당 70–150 토큰의 대략 5–10배입니다. 헤드라인은 마법이라 불렀습니다. 아닙니다. 2년간 쌓여 온 병목 이동의 결실이고, 추론 엔지니어링 바깥에서는 거의 아무도 그 메커니즘을 이해하지 못합니다. 이 레슨은 그 명료한 버전입니다. 토큰 속도를 실제로 제한하는 것, 방금 한계를 깬 특화 하드웨어 경쟁, 그것을 더 배가하는 소프트웨어 기법, 그리고 빠른 토큰이 조용히 AI 제품의 존재 방식을 바꾸는 이유.

What you'll learn
  • LLM 추론이 왜 연산이 아니라 메모리 대역폭에 제한되는지 — 그리고 그것이 물리적으로 뜻하는 바 설명하기
  • Cerebras 웨이퍼 스케일 칩, Groq LPU, SambaNova RDU가 각각 메모리 장벽을 어떻게 공격하는지 서술하기
  • 세 가지 소프트웨어 배수 — 추측 디코딩, 양자화, 배칭 — 과 각각의 트레이드오프 명명하기
  • 빠른 토큰이 어떤 제품을 먼저 바꾸는지 예측하기: 에이전트, 추론 모델, 음성
  • 자신의 워크로드에 맞게 추론 속도를 올바르게 벤치마킹하기: 초당 토큰 그리고 첫 토큰까지의 시간 — 절대 하나만 보지 말 것

아무도 예상 못 하는 병목: 연산이 아니라 메모리 대역폭

나머지 전부를 재편하는 사실이 여기 있습니다. 토큰 하나를 생성하려면 모델이 (활성) 가중치 전부를 사실상 메모리에서 읽어야 합니다. 일부가 아니라 전부를, 토큰마다 한 번씩.

16비트 정밀도의 70B 파라미터 모델은 약 140 GB의 가중치입니다. 토큰 하나 생성: 메모리에서 연산 유닛으로 140 GB를 흘려보냅니다. 다음 토큰 생성: 같은 140 GB를 또 흘려보냅니다. 행렬 연산 자체는 그에 비하면 거의 사소합니다 — 현대 칩에는 연산이 남아돕니다. 포화되는 것은 메모리와 연산 사이의 파이프입니다.

산수를 해 보면 "느린 AI" 경험이 저절로 설명됩니다. NVIDIA H100의 HBM 메모리 대역폭은 약 3.35 TB/s입니다. 3.35 TB/s를 토큰당 140 GB로 나누면 다른 오버헤드 이전에 이미 GPU 하나에서 단일 사용자 기준 초당 약 24 토큰이라는 단단한 천장이 나옵니다. 챗봇이 읽기 속도로 타자하는 이유가 이것입니다. 칩이 충분히 빨리 곱하지 못해서가 아니라 자기 뇌를 충분히 빨리 읽지 못해서입니다. 추론 엔지니어들은 이것을 **메모리 장벽(memory wall)**이라 부르고, CerebrasGroq 모두 이를 생성형 AI의 근본 제약이라고 서술합니다.

그리고 이것은 복리로 늘어납니다. 가중치와 함께 새 토큰마다 KV 캐시 — 이미 컨텍스트에 있는 모든 토큰의 저장된 어텐션 키와 값 — 도 읽습니다. 긴 컨텍스트는 이후의 모든 토큰을 더 비싸게 만듭니다.

Guided walkthrough1 of 4
  1. 프롬프트 전체가 하나의 병렬 패스로 처리됩니다. 이 단계는 연산 바운드이며(연산이 많고, 한 번에 많은 토큰을 위해 가중치를 한 번 읽음) 첫 토큰까지의 시간을 결정합니다.

그러니 빠른 추론 경쟁은 사실 가중치 바이트를 더 빨리 옮기는 경쟁입니다. 이기는 방법은 정확히 둘입니다. 근본적으로 더 빠른 메모리를 만들거나, 옮겨야 할 바이트를 줄이거나. 하드웨어 회사들은 첫 번째 길을 골랐습니다. 아래의 소프트웨어 기법들은 두 번째를 골랐습니다. 현재의 속도 폭발은 둘 다입니다.

하드웨어 경쟁: 가중치를 칩 위에 올려라

어떤 컴퓨터에서든 가장 빠른 메모리는 SRAM — 연산과 같은 다이 위의 메모리입니다. GPU 옆에 쌓인 HBM보다 몇 자릿수 빠르지만 작습니다. 기가바이트가 아니라 메가바이트. 세 특화 추론 회사는 모두 같은 대담한 베팅을 했습니다 — 온칩 메모리를 모델 전체를 SRAM에 담을 만큼 크게(또는 칩 수를 충분히 많게) 만들자 — 그리고 각자 다르게 엔지니어링했습니다.

Cerebras: 접시 크기의 칩 하나

Cerebras는 **Wafer-Scale Engine (WSE-3)**를 만듭니다. 실리콘 웨이퍼를 수백 개의 작은 칩으로 자르는 대신, 300mm 웨이퍼 전체가 하나의 칩입니다 — 46,225 mm², 4조 트랜지스터, 90만 코어, 44 GB 온칩 SRAM, 그리고 약 초당 21 페타바이트의 메모리 대역폭. Cerebras는 그것을 H100 메모리 대역폭의 약 7,000배로 홍보하고, 그게 트릭의 전부입니다. SRAM에 사는 가중치는 느린 오프칩 버스를 건너지 않습니다. 공개된 결과에는 Llama 3.1-405B가 초당 969 토큰, 첫 토큰까지 240 ms, Llama 3.1 70B가 초당 2,100 토큰 이상이 포함됩니다.

GPT-5.6 Sol 소식, 해독

그것이 이번 주 발표 아래의 기계 장치입니다. OpenAI의 GPT-5.6 Sol 프리뷰는 프런티어 모델을 Cerebras 서빙과 짝지어 초당 최대 750 토큰을 냅니다 — 같은 급 모델이 H100급 GPU 서빙에서 사용자당 내는 초당 약 70 토큰 대비 10배 도약입니다(가장 느린 주류 배포 대비로는 약 15배). Sol은 3개 모델 패밀리(Sol, Terra, Luna)의 플래그십으로 입력 100만 토큰당 $5 / 출력 $30에 출시되며, 2026년 7월 중순 일반 공개 전까지 얼리 액세스는 소수 조직으로 제한됩니다. 커뮤니티 분석가들은 Sol이 대략 70–100장의 웨이퍼에 걸쳐 서빙된다고 — 대략 웨이퍼당 트랜스포머 레이어 하나 — 추정하지만 OpenAI가 토폴로지를 확인해 주지 않았으므로 그 배치는 정보에 근거한 추측으로 다루세요. 어느 쪽이든 이것이 알리는 바: 처음으로 오픈웨이트 모델이 아니라 프런티어급 모델이 특화 하드웨어 속도로 서빙되고 있다는 것.

Groq: 결정론적인 작은 칩 수백 개

Groq의 **LPU (Language Processing Unit)**는 정반대 형태를 취합니다. 각 LPU에는 외부 DRAM이 전혀 없고 — 약 80 TB/s의 온칩 SRAM 수백 메가바이트만 있습니다(H100의 3.35 TB/s 대비). 큰 모델은 수백 개 칩에 샤딩됩니다. FP8의 Llama 3 70B는 300개 이상의 LPU가 든 랙에 걸쳐 있고, 각각 약 230 MB 조각을 들고 있습니다. 마법의 재료는 결정론입니다. 캐시도, 동적 스케줄링도 없습니다 — 컴파일러가 칩 간 통신을 포함한 실행 전체를 개별 클럭 사이클까지 계획하므로, 무엇도 예측 불가능한 것을 기다리지 않습니다. Groq의 표현은 "결정론이 곧 속도"이고, 추측 디코딩과 함께 Llama 3 70B를 초당 1,660 토큰 이상으로 보여 줬습니다.

SambaNova: 3계층 메모리, 거대 모델

SambaNova의 **RDU (Reconfigurable Dataflow Unit)**는 3계층 메모리 시스템(SRAM + HBM + DRAM)으로 접근법을 섞는데, 그것이 가장 큰 모델을 효율적으로 서빙하는 방법입니다. 671B 파라미터 DeepSeek-R1 전체를 SN40L 칩 단 16개로 초당 약 198–250 토큰에 — 통상 GPU 서빙에서는 초당 30–80 토큰을 내는 모델입니다 — 그리고 Llama 3 8B를 초당 1,000 토큰에 서빙하며, Artificial Analysis가 독립적으로 검증했습니다.

접근법핵심 아이디어가중치용 메모리검증된 속도 예시
GPU (H100급)범용, 처리량 우선오프칩 HBM, 약 3.35 TB/s프런티어 모델, 사용자당 약 70–150 tok/s
Cerebras WSE-3웨이퍼 전체 = 칩 하나44 GB 온칩 SRAM, 약 21 PB/sLlama 3.1-405B 969 tok/s; GPT-5.6 Sol 최대 750 tok/s
Groq LPU결정론적 데이터플로, 컴파일러 스케줄링SRAM만(칩당 약 230 MB), 모델을 300개 이상 칩에 샤딩Llama 3 70B 1,660+ tok/s (추측 디코딩 포함)
SambaNova RDU재구성 가능 데이터플로, 3계층 메모리SRAM + HBM + DRAMDeepSeek-R1 671B, 16칩에서 약 250 tok/s
What you'll learn
  • 이 숫자들 중 어느 것도 마법의 연산이 아닙니다. 이 표의 모든 항목은 같은 질문에 대한 서로 다른 답입니다 — 어떻게 가중치 바이트를 연산 유닛으로 더 빨리 흘려보낼 것인가?
  • 속도 기록은 사용자당(세션당) 속도입니다. 데이터센터 총 처리량은 다른 지표이고 GPU가 여전히 뛰어난 영역입니다 — 그 구분이 아래의 배칭 트레이드오프입니다.

소프트웨어 배수: 어떤 하드웨어에서든 더 빠른 토큰

하드웨어만이 레버는 아닙니다. 세 가지 소프트웨어 기법이 GPU와 특화 칩 모두에서 속도를 배가하며, 올해 평범한 GPU 서빙마저 빨라진 이유의 상당 부분을 설명합니다.

추측 디코딩(Speculative decoding) — 반직관적인 것. 작고 빠른 초안 모델이 다음 여러 토큰을 추측하고, 큰 모델이 그것들을 단 한 번의 순전파로 검증합니다. N개 초안 토큰의 검증은 대략 토큰 하나 생성만큼의 가중치 스트리밍이 듭니다 — 그러니 추측이 맞으면(예측 가능한 텍스트에서는 대개 맞습니다) 토큰 하나의 메모리 값으로 여러 토큰을 얻습니다. 별로 알려지지 않은 부분: 출력은 큰 모델이 혼자 만들어냈을 것과 증명 가능하게 동일합니다. 근사가 아닙니다 — 틀린 추측은 그냥 거부되고 다시 생성됩니다. 이것이 Groq의 1,660 tok/s 수치 뒤의 기법이며, 이제 모든 주요 제공자가 어떤 변형이든 사용합니다.

양자화(Quantization) — 직접적인 것. 병목이 토큰당 옮기는 바이트라면, 바이트를 반으로 줄이세요. 가중치를 16비트 대신 8비트나 4비트로 저장하면 문자 그대로 절반(또는 4분의 1)의 데이터를 흘려보내므로 디코드 속도가 거의 비례해서 오릅니다. 트레이드오프는 대개 작지만 때때로 실재하는 정확도 비용입니다 — 분위기가 아니라 여러분의 작업에서 측정하세요.

배칭(Batching) — 트레이드오프인 것. GPU는 한 번의 패스로 여러 사용자를 서빙해 효율을 되찾습니다. 가중치를 한 번 흘려보내고 배치 전체에 재사용하므로 처리량이 치솟습니다. 하지만 개별 사용자의 토큰은 여전히 공유된 순차 속도로 나옵니다 — 큰 배치는 높은 데이터센터 처리량과 평범한 사용자당 속도를 뜻합니다. 이것이 추론 마케팅에서 가장 많이 오독되는 숫자입니다. "초당 수천 토큰"을 인용하는 제공자는 여러분이 한 세션에서 경험할 것이 아니라 총 처리량을 뜻할 수 있습니다.

빠른 토큰이 모든 것을 바꾸는 이유

속도는 편의 기능처럼 들립니다. 실제로는 능력의 문턱입니다. 여러 제품 범주가 특정 실제 지연시간 아래에서만 동작하기 때문입니다.

에이전트가 가장 큰 배수를 얻습니다. 에이전트 루프는 직렬입니다 — 모델을 호출하고, 도구를 돌리고, 결과를 되먹이고, 반복. 20번의 모델 호출이 연달아 이어지는 건 예사입니다. 70 tok/s에서 각 800 출력 토큰인 20번의 호출은 순수 생성만 약 230초입니다. 커피 한 잔이죠. 그래서 에이전트는 백그라운드 작업으로 밀려납니다. 750 tok/s에서 같은 루프는 약 21초입니다. 상호작용적입니다. 속도 향상은 루프의 모든 단계에 걸쳐 배가되므로, 10배 빠른 토큰은 에이전트를 10% 좋게 만드는 게 아니라 배치 도구에서 대화 상대로 선을 넘게 합니다. (에이전트를 만드시나요? 모델 고르기에서 시작하세요.)

추론 모델이 초당 더 많이 생각합니다. 추론 모델의 품질은 사고 토큰을 얼마나 쓸 수 있는지에 비례합니다. GPU 속도에서 "높은 노력"은 몇 분의 기다림을 뜻하므로 사용자는 사고를 낮춥니다. 웨이퍼 스케일 속도에서는 같은 사고 예산이 몇 초에 끝납니다 — 같은 실제 지연시간에 더 많은 지능을 얻는 셈이고, 이것이 OpenAI–Cerebras 짝짓기의 진짜 전략적 요점이라 할 만합니다.

음성이 진짜로 실시간이 됩니다. 인간의 대화는 약 500 ms의 응답 간격을 견딥니다. 300 ms 미만의 첫 토큰 시간(Cerebras는 405B 모델에서 240 ms를 시연했습니다)에 말하기 속도를 훨씬 웃도는 생성을 더한 빠른 서빙은, 작은 증류 모델이 아니라 프런티어 모델과의 자연스러운 구어 왕복을 마침내 가능하게 합니다.

비용 역학이 흥미로워집니다. 빠르다고 자동으로 싼 건 아닙니다. 특화 서빙은 프리미엄 가격을 부르고(Sol의 출력 100만 토큰당 $30은 최상위입니다), 사용자를 기쁘게 하는 바로 그 속도가 에이전트도 토큰을 더 빨리 태우게 합니다. 하지만 웨이퍼 스케일 제공자들은 규모에서 토큰당 비용이 GPU를 밑돈다고 주장하므로, 속도 티어가 특급 배송처럼 표준 가격 축이 되리라 예상하세요. 예산 관련 맥락은 제공자별 AI 비용에 있습니다.

여러분의 워크로드에 맞게 속도를 평가하는 법

가장 흔한 벤치마킹 실수: "초당 토큰"을 이야기의 전부로 다루는 것. 서로 다른 병목이 만들어내는 개의 숫자가 있습니다.

  • 첫 토큰까지의 시간(TTFT) — 출력이 시작되기까지 얼마나 걸리는가. 연산 바운드인 프리필 단계가 지배하므로 프롬프트 길이와 함께 늘어납니다. 채팅과 음성 사용자가 느끼는 것입니다.
  • 출력 초당 토큰 — 시작된 뒤 텍스트가 얼마나 빨리 흐르는가. 메모리 바운드인 디코드 단계가 지배합니다. 긴 생성과 에이전트 루프가 느끼는 것입니다.

제공자는 서로 다른 하드웨어 한계를 압박하므로 하나를 이기고 다른 하나를 질 수 있습니다. 50K 토큰 컨텍스트를 채우는 RAG 앱은 TTFT에 살고 죽고, 긴 코드 파일을 쓰는 에이전트는 디코드 속도에 살고 죽습니다. Artificial Analysis 같은 독립 리더보드는 둘 다 보고합니다 — 하지만 여러분의 프롬프트 형태, 컨텍스트 길이, 트래픽 패턴은 여러분의 것이므로 자신의 워크로드로 측정하세요. (스트리밍은 체감 지연시간을 총 시간이 아니라 TTFT에 가깝게 만듭니다 — 스트리밍 참고.)

Guided walkthrough1 of 5
  1. 제품에서 실제 프롬프트 10–20개를 고르세요 — 실제 시스템 프롬프트, 실제 컨텍스트 길이. 속도는 입력 크기에 따라 엄청나게 달라집니다. 장난감 프롬프트는 장난감 숫자를 냅니다.

실제 생성 속도를 측정하기 위한 벤치마크 작업

Write a complete Python module implementing a rate limiter with three strategies
(fixed window, sliding window, token bucket), a shared abstract base class,
type hints throughout, docstrings, and a pytest test suite covering edge cases
(burst traffic, clock skew, zero-capacity buckets). Target roughly 2,000 tokens
of output. Do not truncate or summarize - produce the full code.

--- How to use this prompt as a benchmark ---
1. Send it with streaming enabled and your production system prompt attached.
2. Record TTFT = time from request to first streamed chunk.
3. Record decode speed = output_tokens / (total_time - TTFT).
4. Repeat 5 times at 3 different times of day; report medians, not best runs.
5. Re-run the same prompt with 30K tokens of context pasted above it -
 watch what happens to TTFT. That difference is your prefill cost.

확인해 보세요

0/5
  1. 오늘날 LLM이 토큰을 얼마나 빨리 생성하는지에 대한 주된 물리적 제한은?
  2. Cerebras의 웨이퍼 스케일 접근은 메모리 장벽을 어떻게 이기나요?
  3. 추측 디코딩의 함정은?
  4. 한 제공자가 초당 3,000 토큰을 광고합니다. 사용자가 그것을 보게 되리라 가정하기 전에 무엇을 확인해야 하나요?
  5. 빠른 토큰이 단순 채팅보다 에이전트에 더 이로운 이유는?
빠른 추론 어휘
Enter 또는 스페이스 키를 눌러 카드를 뒤집습니다. 좌우 화살표 키로 카드를 이동할 수 있습니다.용어가 표시되었습니다.
1 / 10
Key takeaways
  • 추론 속도는 메모리 대역폭 문제입니다: 모든 토큰이 모든 활성 가중치를 흘려보내야 하므로, 70B FP16 모델이면 토큰당 약 140 GB의 읽기입니다 — 그것이 병목의 전부입니다.
  • 특화 하드웨어 경쟁(Cerebras 웨이퍼 스케일 SRAM, Groq의 DRAM 없는 결정론적 LPU, SambaNova의 3계층 RDU)은 가중치를 온칩 메모리에 두어 장벽을 이깁니다 — 그리고 750 tok/s의 GPT-5.6 Sol이 방금 그 속도를 프런티어 모델에 가져왔습니다.
  • 소프트웨어가 그것을 더 배가합니다: 추측 디코딩(동일한 출력, 다중 토큰 검증), 양자화(토큰당 더 적은 바이트), 배칭(처리량 상승, 사용자당 속도 하락 — 제공자 주장을 주의 깊게 읽으세요).
  • 빠른 토큰은 편의 기능이 아니라 능력의 문턱입니다: 직렬 에이전트 루프가 상호작용적이 되고, 추론 모델이 실제 초당 더 많이 생각하고, 프런티어 모델 음성이 실시간이 됩니다.
  • 두 숫자로 평가하세요 — TTFT(프리필, 프롬프트 길이에 민감)와 출력 초당 토큰(디코드) — 자신의 프롬프트로, 자신의 동시성에서 측정하고 매달 다시 확인하세요.

모델이 내부적으로 어떻게 동작하는지 처음 보시나요? 기초 섹션이 이 레슨이 딛고 선 토큰, 컨텍스트 윈도우, 모델 기본기를 다룹니다.

출처 및 더 읽을거리