본문으로 건너뛰기

토큰, 컨텍스트 및 가격

초급
What you'll learn
  • Anthropic 자체 도구로 토큰을 정확히 세기(다른 모델의 토크나이저가 아니라)
  • max_tokens와 컨텍스트 윈도우를 구분하기 — 그리고 그 차이가 왜 중요한지
  • 입력 + 출력 토큰과 모델별 요율로 API 비용 추정하기
  • 품질을 잃지 않고 비용 줄이기: 적정 크기, 캐싱, 다듬기, 배치

API의 비용과 한도는 모두 토큰(단어의 약 ¾)으로 측정됩니다. 제대로 잡아야 할 세 가지가 있습니다.

1. 토큰을 정확히 세기

추측하지 말고, 다른 모델의 토크나이저를 쓰지 마세요(예: tiktoken) — 토큰 수는 모델 계열마다 다릅니다. 요청을 보내기 전에 측정하려면 Anthropic의 토큰 세기 엔드포인트/SDK 헬퍼를 사용하세요.

Pro tip
  • 대략적인 계획 규칙: ~750단어 ≈ ~1,000토큰(토큰은 대략 단어의 ¾).

2. max_tokens ≠ 컨텍스트 윈도우

이 두 한도는 헷갈리기 쉽지만 서로 다른 것을 관리합니다.

한도무엇을 제한하나언제 바꾸나
max_tokens응답의 길이(출력만)출력이 잘리면 올리세요
컨텍스트 윈도우입력 + 출력의 전체 예산큰 입력은 출력 여지를 줄입니다
Watch out
  • max_tokens는 작업에 필요한 만큼 설정하세요. 너무 낮으면 응답이 잘립니다. 불필요하게 높아도 비용이 더 들지는 않지만 — 실제 생성된 토큰만큼만 지불합니다 — 응답이 장황해질 수 있습니다.

3. 비용 추정

입력 토큰 + 출력 토큰에 대해 모델별 요율(Opus > Sonnet > Haiku)로 청구됩니다. 빠른 추정:

cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)

현재 요율은 공식 가격 페이지에서 확인하세요 — 여기서는 일부러 하드코딩하지 않습니다.

비용 줄이기(품질을 잃지 않고)

Guided walkthrough1 of 4
  1. Sonnet으로 시작하고, 어려운 부분에만 Opus를 아껴 쓰세요. 모델 선택(/docs/api/choosing-a-model)을 참고하세요.

더 많은 전략은 비용 & 지연 시간 트레이드오프에서.

스스로 점검하기

0/4
  1. 요청을 계획 중이고 보내기 전에 토큰 수를 알고 싶습니다. 무엇을 써야 하나요?
  2. 응답이 문장 중간에서 계속 잘립니다. 어떤 설정을 바꾸나요?
  3. API에서는 어떻게 청구되나요?
  4. 품질을 잃지 않고 비용을 줄이는 가장 좋은 첫 수는?
Key takeaways
  • 모든 것은 토큰으로 측정됩니다(단어의 약 ¾); ~750단어 ≈ ~1,000토큰.
  • 토큰은 Anthropic 자체 도구로 세세요 — 다른 모델의 토크나이저를 절대 쓰지 마세요.
  • max_tokens는 응답을 제한하고; 컨텍스트 윈도우는 입력 + 출력 전체 예산입니다.
  • 청구 = 입력 토큰 + 출력 토큰, 모델별 요율로(Opus > Sonnet > Haiku).
  • 모델 적정 크기, 접두부 캐싱, 입력 다듬기, 배치로 비용을 줄이세요.

다음