토큰, 컨텍스트 및 가격
- Anthropic 자체 도구로 토큰을 정확히 세기(다른 모델의 토크나이저가 아니라)
- max_tokens와 컨텍스트 윈도우를 구분하기 — 그리고 그 차이가 왜 중요한지
- 입력 + 출력 토큰과 모델별 요율로 API 비용 추정하기
- 품질을 잃지 않고 비용 줄이기: 적정 크기, 캐싱, 다듬기, 배치
API의 비용과 한도는 모두 토큰(단어의 약 ¾)으로 측정됩니다. 제대로 잡아야 할 세 가지가 있습니다.
1. 토큰을 정확히 세기
추측하지 말고, 다른 모델의 토크나이저를 쓰지 마세요(예: tiktoken) — 토큰 수는 모델 계열마다 다릅니다. 요청을 보내기 전에 측정하려면 Anthropic의 토큰 세기 엔드포인트/SDK 헬퍼를 사용하세요.
- 대략적인 계획 규칙: ~750단어 ≈ ~1,000토큰(토큰은 대략 단어의 ¾).
2. max_tokens ≠ 컨텍스트 윈도우
이 두 한도는 헷갈리기 쉽지만 서로 다른 것을 관리합니다.
| 한도 | 무엇을 제한하나 | 언제 바꾸나 |
|---|---|---|
max_tokens | 응답의 길이(출력만) | 출력이 잘리면 올리세요 |
| 컨텍스트 윈도우 | 입력 + 출력의 전체 예산 | 큰 입력은 출력 여지를 줄입니다 |
- max_tokens는 작업에 필요한 만큼 설정하세요. 너무 낮으면 응답이 잘립니다. 불필요하게 높아도 비용이 더 들지는 않지만 — 실제 생성된 토큰만큼만 지불합니다 — 응답이 장황해질 수 있습니다.
3. 비용 추정
입력 토큰 + 출력 토큰에 대해 모델별 요율(Opus > Sonnet > Haiku)로 청구됩니다. 빠른 추정:
cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)
현재 요율은 공식 가격 페이지에서 확인하세요 — 여기서는 일부러 하드코딩하지 않습니다.
비용 줄이기(품질을 잃지 않고)
Guided walkthrough1 of 4
- Sonnet으로 시작하고, 어려운 부분에만 Opus를 아껴 쓰세요. 모델 선택(/docs/api/choosing-a-model)을 참고하세요.
- 호출 간에 안정적인 프롬프트 접두부를 재사용하세요. 프롬프트 캐싱(/docs/api/prompt-caching)을 참고하세요.
- 중요한 컨텍스트만 보내세요. RAG(/docs/foundations/rag)가 도움이 되는 지점이기도 합니다.
- 지연 시간이 중요하지 않은 작업은 배치로 처리하세요.
더 많은 전략은 비용 & 지연 시간 트레이드오프에서.
스스로 점검하기
0/4- 모든 것은 토큰으로 측정됩니다(단어의 약 ¾); ~750단어 ≈ ~1,000토큰.
- 토큰은 Anthropic 자체 도구로 세세요 — 다른 모델의 토크나이저를 절대 쓰지 마세요.
- max_tokens는 응답을 제한하고; 컨텍스트 윈도우는 입력 + 출력 전체 예산입니다.
- 청구 = 입력 토큰 + 출력 토큰, 모델별 요율로(Opus > Sonnet > Haiku).
- 모델 적정 크기, 접두부 캐싱, 입력 다듬기, 배치로 비용을 줄이세요.