Токены, контекст и стоимость
- Правильно считать токены с помощью собственных инструментов Anthropic (а не токенизатора другой модели)
- Отличать max_tokens от окна контекста — и понимать, почему это важно
- Оценивать стоимость API по количеству входных и выходных токенов по тарифам конкретной модели
- Снижать стоимость без потери качества: подбирать размер модели, кэшировать, урезать, группировать в пакеты
Стоимость и лимиты в API измеряются в токенах (примерно ¾ слова). Три вещи, в которых важно не ошибиться.
1. Правильно считайте токены
Не угадывайте и не используйте токенизатор другой модели (например, tiktoken) — количество токенов различается между семействами моделей. Используйте эндпоинт подсчёта токенов Anthropic или соответствующий помощник SDK, чтобы измерить запрос перед отправкой.
- Грубое правило для планирования: ~750 слов ≈ ~1 000 токенов (токен — это примерно ¾ слова).
2. max_tokens ≠ окно контекста
Эти два лимита легко перепутать, но они управляют разными вещами.
| Лимит | Что ограничивает | Когда менять |
|---|---|---|
max_tokens | Длину ответа (только вывод) | Увеличьте, если ответ обрезается |
| Окно контекста | Общий бюджет на вход + вывод | Большой ввод оставляет меньше места для вывода |
- Устанавливайте max_tokens под нужды задачи. Слишком низкое значение обрежет ответ. Излишне высокое не стоит дороже — вы платите только за реально сгенерированные токены — но может привести к многословным ответам.
3. Оцените стоимость
Вам выставляют счёт за входные токены + выходные токены по тарифам конкретной модели (Opus > Sonnet > Haiku). Быстрая оценка:
cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)
Актуальные тарифы смотрите на официальной странице цен — мы намеренно не прописываем их здесь жёстко.
Снижение стоимости (без потери качества)
Guided walkthrough1 of 4
- Начните с Sonnet; оставьте Opus для сложных частей. См. Выбор модели (/docs/api/choosing-a-model).
- Переиспользуйте стабильный префикс промпта между вызовами. См. Кэширование промптов (/docs/api/prompt-caching).
- Отправляйте только тот контекст, который важен. Здесь также помогает RAG (/docs/foundations/rag).
- Пакетные задания, где задержка не имеет значения.
Больше стратегий в разделе Компромиссы между стоимостью и задержкой.
Проверьте себя
0/4- Всё измеряется в токенах (примерно ¾ слова); ~750 слов ≈ ~1 000 токенов.
- Считайте токены собственными инструментами Anthropic — никогда токенизатором другой модели.
- max_tokens ограничивает ответ; окно контекста — это общий бюджет на вход + вывод.
- Счёт = входные токены + выходные токены по тарифам конкретной модели (Opus > Sonnet > Haiku).
- Снижайте стоимость, подбирая размер модели, кэшируя префиксы, урезая ввод и группируя в пакеты.