Перейти к основному содержимому

Токены, контекст и стоимость

Начальный
What you'll learn
  • Правильно считать токены с помощью собственных инструментов Anthropic (а не токенизатора другой модели)
  • Отличать max_tokens от окна контекста — и понимать, почему это важно
  • Оценивать стоимость API по количеству входных и выходных токенов по тарифам конкретной модели
  • Снижать стоимость без потери качества: подбирать размер модели, кэшировать, урезать, группировать в пакеты

Стоимость и лимиты в API измеряются в токенах (примерно ¾ слова). Три вещи, в которых важно не ошибиться.

1. Правильно считайте токены

Не угадывайте и не используйте токенизатор другой модели (например, tiktoken) — количество токенов различается между семействами моделей. Используйте эндпоинт подсчёта токенов Anthropic или соответствующий помощник SDK, чтобы измерить запрос перед отправкой.

Pro tip
  • Грубое правило для планирования: ~750 слов ≈ ~1 000 токенов (токен — это примерно ¾ слова).

2. max_tokens ≠ окно контекста

Эти два лимита легко перепутать, но они управляют разными вещами.

ЛимитЧто ограничиваетКогда менять
max_tokensДлину ответа (только вывод)Увеличьте, если ответ обрезается
Окно контекстаОбщий бюджет на вход + выводБольшой ввод оставляет меньше места для вывода
Watch out
  • Устанавливайте max_tokens под нужды задачи. Слишком низкое значение обрежет ответ. Излишне высокое не стоит дороже — вы платите только за реально сгенерированные токены — но может привести к многословным ответам.

3. Оцените стоимость

Вам выставляют счёт за входные токены + выходные токены по тарифам конкретной модели (Opus > Sonnet > Haiku). Быстрая оценка:

cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)

Актуальные тарифы смотрите на официальной странице цен — мы намеренно не прописываем их здесь жёстко.

Снижение стоимости (без потери качества)

Guided walkthrough1 of 4
  1. Начните с Sonnet; оставьте Opus для сложных частей. См. Выбор модели (/docs/api/choosing-a-model).

Больше стратегий в разделе Компромиссы между стоимостью и задержкой.

Проверьте себя

0/4
  1. Вы планируете запрос и хотите узнать количество токенов перед отправкой. Чем стоит воспользоваться?
  2. Ваш ответ постоянно обрывается на середине предложения. Какую настройку вы меняете?
  3. Как вам выставляется счёт в API?
  4. Какой первый шаг лучше всего снижает стоимость без потери качества?
Key takeaways
  • Всё измеряется в токенах (примерно ¾ слова); ~750 слов ≈ ~1 000 токенов.
  • Считайте токены собственными инструментами Anthropic — никогда токенизатором другой модели.
  • max_tokens ограничивает ответ; окно контекста — это общий бюджет на вход + вывод.
  • Счёт = входные токены + выходные токены по тарифам конкретной модели (Opus > Sonnet > Haiku).
  • Снижайте стоимость, подбирая размер модели, кэшируя префиксы, урезая ввод и группируя в пакеты.

Дальше