Перейти к основному содержимому

Сколько на самом деле стоит ИИ (у разных провайдеров)

Средний

У вопроса «Сколько стоит ИИ?» нет единого ответа — всё зависит от того, какой архетип ценообразования вы покупаете и сколько вы им реально пользуетесь. Долларовые цифры меняются каждые несколько месяцев; сама структура стоимости почти не двигается. Эта страница учит устойчивой форме: три способа, которыми оценивается ИИ, как оценить нагрузку до того, как вы её построите, рычаги, снижающие счёт, и настоящую развилку между арендой API и самостоятельным хостингом.

What you'll learn
  • Различать три архетипа стоимости: API с оплатой за токены, фиксированная подписка и open/самостоятельный хостинг
  • Оценивать стоимость любой нагрузки по формуле токены × ставка × объём — до того, как вы её выпустите
  • Использовать главные рычаги, снижающие расходы без ущерба для качества
  • Знать, когда open/самостоятельный хостинг выигрывает у API по стоимости, а когда выигрывает API
  • Знать, какие числа быстро устаревают — и где проверить сегодняшнюю правду

Три архетипа стоимости

Почти любой способ платить за ИИ сводится к одной из трёх форм. Учите формы, а не цены.

  • API с оплатой за токены (usage-based). Вы обращаетесь к размещённой модели через API и платите за токен — причём вход и выход оцениваются раздельно, и выход почти всегда дороже. Более крупные/умные модели стоят больше за токен; меньшие модели стоят гораздо меньше. Большинство провайдеров также предлагают скидки: сниженную ставку за кэшированный вход, который вы пересылаете повторно, и фиксированную пакетную скидку для несрочных асинхронных задач. Так вы платите, когда строите продукт на Claude, GPT или Gemini. Стоимость растёт прямо пропорционально использованию — копейки на малом масштабе, доминирующая статья расходов на большом.
  • Фиксированная потребительская/пользовательская подписка. Фиксированная ежемесячная плата за чат-приложение или ассистента в IDE (потребительские планы Claude / ChatGPT / Gemini, места в стиле Copilot). Вы не видите токенов; вы получаете лимит использования и ограничения по скорости. Предсказуемо и дёшево для человека за клавиатурой — но это не масштабируется на программную/высоконагруженную работу, и стоимость за место складывается по всей команде.
  • Open / локальный (самостоятельный хостинг). Вы запускаете модель с открытыми весами (Llama, Mistral, Qwen, DeepSeek) на своём железе или арендованном GPU. Здесь нет цены за вызов — вы платите за железо (или почасовую аренду GPU) + электричество + эксплуатацию, занята модель или простаивает. Предельная стоимость ещё одного вызова фактически близка к нулю на масштабе, но вы несёте фиксированные расходы и операционную нагрузку. См. Запуск моделей локально с Ollama.
Pro tip
  • Ключевое разделение: API и подписки — это ПРЕДЕЛЬНАЯ стоимость (платишь за использование); самостоятельный хостинг — в основном ФИКСИРОВАННАЯ стоимость (платишь за поддержание мощностей, используешь ты их или нет).
  • На API самый большой сюрприз в том, что ВЫХОДНЫЕ токены обычно стоят в несколько раз дороже входных — многословные ответы стоят реальных денег.
  • Фиксированная подписка — правильный инструмент для человека, который общается в чате; API с оплатой за токены — правильный инструмент для приложения, вызывающего модель в цикле.

Как оценить стоимость нагрузки

Вы можете прикинуть счёт за API ещё до написания строки продакшн-кода. Вся модель — это одна формула:

стоимость ≈ (входные токены × ставка за вход) + (выходные токены × ставка за выход), за вызов × число вызовов

Ставки указываются за миллион токенов, и у входа и выхода разные ставки — поэтому оценивайте две половины отдельно и складывайте. Грубое правило для токенов: ~1 токен ≈ 4 символа английского текста, или ~0,75 слова. Для точного подсчёта используйте область Оценщика токенов и читайте Токены и цены. Полная механика того, где прячутся токены, — в Экономике токенов.

Guided walkthrough1 of 5
  1. Сложите вход: системный промпт + инструменты + извлечённый контекст + история + ход пользователя. Затем оцените выход, который вы запрашиваете. Считайте вход и выход отдельно — они оцениваются по-разному.

Прикидка на салфетке (подставьте сегодняшние ставки)

Per call:
input_tokens  = system + tools + context + history + user_turn
output_tokens = the answer you ask for
call_cost = (input_tokens  * input_rate_per_million  / 1e6)
          + (output_tokens * output_rate_per_million / 1e6)

Per month:
monthly_cost = call_cost * calls_per_day * 30

Then adjust:
- cached repeated input -> use the (lower) cache-read rate for that slice
- offline / non-urgent  -> apply the batch discount to the whole job
Rates change monthly — pull today's numbers from the provider's pricing page.

Главные рычаги для снижения стоимости

Большинство реальных нагрузок несут мёртвый груз. Эти рычаги, примерно в порядке отдачи, снижают расходы, не трогая качество — сначала используйте дешёвые структурные.

  • Подберите модель по размеру. Не платите по ставке флагмана за задачу, с которой прекрасно справляется маленькая/дешёвая модель. Классификация, извлечение, маршрутизация и простое форматирование обычно отлично работают на самом младшем уровне за долю цены за токен. Приберегите большую модель для по-настоящему сложных рассуждений и рассмотрите маршрутизацию: дешёвая модель обрабатывает лёгкое большинство, эскалация только сложных случаев. См. Выбор модели.
  • Урезайте контекст, который отправляете. Самый дешёвый токен — тот, который вы никогда не отправляете. Обрезайте раздутые системные промпты, сжимайте длинные истории в текущее резюме и открывайте только те инструменты, что нужны задаче — каждый из них это вход, за который вы платите заново на каждом вызове.
  • RAG вместо запихивания огромного контекста. Вставлять 50-страничный документ, чтобы ответить на один вопрос, — значит платить за 50 страниц на каждом вызове. Извлечение (retrieval) достаёт только несколько релевантных фрагментов — гораздо меньше входных токенов при том же (часто лучшем) ответе. Тянитесь к гигантскому окну контекста только тогда, когда вам действительно нужен весь корпус целиком.
  • Кэширование промптов. Если многие вызовы разделяют большой неизменный префикс (системный промпт, каталог инструментов, справочный документ), кэширование обрабатывает его один раз и переотдаёт с крутой скидкой на каждом последующем вызове. Самое высокоотдачное структурное изменение для чат- и агентных нагрузок, потому что оно окупается на каждом ходу.
  • Отправляйте несрочное в пакетную обработку. Оценки (evals), массовая разметка, суммирование архива — всё, где ответ не нужен за секунды, — проходит через асинхронный пакетный путь с фиксированной скидкой у большинства провайдеров. Обменяйте мгновенность на ощутимо меньший счёт.
  • Сокращайте выход. Выход — более дорогая сторона. Просите JSON или строгую схему вместо болтливого абзаца: меньше выходных токенов и никаких догадок при парсинге вниз по потоку.
  • Меньшие / open модели для лёгкой доли. Для высокообъёмного, низкосложного большинства вызовов open или маленькая модель может быть драматически дешевле за вызов — иногда почти бесплатно, если вы уже держите самостоятельный хостинг. Оставьте фронтир-модель для случаев, которым она действительно нужна.
Pro tip
  • Они складываются мультипликативно: кэшированный вход × правильно подобранная модель × более краткий выход × пакетная скидка компонуются в большое суммарное сокращение на лёгкой задаче — при неизменном качестве.
  • Используйте структурные рычаги (подбор размера, кэш, RAG, пакет) прежде чем микрооптимизировать формулировки — они двигают счёт куда сильнее.
  • Всегда ИЗМЕРЯЙТЕ изменение по реальному счёту, а не по догадке. Глубокий сборник приёмов — это Экономика токенов.

Когда open/самостоятельный хостинг выигрывает у API — и когда выигрывает API

Это решение, которое реально двигает ваш бюджет на ИИ. Это переход между фиксированной и предельной стоимостью, и объём — переменная, которая его решает.

  • Open / самостоятельный хостинг выигрывает при ВЫСОКОМ, устойчивом объёме. Как только вы гоняете достаточно вызовов, чтобы держать GPU занятым большую часть времени, близкая к нулю предельная стоимость за вызов бьёт вечную оплату за токены. Вы амортизируете фиксированную стоимость железа/аренды по огромному числу вызовов, получаете приватность данных и полную кастомизацию — и принимаете операционную нагрузку (провижининг, масштабирование, аптайм, MLOps) как плату за вход.
  • API выигрывает при НИЗКОМ или РВАНОМ объёме, либо без инфраструктуры. Если трафик мал, всплесковый или непредсказуемый, оплата за токены означает, что вы платите только за то, что используете, и ничего в простое — никакого GPU, греющегося в 3 часа ночи. Вы также избегаете всей эксплуатации. Для большинства команд, выпускающих продукт, прототипирующих или с трафиком всплесками, API одновременно и дешевле, и гораздо меньше работы.
Watch out
  • Самостоятельный хостинг редко бывает «бесплатным». Веса модели могут быть бесплатны, но GPU, электричество и часы инженеров на поддержание работы — нет; честно посчитайте их, прежде чем заявлять об экономии.
  • Простаивающие GPU — чистый убыток: инфраструктура с фиксированной стоимостью бьёт оплату за токены только при ВЫСОКОЙ утилизации. Низкий или всплесковый трафик каждый раз в пользу API.
  • Точка перехода сдвигается всякий раз, когда падают цены на API или дешевеет железо — периодически пересчитывайте, не решайте один раз и не забывайте.
Словарь стоимости ИИ
Нажмите Enter или пробел, чтобы перевернуть карточку. Используйте стрелки влево и вправо для перехода между карточками.Показан термин.
1 / 6

Проверь себя

0/3
  1. На API с оплатой за токены какая сторона счёта почти всегда дороже?
  2. У вас низкий, всплесковый, непредсказуемый трафик и нет ML-инфраструктуры. Что обычно дешевле?
  3. Какой самый надёжный способ срезать счёт за API на лёгкой высокообъёмной задаче?
Key takeaways
  • Три архетипа: API за токены (usage-based, вход и выход оцениваются раздельно), фиксированная подписка (предсказуемо, не масштабируется на большой объём) и open/самостоятельный хостинг (фиксированная стоимость, почти ноль за вызов).
  • Оценивайте до того, как строить: (вход × ставка за вход) + (выход × ставка за выход), за вызов × объём — затем примените скидки за кэш и пакет.
  • Крупнейшие рычаги: подобрать модель по размеру, урезать контекст, RAG вместо огромного контекста, кэширование промптов, пакетировать несрочное, сокращать выход.
  • Самостоятельный хостинг выигрывает при ВЫСОКОМ устойчивом объёме (амортизация фиксированной стоимости); API выигрывает при НИЗКОМ/всплесковом объёме или без инфраструктуры (платишь только за использование).
  • Любая долларовая цифра быстро устаревает — проверяйте на странице цен провайдера и на трекере, и считайте свои числа в Калькуляторе стоимости.

Источники и дополнительное чтение

  • Anthropic — Pricing — актуальные ставки Claude за токен, скидки за кэш и пакет.
  • OpenAI — API Pricing · OpenAI — Pricing overview — актуальные ставки GPT за токен и уровни.
  • Google — Gemini API Pricing — актуальные ставки Gemini, бесплатный уровень и платные уровни.
  • Mistral — Pricing — цены open-weight + API, ориентир с упором на эффективность.
  • Artificial Analysis — независимые, часто обновляемые кросс-провайдерные сравнения цены/скорости/качества (трекер для сверки любой заявленной цифры).
  • Ollama — запускайте open-weight модели локально, чтобы свести цену за вызов к нулю на масштабе.

Далее