Сколько на самом деле стоит ИИ (у разных провайдеров)
У вопроса «Сколько стоит ИИ?» нет единого ответа — всё зависит от того, какой архетип ценообразования вы покупаете и сколько вы им реально пользуетесь. Долларовые цифры меняются каждые несколько месяцев; сама структура стоимости почти не двигается. Эта страница учит устойчивой форме: три способа, которыми оценивается ИИ, как оценить нагрузку до того, как вы её построите, рычаги, снижающие счёт, и настоящую развилку между арендой API и самостоятельным хостингом.
- Различать три архетипа стоимости: API с оплатой за токены, фиксированная подписка и open/самостоятельный хостинг
- Оценивать стоимость любой нагрузки по формуле токены × ставка × объём — до того, как вы её выпустите
- Использовать главные рычаги, снижающие расходы без ущерба для качества
- Знать, когда open/самостоятельный хостинг выигрывает у API по стоимости, а когда выигрывает API
- Знать, какие числа быстро устаревают — и где проверить сегодняшнюю правду
Три архетипа стоимости
Почти любой способ платить за ИИ сводится к одной из трёх форм. Учите формы, а не цены.
- API с оплатой за токены (usage-based). Вы обращаетесь к размещённой модели через API и платите за токен — причём вход и выход оцениваются раздельно, и выход почти всегда дороже. Более крупные/умные модели стоят больше за токен; меньшие модели стоят гораздо меньше. Большинство провайдеров также предлагают скидки: сниженную ставку за кэшированный вход, который вы пересылаете повторно, и фиксированную пакетную скидку для несрочных асинхронных задач. Так вы платите, когда строите продукт на Claude, GPT или Gemini. Стоимость растёт прямо пропорционально использованию — копейки на малом масштабе, доминирующая статья расходов на большом.
- Фиксированная потребительская/пользовательская подписка. Фиксированная ежемесячная плата за чат-приложение или ассистента в IDE (потребительские планы Claude / ChatGPT / Gemini, места в стиле Copilot). Вы не видите токенов; вы получаете лимит использования и ограничения по скорости. Предсказуемо и дёшево для человека за клавиатурой — но это не масштабируется на программную/высоконагруженную работу, и стоимость за место складывается по всей команде.
- Open / локальный (самостоятельный хостинг). Вы запускаете модель с открытыми весами (Llama, Mistral, Qwen, DeepSeek) на своём железе или арендованном GPU. Здесь нет цены за вызов — вы платите за железо (или почасовую аренду GPU) + электричество + эксплуатацию, занята модель или простаивает. Предельная стоимость ещё одного вызова фактически близка к нулю на масштабе, но вы несёте фиксированные расходы и операционную нагрузку. См. Запуск моделей локально с Ollama.
- Ключевое разделение: API и подписки — это ПРЕДЕЛЬНАЯ стоимость (платишь за использование); самостоятельный хостинг — в основном ФИКСИРОВАННАЯ стоимость (платишь за поддержание мощностей, используешь ты их или нет).
- На API самый большой сюрприз в том, что ВЫХОДНЫЕ токены обычно стоят в несколько раз дороже входных — многословные ответы стоят реальных денег.
- Фиксированная подписка — правильный инструмент для человека, который общается в чате; API с оплатой за токены — правильный инструмент для приложения, вызывающего модель в цикле.
Как оценить стоимость нагрузки
Вы можете прикинуть счёт за API ещё до написания строки продакшн-кода. Вся модель — это одна формула:
стоимость ≈ (входные токены × ставка за вход) + (выходные токены × ставка за выход), за вызов × число вызовов
Ставки указываются за миллион токенов, и у входа и выхода разные ставки — поэтому оценивайте две половины отдельно и складывайте. Грубое правило для токенов: ~1 токен ≈ 4 символа английского текста, или ~0,75 слова. Для точного подсчёта используйте область Оценщика токенов и читайте Токены и цены. Полная механика того, где прячутся токены, — в Экономике токенов.
- Сложите вход: системный промпт + инструменты + извлечённый контекст + история + ход пользователя. Затем оцените выход, который вы запрашиваете. Считайте вход и выход отдельно — они оцениваются по-разному.
- входные токены × ставка за вход, плюс выходные токены × ставка за выход. Используйте сегодняшние числа за миллион со страницы цен провайдера (не доверяйте цифре, которую запомнили — см. VerifyNote).
- Умножьте стоимость за вызов на число вызовов в день × число дней. Стоимость, ничтожная за один вызов (доли цента), становится вашей главной статьёй расходов при миллионах вызовов — моделируйте ВАШ реальный трафик, а не один запрос.
- Если большой кусок входа повторяется каждый вызов, считайте его по КЭШИРОВАННОЙ ставке, а не по полной входной. Если задача офлайн — примените ПАКЕТНУЮ скидку. На масштабе это резко меняет ответ.
- Сравните ваши допущения по токенам с независимым трекером и нашим Калькулятором стоимости, затем атакуйте счёт рычагами ниже.
Прикидка на салфетке (подставьте сегодняшние ставки)
Per call:
input_tokens = system + tools + context + history + user_turn
output_tokens = the answer you ask for
call_cost = (input_tokens * input_rate_per_million / 1e6)
+ (output_tokens * output_rate_per_million / 1e6)
Per month:
monthly_cost = call_cost * calls_per_day * 30
Then adjust:
- cached repeated input -> use the (lower) cache-read rate for that slice
- offline / non-urgent -> apply the batch discount to the whole job
Rates change monthly — pull today's numbers from the provider's pricing page.Главные рычаги для снижения стоимости
Большинство реальных нагрузок несут мёртвый груз. Эти рычаги, примерно в порядке отдачи, снижают расходы, не трогая качество — сначала используйте дешёвые структурные.
- Подберите модель по размеру. Не платите по ставке флагмана за задачу, с которой прекрасно справляется маленькая/дешёвая модель. Классификация, извлечение, маршрутизация и простое форматирование обычно отлично работают на самом младшем уровне за долю цены за токен. Приберегите большую модель для по-настоящему сложных рассуждений и рассмотрите маршрутизацию: дешёвая модель обрабатывает лёгкое большинство, эскалация только сложных случаев. См. Выбор модели.
- Урезайте контекст, который отправляете. Самый дешёвый токен — тот, который вы никогда не отправляете. Обрезайте раздутые системные промпты, сжимайте длинные истории в текущее резюме и открывайте только те инструменты, что нужны задаче — каждый из них это вход, за который вы платите заново на каждом вызове.
- RAG вместо запихивания огромного контекста. Вставлять 50-страничный документ, чтобы ответить на один вопрос, — значит платить за 50 страниц на каждом вызове. Извлечение (retrieval) достаёт только несколько релевантных фрагментов — гораздо меньше входных токенов при том же (часто лучшем) ответе. Тянитесь к гигантскому окну контекста только тогда, когда вам действительно нужен весь корпус целиком.
- Кэширование промптов. Если многие вызовы разделяют большой неизменный префикс (системный промпт, каталог инструментов, справочный документ), кэширование обрабатывает его один раз и переотдаёт с крутой скидкой на каждом последующем вызове. Самое высокоотдачное структурное изменение для чат- и агентных нагрузок, потому что оно окупается на каждом ходу.
- Отправляйте несрочное в пакетную обработку. Оценки (evals), массовая разметка, суммирование архива — всё, где ответ не нужен за секунды, — проходит через асинхронный пакетный путь с фиксированной скидкой у большинства провайдеров. Обменяйте мгновенность на ощутимо меньший счёт.
- Сокращайте выход. Выход — более дорогая сторона. Просите JSON или строгую схему вместо болтливого абзаца: меньше выходных токенов и никаких догадок при парсинге вниз по потоку.
- Меньшие / open модели для лёгкой доли. Для высокообъёмного, низкосложного большинства вызовов open или маленькая модель может быть драматически дешевле за вызов — иногда почти бесплатно, если вы уже держите самостоятельный хостинг. Оставьте фронтир-модель для случаев, которым она действительно нужна.
- Они складываются мультипликативно: кэшированный вход × правильно подобранная модель × более краткий выход × пакетная скидка компонуются в большое суммарное сокращение на лёгкой задаче — при неизменном качестве.
- Используйте структурные рычаги (подбор размера, кэш, RAG, пакет) прежде чем микрооптимизировать формулировки — они двигают счёт куда сильнее.
- Всегда ИЗМЕРЯЙТЕ изменение по реальному счёту, а не по догадке. Глубокий сборник приёмов — это Экономика токенов.
Когда open/самостоятельный хостинг выигрывает у API — и когда выигрывает API
Это решение, которое реально двигает ваш бюджет на ИИ. Это переход между фиксированной и предельной стоимостью, и объём — переменная, которая его решает.
- Open / самостоятельный хостинг выигрывает при ВЫСОКОМ, устойчивом объёме. Как только вы гоняете достаточно вызовов, чтобы держать GPU занятым большую часть времени, близкая к нулю предельная стоимость за вызов бьёт вечную оплату за токены. Вы амортизируете фиксированную стоимость железа/аренды по огромному числу вызовов, получаете приватность данных и полную кастомизацию — и принимаете операционную нагрузку (провижининг, масштабирование, аптайм, MLOps) как плату за вход.
- API выигрывает при НИЗКОМ или РВАНОМ объёме, либо без инфраструктуры. Если трафик мал, всплесковый или непредсказуемый, оплата за токены означает, что вы платите только за то, что используете, и ничего в простое — никакого GPU, греющегося в 3 часа ночи. Вы также избегаете всей эксплуатации. Для большинства команд, выпускающих продукт, прототипирующих или с трафиком всплесками, API одновременно и дешевле, и гораздо меньше работы.
- Самостоятельный хостинг редко бывает «бесплатным». Веса модели могут быть бесплатны, но GPU, электричество и часы инженеров на поддержание работы — нет; честно посчитайте их, прежде чем заявлять об экономии.
- Простаивающие GPU — чистый убыток: инфраструктура с фиксированной стоимостью бьёт оплату за токены только при ВЫСОКОЙ утилизации. Низкий или всплесковый трафик каждый раз в пользу API.
- Точка перехода сдвигается всякий раз, когда падают цены на API или дешевеет железо — периодически пересчитывайте, не решайте один раз и не забывайте.
Проверь себя
0/3- Три архетипа: API за токены (usage-based, вход и выход оцениваются раздельно), фиксированная подписка (предсказуемо, не масштабируется на большой объём) и open/самостоятельный хостинг (фиксированная стоимость, почти ноль за вызов).
- Оценивайте до того, как строить: (вход × ставка за вход) + (выход × ставка за выход), за вызов × объём — затем примените скидки за кэш и пакет.
- Крупнейшие рычаги: подобрать модель по размеру, урезать контекст, RAG вместо огромного контекста, кэширование промптов, пакетировать несрочное, сокращать выход.
- Самостоятельный хостинг выигрывает при ВЫСОКОМ устойчивом объёме (амортизация фиксированной стоимости); API выигрывает при НИЗКОМ/всплесковом объёме или без инфраструктуры (платишь только за использование).
- Любая долларовая цифра быстро устаревает — проверяйте на странице цен провайдера и на трекере, и считайте свои числа в Калькуляторе стоимости.
Источники и дополнительное чтение
- Anthropic — Pricing — актуальные ставки Claude за токен, скидки за кэш и пакет.
- OpenAI — API Pricing · OpenAI — Pricing overview — актуальные ставки GPT за токен и уровни.
- Google — Gemini API Pricing — актуальные ставки Gemini, бесплатный уровень и платные уровни.
- Mistral — Pricing — цены open-weight + API, ориентир с упором на эффективность.
- Artificial Analysis — независимые, часто обновляемые кросс-провайдерные сравнения цены/скорости/качества (трекер для сверки любой заявленной цифры).
- Ollama — запускайте open-weight модели локально, чтобы свести цену за вызов к нулю на масштабе.
Далее
- Выберите правильную (и правильно оценённую) модель → Выбор модели
- Найдите, где реально утекают токены → Экономика токенов
- Механика оплаты за токены в глубину → Токены и цены
- Посчитайте свои числа → Калькулятор стоимости