본문으로 건너뛰기

AI의 실제 비용 (제공업체별 비교)

중급

"AI는 비용이 얼마나 드는가?"라는 질문에는 단 하나의 답이 없다 — 어떤 가격 책정 원형을 구매하고 있는지, 그리고 실제로 얼마나 사용하는지에 달려 있다. 달러 수치는 몇 달마다 바뀌지만, 비용의 구조는 거의 움직이지 않는다. 이 페이지는 그 견고한 형태를 가르친다: AI 가격이 책정되는 세 가지 방식, 만들기 전에 워크로드를 추정하는 방법, 청구액을 줄이는 레버, 그리고 API를 임대할지 자체 호스팅할지의 실질적인 갈림길.

What you'll learn
  • 세 가지 비용 원형을 구분한다: 토큰당 API, 정액 구독, 오픈/자체 호스팅
  • 어떤 워크로드든 토큰 × 요율 × 볼륨으로 비용을 추정한다 — 출시하기 전에
  • 품질을 해치지 않고 지출을 줄이는 큰 레버를 당긴다
  • 비용 면에서 오픈/자체 호스팅이 API를 이기는 시점과 API가 이기는 시점을 안다
  • 어떤 수치가 빠르게 낡는지 — 그리고 오늘의 진실을 어디서 확인할지 안다

세 가지 비용 원형

AI에 지불하는 거의 모든 방식은 세 가지 형태 중 하나로 귀결된다. 가격이 아니라 형태를 배워라.

  • 토큰당 API (사용량 기반). 호스팅된 모델을 API를 통해 호출하고 토큰당 지불한다 — 그리고 입력과 출력은 별도로 가격이 책정되며, 출력이 거의 항상 둘 중 더 비싸다. 더 크고/똑똑한 모델은 토큰당 더 비싸고, 더 작은 모델은 훨씬 저렴하다. 대부분의 제공업체는 또한 할인을 제공한다: 다시 보내는 캐시된 입력에 대한 할인 요율, 그리고 긴급하지 않은 비동기 작업을 위한 정액 배치 할인. 이것이 Claude, GPT, Gemini 위에 제품을 만들 때 지불하는 방식이다. 비용은 사용량에 직접 비례한다 — 작은 규모에서는 몇 푼, 큰 규모에서는 지배적인 항목.
  • 정액 소비자/좌석 구독. 채팅 앱이나 IDE 어시스턴트에 대한 고정 월 요금 (Claude / ChatGPT / Gemini 소비자 플랜, Copilot 스타일 좌석). 토큰은 보이지 않는다; 사용량 허용치와 요율 제한을 받는다. 키보드 앞의 사람에게는 예측 가능하고 저렴하다 — 하지만 프로그래밍적/대량 작업으로는 확장되지 않고, 좌석당 비용은 팀 전체에 걸쳐 누적된다.
  • 오픈 / 로컬 (자체 호스팅). 자신의 하드웨어나 임대한 GPU에서 오픈 웨이트 모델(Llama, Mistral, Qwen, DeepSeek)을 실행한다. 호출당 가격이 없다 — 모델이 바쁘든 유휴 상태이든 하드웨어(또는 시간당 GPU 임대) + 전기 + 운영에 지불한다. 한 번 더 호출하는 한계 비용은 대규모에서 사실상 거의 0이지만, 고정 비용과 운영 부담을 짊어진다. Ollama로 로컬에서 모델 실행하기를 참조하라.
Pro tip
  • 핵심 구분: API와 구독은 한계 비용(사용할 때마다 지불)이고, 자체 호스팅은 대부분 고정 비용(사용하든 안 하든 용량을 유지하기 위해 지불)이다.
  • API에서 가장 큰 놀라움은 출력 토큰이 보통 입력보다 몇 배 더 비싸다는 것이다 — 장황한 답변은 실제 돈이 든다.
  • 정액 구독은 사람이 채팅하기에 적합한 도구이고, 토큰당 API는 앱이 루프에서 모델을 호출하기에 적합한 도구다.

워크로드 비용을 추정하는 방법

프로덕션 코드를 한 줄 쓰기 전에 API 청구액을 가늠할 수 있다. 전체 모델은 하나의 공식이다:

비용 ≈ (입력 토큰 × 입력 요율) + (출력 토큰 × 출력 요율), 호출당 × 호출 횟수

요율은 백만 토큰당으로 표시되며, 입력과 출력은 다른 요율을 갖는다 — 그러니 두 절반을 별도로 추정하고 더하라. 대략적인 토큰 어림법: ~1 토큰 ≈ 영어 4글자, 또는 ~0.75 단어. 정확한 개수는 토큰 추정기 영역을 사용하고 토큰 & 가격을 읽어라. 토큰이 어디에 숨는지에 대한 전체 메커니즘은 토큰 경제에 있다.

Guided walkthrough1 of 5
  1. 입력을 더하라: 시스템 프롬프트 + 도구 + 검색된 컨텍스트 + 히스토리 + 사용자 턴. 그런 다음 요청하는 출력을 추정하라. 입력과 출력을 별도로 세라 — 가격이 다르게 책정된다.

봉투 뒷면 추정 (오늘의 요율을 채워라)

Per call:
input_tokens  = system + tools + context + history + user_turn
output_tokens = the answer you ask for
call_cost = (input_tokens  * input_rate_per_million  / 1e6)
          + (output_tokens * output_rate_per_million / 1e6)

Per month:
monthly_cost = call_cost * calls_per_day * 30

Then adjust:
- cached repeated input -> use the (lower) cache-read rate for that slice
- offline / non-urgent  -> apply the batch discount to the whole job
Rates change monthly — pull today's numbers from the provider's pricing page.

비용을 줄이는 큰 레버

대부분의 실제 워크로드는 죽은 무게를 짊어진다. 이 레버들은, 대략 지렛대 순서대로, 품질을 건드리지 않고 지출을 줄인다 — 저렴한 구조적 레버부터 먼저 당겨라.

  • 모델의 크기를 알맞게 맞춰라. 작고/저렴한 모델이 잘 해내는 작업에 최상위 요율을 지불하지 마라. 분류, 추출, 라우팅, 단순 포맷팅은 보통 토큰당 가격의 일부로 가장 작은 등급에서 훌륭하게 돌아간다. 진정으로 어려운 추론에는 큰 모델을 아껴두고, 라우팅을 고려하라: 저렴한 모델이 쉬운 다수를 처리하고, 어려운 경우만 에스컬레이션한다. 모델 선택하기를 참조하라.
  • 보내는 컨텍스트를 다듬어라. 가장 저렴한 토큰은 결코 보내지 않는 토큰이다. 비대해진 시스템 프롬프트를 잘라내고, 긴 히스토리를 진행 중인 요약으로 압축하고, 작업에 필요한 도구만 노출하라 — 모든 것이 매 호출마다 다시 지불하는 입력이다.
  • 거대한 컨텍스트를 채우는 대신 RAG. 하나의 질문에 답하기 위해 50페이지 문서를 붙여넣으면 매 호출마다 50페이지를 지불한다. **검색(Retrieval)**은 관련된 몇 개의 구절만 가져온다 — 같은(종종 더 나은) 답변에 훨씬 적은 입력 토큰. 전체 코퍼스를 한 번에 봐야 진정으로 필요할 때만 거대한 컨텍스트 창에 손을 뻗어라.
  • 프롬프트 캐싱. 많은 호출이 큰 불변 접두사(시스템 프롬프트, 도구 카탈로그, 참조 문서)를 공유한다면, 캐싱은 그것을 한 번 처리하고 이후 모든 호출에서 큰 할인으로 다시 제공한다. 채팅과 에이전트 워크로드에서 가장 지렛대가 큰 단일 구조적 변경인데, 매 턴마다 본전을 뽑기 때문이다.
  • 긴급하지 않은 것은 배치로 처리하라. 평가, 대량 라벨링, 아카이브 요약 — 몇 초 안에 답이 필요하지 않은 모든 것 — 은 대부분의 제공업체에서 정액 할인으로 비동기 배치 경로를 거친다. 즉시성을 실질적으로 낮은 청구액과 맞바꿔라.
  • 출력을 줄여라. 출력이 더 비싼 쪽이다. 수다스러운 문단 대신 JSON이나 빡빡한 스키마를 요청하라: 더 적은 출력 토큰 그리고 하위 단계 파싱 추측이 없다.
  • 쉬운 부분에는 더 작은/오픈 모델. 대량, 저난도의 다수 호출에 대해, 오픈 또는 작은 모델은 호출당 극적으로 저렴할 수 있다 — 이미 자체 호스팅한다면 때로는 거의 무료다. 진정으로 필요한 경우를 위해 프론티어 모델을 아껴두어라.
Pro tip
  • 이것들은 곱셈적으로 쌓인다: 캐시된 입력 × 알맞은 크기의 모델 × 더 간결한 출력 × 배치 할인이 복리로 작용해 쉬운 작업에서 큰 총 절감이 된다 — 품질은 그대로.
  • 표현을 미세 최적화하기 전에 구조적 레버(크기 조정, 캐시, RAG, 배치)를 먼저 당겨라 — 청구액을 훨씬 더 많이 움직인다.
  • 변화를 항상 추측이 아니라 실제 청구액에 대해 측정하라. 심층 플레이북은 토큰 경제다.

오픈/자체 호스팅이 API를 이기는 시점 — 그리고 API가 이기는 시점

이것이 실제로 AI 예산을 움직이는 결정이다. 고정 비용 대 한계 비용의 교차점이며, 볼륨이 그것을 결정하는 변수다.

  • 오픈 / 자체 호스팅은 높고 꾸준한 볼륨에서 이긴다. GPU를 대부분의 시간 동안 바쁘게 유지할 만큼 충분한 호출을 실행하게 되면, 호출당 거의 0에 가까운 한계 비용이 영원히 토큰당 지불하는 것을 이긴다. 고정 하드웨어/임대 비용을 엄청난 수의 호출에 걸쳐 상각하고, 데이터 프라이버시와 완전한 커스터마이징을 얻는다 — 그리고 운영 부담(프로비저닝, 스케일링, 가동 시간, MLOps)을 입장료로 받아들인다.
  • API는 낮거나 급증하는 볼륨에서, 또는 인프라가 없을 때 이긴다. 트래픽이 작거나 급증하거나 예측 불가능하다면, 토큰당 지불한다는 것은 사용한 만큼만 지불하고 유휴 상태일 때는 아무것도 지불하지 않는다는 뜻이다 — 새벽 3시에 GPU가 따뜻하게 놀고 있지 않다. 또한 모든 운영을 건너뛴다. 제품을 출시하거나, 프로토타이핑하거나, 급증하는 트래픽을 가진 대부분의 팀에게 API는 더 저렴하고 또한 훨씬 일이 적다.
Watch out
  • 자체 호스팅은 좀처럼 '무료'가 아니다. 모델 웨이트는 무료일 수 있지만, GPU, 전기, 그리고 그것을 계속 돌리는 엔지니어 시간은 무료가 아니다 — 절감을 주장하기 전에 정직하게 계산하라.
  • 유휴 GPU는 순수한 손실이다: 고정 비용 인프라는 활용도가 높을 때만 토큰당 가격을 이긴다. 낮거나 급증하는 트래픽은 매번 API에 유리하다.
  • 교차점은 API 가격이 떨어지거나 하드웨어가 저렴해질 때마다 움직인다 — 주기적으로 계산을 다시 하라, 한 번 결정하고 잊지 마라.
AI 비용 용어
Enter 또는 스페이스 키를 눌러 카드를 뒤집습니다. 좌우 화살표 키로 카드를 이동할 수 있습니다.용어가 표시되었습니다.
1 / 6

스스로 확인하기

0/3
  1. 토큰당 API에서, 청구액의 어느 쪽이 거의 항상 더 비싼가?
  2. 낮고, 급증하고, 예측 불가능한 트래픽이 있고 ML 인프라가 없다. 보통 어느 쪽이 더 저렴한가?
  3. 쉽고 대량인 작업에서 API 청구액을 줄이는 가장 신뢰할 수 있는 방법은?
Key takeaways
  • 세 가지 원형: 토큰당 API(사용량 기반, 입력 대 출력 별도 가격), 정액 구독(예측 가능, 대량으로 확장 안 됨), 오픈/자체 호스팅(고정 비용, 호출당 거의 0).
  • 만들기 전에 추정하라: (입력 × 입력 요율) + (출력 × 출력 요율), 호출당 × 볼륨 — 그런 다음 캐시 및 배치 할인을 적용하라.
  • 가장 큰 레버: 모델 크기 맞추기, 컨텍스트 다듬기, 거대한 컨텍스트 대신 RAG, 프롬프트 캐싱, 긴급하지 않은 것 배치, 출력 줄이기.
  • 자체 호스팅은 높고 꾸준한 볼륨에서 이긴다(고정 비용 상각); API는 낮거나 급증하는 볼륨에서 또는 인프라가 없을 때 이긴다(사용한 만큼만 지불).
  • 모든 달러 수치는 빠르게 낡는다 — 제공업체의 가격 페이지와 추적기에서 검증하고, 비용 계산기에서 직접 수치를 계산하라.

출처 & 추가 읽을거리

다음