Cuánto cuesta realmente la IA (entre proveedores)
"¿Cuánto cuesta la IA?" no tiene una única respuesta: depende de qué arquetipo de precios estás comprando y cuánto lo usas en realidad. Las cifras en dólares cambian cada pocos meses; la estructura del coste apenas se mueve. Esta página enseña la forma duradera: las tres maneras en que se cobra la IA, cómo estimar una carga de trabajo antes de construirla, las palancas que reducen la factura y la verdadera bifurcación entre alquilar una API y autohospedar.
- Distinguir los tres arquetipos de coste: API por token, suscripción plana y abierto/autohospedado
- Estimar el coste de cualquier carga de trabajo a partir de tokens × tarifa × volumen, antes de lanzarla
- Accionar las grandes palancas que reducen el gasto sin dañar la calidad
- Saber cuándo lo abierto/autohospedado gana en coste a la API, y cuándo gana la API
- Saber qué números caducan rápido, y dónde comprobar la verdad de hoy
Los tres arquetipos de coste
Casi todas las formas de pagar por IA se reducen a una de tres formas. Aprende las formas, no los precios.
- API por token (basada en uso). Llamas a un modelo alojado a través de una API y pagas por token, y la entrada y la salida se cobran por separado, con la salida casi siempre como la más cara de las dos. Los modelos más grandes/inteligentes cuestan más por token; los más pequeños cuestan mucho menos. La mayoría de los proveedores también ofrecen descuentos: una tarifa reducida para la entrada en caché que reenvías, y un descuento por batch fijo para trabajos asíncronos no urgentes. Así es como pagas cuando construyes un producto sobre Claude, GPT o Gemini. El coste escala directamente con el uso: céntimos a pequeña escala, la partida dominante a gran escala.
- Suscripción plana de consumidor/asiento. Una cuota mensual fija por una app de chat o un asistente de IDE (los planes de consumidor de Claude / ChatGPT / Gemini, los asientos tipo Copilot). No ves tokens; obtienes un cupo de uso y límites de tasa. Predecible y barato para un humano ante un teclado, pero no escala a trabajo programático/de alto volumen, y los costes por asiento se acumulan en un equipo.
- Abierto / local (autohospedado). Ejecutas un modelo de pesos abiertos (Llama, Mistral, Qwen, DeepSeek) en tu propio hardware o en una GPU alquilada. No hay precio por llamada: pagas por el hardware (o alquiler de GPU por hora) + electricidad + operaciones, esté el modelo ocupado o inactivo. El coste marginal de una llamada más es prácticamente casi cero a escala, pero cargas con el coste fijo y la carga operativa. Mira Ejecutar modelos localmente con Ollama.
- La división clave: la API y las suscripciones son coste MARGINAL (pagas por uso); el autohospedaje es sobre todo coste FIJO (pagas por mantener la capacidad disponible, se use o no).
- En la API, la mayor sorpresa es que los tokens de SALIDA normalmente cuestan varias veces más que los de entrada: las respuestas verbosas cuestan dinero real.
- Una suscripción plana es la herramienta correcta para un humano chateando; la API por token es la herramienta correcta para una app llamando al modelo en un bucle.
Cómo estimar el coste de una carga de trabajo
Puedes dimensionar una factura de API antes de escribir una línea de código en producción. Todo el modelo es una fórmula:
coste ≈ (tokens de entrada × tarifa de entrada) + (tokens de salida × tarifa de salida), por llamada × número de llamadas
Las tarifas se cotizan por millón de tokens, y la entrada y la salida tienen tarifas diferentes, así que estima las dos mitades por separado y súmalas. Una regla aproximada de tokens: ~1 token ≈ 4 caracteres de inglés, o ~0,75 palabras. Para conteos exactos, usa el área del Estimador de tokens y lee Tokens y precios. La mecánica completa de dónde se esconden los tokens vive en La economía de los tokens.
- Suma la entrada: prompt de sistema + herramientas + contexto recuperado + historial + el turno del usuario. Luego estima la salida que pides. Cuenta entrada y salida por separado: se cobran distinto.
- tokens de entrada × tarifa de entrada, más tokens de salida × tarifa de salida. Usa los números por millón de hoy de la página de precios del proveedor (no confíes en una cifra que memorizaste; mira VerifyNote).
- Multiplica el coste por llamada por llamadas al día × días. Un coste trivial por llamada (fracciones de céntimo) se convierte en tu mayor partida con millones de llamadas: modela tu tráfico REAL, no una sola petición.
- Si una gran parte de la entrada se repite en cada llamada, cótizala a la tarifa de CACHÉ, no a la de entrada completa. Si el trabajo es offline, aplica el descuento por BATCH. Estos cambian la respuesta drásticamente a escala.
- Compara tus supuestos por token con un tracker independiente y nuestra Calculadora de coste, luego ataca la factura con las palancas de abajo.
Estimación de servilleta (rellena las tarifas de hoy)
Per call:
input_tokens = system + tools + context + history + user_turn
output_tokens = the answer you ask for
call_cost = (input_tokens * input_rate_per_million / 1e6)
+ (output_tokens * output_rate_per_million / 1e6)
Per month:
monthly_cost = call_cost * calls_per_day * 30
Then adjust:
- cached repeated input -> use the (lower) cache-read rate for that slice
- offline / non-urgent -> apply the batch discount to the whole job
Rates change monthly — pull today's numbers from the provider's pricing page.Las grandes palancas para reducir el coste
La mayoría de las cargas de trabajo reales llevan peso muerto. Estas palancas, aproximadamente en orden de apalancamiento, reducen el gasto sin tocar la calidad: acciona primero las estructurales baratas.
- Ajusta el tamaño del modelo. No pagues tarifa de buque insignia por un trabajo que hace bien un modelo pequeño/barato. Clasificación, extracción, enrutamiento y formateo simple suelen ir genial en el nivel más pequeño a una fracción del precio por token. Reserva el modelo grande para razonamiento genuinamente difícil, y considera el enrutamiento: el modelo barato maneja la mayoría fácil, escala solo los casos difíciles. Mira Elegir un modelo.
- Recorta el contexto que envías. El token más barato es el que nunca envías. Poda prompts de sistema inflados, compacta historiales largos en un resumen continuo, y expón solo las herramientas que la tarea necesita: cada una es entrada que vuelves a pagar en cada llamada.
- RAG en vez de meter un contexto enorme. Pegar un documento de 50 páginas para responder una pregunta paga 50 páginas en cada llamada. La recuperación trae solo los pocos pasajes relevantes: muchos menos tokens de entrada para la misma respuesta (a menudo mejor). Recurre a una ventana de contexto gigante solo cuando realmente necesites todo el corpus a la vista a la vez.
- Caché de prompts. Si muchas llamadas comparten un prefijo grande e invariable (prompt de sistema, catálogo de herramientas, documento de referencia), la caché lo procesa una vez y lo vuelve a servir con un fuerte descuento en cada llamada posterior. El cambio estructural de mayor apalancamiento para cargas de chat y agente, porque se paga solo en cada turno.
- Agrupa lo no urgente. Evals, etiquetado masivo, resumir un archivo: cualquier cosa donde no necesites la respuesta en segundos corre por una vía batch asíncrona con un descuento fijo en la mayoría de proveedores. Cambia inmediatez por una factura materialmente menor.
- Acorta la salida. La salida es el lado más caro. Pide JSON o un esquema ajustado en lugar de un párrafo charlatán: menos tokens de salida y sin adivinanzas de parseo aguas abajo.
- Modelos más pequeños / abiertos para la parte fácil. Para la mayoría de llamadas de alto volumen y baja dificultad, un modelo abierto o pequeño puede ser drásticamente más barato por llamada, a veces casi gratis si ya autohospedas. Reserva el modelo de frontera para los casos que realmente lo necesitan.
- Estas se multiplican entre sí: entrada en caché × modelo bien dimensionado × salida más breve × descuento por batch se compone en un gran recorte total en una tarea fácil, con la calidad intacta.
- Acciona las palancas estructurales (dimensionar, cachear, RAG, batch) antes de microoptimizar la redacción: mueven la factura mucho más.
- SIEMPRE MIDE el cambio contra la factura real, no contra una suposición. El manual profundo es La economía de los tokens.
Cuándo lo abierto/autohospedado gana a la API, y cuándo gana la API
Esta es la decisión que de verdad mueve tu presupuesto de IA. Es un cruce de coste fijo frente a marginal, y el volumen es la variable que lo decide.
- Lo abierto/autohospedado gana con volumen ALTO y estable. Una vez que ejecutas suficientes llamadas para mantener una GPU ocupada la mayor parte del tiempo, el coste marginal casi cero por llamada supera pagar por token para siempre. Amortizas el coste fijo de hardware/alquiler entre un número enorme de llamadas, ganas privacidad de datos y personalización total, y aceptas la carga operativa (aprovisionamiento, escalado, disponibilidad, MLOps) como precio de entrada.
- La API gana con volumen BAJO o irregular, o sin infraestructura. Si el tráfico es pequeño, a ráfagas o impredecible, pagar por token significa que pagas solo por lo que usas y nada cuando está inactivo: ninguna GPU caliente a las 3 de la mañana. También te saltas todas las operaciones. Para la mayoría de equipos que lanzan un producto, prototipan o tienen tráfico a ráfagas, la API es a la vez más barata y mucho menos trabajo.
- El autohospedaje rara vez es 'gratis'. Los pesos del modelo pueden ser gratis, pero las GPU, la electricidad y las horas de ingeniería para mantenerlo en marcha no lo son: cuéntalos con honestidad antes de proclamar un ahorro.
- Las GPU inactivas son pura pérdida: la infraestructura de coste fijo solo supera al precio por token cuando la utilización es ALTA. El tráfico bajo o a ráfagas favorece a la API cada vez.
- El punto de cruce se mueve cada vez que bajan los precios de API o se abarata el hardware: rehaz las cuentas periódicamente, no decidas una vez y lo olvides.
Compruébate
0/3- Tres arquetipos: API por token (basada en uso, entrada vs salida cotizadas por separado), suscripción plana (predecible, no escala a alto volumen) y abierto/autohospedado (coste fijo, casi cero por llamada).
- Estima antes de construir: (entrada × tarifa de entrada) + (salida × tarifa de salida), por llamada × volumen, luego aplica los descuentos de caché y batch.
- Mayores palancas: dimensionar el modelo, recortar contexto, RAG sobre contexto enorme, caché de prompts, agrupar lo no urgente, acortar la salida.
- El autohospedaje gana con volumen ALTO y estable (amortiza el coste fijo); la API gana con volumen BAJO/irregular o sin infraestructura (pagas solo por uso).
- Cada cifra en dólares caduca rápido: verifica en la página de precios del proveedor y en un tracker, y haz tus propias cuentas en la Calculadora de coste.
Fuentes y lecturas adicionales
- Anthropic — Precios — tarifas actuales por token de Claude, descuentos de caché y batch.
- OpenAI — Precios de API · OpenAI — Resumen de precios — tarifas actuales por token de GPT y niveles.
- Google — Precios de la API Gemini — tarifas actuales de Gemini, nivel gratuito y niveles de pago.
- Mistral — Precios — precios de pesos abiertos + API, una referencia centrada en la eficiencia.
- Artificial Analysis — comparaciones independientes y actualizadas con frecuencia de precio/velocidad/calidad entre proveedores (el tracker para contrastar cualquier cifra citada).
- Ollama — ejecuta modelos de pesos abiertos localmente para llevar el precio por llamada hacia cero a escala.
Siguiente
- Elige el modelo correcto (y al precio correcto) → Elegir un modelo
- Encuentra dónde se fugan los tokens de verdad → La economía de los tokens
- La mecánica por token en profundidad → Tokens y precios
- Haz tus propias cuentas → Calculadora de coste