El panorama de modelos de IA: elegir entre Claude, ChatGPT, Gemini y modelos abiertos
El núcleo de AILmanac es Claude — pero las habilidades viajan. Los mismos hábitos de prompting, ingeniería de contexto, uso de herramientas y evaluación funcionan en casi cualquier modelo moderno. Esta página amplía la mirada a todo el campo: quiénes son los actores principales, cómo elegir para una tarea y qué se traslada sin importar cuál uses.
- Conocer los principales asistentes y modelos de IA y qué arquetipo es cada uno
- Usar un marco repetible para elegir un modelo para una tarea específica — no por el hype
- Ver qué habilidades se transfieren a todos los modelos (la mayoría)
- Saber qué datos caducan rápido — y dónde comprobar la verdad actual
Los actores principales (por arquetipo, no por ranking)
Piensa en arquetipos — los rankings se barajan, los arquetipos son estables:
- Anthropic — Claude · modelo cerrado de frontera. Conocido por la programación, el uso agéntico/de herramientas, el razonamiento con contexto largo y una postura que prioriza la seguridad. (Todo el resto de este sitio profundiza aquí.)
- OpenAI — ChatGPT / GPT · modelo cerrado de frontera con el mayor ecosistema de consumo y un conjunto de funciones muy amplio y multimodal.
- Google — Gemini · modelo cerrado de frontera, profundamente integrado en los productos y datos de Google, con ventanas de contexto muy grandes.
- Meta — Llama · peso abierto: puedes descargarlo y auto-alojarlo. La columna vertebral de gran parte del ecosistema local/abierto.
- Mistral · peso abierto + API, europeo, centrado en la eficiencia.
- xAI — Grok · cerrado, integrado con X, apoyándose en la señal en tiempo real.
- DeepSeek / Qwen (Alibaba) · potentes modelos de peso abierto conocidos por su capacidad por coste; populares para el auto-alojamiento.
- La mayor bifurcación práctica es CERRADO de frontera (mejor capacidad bruta, solo alojado) frente a PESO ABIERTO (auto-alojable, privado, personalizable, a menudo más barato de ejecutar a escala).
- No compres por leaderboard. El único benchmark que importa es TU tarea sobre TUS datos.
Cómo elegir un modelo para una tarea
- Qué debe hacer, y qué es innegociable: privacidad de datos (¿pueden salir los datos de tu red?), presupuesto, latencia, contexto máximo, dominio regulado, requisito on-device.
- ¿Necesitas la máxima capacidad absoluta con cero infraestructura? Un modelo cerrado de frontera (Claude / GPT / Gemini). ¿Necesitas privacidad, auto-alojamiento, personalización intensa o el menor coste de ejecución a escala? Un modelo de peso abierto (Llama / Mistral / Qwen / DeepSeek) que tú alojes.
- Elige un par que plausiblemente encajen con las restricciones — no te agobies; los vas a probar.
- 10-50 casos reales con respuestas conocidas como buenas. Ejecuta cada candidato. Esto supera a cualquier leaderboard público para tu caso de uso.
- Multiplica el coste y la velocidad por llamada por tu tráfico esperado. El 'mejor' modelo puede ser el equivocado si cuesta 10x el precio por una mejora de calidad del 2% que no necesitas.
- Vuelve a ejecutarla cuando salga un nuevo modelo. Cambiar es barato cuando tienes una evaluación; es una moneda al aire cuando no la tienes.
Esqueleto de system prompt neutral respecto al proveedor (funciona en cualquier modelo)
You are a {role}.
Goal: {one sentence}.
Rules:
- Use ONLY the provided context; if the answer isn't there, say "I don't know".
- Output: {exact format / schema}.
Context:
{context}
Task: {task}Qué se transfiere a (casi) todos los modelos
La razón por la que aprender bien Claude rinde en todas partes — estas habilidades son portátiles:
- Estructura del prompting — rol claro, tarea explícita, ejemplos, formato de salida → Fundamentos del prompting
- Ingeniería de contexto — decidir qué entra en la ventana → Fundamentos
- Uso de herramientas / function calling — el patrón es casi idéntico entre proveedores → Uso de herramientas
- Recuperación (RAG) — fundamentar las respuestas en tus datos → RAG
- Evaluaciones — medir la calidad para poder comparar modelos honestamente → Evaluaciones
- Salida estructurada — hacer los resultados legibles por máquina → Salida estructurada
Lo que NO se transfiere de forma limpia: las formas exactas de la API, los detalles JSON del tool-calling, los límites de tokens, los precios y el comportamiento de seguridad/rechazo — vuelve a comprobarlo siempre por proveedor.
Ponte a prueba
0/3- Piensa en arquetipos (cerrado de frontera vs peso abierto); los rankings cambian, los arquetipos no.
- Elige por restricciones + una evaluación mínima sobre tus propios datos — nunca por el hype de un leaderboard.
- La mayoría de las habilidades (prompting, contexto, herramientas, RAG, evaluaciones) se transfieren a todos los modelos — por eso profundizar en Claude rinde en todas partes.
- Nombres, precios, límites y benchmarks caducan rápido — verifica las especificidades actuales en la fuente.
Fuentes y lecturas adicionales
- Anthropic — Resumen de modelos — la lista actual de Claude.
- OpenAI — Modelos · Google — Modelos Gemini · Meta — Llama · Mistral — Modelos — la fuente de verdad propia y actual de cada proveedor.
- Artificial Analysis — comparaciones independientes de capacidad/precio/velocidad, actualizadas con frecuencia.
- Ollama · LM Studio — ejecuta modelos de peso abierto localmente.
Siguiente
- Profundiza en el núcleo → ¿Qué Claude debería usar?
- Haz tu elección medible → Evaluaciones
- Las habilidades que viajan → Fundamentos del prompting · Fundamentos