AI Models & Assistants
Claude is our core — but the same skills travel. This section widens the lens to the whole AI world: the major assistants, how they differ, when to use which, and the techniques that transfer across all of them.
- Pick the right model for a job without re-learning the field every time
- Move between assistants — ChatGPT, Gemini, Grok, open models — without losing your technique
- Run capable models on your own machine, and know when that is worth it
- Combine Claude with local models and agent frameworks
Start here
If you read one page in this section, read this one. Everything below is a branch off it.
- How to choose a model — a durable framework that outlives any particular release.
Then follow whichever thread matches what you are doing.
The current flagships
The two September 2026 releases at the top of both stacks, read side by side.
- Claude Fable 5.1: what changed and how to migrate — three breaking changes, five betas, cache reads at a quarter of the price
- GPT-6 Astra: the field guide for Claude users — same list price, different bill, Critical-tier cyber classification
Coming from another assistant
You already know one tool and want your habits to carry over.
- ChatGPT for Claude users
- Gemini for Claude users
- Grok for Claude users
- Porting prompts across models — what transfers, what breaks
Comparing before you commit
- Claude vs GPT vs Gemini for coding
- Reasoning models compared
- What AI costs across providers
- Generative media: image, audio, video
Running models yourself
Local models trade some capability for privacy, cost control, and working offline. These pages cover when that trade is worth making.
- Run models locally with Ollama — the practical starting point
- Why a 35 KB system prompt breaks on a local model — context budgets, Ollama's silent middle-of-prompt truncation, and the failure signals to watch
- DeepSeek, Qwen & the open models
- DeepSeek V4-Flash-Vision: first native-vision frontier open weight
- Colibrì: run a 744B MoE from your SSD — expert streaming on 16–32 GB machines, and what it really costs in tok/s
- A private local AI stack
- Claude plus local models — using both, deliberately
Agents beyond Claude
- Local AI agents
- Open-source agent frameworks
- Claude, MCP and local tools
- A2A: the agent-to-agent protocol
- Agent payments: x402, MPP and AgentCore GA — how agents actually pay for things now
- OpenAI Agents API vs Claude Managed Agents — the two hosted agent loops side by side: permissions, vaults, budgets, network policy, sandbox cost
Everything in this section
The full list, including pages added since this index was written.
AI Models & Assistants
Claude is the core here, but the same skills travel. Start with how to choose, then go as deep as you need on any assistant, on running models locally, or on agents.
Le paysage des modèles d'IA : choisir parmi Claude, ChatGPT, Gemini et les modèles ouverts
Un cadre durable pour choisir le bon modèle d'IA pour une tâche — parmi Claude, ChatGPT, Gemini, Llama, Mistral, Grok et les modèles ouverts/locaux — ainsi que les compétences transférables à tous.
Claude Fable 5.1: What Changed and How to Migrate
Anthropic shipped Claude Fable 5.1 and Mythos 5.1 on September 1, 2026: same $10/$50 price, cache reads cut to $0.25, three breaking API changes (forced tool_choice errors, one-way thinking blocks, append-only history) and five additive betas. The migration field guide for anyone pinning claude-fable-5 or claude-opus-5.
Claude Fable 5 et Mythos 5 : le guide de terrain flagship
Fable 5 est le modèle le plus capable d'Anthropic. Son API refuse in-band (HTTP 200, stop_reason: refusal), n'a que la réflexion adaptative, et ne retourne jamais la réflexion brute. Si vous épinglez un modèle de niveau supérieur, cela change comment vous écrivez les intégrations. Quand l'utiliser vs Opus 4.8, le pattern de fallback, les changements de prompting.
Claude Opus 5 : Le Guide de Terrain
Opus 5 est sorti le 24 juillet 2026 comme quatrième modèle d'Anthropic en deux mois — tarif identique à Opus 4.8 ($5/$25) mais plus du double du score Frontier-Bench, 3× ARC-AGI-3 face au meilleur modèle suivant, et un nouveau palier d'effort xhigh/max. Les benchmarks qui comptent, les deux erreurs 400 qui cassent les migrations naïves, et quand Opus 5 remplace Fable 5 dans votre stack.
Claude Sonnet 5 : le guide de terrain
Sonnet 5 est le nouveau modèle par défaut de Claude Code et le successeur direct de Sonnet 4.6 — mais trois contraintes API produiront des 400 lors de la migration et un nouveau tokenizer produit environ 30 % de tokens en plus pour le même texte. Le calcul de prix, la re-cartographie de l'effort (Sonnet 5 medium ≈ Sonnet 4.6 high), et les changements de prompt qui piègent les équipes.
ChatGPT pour les utilisateurs de Claude
Vous maîtrisez Claude et devez utiliser ChatGPT ? Les différences qui comptent, ce qui se transpose, et quand choisir l'un ou l'autre.
GPT-5.6 et ChatGPT Work pour les utilisateurs de Claude
OpenAI a livré la famille GPT-5.6 (Sol, Terra, Luna) et ChatGPT Work le 9 juillet 2026. Ce qui a réellement changé pour un utilisateur de Claude — contexte 1,05 M, tier à 1 $, un agent qui tourne des heures, et les parties du lancement dont personne ne parle.
Mise à jour GPT-5.6 d'août 2026 : curseur d'effort, bouton Think gratuit et le précipice tarifaire des 272K
Le 6 août 2026, OpenAI a livré une mise à jour de mi-cycle pour GPT-5.6 que la plupart des articles ont résumée à « Sol est devenu plus intelligent ». La vraie histoire : un contrôle d'effort à six niveaux qui change la façon dont vous tarifez une requête, un bouton Think pour le niveau gratuit, un précipice tarifaire à 272K tokens qui re-tarifie tout l'appel, et un mode Fast qui ne fonctionne que sur Sol. Ce que chacun signifie pour un utilisateur de Claude.
OpenAI Astra : la note terrain de preview
Le « prochain grand modèle » d'OpenAI, Astra, a été prévisualisé le 1er août 2026 avec dix preuves math vérifiées en Lean et presque aucune spéc produit. Ce qui est réellement confirmé, ce qui reste inconnu, et si un utilisateur Claude doit attendre — la prise honnête, sourcée.
Agent Plugins Codex & fédération de catalogues (v0.147.0) : le guide pratique
Le 7 août 2026, OpenAI a livré Codex CLI v0.147.0 — la version qui transforme les Skills en Agent Plugins portables via un catalogue à quatre niveaux, ajoute un flag --approve-for-me qui ne fait pas ce que son nom suggère, retire discrètement --full-auto, et vous inscrit à MCP 2026-07-28 en opt-in. Ce que chaque brique fait réellement, expliqué en termes que les utilisateurs de Claude comprennent.
Se connecter avec ChatGPT
La nouvelle couche d'identité d'OpenAI, âgée de trois jours. Quelles données franchissent réellement la ligne, ce que les administrateurs d'entreprise peuvent y faire, et comment l'accepter dans votre application sans donner à OpenAI un point d'ancrage que vous ne souhaitiez pas.
Exécuter des modèles d'IA en local avec Ollama
Exécutez des modèles à poids ouverts (Llama, Mistral, Qwen…) sur votre propre machine — privé, hors ligne, gratuit à l'exécution — avec Ollama. Installation, CLI et appel depuis du code.
Claude vs GPT vs Gemini pour le code
Un cadre de décision (pas un classement) pour choisir un modèle de pointe pour le code — les facteurs qui comptent, et pourquoi une éval sur votre propre dépôt bat tous les benchmarks.
Comparatif des CLI d'agents de codage
Claude Code, Codex CLI, Gemini CLI et les agents de terminal open source — comment le harnais (et pas seulement le modèle) décide de vos résultats, et comment garder votre configuration portable avec AGENTS.md.
Supabase Evals — benchmark d'agents sur vrai backend
Supabase a open-sourcé un benchmark qui fait tourner Claude Code, Codex et OpenCode contre de vraies stacks Supabase conteneurisées — pas des mocks. Voici ce qu'il mesure, ce qu'il a trouvé sur la façon dont les modèles utilisent réellement docs et skills, et comment le faire tourner en local en une soirée.
Apple Foundation Models 3 & la stack LLM on-device pour utilisateurs de Claude
La troisième génération des Foundation Models d'Apple (AFM 3) a atterri à la WWDC 2026 avec un modèle dense on-device 3B, un MoE sparse 20B qui tourne sur iPhone, et un framework Swift-natif qui vous permet maintenant d'apporter votre propre fournisseur LLM — y compris Claude. Ce qui a réellement été livré, les mécanismes non évidents, et comment ça change l'histoire on-device pour quiconque livre des apps Claude.
Gemini pour les utilisateurs de Claude
À l'aise avec Claude, mais vous avez besoin du Gemini de Google ? Les différences qui comptent — Gems, intégration à Workspace, contexte immense, multimodal — et ce qui se transpose.
Gemini 3.6 Flash, Flash-Lite et Flash Cyber pour les utilisateurs de Claude
Le 21 juillet 2026, Google a entièrement sauté Gemini 3.5 Pro et a livré trois modèles de niveau Flash à la place. Vrais prix, vrais benchmarks, les pièges de migration, et les parties que la plupart des articles manquent — y compris un fine-tune de cybersécurité qui a battu Claude Opus 4.6 sur la chasse aux bugs V8.
Gemini 3.7 Flash for Claude Users: Coding-Agent Workhorse at Half Price (Aug 2026)
On 13 August 2026, three weeks after 3.6 Flash, Google shipped Gemini 3.7 Flash at half the introductory price with a 16-point DeepSWE jump. The gotchas most write-ups skip: an expiring intro price, a 3× throughput advantage that matters for agent loops but not chat, and where it still trails Claude Sonnet 5.
Grok pour les utilisateurs de Claude
À l'aise avec Claude, mais besoin de Grok de xAI ? Les différences qui comptent — recherche X/web en temps réel, une API compatible OpenAI et l'agent de codage Grok Build — plus tout ce qui se transfère.
Muse Code + Muse Spark 1.2 : l'agent de code terminal de Meta
Le 5 août 2026, Meta a livré Muse Code, un agent de code terminal, et Muse Spark 1.2, le modèle co-entraîné avec lui. Ce que le journal d'événements append-only vous achète vraiment, pourquoi le tier contributeur est 12,5× moins cher que le standard, comment il se compare à Claude Code sur Terminal-Bench 2.1, et les trois skills livrés qui valent la peine d'être volés quel que soit l'agent que vous utilisez.
Frameworks open source pour agents IA
Une carte neutre vis-à-vis des fournisseurs des principaux frameworks ouverts pour construire des agents LLM — LangGraph, LlamaIndex, AutoGen, CrewAI et l'approche à boucle minimale — et comment choisir.
APIs multi-agents natives : la beta multi-agent Responses d'OpenAI vs le faire soi-même
Le 9 juillet 2026 OpenAI a livré la beta multi-agent de la Responses API et Sol Ultra Mode — le premier vendeur de pointe à faire de 'le modèle spawne et synthétise N sub-agents en une seule requête HTTP' une primitive de première classe. Ce qui livre réellement, la forme d'API, les calculs de coût, ce que fait Anthropic à la place, et quand la primitive native bat un fan-out DIY.
A2A : le protocole agent-à-agent
MCP connecte les agents aux outils. A2A connecte les agents à d'autres agents — à travers les frameworks, les clouds et les entreprises. Apprenez l'Agent Card, les tâches, les huit états du cycle de vie, streaming vs webhooks, et comment A2A se compose avec MCP.
Agent Payments: x402, MPP and AgentCore GA
How AI agents actually pay for things now — the x402 HTTP-402 protocol, the exact/upto/batch-settlement schemes, facilitators, Amazon Bedrock AgentCore Payments' Aug 2026 GA (payment sessions, Coinbase Bazar MCP, Stripe Privy, Machine Payment Protocol), and how to add a paywall or a spending agent without inventing a wallet.
Porter des prompts d'un modèle à l'autre
Déplacer un prompt entre Claude, GPT, Gemini et les modèles ouverts — ce qui se transfère proprement, ce qu'il faut ajuster par modèle, et un workflow de migration.
Patterns d'aiguillage de modèles : cascades, classifieurs et ce qui expédie vraiment
Les patterns de conception pour envoyer chaque requête au bon modèle d'IA — par règle, par classifieur, par complexité, cascade, ensemble, fallback. Quand utiliser chacun, ce qui casse et les recettes qui expédient vraiment en 2026.
DeepSeek, Qwen et la vague des poids ouverts
De solides modèles à poids ouverts (DeepSeek, Qwen, Llama, Mistral) ont comblé une grande partie de l'écart. Ce que signifie « poids ouverts », les compromis face aux modèles de frontière fermés, et comment les utiliser.
Qwen3.8-Max : Le premier modèle open-weight de classe Max (quand les poids sortent)
3 août 2026 : Qwen3.8-Max d'Alibaba a été livré API-only avec un MoE à 2,4T paramètres (95B actifs), un contexte 1M, des APIs à double spec OpenAI/Anthropic, et des scores de benchmark qui battent GPT-5.6 Sol Max sur OSWorld. Ce qui est vraiment nouveau, ce que « open weight » signifie réellement quand la page Hugging Face est vide, et les maths de sparsité qui rendent le self-hosting coûteux.
DeepSeek V4-Flash-Vision: First Native-Vision Frontier Open Weight
On Aug 31 2026 DeepSeek open-sourced V4-Flash-Vision-Exp — a 305B MoE that adds native vision to V4-Flash without hurting text agent scores, matches or beats Claude Opus 4.8 on ApexBench / Agents' Last Exam / ZeroBench at a fraction of the price, and ships MIT. The specific numbers, the hard 384-token-per-image cap most guides ignore, and the concrete way to run it.
Kimi K2 pour les utilisateurs de Claude
Le Kimi K2 de Moonshot est un agent à poids ouverts d'un billion de paramètres, conçu pour les longues chaînes d'usage d'outils. Ce qui le distingue vraiment de Claude — poids INT4 natifs, 200 à 300 appels d'outils séquentiels, une licence permissive — et quand il vaut la peine d'y recourir.
GLM-5.2 : le modèle de codage open-weight à la frontière
Le MoE 753B de Z.ai (~40B actifs), contexte de 1M tokens, licence MIT — à un point près de Claude Opus 4.8 sur le codage long horizon, à environ un sixième du coût de l'API. Ce que fait réellement IndexShare, comment l'exécuter en local, et où il bat Claude Code sur le terrain.
Inkling : le modèle à poids ouverts de Thinking Machines
Le Thinking Machines Lab de Mira Murati a publié Inkling — un MoE multimodal de 975B de paramètres sous Apache 2.0, doté d'un curseur continu d'effort de réflexion. Ce que la couverture médiatique du lancement a mal compris, pourquoi le modèle perd délibérément les benchmarks, et ce que fait réellement le curseur d'effort.
Kimi K3 : le plus grand modèle open-weight au monde
Le modèle open-weight de 2,8 mille milliards de paramètres de Moonshot AI bat Claude Opus 4.8 sur de nombreux benchmarks et domine le Frontend Code Arena. Ce qui le rend architecturalement différent, quand le prix de cache-hit renverse le calcul de coût, et s'il vaut la peine d'y recourir.
Exécuter Kimi K3 en local : vLLM, DSpark et la vraie facture matérielle
Le guide pratique définitif pour auto-héberger le Kimi K3 open-weight 2,8T de Moonshot en 2026. Ce que fait vraiment le speculative decoding DSpark, le matériel minimum (1× DGX B300 ou 16× DGX Spark), les commandes vLLM serve exactes, l'asymétrie prefill/decode dont personne ne vous prévient, et quand l'inférence hébergée écrase votre propre rack.
Dans Grok Build : lire un harness d'agent ouvert
xAI a publié tout le code source Rust de son agent de codage sous Apache 2.0 — la boucle d'agent, la couche d'outils, la TUI et le système d'extensions. Ce que la carte des crates enseigne sur la construction d'agents, pourquoi « open source » signifie ici source-available, et ce que le code du collecteur de données encore présent dans l'arbre révèle.
Poolside Laguna : des modèles de code open-weight qui frappent au-dessus de leur catégorie
La famille Laguna de Poolside AI (XS 2.1, S 2.1, M.1) — des modèles de code MoE avec 3B–23B paramètres actifs, contexte 1M tokens, licence OpenMDW-1.1. Ce que le S 2.1 8B-actif bat réellement, pourquoi le XS 2.1 3B-actif tourne sur un MacBook, le premier pipeline d'entraînement RL-en-FP8 connu, et quand y recourir plutôt qu'à Claude, GLM-5.2 ou Kimi K3.
Médias génératifs : IA d'image, d'audio et de vidéo
Au-delà du chat textuel — une carte de l'IA pour les images, la vidéo, la voix et la musique : les principaux outils, les compétences durables et les questions de droits/d'éthique qui comptent.
MiniMax H3 (Hailuo 3.0) : le modèle vidéo omni open-weight
MiniMax a open-sourcé un Transformer single-stream de 33B qui génère 4–15s de vidéo 2K avec audio stéréo natif en une passe. La licence bloque discrètement l'auto-hébergement aux US/EU/UK/Corée, la base ouverte est 768p (pas 2K), et ~13B des 33B params sont des branches AdaLN qu'on peut sauter à l'inférence. Ce qu'est vraiment H3, ce qu'il coûte, et quand il bat les APIs vidéo fermées.
Ce que l'IA coûte réellement (selon les fournisseurs)
Un cadre durable pour comparer le coût de l'IA entre fournisseurs — les archétypes de tarification, comment estimer une charge de travail, les leviers pour réduire la facture, et quand l'open/local l'emporte.
Pourquoi les agents IA brûlent des tokens (et comment plafonner la facture)
Les exécutions agentiques coûtent 50 à 1000× un chat — non pas parce que le modèle est plus bête, mais à cause de la boule de neige de contexte. Le mécanisme, les chiffres surprenants, et les quatre leviers qui réduisent vraiment la facture, sur Claude, GPT, Gemini et les modèles ouverts.
Construire des agents IA locaux
Des agents autonomes qui s'exécutent entièrement sur votre machine avec un modèle local à poids ouverts — privés, hors ligne, gratuits à exécuter. L'architecture, les compromis et comment démarrer.
Claude + modèles locaux : les patterns hybrides
Faites travailler Claude et les modèles locaux open-weight en synergie — routeur, brouillon-puis-affinage, expurgation de la confidentialité, pré-traitement en masse — pour le raisonnement du frontier avec la confidentialité et le coût du local.
Passerelles IA : LiteLLM, OpenRouter, Portkey, Vercel
Une passerelle IA de production est le routeur manquant entre votre application et chaque modèle — Claude, GPT, Gemini, Llama. Comparez LiteLLM, OpenRouter, Portkey et Vercel AI Gateway, puis connectez Claude Code via votre propre proxy.
Agents de codage locaux (et comment ils s'associent à Claude)
Des agents de codage qui s'exécutent sur votre machine et modifient votre dépôt — Aider, Cline, Continue, OpenHands, Claude Code — propulsés par Claude pour la qualité ou par un modèle local pour la confidentialité.
Connecter Claude à des outils et agents locaux avec MCP
Le Model Context Protocol permet à Claude d'orchestrer des outils, des données et des agents qui s'exécutent en privé sur votre propre machine — la synergie Claude-cerveau, capacités-locales. Ajoutez ou construisez un serveur MCP local.
Construire une pile d'IA locale et privée (de bout en bout)
Assemblez le tout : un modèle local (Ollama) + un agent agnostique au modèle + des outils via un serveur MCP local — un assistant privé sur votre propre machine, avec Claude comme couche intelligente optionnelle.
Agent local ou Claude ? Un guide de décision
Agent entièrement local, propulsé par Claude, ou hybride ? Les facteurs qui tranchent la question — confidentialité, difficulté de la tâche, coût, latence, fiabilité — et pourquoi l'hybride l'emporte souvent.
Sécuriser les agents locaux et hybrides
Un agent capable de modifier des fichiers et d'exécuter des commandes est puissant et dangereux. Moindre privilège, isolation, approbation humaine, défense contre l'injection de prompt, plafonds de budget — comment exécuter des agents en toute sécurité.
Comparatif des modèles de raisonnement
Budgets de réflexion et effort de raisonnement chez Claude, GPT, Gemini, DeepSeek et Qwen — quand dépenser des tokens à réfléchir, et quand s'en abstenir.
IA vocale full-duplex : pourquoi les agents vocaux sont soudain devenus crédibles
GPT-Live et les nouveaux modèles nativement vocaux écoutent et parlent en même temps. Ce que le full-duplex change, comment ça marche, et le paysage de l’IA vocale aujourd’hui.
Claude Voice avec Opus et Sonnet (juillet 2026) : voix orientée raisonnement vs GPT-Live
Anthropic a ouvert la voix Claude à Opus, Sonnet et aux apps connectées le 23 juillet 2026 — mais a gardé la stack en tour par tour. Ce qui a réellement changé, quand changer de modèle en cours d'appel, et en quoi le pari de design diffère du full-duplex GPT-Live d'OpenAI.
Vitesse des tokens : pourquoi l'inférence IA est soudain 10 à 15× plus rapide
Les puces à l'échelle du wafer et les LPU servent des modèles de pointe à des centaines de tokens par seconde. Ce qui limite réellement la vitesse d'inférence, la nouvelle course au matériel, et pourquoi des tokens rapides changent les agents, la voix et le raisonnement.
Comparatif des agents computer-use
Claude, GPT et Gemini savent tous piloter un écran désormais — mais chacun expose un espace d'actions, un contrat de coordonnées et une barrière de sécurité différents. Ce qui casse réellement, et comment construire une boucle qui y survit.
Navigateurs à session partagée pour agents IA : le modèle ego lite
Une nouvelle catégorie de navigateur — parfaitement illustrée par ego lite, qui a atteint la #1 place du GitHub Trending le 24 juillet 2026 — permet à Claude Code, Codex, Cursor et à tout autre agent de coding de piloter une session Chromium isolée qui hérite de vos véritables connexions. Ce que les Spaces et les snapshots sémantiques résolvent réellement, pourquoi ils surpassent Playwright pour le travail d'agent, et le coût de sécurité lié au partage des cookies de session avec un processus autonome.
Cloudflare Kitesurf: The First Browser Runtime Built for AI Agents (Not Humans)
On August 6, 2026 Cloudflare launched Kitesurf, a stateless, agent-first browser that runs entirely in V8 isolates on Workers. It uses 3-7x less CPU and memory than Chromium on common agent tasks — at the cost of ~1.7x wall-clock time. Written in Rust, using Firefox's CSS parser (Stylo) and the Blitz rendering engine, drop-in compatible with Puppeteer/Playwright via the Chrome DevTools Protocol. This page: what changed, when to reach for it instead of headless Chrome, how to wire it into Claude Code / Codex / your MCP client, and the four things it flat-out can't do yet.
SKILL.md : le standard ouvert inter-agents
Un seul fichier SKILL.md, trente-deux agents. Ce qu'est vraiment le standard ouvert Agent Skills, comment la divulgation progressive maintient le contexte à faible coût, ce qui casse la portabilité, et comment écrire une skill qui s'exécute sans modification dans Claude Code, Codex, Gemini CLI et Cursor.
Colibrì: Run a 744B MoE From Your SSD (and What It Really Costs You)
Colibrì is a pure-C, zero-dependency engine that runs GLM-5.2 (744B), Kimi K3 (2.8T), DeepSeek V4.1 Flash and six other frontier MoE models on a 16–32 GB machine by keeping the dense layers in RAM and streaming the routed experts from NVMe. This page explains the memory hierarchy, the numbers that decide whether it is usable for you (0.05 to 6.8 tok/s), the SSD-wear and speculative-decoding gotchas, and the exact commands to get a first token.
OpenAI Agents API vs Claude Managed Agents: The Hosted Agent Loop, Compared
On September 10, 2026 OpenAI put the Codex harness behind a single API call: the Agents API public beta — durable sessions, hosted or self-hosted sandboxes, automatic compaction, tool search, subagents. Anthropic has run the same shape since April as Managed Agents. Both use the same four primitives; they differ on permissions, secrets, budgets, network policy and what the sandbox costs. The side-by-side, the request shapes, the six gotchas, and when to pick which.
Why a 35 KB System Prompt Breaks on a Local Model
Moving a big Claude/GPT system prompt to Ollama or another local runtime: the context-budget math, Ollama's silent middle-of-prompt truncation, the failure signals of context exhaustion, and the restructuring that actually works.