Le paysage des modèles d'IA : choisir parmi Claude, ChatGPT, Gemini et les modèles ouverts
Un cadre durable pour choisir le bon modèle d'IA pour une tâche — parmi Claude, ChatGPT, Gemini, Llama, Mistral, Grok et les modèles ouverts/locaux — ainsi que les compétences transférables à tous.
Claude Fable 5 et Mythos 5 : le guide de terrain flagship
Fable 5 est le modèle le plus capable d'Anthropic. Son API refuse in-band (HTTP 200, stop_reason: refusal), n'a que la réflexion adaptative, et ne retourne jamais la réflexion brute. Si vous épinglez un modèle de niveau supérieur, cela change comment vous écrivez les intégrations. Quand l'utiliser vs Opus 4.8, le pattern de fallback, les changements de prompting.
Claude Opus 5 : Le Guide de Terrain
Opus 5 est sorti le 24 juillet 2026 comme quatrième modèle d'Anthropic en deux mois — tarif identique à Opus 4.8 ($5/$25) mais plus du double du score Frontier-Bench, 3× ARC-AGI-3 face au meilleur modèle suivant, et un nouveau palier d'effort xhigh/max. Les benchmarks qui comptent, les deux erreurs 400 qui cassent les migrations naïves, et quand Opus 5 remplace Fable 5 dans votre stack.
Claude Sonnet 5 : le guide de terrain
Sonnet 5 est le nouveau modèle par défaut de Claude Code et le successeur direct de Sonnet 4.6 — mais trois contraintes API produiront des 400 lors de la migration et un nouveau tokenizer produit environ 30 % de tokens en plus pour le même texte. Le calcul de prix, la re-cartographie de l'effort (Sonnet 5 medium ≈ Sonnet 4.6 high), et les changements de prompt qui piègent les équipes.
ChatGPT pour les utilisateurs de Claude
Vous maîtrisez Claude et devez utiliser ChatGPT ? Les différences qui comptent, ce qui se transpose, et quand choisir l'un ou l'autre.
GPT-5.6 et ChatGPT Work pour les utilisateurs de Claude
OpenAI a livré la famille GPT-5.6 (Sol, Terra, Luna) et ChatGPT Work le 9 juillet 2026. Ce qui a réellement changé pour un utilisateur de Claude — contexte 1,05 M, tier à 1 $, un agent qui tourne des heures, et les parties du lancement dont personne ne parle.
OpenAI Astra : la note terrain de preview
Le « prochain grand modèle » d'OpenAI, Astra, a été prévisualisé le 1er août 2026 avec dix preuves math vérifiées en Lean et presque aucune spéc produit. Ce qui est réellement confirmé, ce qui reste inconnu, et si un utilisateur Claude doit attendre — la prise honnête, sourcée.
Se connecter avec ChatGPT
La nouvelle couche d'identité d'OpenAI, âgée de trois jours. Quelles données franchissent réellement la ligne, ce que les administrateurs d'entreprise peuvent y faire, et comment l'accepter dans votre application sans donner à OpenAI un point d'ancrage que vous ne souhaitiez pas.
Exécuter des modèles d'IA en local avec Ollama
Exécutez des modèles à poids ouverts (Llama, Mistral, Qwen…) sur votre propre machine — privé, hors ligne, gratuit à l'exécution — avec Ollama. Installation, CLI et appel depuis du code.
Claude vs GPT vs Gemini pour le code
Un cadre de décision (pas un classement) pour choisir un modèle de pointe pour le code — les facteurs qui comptent, et pourquoi une éval sur votre propre dépôt bat tous les benchmarks.
Comparatif des CLI d'agents de codage
Claude Code, Codex CLI, Gemini CLI et les agents de terminal open source — comment le harnais (et pas seulement le modèle) décide de vos résultats, et comment garder votre configuration portable avec AGENTS.md.
Supabase Evals — benchmark d'agents sur vrai backend
Supabase a open-sourcé un benchmark qui fait tourner Claude Code, Codex et OpenCode contre de vraies stacks Supabase conteneurisées — pas des mocks. Voici ce qu'il mesure, ce qu'il a trouvé sur la façon dont les modèles utilisent réellement docs et skills, et comment le faire tourner en local en une soirée.
Gemini pour les utilisateurs de Claude
À l'aise avec Claude, mais vous avez besoin du Gemini de Google ? Les différences qui comptent — Gems, intégration à Workspace, contexte immense, multimodal — et ce qui se transpose.
Gemini 3.6 Flash, Flash-Lite et Flash Cyber pour les utilisateurs de Claude
Le 21 juillet 2026, Google a entièrement sauté Gemini 3.5 Pro et a livré trois modèles de niveau Flash à la place. Vrais prix, vrais benchmarks, les pièges de migration, et les parties que la plupart des articles manquent — y compris un fine-tune de cybersécurité qui a battu Claude Opus 4.6 sur la chasse aux bugs V8.
Grok pour les utilisateurs de Claude
À l'aise avec Claude, mais besoin de Grok de xAI ? Les différences qui comptent — recherche X/web en temps réel, une API compatible OpenAI et l'agent de codage Grok Build — plus tout ce qui se transfère.
Muse Code + Muse Spark 1.2 : l'agent de code terminal de Meta
Le 5 août 2026, Meta a livré Muse Code, un agent de code terminal, et Muse Spark 1.2, le modèle co-entraîné avec lui. Ce que le journal d'événements append-only vous achète vraiment, pourquoi le tier contributeur est 12,5× moins cher que le standard, comment il se compare à Claude Code sur Terminal-Bench 2.1, et les trois skills livrés qui valent la peine d'être volés quel que soit l'agent que vous utilisez.
Frameworks open source pour agents IA
Une carte neutre vis-à-vis des fournisseurs des principaux frameworks ouverts pour construire des agents LLM — LangGraph, LlamaIndex, AutoGen, CrewAI et l'approche à boucle minimale — et comment choisir.
APIs multi-agents natives : la beta multi-agent Responses d'OpenAI vs le faire soi-même
Le 9 juillet 2026 OpenAI a livré la beta multi-agent de la Responses API et Sol Ultra Mode — le premier vendeur de pointe à faire de 'le modèle spawne et synthétise N sub-agents en une seule requête HTTP' une primitive de première classe. Ce qui livre réellement, la forme d'API, les calculs de coût, ce que fait Anthropic à la place, et quand la primitive native bat un fan-out DIY.
A2A : le protocole agent-à-agent
MCP connecte les agents aux outils. A2A connecte les agents à d'autres agents — à travers les frameworks, les clouds et les entreprises. Apprenez l'Agent Card, les tâches, les huit états du cycle de vie, streaming vs webhooks, et comment A2A se compose avec MCP.
Porter des prompts d'un modèle à l'autre
Déplacer un prompt entre Claude, GPT, Gemini et les modèles ouverts — ce qui se transfère proprement, ce qu'il faut ajuster par modèle, et un workflow de migration.
DeepSeek, Qwen et la vague des poids ouverts
De solides modèles à poids ouverts (DeepSeek, Qwen, Llama, Mistral) ont comblé une grande partie de l'écart. Ce que signifie « poids ouverts », les compromis face aux modèles de frontière fermés, et comment les utiliser.
Kimi K2 pour les utilisateurs de Claude
Le Kimi K2 de Moonshot est un agent à poids ouverts d'un billion de paramètres, conçu pour les longues chaînes d'usage d'outils. Ce qui le distingue vraiment de Claude — poids INT4 natifs, 200 à 300 appels d'outils séquentiels, une licence permissive — et quand il vaut la peine d'y recourir.
GLM-5.2 : le modèle de codage open-weight à la frontière
Le MoE 753B de Z.ai (~40B actifs), contexte de 1M tokens, licence MIT — à un point près de Claude Opus 4.8 sur le codage long horizon, à environ un sixième du coût de l'API. Ce que fait réellement IndexShare, comment l'exécuter en local, et où il bat Claude Code sur le terrain.
Inkling : le modèle à poids ouverts de Thinking Machines
Le Thinking Machines Lab de Mira Murati a publié Inkling — un MoE multimodal de 975B de paramètres sous Apache 2.0, doté d'un curseur continu d'effort de réflexion. Ce que la couverture médiatique du lancement a mal compris, pourquoi le modèle perd délibérément les benchmarks, et ce que fait réellement le curseur d'effort.
Kimi K3 : le plus grand modèle open-weight au monde
Le modèle open-weight de 2,8 mille milliards de paramètres de Moonshot AI bat Claude Opus 4.8 sur de nombreux benchmarks et domine le Frontend Code Arena. Ce qui le rend architecturalement différent, quand le prix de cache-hit renverse le calcul de coût, et s'il vaut la peine d'y recourir.
Exécuter Kimi K3 en local : vLLM, DSpark et la vraie facture matérielle
Le guide pratique définitif pour auto-héberger le Kimi K3 open-weight 2,8T de Moonshot en 2026. Ce que fait vraiment le speculative decoding DSpark, le matériel minimum (1× DGX B300 ou 16× DGX Spark), les commandes vLLM serve exactes, l'asymétrie prefill/decode dont personne ne vous prévient, et quand l'inférence hébergée écrase votre propre rack.
Dans Grok Build : lire un harness d'agent ouvert
xAI a publié tout le code source Rust de son agent de codage sous Apache 2.0 — la boucle d'agent, la couche d'outils, la TUI et le système d'extensions. Ce que la carte des crates enseigne sur la construction d'agents, pourquoi « open source » signifie ici source-available, et ce que le code du collecteur de données encore présent dans l'arbre révèle.
Poolside Laguna : des modèles de code open-weight qui frappent au-dessus de leur catégorie
La famille Laguna de Poolside AI (XS 2.1, S 2.1, M.1) — des modèles de code MoE avec 3B–23B paramètres actifs, contexte 1M tokens, licence OpenMDW-1.1. Ce que le S 2.1 8B-actif bat réellement, pourquoi le XS 2.1 3B-actif tourne sur un MacBook, le premier pipeline d'entraînement RL-en-FP8 connu, et quand y recourir plutôt qu'à Claude, GLM-5.2 ou Kimi K3.
Médias génératifs : IA d'image, d'audio et de vidéo
Au-delà du chat textuel — une carte de l'IA pour les images, la vidéo, la voix et la musique : les principaux outils, les compétences durables et les questions de droits/d'éthique qui comptent.
Ce que l'IA coûte réellement (selon les fournisseurs)
Un cadre durable pour comparer le coût de l'IA entre fournisseurs — les archétypes de tarification, comment estimer une charge de travail, les leviers pour réduire la facture, et quand l'open/local l'emporte.
Pourquoi les agents IA brûlent des tokens (et comment plafonner la facture)
Les exécutions agentiques coûtent 50 à 1000× un chat — non pas parce que le modèle est plus bête, mais à cause de la boule de neige de contexte. Le mécanisme, les chiffres surprenants, et les quatre leviers qui réduisent vraiment la facture, sur Claude, GPT, Gemini et les modèles ouverts.
Construire des agents IA locaux
Des agents autonomes qui s'exécutent entièrement sur votre machine avec un modèle local à poids ouverts — privés, hors ligne, gratuits à exécuter. L'architecture, les compromis et comment démarrer.
Claude + modèles locaux : les patterns hybrides
Faites travailler Claude et les modèles locaux open-weight en synergie — routeur, brouillon-puis-affinage, expurgation de la confidentialité, pré-traitement en masse — pour le raisonnement du frontier avec la confidentialité et le coût du local.
Passerelles IA : LiteLLM, OpenRouter, Portkey, Vercel
Une passerelle IA de production est le routeur manquant entre votre application et chaque modèle — Claude, GPT, Gemini, Llama. Comparez LiteLLM, OpenRouter, Portkey et Vercel AI Gateway, puis connectez Claude Code via votre propre proxy.
Agents de codage locaux (et comment ils s'associent à Claude)
Des agents de codage qui s'exécutent sur votre machine et modifient votre dépôt — Aider, Cline, Continue, OpenHands, Claude Code — propulsés par Claude pour la qualité ou par un modèle local pour la confidentialité.
Connecter Claude à des outils et agents locaux avec MCP
Le Model Context Protocol permet à Claude d'orchestrer des outils, des données et des agents qui s'exécutent en privé sur votre propre machine — la synergie Claude-cerveau, capacités-locales. Ajoutez ou construisez un serveur MCP local.
Construire une pile d'IA locale et privée (de bout en bout)
Assemblez le tout : un modèle local (Ollama) + un agent agnostique au modèle + des outils via un serveur MCP local — un assistant privé sur votre propre machine, avec Claude comme couche intelligente optionnelle.
Agent local ou Claude ? Un guide de décision
Agent entièrement local, propulsé par Claude, ou hybride ? Les facteurs qui tranchent la question — confidentialité, difficulté de la tâche, coût, latence, fiabilité — et pourquoi l'hybride l'emporte souvent.
Sécuriser les agents locaux et hybrides
Un agent capable de modifier des fichiers et d'exécuter des commandes est puissant et dangereux. Moindre privilège, isolation, approbation humaine, défense contre l'injection de prompt, plafonds de budget — comment exécuter des agents en toute sécurité.
Comparatif des modèles de raisonnement
Budgets de réflexion et effort de raisonnement chez Claude, GPT, Gemini, DeepSeek et Qwen — quand dépenser des tokens à réfléchir, et quand s'en abstenir.
IA vocale full-duplex : pourquoi les agents vocaux sont soudain devenus crédibles
GPT-Live et les nouveaux modèles nativement vocaux écoutent et parlent en même temps. Ce que le full-duplex change, comment ça marche, et le paysage de l’IA vocale aujourd’hui.
Claude Voice avec Opus et Sonnet (juillet 2026) : voix orientée raisonnement vs GPT-Live
Anthropic a ouvert la voix Claude à Opus, Sonnet et aux apps connectées le 23 juillet 2026 — mais a gardé la stack en tour par tour. Ce qui a réellement changé, quand changer de modèle en cours d'appel, et en quoi le pari de design diffère du full-duplex GPT-Live d'OpenAI.
Vitesse des tokens : pourquoi l'inférence IA est soudain 10 à 15× plus rapide
Les puces à l'échelle du wafer et les LPU servent des modèles de pointe à des centaines de tokens par seconde. Ce qui limite réellement la vitesse d'inférence, la nouvelle course au matériel, et pourquoi des tokens rapides changent les agents, la voix et le raisonnement.
Comparatif des agents computer-use
Claude, GPT et Gemini savent tous piloter un écran désormais — mais chacun expose un espace d'actions, un contrat de coordonnées et une barrière de sécurité différents. Ce qui casse réellement, et comment construire une boucle qui y survit.
Navigateurs à session partagée pour agents IA : le modèle ego lite
Une nouvelle catégorie de navigateur — parfaitement illustrée par ego lite, qui a atteint la #1 place du GitHub Trending le 24 juillet 2026 — permet à Claude Code, Codex, Cursor et à tout autre agent de coding de piloter une session Chromium isolée qui hérite de vos véritables connexions. Ce que les Spaces et les snapshots sémantiques résolvent réellement, pourquoi ils surpassent Playwright pour le travail d'agent, et le coût de sécurité lié au partage des cookies de session avec un processus autonome.
SKILL.md : le standard ouvert inter-agents
Un seul fichier SKILL.md, trente-deux agents. Ce qu'est vraiment le standard ouvert Agent Skills, comment la divulgation progressive maintient le contexte à faible coût, ce qui casse la portabilité, et comment écrire une skill qui s'exécute sans modification dans Claude Code, Codex, Gemini CLI et Cursor.