Aller au contenu principal

Gemini 3.6 Flash, Flash-Lite et Flash Cyber pour les utilisateurs de Claude

Intermédiaire

Google était attendu pour livrer Gemini 3.5 Pro en juillet 2026. À la place, le 21 juillet 2026, ils ont livré trois modèles de niveau FlashGemini 3.6 Flash, Gemini 3.5 Flash-Lite et Gemini 3.5 Flash Cyber — et ont laissé le niveau Pro en test partenaire. Si vous construisez sur Claude et utilisez Gemini comme cross-check, la forme de cette sortie importe plus que n'importe quel benchmark individuel : Google dit au marché que le niveau workhorse, pas le flagship, est là où est le vrai argent. Cette page emmène un utilisateur Claude à travers ce qui a réellement atterri, à quel prix, et ce qui casse quand vous portez un appel existant.

What you'll learn
  • Comprendre ce qui a été livré le 21 juillet 2026 — trois modèles Flash, et pourquoi Google a sauté 3.5 Pro
  • Lire la table des prix honnêtement : 17 % de sortie moins chère plus 17 % de tokens de sortie en moins se compose en une baisse de coût réelle d'environ 30 %
  • Savoir quand Flash-Lite (0,30 $ in / 2,50 $ out, 350 tok/s, contexte 1M) est le bon cross-check contre Claude Haiku
  • Voir comment Flash Cyber a dépassé Claude Opus 4.6 sur la chasse aux bugs V8 — et pourquoi vous ne pouvez presque certainement pas l'utiliser
  • Migrer proprement : quels boutons d'échantillonnage ont été supprimés, et ce que le nouveau enum thinking_level accepte

La version en une phrase

La sortie du 21 juillet 2026 de Google est un rafraîchissement du niveau Flash sans Pro — un nouveau workhorse (3.6 Flash, 1,50 $ in / 7,50 $ out, contexte 1M, Computer Use intégré), un frère cadet moins cher à haut débit (3.5 Flash-Lite, 0,30 $ in / 2,50 $ out, 350 tokens/seconde) et un fine-tune uniquement sécurité (3.5 Flash Cyber) que Google verrouille aux gouvernements et partenaires de confiance via son programme CodeMender.

L'histoire intéressante n'est pas le modèle. C'est le choix : Google a poussé un workhorse et un tier bon marché tout en retenant explicitement Pro, et Logan Kilpatrick a dit que Pro est "actuellement en test avec des partenaires" après avoir raté les cibles de performance internes. C'est un pari différent du lancement OpenAI GPT-5.6 deux semaines plus tôt, qui a mené avec un flagship (Sol) — voir la page GPT-5.6 Sol/Terra/Luna pour la comparaison image miroir.

Trois choses sur ce lancement qui surprennent les gens

Tout le monde écrit le titre "17 % moins cher". Voici les détails qu'un utilisateur Claude ne devrait pas manquer.

1. Google a sauté 3.5 Pro — publiquement

Ce n'est pas comme ça que Google livre habituellement. Dans les rafraîchissements précédents, le flagship menait le lancement et les petits frères suivaient. Le 21 juillet 2026, Google n'a livré que des modèles de classe Flash et a confirmé que 3.5 Pro est encore en test partenaire après avoir raté les objectifs de performance internes. Le lead produit Logan Kilpatrick a dit que l'équipe espère "atterrir bientôt". Lisez-le littéralement : au niveau le plus élevé d'intelligence, Google n'a pas encore de fonction escalier qu'il peut livrer. Il a un workhorse solide et un chasseur de bugs qu'il peut verrouiller. Si votre workflow dépend du "Gemini le plus intelligent que vous puissiez acheter", aujourd'hui c'est encore 3.5 Pro-Preview ou le niveau 3.5 Ultra plus ancien — pas un modèle de juillet 2026.

2. La baisse de prix de sortie de 17 % est vraiment ~30 % parce que les tokens de sortie ont baissé de 17 % aussi

Le graphique de lancement montre le prix de sortie de Gemini 3.6 Flash à 7,50 $ par 1M tokens, en baisse de 9 $ sur 3.5 Flash — une baisse de 17 %. Regardez une ligne plus bas : Google rapporte aussi 17 % de tokens de sortie en moins sur les mêmes charges de travail (mesurées sur l'Artificial Analysis Index). Ceux-ci se composent : 0,83 × 0,83 ≈ 0,69, donc le coût de sortie en conditions réelles baisse d'environ 31 % sur des jobs comparables, pas 17 %. Sur DeepSWE, Google revendique des réductions de tokens "jusqu'à 65 %". Quand vous croisez un pipeline Claude Sonnet 5 contre 3.6 Flash, faites la multiplication avant de décider s'il faut basculer — le titre sous-estime le delta.

3. Flash Cyber a battu Claude Opus 4.6 sur la chasse aux bugs V8 — mais vous ne pouvez presque certainement pas l'utiliser

Google rapporte que Gemini 3.5 Flash Cyber a découvert 55 vulnérabilités uniques confirmées sur les benchmarks internes du moteur JavaScript V8, contre 47 pour 3.5 Flash standard et 36 pour Claude Opus 4.6. Dix de ces bugs ont été trouvés par aucun autre modèle. Sur le benchmark CyberGym, il atterrit à 83,2 %, proche de Claude Mythos 5 (83,8 %) et GPT-5.5-Cyber (85,6 %). Impressionnant — et verrouillé. Flash Cyber ne livre qu'à travers le programme CodeMender de Google aux gouvernements et partenaires d'entreprise de confiance. Il n'y a pas d'API publique, pas de prix, pas d'accès self-serve. Si vous avez vu un titre qui disait "l'IA cyber de Google a battu Claude" et que vous vous attendiez à l'essayer : vous ne pouvez pas. Ce qu'un défenseur devrait extraire n'est pas "basculer de modèle" ; c'est que fine-tuner un modèle de niveau moyen sur un domaine étroit bat maintenant un modèle plus gros à usage général sur ce domaine. Ce pattern se répétera.

Le tableau des tiers (au 21 juillet 2026)

ModèleEntrée $/1MSortie $/1MEntrée en cache $/1MContexteSortie maxNotes
Gemini 3.6 Flash1,50 $7,50 $0,15 $1 048 57665 536Workhorse ; Computer Use intégré
Gemini 3.5 Flash-Lite0,30 $2,50 $(non indiqué)1 048 57665 536350 tokens/seconde en sortie ; déploiement dans Google Search
Gemini 3.5 Flash Cyber(non public)(non public)(non public)(non public)(non public)Gouvernements et partenaires de confiance via CodeMender uniquement

Deltas de benchmark que Google a publiés pour 3.6 Flash vs 3.5 Flash (plus élevé est meilleur) :

  • DeepSWE : 49 % vs 37 % (+12 points)
  • MLE Bench : 63,9 % vs 49,7 % (+14,2 points)
  • OSWorld-Verified : 83,0 % vs 78,4 % (+4,6 points)
  • GDPval-AA v2 : 1421 Elo vs 1349 (+72 Elo)
  • GPQA Diamond : 92,8 %
  • MMMU-Pro : 83,2 %
  • Humanity's Last Exam : 38,3 %
  • Chatbot Arena Elo (Text Overall) : 1485
  • Artificial Analysis Coding Index : 69,2 %

Deux boutons sont plus utiles que n'importe quelle ligne de benchmark individuelle. Le cutoff de connaissance a sauté de janvier 2025 à mars 2026 — un saut de 14 mois. Pour les tâches "répondre directement depuis le modèle" (pas de RAG, pas de navigation), c'est souvent plus grand qu'un score de benchmark. La vitesse de sortie est citée à 304 tokens/seconde pour 3.6 Flash et 350 tokens/seconde pour Flash-Lite, ce qui change combien de dissimulation de latence votre UI doit faire.

Flash-Lite est la vraie histoire pour les workflows Claude à haut volume

Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 6

Pour les workflows Claude à haut volume et sensibles à la latence — classification, extraction, modération, autocomplétion — Flash-Lite à 0,30 $/2,50 $ avec contexte 1M tokens et 350 tok/s est maintenant le cross-check évident contre Claude Haiku 4.5. Ce n'est pas un remplacement de Sonnet, et vous ne devriez pas l'utiliser pour des boucles d'agent lourdes en planification. Mais si vous avez un tier "modèle bon marché derrière une file" dans votre stack, budgétez une journée pour l'A/B.

Migration : ce qu'un utilisateur Claude doit vraiment changer

La surface API Gemini a changé avec 3.6. Si vous portez un appel de forme Claude, quatre choses cassent.

Guided walkthrough1 of 6
  1. Utilisez `gemini-3.6-flash` pour le workhorse ou `gemini-3.5-flash-lite` pour le tier bon marché. Il n'y a pas d'ID de modèle public pour 3.5 Flash Cyber. 3.5 Pro n'est pas livré encore — ne l'épinglez pas.

Appel minimal 3.6 Flash (SDK Python)

from google import genai

client = genai.Client()  # picks up GOOGLE_API_KEY
resp = client.models.generate_content(
  model="gemini-3.6-flash",
  contents="Extract the 3 riskiest lines from this diff and cite line numbers.",
  config={
      "thinking_level": "medium",   # was thinking_budget=<int>
      # do NOT pass temperature, top_p, top_k, candidate_count
      "tools": [{"computer_use": {}}],  # built-in, not a separate SDK
  },
)
print(resp.text)

Quand recourir à Gemini 3.6 Flash plutôt qu'à Claude — et quand ne pas

Pro tip
  • Recourez à 3.6 Flash : boucles d'outils à haut volume où l'efficacité des tokens domine le coût, et workflows qui bénéficient du cutoff de connaissance de mars 2026 (14 mois plus frais que le 3.5 Flash plus ancien).
  • Recourez à Flash-Lite : classification/extraction sensible à la latence sur des entrées 1M tokens où Haiku est votre baseline.
  • Restez sur Claude : corrections de bugs réels de dépôt style SWE-Bench-Pro, longs runs d'agent où la discipline d'extended thinking compte, et partout où vous faites déjà confiance à la qualité de planification de Sonnet 5.
  • Ne courez pas après Flash Cyber : à moins d'être un gouvernement ou un partenaire CodeMender, traitez ses chiffres comme un signal de recherche, pas une décision d'achat.

Pour un cadrage Gemini-vs-Claude plus large qui précède cette sortie, voir Gemini pour les utilisateurs de Claude et le Claude vs GPT vs Gemini pour le codage axé codage. Pour le lancement OpenAI image miroir deux semaines plus tôt, GPT-5.6 Sol/Terra/Luna. Pour les règles de portage cross-modèle qui font que n'importe laquelle de ces bascules survit au contact avec la production, portage de prompts à travers les modèles.

Vérification rapide

Check yourself

0/4
  1. Quel modèle Google n'a **pas** livré le 21 juillet 2026 ?
  2. Pourquoi la 'baisse de prix de sortie de 17 %' sous-estime-t-elle la baisse de coût réelle pour 3.6 Flash ?
  3. Quel paramètre d'échantillonnage est encore valide sur Gemini 3.6 Flash ?
  4. Quelle est la vraie histoire d'accès pour Gemini 3.5 Flash Cyber ?

Sources et lectures complémentaires