Passa al contenuto principale

Gemini 3.6 Flash, Flash-Lite e Flash Cyber per utenti Claude

Intermedio

Google era atteso al rilascio di Gemini 3.5 Pro a luglio 2026. Invece, il 21 luglio 2026 ha rilasciato tre modelli di fascia FlashGemini 3.6 Flash, Gemini 3.5 Flash-Lite e Gemini 3.5 Flash Cyber — lasciando la fascia Pro in test con i partner. Se costruisci su Claude e usi Gemini come contro-verifica, la forma di questo rilascio conta più di qualunque singolo benchmark: Google sta dicendo al mercato che il vero denaro sta nella fascia workhorse, non nel flagship. Questa pagina accompagna un utente Claude in ciò che è davvero atterrato, a che prezzo, e cosa si rompe quando porti una chiamata esistente.

What you'll learn
  • Capire cosa è arrivato il 21 luglio 2026 — tre modelli Flash, e perché Google ha saltato 3.5 Pro
  • Leggere la tabella prezzi onestamente: output più economico del 17% più 17% di token di output in meno compone un calo di costo reale del ~30%
  • Sapere quando Flash-Lite ($0.30 in / $2.50 out, 350 tok/s, contesto 1M) è la contro-verifica giusta rispetto a Claude Haiku
  • Vedere come Flash Cyber ha superato Claude Opus 4.6 nella caccia ai bug di V8 — e perché quasi certamente non puoi usarlo
  • Migrare in modo pulito: quali manopole di sampling sono state rimosse e cosa accetta il nuovo enum thinking_level

La versione in una frase

Il rilascio Google del 21 luglio 2026 è un refresh della fascia Flash senza Pro — un nuovo workhorse (3.6 Flash, $1.50 in / $7.50 out, contesto 1M, Computer Use integrato), un fratello più economico ad alta velocità (3.5 Flash-Lite, $0.30 in / $2.50 out, 350 token/secondo), e un fine-tune solo-security (3.5 Flash Cyber) che Google sta gating a governi e partner fidati tramite il programma CodeMender.

La storia interessante non è il modello. È la scelta: Google ha spinto un workhorse e una fascia economica trattenendo esplicitamente Pro, e Logan Kilpatrick ha detto che Pro è "attualmente in test con i partner" dopo aver mancato i target di performance interni. È una scommessa diversa da quella del lancio OpenAI GPT-5.6 di due settimane prima, che ha aperto con un flagship (Sol) — vedi la pagina GPT-5.6 Sol/Terra/Luna per il confronto speculare.

Tre cose di questo lancio che sorprendono

Tutti scrivono il titolo "17% più economico". Ecco i dettagli che un utente Claude non dovrebbe perdere.

1. Google ha saltato 3.5 Pro — pubblicamente

Non è così che Google di solito rilascia. Nei refresh precedenti il flagship apriva il lancio e i fratelli minori seguivano. Il 21 luglio 2026 Google ha rilasciato solo modelli di classe Flash e ha confermato che 3.5 Pro è ancora in test con i partner dopo aver mancato gli obiettivi di performance interni. Il product lead Logan Kilpatrick ha detto che il team spera di "atterrarlo presto". Leggilo letteralmente: al livello più alto di intelligenza, Google non ha ancora una discontinuità pronta da rilasciare. Ha però un workhorse forte e un bug-hunter che può gating. Se il tuo workflow dipende dal "Gemini più intelligente che puoi comprare", oggi è ancora 3.5 Pro-Preview o la vecchia fascia 3.5 Ultra — non un modello di luglio 2026.

2. Il taglio del 17% sul prezzo di output è in realtà ~30% perché anche i token di output sono calati del 17%

Il grafico di lancio mostra il prezzo di output di Gemini 3.6 Flash a $7.50 per 1M di token, in calo da $9 su 3.5 Flash — un taglio del 17%. Guarda una riga più in basso: Google riporta anche 17% di token di output in meno sugli stessi carichi (misurati sull'Artificial Analysis Index). Si compongono: 0.83 × 0.83 ≈ 0.69, quindi il costo reale di output cala di circa il 31% su job comparabili, non il 17%. Su DeepSWE Google dichiara riduzioni di token "fino al 65%". Quando confronti una pipeline Claude Sonnet 5 con 3.6 Flash, fai la moltiplicazione prima di decidere se cambiare — il titolo sottostima il delta.

3. Flash Cyber ha battuto Claude Opus 4.6 nella caccia ai bug di V8 — ma quasi certamente non puoi usarlo

Google riporta che Gemini 3.5 Flash Cyber ha scoperto 55 vulnerabilità uniche confermate su benchmark interni del motore JavaScript V8, contro 47 per lo standard 3.5 Flash e 36 per Claude Opus 4.6. Dieci di questi bug non sono stati trovati da nessun altro modello. Sul benchmark CyberGym atterra all'83.2%, vicino a Claude Mythos 5 (83.8%) e GPT-5.5-Cyber (85.6%). Impressionante — e gated. Flash Cyber viene distribuito solo tramite il programma CodeMender di Google a governi e partner enterprise fidati. Non c'è API pubblica, non ci sono prezzi, non c'è accesso self-serve. Se hai visto un titolo che diceva "l'AI cyber di Google ha battuto Claude" e speravi di provarla: non puoi. La lezione che un difensore dovrebbe portare a casa non è "cambia modello"; è che fare fine-tune di un modello di fascia media su un dominio ristretto ora batte un modello general-purpose più grande su quel dominio. Il pattern si ripeterà.

La tabella delle fasce (al 21 luglio 2026)

ModelloInput $/1MOutput $/1MInput cached $/1MContestoOutput maxNote
Gemini 3.6 Flash$1.50$7.50$0.151.048.57665.536Workhorse; Computer Use integrato
Gemini 3.5 Flash-Lite$0.30$2.50(non dichiarato)1.048.57665.536350 token/secondo in output; in rollout su Google Search
Gemini 3.5 Flash Cyber(non pubblico)(non pubblico)(non pubblico)(non pubblico)(non pubblico)Solo governi e partner fidati via CodeMender

Delta di benchmark che Google ha pubblicato per 3.6 Flash vs 3.5 Flash (più alto è meglio):

  • DeepSWE: 49% vs 37% (+12 punti)
  • MLE Bench: 63.9% vs 49.7% (+14.2 punti)
  • OSWorld-Verified: 83.0% vs 78.4% (+4.6 punti)
  • GDPval-AA v2: 1421 Elo vs 1349 (+72 Elo)
  • GPQA Diamond: 92.8%
  • MMMU-Pro: 83.2%
  • Humanity's Last Exam: 38.3%
  • Chatbot Arena Elo (Text Overall): 1485
  • Artificial Analysis Coding Index: 69.2%

Due manopole sono più utili di qualunque singola riga di benchmark. Il knowledge cutoff è saltato da gennaio 2025 a marzo 2026 — un balzo di 14 mesi. Per task "rispondi direttamente dal modello" (niente RAG, niente browsing) questo spesso pesa più di uno score di benchmark. La velocità di output è dichiarata a 304 token/secondo per 3.6 Flash e 350 token/secondo per Flash-Lite, il che cambia quanto latency-hiding deve fare la tua UI.

Flash-Lite è la vera storia per i workflow Claude ad alto volume

Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 6

Per workflow Claude ad alto volume e latency-sensitive — classificazione, estrazione, moderazione, autocomplete — Flash-Lite a $0.30/$2.50 con contesto da 1M di token e 350 tok/s è ora la contro-verifica ovvia rispetto a Claude Haiku 4.5. Non è un sostituto di Sonnet, e non dovresti usarlo per loop di agenti pesanti sulla pianificazione. Ma se hai una fascia "modello economico dietro una coda" nel tuo stack, metti in budget un giorno per un A/B.

Migrazione: cosa deve davvero cambiare un utente Claude

La superficie API di Gemini è cambiata con 3.6. Se porti una chiamata Claude-shaped, quattro cose si rompono.

Guided walkthrough1 of 6
  1. Usa `gemini-3.6-flash` per il workhorse o `gemini-3.5-flash-lite` per la fascia economica. Non esiste un model ID pubblico per 3.5 Flash Cyber. 3.5 Pro non è ancora in rilascio — non ancorarti a esso.

Chiamata minima a 3.6 Flash (SDK Python)

from google import genai

client = genai.Client()  # picks up GOOGLE_API_KEY
resp = client.models.generate_content(
  model="gemini-3.6-flash",
  contents="Extract the 3 riskiest lines from this diff and cite line numbers.",
  config={
      "thinking_level": "medium",   # was thinking_budget=<int>
      # do NOT pass temperature, top_p, top_k, candidate_count
      "tools": [{"computer_use": {}}],  # built-in, not a separate SDK
  },
)
print(resp.text)

Quando puntare su Gemini 3.6 Flash invece di Claude — e quando no

Pro tip
  • Punta su 3.6 Flash: loop di tool ad alto volume dove l'efficienza dei token domina il costo, e workflow che beneficiano del knowledge cutoff di marzo 2026 (14 mesi più fresco del vecchio 3.5 Flash).
  • Punta su Flash-Lite: classificazione/estrazione latency-sensitive su input da 1M di token dove Haiku è la tua baseline.
  • Resta su Claude: fix di bug su repo reali stile SWE-Bench-Pro, run di agenti lunghi dove la disciplina del thinking esteso conta, e ovunque ti fidi già della qualità di pianificazione di Sonnet 5.
  • Non inseguire Flash Cyber: a meno che tu non sia un governo o un partner CodeMender, tratta i suoi numeri come un segnale di ricerca, non una decisione d'acquisto.

Per un inquadramento Gemini-vs-Claude più ampio precedente a questo rilascio, vedi Gemini per utenti Claude e il confronto Claude vs GPT vs Gemini per il coding orientato al coding. Per il lancio speculare di OpenAI di due settimane prima, GPT-5.6 Sol/Terra/Luna. Per le regole di porting cross-model che fanno sopravvivere questi cambi al contatto con la produzione, porting prompts across models.

Verifica rapida

Check yourself

0/4
  1. Quale modello Google **non** ha rilasciato il 21 luglio 2026?
  2. Perché il 'taglio del 17% sul prezzo di output' sottostima il calo di costo reale per 3.6 Flash?
  3. Quale parametro di sampling è ancora valido su Gemini 3.6 Flash?
  4. Qual è la vera storia dell'accesso a Gemini 3.5 Flash Cyber?

Fonti e approfondimenti