Gemini 3.7 Flash per utenti Claude: cavallo da soma per agenti di codice a metà prezzo (Ago 2026)
Google ha rilasciato Gemini 3.7 Flash il 13 agosto 2026, esattamente tre settimane dopo 3.6 Flash. Stesso livello, stessa finestra di contesto, stessa forma — ma un salto di 16,3 punti su DeepSWE, ~3× il throughput in output rispetto al concorrente GPT-5.6 più vicino, e un prezzo introduttivo che dimezza il costo di 3.6 Flash per quattro mesi e mezzo. Questa lezione accompagna un utente Claude attraverso cosa è cambiato davvero, quali numeri sono portanti, e quali decisioni peggiorano se prendi per buoni i titoli del lancio.
- Riconoscere cosa è stato rilasciato il 13 agosto 2026 — e perché la cadenza di tre settimane dopo 3.6 Flash è il segnale vero
- Leggere correttamente il prezzo introduttivo: $0,75 in / $3,75 out raddoppia a $1,50 / $7,50 il 1° gennaio 2027
- Capire il salto su DeepSWE da 49% a 65,3% — e perché conta più di un piccolo spostamento su GDPval
- Usare il vantaggio di throughput di ~3× dove paga (loop di agenti) e ignorarlo dove non serve (chat)
- Migrare da 3.6 Flash a 3.7 Flash con un solo ID modello e senza sorprese — più le parti della migrazione da 3.6 che ancora mordono
La versione in una frase
Gemini 3.7 Flash è il successore diretto di 3.6 Flash — contesto da 1M token, output da 65.536 token, tre valori di thinking_level (low, medium, high, default medium) — con guadagni significativi sugli agenti di codice e uno sconto introduttivo del 50% che scade il 31 dicembre 2026. ID modello: gemini-3.7-flash. Distribuito da subito su Google AI Studio, Android Studio, Gemini API e Google Antigravity.
La storia interessante non è nessuna singola riga di benchmark. È che Google ora itera il livello workhorse su una cadenza di tre settimane — 3.6 Flash il 21 luglio, 3.7 Flash il 13 agosto — mentre tiene ancora fermo 3.5 Pro. Leggilo alla lettera: al livello workhorse Google ha un ciclo di feedback rapido con gli sviluppatori; al livello di punta non ha ancora un salto qualitativo che voglia spedire. Per l'immagine speculare sul lato OpenAI, vedi Aggiornamento GPT-5.6 di agosto.
Tre cose su questo lancio che sorprendono
Tutti stanno scrivendo il titolo "metà prezzo". Ecco cosa un utente Claude non dovrebbe farsi sfuggire.
1. Il prezzo introduttivo scade — e raddoppia — il 1° gennaio 2027
Il post di lancio di Google è esplicito: $0,75 per 1M di token in input e $3,75 per 1M di token in output è una tariffa introduttiva disponibile "fino al 31 dicembre 2026". Il prezzo standard entra in vigore il 1° gennaio 2027: $1,50 / $7,50, allineato allo sticker di 3.6 Flash. Se modelli il costo 2027 sul numero introduttivo sbaglierai di 2×. Regola di budget per un negozio Claude che confronta le pipeline: fai l'A/B al prezzo introduttivo, ma fissa la decisione al numero post-gennaio, perché è quello che troverai sulla fattura Q1. Vedi Quanto costa l'AI dai vari provider per il framework.
2. Il salto su DeepSWE è più grande di quello su GDPval — e questa asimmetria è tutta la storia
Benchmark di lancio Google (3.7 Flash vs 3.6 Flash, più alto è meglio):
| Benchmark | 3.6 Flash | 3.7 Flash | Delta |
|---|---|---|---|
| DeepSWE v1.1 (bug fix reali) | 49,0% | 65,3% | +16,3 punti |
| FrontierCode 1.1 Main (codice di produzione) | 34,4% | 43,6% | +9,2 punti |
| WebDev Arena (Elo) | 1538 | 1588 | +50 Elo |
| AutomationBench (workflow agenti) | 17,0% | 30,4% | +13,4 punti |
| GDPval AA v2 (lavoro di conoscenza, Elo) | 1421 | ~1525 | +~104 Elo |
Lo spostamento su GDPval è reale ma resta indietro rispetto a Claude Sonnet 5 a 1598 e GPT-5.6 Terra a 1578 sul lavoro di conoscenza. Gli spostamenti su DeepSWE e AutomationBench sono proprio dove un modello workhorse era finora imbarazzato — bug fix su repository reali e run di agenti multi-step. Leggi la forma, non la media: 3.7 Flash ha chiuso il gap sugli agenti di codice muovendosi appena sul lavoro di conoscenza generale. Questo ti dice quale lavoro Google è ora disposta a far fare a Flash.
3. Il vantaggio di throughput di ~3× conta per gli agenti, non per la chat
Le misurazioni di terze parti registrano 3.7 Flash a circa 340 token/secondo in output, contro ~110 tok/s per GPT-5.6 Terra su prompt comparabili — circa 3×. Per un utente che digita in una UI di chat questo è invisibile: gli umani leggono a ~250 parole/minuto (~5 tok/s), quindi qualsiasi cosa sopra ~50 tok/s scorre e basta. Per un loop di agente seriale — 20 chiamate, ognuna con qualche centinaio di token in output — 3× si compone a ogni passo e trasforma un minuto di generazione cumulativa in ~20 secondi. Se stai valutando Flash per una chat rivolta al cliente, il throughput è un errore di arrotondamento. Se lo stai valutando per un agente di codice o di ricerca, il throughput è spesso la vittoria più grande in assoluto. La fisica dietro questo è su Inferenza veloce e velocità dei token.
Scheda modello in sintesi
| Spec | Gemini 3.7 Flash |
|---|---|
| ID modello | gemini-3.7-flash |
| Finestra di contesto | 1.048.576 token in input |
| Output massimo | 65.536 token |
| Livelli di thinking | low, medium (default), high |
| Modalità in input | testo, immagine, audio, video, PDF |
| Modalità in output | testo |
| Strumenti | function calling, structured output (JSON schema), esecuzione codice, grounding, computer use |
| Prezzo introduttivo (fino al 31 dic 2026) | $0,75 in / $3,75 out per 1M token |
| Prezzo standard (dal 1° gen 2027) | $1,50 in / $7,50 out per 1M token |
| Disponibilità | Google AI Studio, Android Studio, Gemini API, Google Antigravity, Gemini Enterprise Agent Platform |
Nota che il default di thinking_level è medium, non low né "auto". Un port cieco da 3.6 Flash pagherà per il reasoning medium di default; abbassalo a low per job di classificazione/estrazione dove la pianificazione in più è sprecata. High vale la pena solo sui problemi di codice e agenti multi-step più duri — la guida di migrazione di Google avverte "più alto non è automaticamente meglio".
Migrare una chiamata da 3.6 Flash a 3.7 Flash
La buona notizia per chi è già su 3.6 Flash: la superficie API è invariata. Scambi l'ID del modello e rilanci le eval. La cattiva notizia per chi porta da Claude o da Gemini più vecchi: i cambiamenti API dell'era 3.6 mordono ancora.
- Usa `gemini-3.7-flash`. Non fissare `gemini-3.6-flash` se vuoi il nuovo prezzo e i delta di benchmark.
- Il default è medium. Per classificazione a bassa varianza, abbassa a `low` e misura il delta di qualità. Per run di agenti a lungo orizzonte con tool call, prova `high` su un piccolo campione — ma solo se le tue eval mostrano il vantaggio.
- 3.7 Flash eredita la rimozione era-3.6 di queste manopole di sampling. Una chiamata a forma Claude che le trascina fallirà o sarà ignorata silenziosamente a seconda dell'SDK. Vedi la lista di migrazione 3.6 su [Gemini 3.6 Flash per utenti Claude](/docs/models/gemini-3-6-flash-family) — la stessa lista vale ancora.
- Gemini 3.7 Flash rifiuta ancora i turni model prefillati (conversazioni che finiscono su un ruolo `model` non vuoto). Se usi il prefill stile Anthropic per pilotare l'output, ristruttura in un turno user prima di portare.
- Se la tua analisi di ROI ha bisogno che 3.7 Flash sia più economico di Claude Haiku 4.5, fai i conti con $1,50 / $7,50 — il prezzo che parte il 1° gennaio 2027 — non con lo sticker introduttivo di quattro mesi e mezzo.
Chiamata minima 3.7 Flash (SDK Python)
from google import genai
client = genai.Client() # picks up GOOGLE_API_KEY
resp = client.models.generate_content(
model="gemini-3.7-flash",
contents="Given this diff, list the 3 riskiest lines with file:line and 1-sentence rationale each.",
config={
"thinking_level": "medium", # default; drop to "low" for pure extraction, raise to "high" for hardest agent steps
# do NOT pass temperature, top_p, top_k, candidate_count
"tools": [{"function_declarations": [...]}], # or {"computer_use": {}}
},
)
print(resp.text)Quando puntare su Gemini 3.7 Flash — e quando restare su Claude
- Punta su 3.7 Flash: loop seriali di agenti di codice (lavoro a forma DeepSWE), scaffolding di sviluppo web, e qualsiasi workflow dove il vantaggio di throughput di ~3× si compone su molte chiamate.
- Punta su 3.7 Flash: loop di tool ad alto volume durante la finestra introduttiva — il gap di prezzo 2× rispetto a Claude Haiku 4.5 (sullo sticker attuale Anthropic per Haiku) è reale e si chiude il 1° gennaio 2027.
- Resta su Claude Sonnet 5: task di lavoro di conoscenza dove 3.7 Flash resta indietro su GDPval AA v2 (1525 vs 1598), e run di agenti a lungo orizzonte dove la disciplina di extended-thinking conta più del throughput grezzo.
- Resta su Claude per qualsiasi workload dove ti affidi a turni assistant prefillati, controllo della temperature, o al loop di tool-use di Anthropic — combatterai contro l'API di Gemini invece di usarla.
- Verifica entrambi: per qualsiasi cosa customer-facing, lancia una piccola eval su entrambi al livello che effettivamente pensi di spedire. Il titolo su DeepSWE è reale ma non sopravvive al contatto con ogni codebase.
Per l'inquadramento più ampio Claude-vs-Gemini precedente questo rilascio, vedi Gemini per utenti Claude, il focus sul codice Claude vs GPT vs Gemini per coding, e Scegliere un modello. Per il lato OpenAI della stessa settimana, Aggiornamento GPT-5.6 di agosto. Per le regole di porting cross-modello che tengono stabile ognuno di questi swap, Portare prompt tra modelli.
Verifica rapida
Check yourself
0/5- Il prezzo introduttivo ($0,75/$3,75) è una finestra di quattro mesi e mezzo, non il numero su cui costruire un budget 2027 — fissa le decisioni a $1,50/$7,50.
- Il salto di +16,3 punti su DeepSWE è il benchmark portante: 3.7 Flash ha chiuso il gap sugli agenti di codice per cui Flash era imbarazzato.
- ~3× di throughput vs GPT-5.6 Terra si compone nei loop seriali di agenti e sparisce in chat — scegli il workload dove paga.
- La superficie API è invariata rispetto a 3.6 Flash, ma le rimozioni era-3.6 (temperature/top_p/top_k, candidate_count, turni model prefillati) beccano ancora i port da Claude.
- Sonnet 5 guida ancora sul lavoro di conoscenza GDPval AA v2 (1598 vs ~1525) — sostituisci Flash per le gambe di agenti di codice e tieni Claude per le gambe di pianificazione dove già ti fidi.
Fonti e approfondimenti
- Google — Introducing Gemini 3.7 Flash (blog ufficiale) — post di lancio con DeepSWE, WebDev Arena e prezzi
- Google AI for Developers — What's new in Gemini 3.7 Flash — superficie API,
thinking_level, default - Google Antigravity — Gemini 3.7 Flash in Google Antigravity — i tre workflow showcase di agenti e delta per-benchmark
- VentureBeat — Google's Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut — inquadramento del prezzo e posizionamento competitivo
- DataCamp — Gemini 3.7 Flash: Features, Benchmarks, and Pricing — riferimento GDPval e benchmark comparativi
- OpenRouter — Gemini 3.7 Flash provider stats — numeri di latenza/throughput di terze parti su AI Studio e Vertex
- Medium (Google Cloud Community) — Migrating to Gemini 3.7 Flash: what breaks and what changed — lista pratica di migrazione