Passa al contenuto principale

Gemini 3.7 Flash per utenti Claude: cavallo da soma per agenti di codice a metà prezzo (Ago 2026)

Intermedio

Google ha rilasciato Gemini 3.7 Flash il 13 agosto 2026, esattamente tre settimane dopo 3.6 Flash. Stesso livello, stessa finestra di contesto, stessa forma — ma un salto di 16,3 punti su DeepSWE, ~3× il throughput in output rispetto al concorrente GPT-5.6 più vicino, e un prezzo introduttivo che dimezza il costo di 3.6 Flash per quattro mesi e mezzo. Questa lezione accompagna un utente Claude attraverso cosa è cambiato davvero, quali numeri sono portanti, e quali decisioni peggiorano se prendi per buoni i titoli del lancio.

What you'll learn
  • Riconoscere cosa è stato rilasciato il 13 agosto 2026 — e perché la cadenza di tre settimane dopo 3.6 Flash è il segnale vero
  • Leggere correttamente il prezzo introduttivo: $0,75 in / $3,75 out raddoppia a $1,50 / $7,50 il 1° gennaio 2027
  • Capire il salto su DeepSWE da 49% a 65,3% — e perché conta più di un piccolo spostamento su GDPval
  • Usare il vantaggio di throughput di ~3× dove paga (loop di agenti) e ignorarlo dove non serve (chat)
  • Migrare da 3.6 Flash a 3.7 Flash con un solo ID modello e senza sorprese — più le parti della migrazione da 3.6 che ancora mordono

La versione in una frase

Gemini 3.7 Flash è il successore diretto di 3.6 Flash — contesto da 1M token, output da 65.536 token, tre valori di thinking_level (low, medium, high, default medium) — con guadagni significativi sugli agenti di codice e uno sconto introduttivo del 50% che scade il 31 dicembre 2026. ID modello: gemini-3.7-flash. Distribuito da subito su Google AI Studio, Android Studio, Gemini API e Google Antigravity.

La storia interessante non è nessuna singola riga di benchmark. È che Google ora itera il livello workhorse su una cadenza di tre settimane — 3.6 Flash il 21 luglio, 3.7 Flash il 13 agosto — mentre tiene ancora fermo 3.5 Pro. Leggilo alla lettera: al livello workhorse Google ha un ciclo di feedback rapido con gli sviluppatori; al livello di punta non ha ancora un salto qualitativo che voglia spedire. Per l'immagine speculare sul lato OpenAI, vedi Aggiornamento GPT-5.6 di agosto.

Tre cose su questo lancio che sorprendono

Tutti stanno scrivendo il titolo "metà prezzo". Ecco cosa un utente Claude non dovrebbe farsi sfuggire.

1. Il prezzo introduttivo scade — e raddoppia — il 1° gennaio 2027

Il post di lancio di Google è esplicito: $0,75 per 1M di token in input e $3,75 per 1M di token in output è una tariffa introduttiva disponibile "fino al 31 dicembre 2026". Il prezzo standard entra in vigore il 1° gennaio 2027: $1,50 / $7,50, allineato allo sticker di 3.6 Flash. Se modelli il costo 2027 sul numero introduttivo sbaglierai di 2×. Regola di budget per un negozio Claude che confronta le pipeline: fai l'A/B al prezzo introduttivo, ma fissa la decisione al numero post-gennaio, perché è quello che troverai sulla fattura Q1. Vedi Quanto costa l'AI dai vari provider per il framework.

2. Il salto su DeepSWE è più grande di quello su GDPval — e questa asimmetria è tutta la storia

Benchmark di lancio Google (3.7 Flash vs 3.6 Flash, più alto è meglio):

Benchmark3.6 Flash3.7 FlashDelta
DeepSWE v1.1 (bug fix reali)49,0%65,3%+16,3 punti
FrontierCode 1.1 Main (codice di produzione)34,4%43,6%+9,2 punti
WebDev Arena (Elo)15381588+50 Elo
AutomationBench (workflow agenti)17,0%30,4%+13,4 punti
GDPval AA v2 (lavoro di conoscenza, Elo)1421~1525+~104 Elo

Lo spostamento su GDPval è reale ma resta indietro rispetto a Claude Sonnet 5 a 1598 e GPT-5.6 Terra a 1578 sul lavoro di conoscenza. Gli spostamenti su DeepSWE e AutomationBench sono proprio dove un modello workhorse era finora imbarazzato — bug fix su repository reali e run di agenti multi-step. Leggi la forma, non la media: 3.7 Flash ha chiuso il gap sugli agenti di codice muovendosi appena sul lavoro di conoscenza generale. Questo ti dice quale lavoro Google è ora disposta a far fare a Flash.

3. Il vantaggio di throughput di ~3× conta per gli agenti, non per la chat

Le misurazioni di terze parti registrano 3.7 Flash a circa 340 token/secondo in output, contro ~110 tok/s per GPT-5.6 Terra su prompt comparabili — circa . Per un utente che digita in una UI di chat questo è invisibile: gli umani leggono a ~250 parole/minuto (~5 tok/s), quindi qualsiasi cosa sopra ~50 tok/s scorre e basta. Per un loop di agente seriale — 20 chiamate, ognuna con qualche centinaio di token in output — 3× si compone a ogni passo e trasforma un minuto di generazione cumulativa in ~20 secondi. Se stai valutando Flash per una chat rivolta al cliente, il throughput è un errore di arrotondamento. Se lo stai valutando per un agente di codice o di ricerca, il throughput è spesso la vittoria più grande in assoluto. La fisica dietro questo è su Inferenza veloce e velocità dei token.

Scheda modello in sintesi

SpecGemini 3.7 Flash
ID modellogemini-3.7-flash
Finestra di contesto1.048.576 token in input
Output massimo65.536 token
Livelli di thinkinglow, medium (default), high
Modalità in inputtesto, immagine, audio, video, PDF
Modalità in outputtesto
Strumentifunction calling, structured output (JSON schema), esecuzione codice, grounding, computer use
Prezzo introduttivo (fino al 31 dic 2026)$0,75 in / $3,75 out per 1M token
Prezzo standard (dal 1° gen 2027)$1,50 in / $7,50 out per 1M token
DisponibilitàGoogle AI Studio, Android Studio, Gemini API, Google Antigravity, Gemini Enterprise Agent Platform

Nota che il default di thinking_level è medium, non low né "auto". Un port cieco da 3.6 Flash pagherà per il reasoning medium di default; abbassalo a low per job di classificazione/estrazione dove la pianificazione in più è sprecata. High vale la pena solo sui problemi di codice e agenti multi-step più duri — la guida di migrazione di Google avverte "più alto non è automaticamente meglio".

Migrare una chiamata da 3.6 Flash a 3.7 Flash

La buona notizia per chi è già su 3.6 Flash: la superficie API è invariata. Scambi l'ID del modello e rilanci le eval. La cattiva notizia per chi porta da Claude o da Gemini più vecchi: i cambiamenti API dell'era 3.6 mordono ancora.

Guided walkthrough1 of 5
  1. Usa `gemini-3.7-flash`. Non fissare `gemini-3.6-flash` se vuoi il nuovo prezzo e i delta di benchmark.

Chiamata minima 3.7 Flash (SDK Python)

from google import genai

client = genai.Client()  # picks up GOOGLE_API_KEY

resp = client.models.generate_content(
  model="gemini-3.7-flash",
  contents="Given this diff, list the 3 riskiest lines with file:line and 1-sentence rationale each.",
  config={
      "thinking_level": "medium",   # default; drop to "low" for pure extraction, raise to "high" for hardest agent steps
      # do NOT pass temperature, top_p, top_k, candidate_count
      "tools": [{"function_declarations": [...]}],  # or {"computer_use": {}}
  },
)
print(resp.text)

Quando puntare su Gemini 3.7 Flash — e quando restare su Claude

Pro tip
  • Punta su 3.7 Flash: loop seriali di agenti di codice (lavoro a forma DeepSWE), scaffolding di sviluppo web, e qualsiasi workflow dove il vantaggio di throughput di ~3× si compone su molte chiamate.
  • Punta su 3.7 Flash: loop di tool ad alto volume durante la finestra introduttiva — il gap di prezzo 2× rispetto a Claude Haiku 4.5 (sullo sticker attuale Anthropic per Haiku) è reale e si chiude il 1° gennaio 2027.
  • Resta su Claude Sonnet 5: task di lavoro di conoscenza dove 3.7 Flash resta indietro su GDPval AA v2 (1525 vs 1598), e run di agenti a lungo orizzonte dove la disciplina di extended-thinking conta più del throughput grezzo.
  • Resta su Claude per qualsiasi workload dove ti affidi a turni assistant prefillati, controllo della temperature, o al loop di tool-use di Anthropic — combatterai contro l'API di Gemini invece di usarla.
  • Verifica entrambi: per qualsiasi cosa customer-facing, lancia una piccola eval su entrambi al livello che effettivamente pensi di spedire. Il titolo su DeepSWE è reale ma non sopravvive al contatto con ogni codebase.

Per l'inquadramento più ampio Claude-vs-Gemini precedente questo rilascio, vedi Gemini per utenti Claude, il focus sul codice Claude vs GPT vs Gemini per coding, e Scegliere un modello. Per il lato OpenAI della stessa settimana, Aggiornamento GPT-5.6 di agosto. Per le regole di porting cross-modello che tengono stabile ognuno di questi swap, Portare prompt tra modelli.

Verifica rapida

Check yourself

0/5
  1. Quando finisce il prezzo introduttivo di Gemini 3.7 Flash ($0,75 in / $3,75 out per 1M token)?
  2. Dove ha registrato Gemini 3.7 Flash il salto di benchmark più grande su 3.6 Flash?
  3. Per quale workload conta di più il vantaggio di throughput di ~3× in output?
  4. Porti una chiamata Claude funzionante a `gemini-3.7-flash`. Quale di queste ti morderà?
  5. Qual è il `thinking_level` di default su Gemini 3.7 Flash — e cosa dovresti farne per un job di pura classificazione?
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 8
Key takeaways
  • Il prezzo introduttivo ($0,75/$3,75) è una finestra di quattro mesi e mezzo, non il numero su cui costruire un budget 2027 — fissa le decisioni a $1,50/$7,50.
  • Il salto di +16,3 punti su DeepSWE è il benchmark portante: 3.7 Flash ha chiuso il gap sugli agenti di codice per cui Flash era imbarazzato.
  • ~3× di throughput vs GPT-5.6 Terra si compone nei loop seriali di agenti e sparisce in chat — scegli il workload dove paga.
  • La superficie API è invariata rispetto a 3.6 Flash, ma le rimozioni era-3.6 (temperature/top_p/top_k, candidate_count, turni model prefillati) beccano ancora i port da Claude.
  • Sonnet 5 guida ancora sul lavoro di conoscenza GDPval AA v2 (1598 vs ~1525) — sostituisci Flash per le gambe di agenti di codice e tieni Claude per le gambe di pianificazione dove già ti fidi.

Fonti e approfondimenti