Gemini 3.6 Flash, Flash-Lite & Flash Cyber für Claude-Nutzer
Google wurde erwartet, im Juli 2026 Gemini 3.5 Pro auszuliefern. Stattdessen lieferten sie am 21. Juli 2026 drei Flash-Tier-Modelle — Gemini 3.6 Flash, Gemini 3.5 Flash-Lite und Gemini 3.5 Flash Cyber — und ließen das Pro-Tier im Partner-Testing. Baust du auf Claude und nutzt Gemini als Cross-Check, zählt die Form dieses Releases mehr als jeder einzelne Benchmark: Google sagt dem Markt, dass das Workhorse-Tier, nicht der Flagship, dort ist, wo das echte Geld liegt. Diese Seite führt einen Claude-Nutzer durch, was tatsächlich landete, zu welchem Preis, und was bricht, wenn du einen bestehenden Call portierst.
- Verstehe, was am 21. Juli 2026 gelaunched wurde — drei Flash-Modelle und warum Google 3.5 Pro übersprang
- Lies die Preistabelle ehrlich: 17% günstigerer Output plus 17% weniger Output-Tokens kompoundieren zu einem ~30% realen Kostendrop
- Wisse, wann Flash-Lite ($0.30 in / $2.50 out, 350 tok/s, 1M Kontext) der richtige Cross-Check gegen Claude Haiku ist
- Sieh, wie Flash Cyber Claude Opus 4.6 beim V8-Bug-Hunting übertraf — und warum du es fast sicher nicht nutzen kannst
- Migriere sauber: welche Sampling-Knöpfe entfernt wurden und was das neue thinking_level-Enum akzeptiert
Die Ein-Satz-Version
Googles Release vom 21. Juli 2026 ist ein Flash-Tier-Refresh ohne Pro — ein neuer Workhorse (3.6 Flash, $1.50 in / $7.50 out, 1M Kontext, Computer Use eingebaut), ein günstigeres High-Throughput-Geschwister (3.5 Flash-Lite, $0.30 in / $2.50 out, 350 Tokens/Sekunde) und ein nur-Security-Fine-Tune (3.5 Flash Cyber), den Google über sein CodeMender-Programm auf Regierungen und trusted Partner gated.
Die interessante Geschichte ist nicht das Modell. Es ist die Wahl: Google pushte einen Workhorse und ein günstiges Tier, während es Pro explizit zurückhielt, und Logan Kilpatrick sagte, Pro sei "currently testing with partners" nach verfehlten internen Performance-Zielen. Das ist eine andere Wette als das OpenAI GPT-5.6 Launch zwei Wochen zuvor, das mit einem Flagship (Sol) führte — siehe die GPT-5.6 Sol/Terra/Luna-Seite für den Spiegelbild-Vergleich.
Drei Dinge an diesem Launch, die Leute überraschen
Jeder schreibt die "17% günstiger"-Schlagzeile. Hier sind die Details, die ein Claude-Nutzer nicht verpassen sollte.
1. Google übersprang 3.5 Pro — öffentlich
So liefert Google üblicherweise nicht aus. In früheren Refreshes führte der Flagship den Launch an und die kleineren Geschwister folgten. Am 21. Juli 2026 lieferte Google nur Flash-Class-Modelle aus und bestätigte, 3.5 Pro sei nach verfehlten internen Performance-Zielen weiter im Partner-Testing. Produktleiter Logan Kilpatrick sagte, das Team hoffe, "bald zu landen". Lies das wörtlich: auf der höchsten Intelligenzstufe hat Google noch keinen Step-Funktion, die es ausliefern kann. Es hat einen starken Workhorse und einen Bug-Hunter, den es gated. Hängt dein Workflow von "dem schlausten Gemini, das du kaufen kannst" ab, ist das heute noch 3.5 Pro-Preview oder das ältere 3.5 Ultra-Tier — kein Juli-2026-Modell.
2. Der 17%-Output-Preis-Cut ist eigentlich ~30%, weil Output-Tokens auch um 17% fielen
Die Launch-Grafik zeigt Gemini 3.6 Flash Output-Pricing bei $7.50 pro 1M Tokens, runter von $9 auf 3.5 Flash — ein 17%-Cut. Schau eine Zeile tiefer: Google berichtet auch 17% weniger Output-Tokens auf denselben Workloads (gemessen am Artificial Analysis Index). Die kompoundieren: 0.83 × 0.83 ≈ 0.69, sodass Real-World-Output-Kosten auf vergleichbaren Jobs grob 31% fallen, nicht 17%. Auf DeepSWE claimt Google Token-Reduktionen "bis zu 65%". Wenn du eine Claude-Sonnet-5-Pipeline gegen 3.6 Flash cross-checkst, mach die Multiplikation, bevor du entscheidest, ob du swappst — die Schlagzeile understated das Delta.
3. Flash Cyber schlug Claude Opus 4.6 beim V8-Bug-Hunting — aber du kannst es fast sicher nicht nutzen
Google berichtet, dass Gemini 3.5 Flash Cyber 55 unique bestätigte Vulnerabilities in internen V8-JavaScript-Engine-Benchmarks entdeckte, gegen 47 für Standard-3.5 Flash und 36 für Claude Opus 4.6. Zehn dieser Bugs wurden von keinem anderen Modell gefunden. Auf dem CyberGym-Benchmark landet es bei 83.2%, nahe an Claude Mythos 5 (83.8%) und GPT-5.5-Cyber (85.6%). Beeindruckend — und gated. Flash Cyber liefert nur über Googles CodeMender-Programm an Regierungen und trusted Enterprise-Partner. Kein öffentliches API, kein Pricing, kein Self-Serve-Zugang. Sahst du eine Schlagzeile, die sagte "Googles Cyber-KI schlug Claude" und erwartetest zu testen: du kannst nicht. Das Takeaway, das ein Verteidiger extrahieren sollte, ist nicht "Modelle swappen"; es ist, dass Fine-Tuning eines Mid-Tier-Modells auf eine schmale Domain jetzt ein größeres General-Purpose-Modell auf dieser Domain schlägt. Dieses Muster wird sich wiederholen.
Die Tier-Tabelle (Stand 21. Juli 2026)
| Modell | Input $/1M | Output $/1M | Cached Input $/1M | Kontext | Max Output | Notes |
|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | $0.15 | 1,048,576 | 65,536 | Workhorse; Computer Use eingebaut |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | (nicht angegeben) | 1,048,576 | 65,536 | 350 Tokens/Sekunde Output; Rollout in Google Search |
| Gemini 3.5 Flash Cyber | (nicht öffentlich) | (nicht öffentlich) | (nicht öffentlich) | (nicht öffentlich) | (nicht öffentlich) | Nur Regierungen & trusted Partner via CodeMender |
Benchmark-Deltas, die Google für 3.6 Flash vs. 3.5 Flash publizierte (höher ist besser):
- DeepSWE: 49% vs. 37% (+12 Punkte)
- MLE Bench: 63.9% vs. 49.7% (+14.2 Punkte)
- OSWorld-Verified: 83.0% vs. 78.4% (+4.6 Punkte)
- GDPval-AA v2: 1421 Elo vs. 1349 (+72 Elo)
- GPQA Diamond: 92.8%
- MMMU-Pro: 83.2%
- Humanity's Last Exam: 38.3%
- Chatbot Arena Elo (Text Overall): 1485
- Artificial Analysis Coding Index: 69.2%
Zwei Knöpfe sind nützlicher als jede einzelne Benchmark-Zeile. Knowledge Cutoff sprang von Januar 2025 auf März 2026 — ein 14-Monats-Sprung. Für "aus dem Modell direkt antworten"-Tasks (keine RAG, kein Browsing) ist das oft größer als ein Benchmark-Score. Output-Speed wird mit 304 Tokens/Sekunde für 3.6 Flash und 350 Tokens/Sekunde für Flash-Lite angegeben, was ändert, wieviel Latenz-Hiding dein UI machen muss.
Flash-Lite ist die eigentliche Story für High-Volume-Claude-Workflows
Für High-Volume-, latenz-sensitive Claude-Workflows — Klassifikation, Extraktion, Moderation, Autocomplete — ist Flash-Lite bei $0.30/$2.50 mit 1M-Token-Kontext und 350 tok/s jetzt der offensichtliche Cross-Check gegen Claude Haiku 4.5. Es ist kein Sonnet-Ersatz, und du solltest es nicht für planungsintensive Agent-Loops nutzen. Aber wenn du in deinem Stack ein "günstiges Modell hinter einer Queue"-Tier hast, budgetiere einen Tag, um es zu A/B-testen.
Migration: was ein Claude-Nutzer tatsächlich ändern muss
Die Gemini-API-Oberfläche änderte sich mit 3.6. Trägst du einen Claude-shaped Call rüber, brechen vier Dinge.
- Nutze `gemini-3.6-flash` für den Workhorse oder `gemini-3.5-flash-lite` für das günstige Tier. Es gibt keine öffentliche Model-ID für 3.5 Flash Cyber. 3.5 Pro liefert noch nicht — pinne nicht darauf.
- Diese Sampling-Knöpfe wurden aus 3.6 Flash und 3.5 Flash-Lite entfernt. Trägt dein Claude-seitiger Code sie via Shim rüber, wird Gemini sie je nach SDK ablehnen oder ignorieren. Lösche sie; das Modell handled Sampling jetzt intern.
- Das Integer-Tokens-`thinking_budget`-Feld wurde durch ein `thinking_level`-Enum ersetzt. Flash defaultet auf medium; Flash-Lite defaultet auf minimal. Setze es explizit, wenn du Budgets tunedest — du kannst das alte Integer nicht rübertragen.
- 3.6 Flash lehnt prefilled Model-Turns ab (eine Konversation, die auf einer nicht-leeren `model`-Rolle endet). Nutztest du Anthropic-artiges Prefill, um Output zu steuern, restrukturiere — Gemini wird den Request mit 400 abweisen.
- `candidate_count` ist auf 3.6 Flash unsupported. Requeststest du mehrere Completions in einem Call, rufe die API N-mal auf oder verschiebe den Job auf ein anderes Tier.
- In 3.6 Flash ist Computer Use — Bedienen eines GUI — jetzt ein *client-seitiges eingebautes Tool* im Gemini API und Gemini Enterprise, keine separate Integration. Aktiviere es im Tools-Block, statt ein separates SDK zu verkabeln. Anthropics Äquivalent lebt im [Claude-Computer-Use-Bereich](/docs/models/computer-use-agents).
Minimaler 3.6-Flash-Call (Python SDK)
from google import genai
client = genai.Client() # picks up GOOGLE_API_KEY
resp = client.models.generate_content(
model="gemini-3.6-flash",
contents="Extract the 3 riskiest lines from this diff and cite line numbers.",
config={
"thinking_level": "medium", # was thinking_budget=<int>
# do NOT pass temperature, top_p, top_k, candidate_count
"tools": [{"computer_use": {}}], # built-in, not a separate SDK
},
)
print(resp.text)Wann zu Gemini 3.6 Flash statt Claude greifen — und wann nicht
- Greif zu 3.6 Flash: High-Volume-Tool-Loops, wo Token-Effizienz Kosten dominiert, und Workflows, die vom März-2026-Knowledge-Cutoff profitieren (14 Monate frischer als das ältere 3.5 Flash).
- Greif zu Flash-Lite: Latenz-sensitive Klassifikation/Extraktion auf 1M-Token-Inputs, wo Haiku deine Baseline ist.
- Bleib auf Claude: SWE-Bench-Pro-artige Real-Repo-Bug-Fixes, lange Agent-Runs, wo Extended-Thinking-Disziplin zählt, und überall wo du Sonnet-5-Planungsqualität schon vertraust.
- Jag Flash Cyber nicht: außer du bist eine Regierung oder ein CodeMender-Partner, behandle seine Zahlen als Forschungssignal, nicht als Kaufentscheidung.
Für ein breiteres Gemini-vs-Claude-Framing, das vor diesem Release liegt, siehe Gemini for Claude users und das coding-fokussierte Claude vs GPT vs Gemini for coding. Für das Spiegelbild OpenAI-Launch zwei Wochen zuvor, GPT-5.6 Sol/Terra/Luna. Für die Cross-Modell-Porting-Regeln, die jeden dieser Swaps den Produktionskontakt überleben lassen, Porting Prompts Across Models.
Schnellcheck
Check yourself
0/4Quellen & weiterführende Lektüre
- Google DeepMind — Introducing Gemini 3.5 Flash Cyber
- Gemini API pricing (offiziell)
- Google AI Studio
- TechCrunch — Google releases three new Gemini models, but no 3.5 Pro
- SiliconANGLE — Google expands Gemini with cheaper models and a bug-hunter it keeps on a leash
- MarkTechPost — Google releases Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
- The Hacker News — Google Launches Gemini 3.5 Flash Cyber AI to Find and Fix Software Vulnerabilities
- Help Net Security — Google's Gemini 3.5 Flash Cyber becomes a vulnerability hunter