Zum Hauptinhalt springen

Gemini 3.6 Flash, Flash-Lite & Flash Cyber für Claude-Nutzer

Fortgeschritten

Google wurde erwartet, im Juli 2026 Gemini 3.5 Pro auszuliefern. Stattdessen lieferten sie am 21. Juli 2026 drei Flash-Tier-ModelleGemini 3.6 Flash, Gemini 3.5 Flash-Lite und Gemini 3.5 Flash Cyber — und ließen das Pro-Tier im Partner-Testing. Baust du auf Claude und nutzt Gemini als Cross-Check, zählt die Form dieses Releases mehr als jeder einzelne Benchmark: Google sagt dem Markt, dass das Workhorse-Tier, nicht der Flagship, dort ist, wo das echte Geld liegt. Diese Seite führt einen Claude-Nutzer durch, was tatsächlich landete, zu welchem Preis, und was bricht, wenn du einen bestehenden Call portierst.

What you'll learn
  • Verstehe, was am 21. Juli 2026 gelaunched wurde — drei Flash-Modelle und warum Google 3.5 Pro übersprang
  • Lies die Preistabelle ehrlich: 17% günstigerer Output plus 17% weniger Output-Tokens kompoundieren zu einem ~30% realen Kostendrop
  • Wisse, wann Flash-Lite ($0.30 in / $2.50 out, 350 tok/s, 1M Kontext) der richtige Cross-Check gegen Claude Haiku ist
  • Sieh, wie Flash Cyber Claude Opus 4.6 beim V8-Bug-Hunting übertraf — und warum du es fast sicher nicht nutzen kannst
  • Migriere sauber: welche Sampling-Knöpfe entfernt wurden und was das neue thinking_level-Enum akzeptiert

Die Ein-Satz-Version

Googles Release vom 21. Juli 2026 ist ein Flash-Tier-Refresh ohne Pro — ein neuer Workhorse (3.6 Flash, $1.50 in / $7.50 out, 1M Kontext, Computer Use eingebaut), ein günstigeres High-Throughput-Geschwister (3.5 Flash-Lite, $0.30 in / $2.50 out, 350 Tokens/Sekunde) und ein nur-Security-Fine-Tune (3.5 Flash Cyber), den Google über sein CodeMender-Programm auf Regierungen und trusted Partner gated.

Die interessante Geschichte ist nicht das Modell. Es ist die Wahl: Google pushte einen Workhorse und ein günstiges Tier, während es Pro explizit zurückhielt, und Logan Kilpatrick sagte, Pro sei "currently testing with partners" nach verfehlten internen Performance-Zielen. Das ist eine andere Wette als das OpenAI GPT-5.6 Launch zwei Wochen zuvor, das mit einem Flagship (Sol) führte — siehe die GPT-5.6 Sol/Terra/Luna-Seite für den Spiegelbild-Vergleich.

Drei Dinge an diesem Launch, die Leute überraschen

Jeder schreibt die "17% günstiger"-Schlagzeile. Hier sind die Details, die ein Claude-Nutzer nicht verpassen sollte.

1. Google übersprang 3.5 Pro — öffentlich

So liefert Google üblicherweise nicht aus. In früheren Refreshes führte der Flagship den Launch an und die kleineren Geschwister folgten. Am 21. Juli 2026 lieferte Google nur Flash-Class-Modelle aus und bestätigte, 3.5 Pro sei nach verfehlten internen Performance-Zielen weiter im Partner-Testing. Produktleiter Logan Kilpatrick sagte, das Team hoffe, "bald zu landen". Lies das wörtlich: auf der höchsten Intelligenzstufe hat Google noch keinen Step-Funktion, die es ausliefern kann. Es hat einen starken Workhorse und einen Bug-Hunter, den es gated. Hängt dein Workflow von "dem schlausten Gemini, das du kaufen kannst" ab, ist das heute noch 3.5 Pro-Preview oder das ältere 3.5 Ultra-Tier — kein Juli-2026-Modell.

2. Der 17%-Output-Preis-Cut ist eigentlich ~30%, weil Output-Tokens auch um 17% fielen

Die Launch-Grafik zeigt Gemini 3.6 Flash Output-Pricing bei $7.50 pro 1M Tokens, runter von $9 auf 3.5 Flash — ein 17%-Cut. Schau eine Zeile tiefer: Google berichtet auch 17% weniger Output-Tokens auf denselben Workloads (gemessen am Artificial Analysis Index). Die kompoundieren: 0.83 × 0.83 ≈ 0.69, sodass Real-World-Output-Kosten auf vergleichbaren Jobs grob 31% fallen, nicht 17%. Auf DeepSWE claimt Google Token-Reduktionen "bis zu 65%". Wenn du eine Claude-Sonnet-5-Pipeline gegen 3.6 Flash cross-checkst, mach die Multiplikation, bevor du entscheidest, ob du swappst — die Schlagzeile understated das Delta.

3. Flash Cyber schlug Claude Opus 4.6 beim V8-Bug-Hunting — aber du kannst es fast sicher nicht nutzen

Google berichtet, dass Gemini 3.5 Flash Cyber 55 unique bestätigte Vulnerabilities in internen V8-JavaScript-Engine-Benchmarks entdeckte, gegen 47 für Standard-3.5 Flash und 36 für Claude Opus 4.6. Zehn dieser Bugs wurden von keinem anderen Modell gefunden. Auf dem CyberGym-Benchmark landet es bei 83.2%, nahe an Claude Mythos 5 (83.8%) und GPT-5.5-Cyber (85.6%). Beeindruckend — und gated. Flash Cyber liefert nur über Googles CodeMender-Programm an Regierungen und trusted Enterprise-Partner. Kein öffentliches API, kein Pricing, kein Self-Serve-Zugang. Sahst du eine Schlagzeile, die sagte "Googles Cyber-KI schlug Claude" und erwartetest zu testen: du kannst nicht. Das Takeaway, das ein Verteidiger extrahieren sollte, ist nicht "Modelle swappen"; es ist, dass Fine-Tuning eines Mid-Tier-Modells auf eine schmale Domain jetzt ein größeres General-Purpose-Modell auf dieser Domain schlägt. Dieses Muster wird sich wiederholen.

Die Tier-Tabelle (Stand 21. Juli 2026)

ModellInput $/1MOutput $/1MCached Input $/1MKontextMax OutputNotes
Gemini 3.6 Flash$1.50$7.50$0.151,048,57665,536Workhorse; Computer Use eingebaut
Gemini 3.5 Flash-Lite$0.30$2.50(nicht angegeben)1,048,57665,536350 Tokens/Sekunde Output; Rollout in Google Search
Gemini 3.5 Flash Cyber(nicht öffentlich)(nicht öffentlich)(nicht öffentlich)(nicht öffentlich)(nicht öffentlich)Nur Regierungen & trusted Partner via CodeMender

Benchmark-Deltas, die Google für 3.6 Flash vs. 3.5 Flash publizierte (höher ist besser):

  • DeepSWE: 49% vs. 37% (+12 Punkte)
  • MLE Bench: 63.9% vs. 49.7% (+14.2 Punkte)
  • OSWorld-Verified: 83.0% vs. 78.4% (+4.6 Punkte)
  • GDPval-AA v2: 1421 Elo vs. 1349 (+72 Elo)
  • GPQA Diamond: 92.8%
  • MMMU-Pro: 83.2%
  • Humanity's Last Exam: 38.3%
  • Chatbot Arena Elo (Text Overall): 1485
  • Artificial Analysis Coding Index: 69.2%

Zwei Knöpfe sind nützlicher als jede einzelne Benchmark-Zeile. Knowledge Cutoff sprang von Januar 2025 auf März 2026 — ein 14-Monats-Sprung. Für "aus dem Modell direkt antworten"-Tasks (keine RAG, kein Browsing) ist das oft größer als ein Benchmark-Score. Output-Speed wird mit 304 Tokens/Sekunde für 3.6 Flash und 350 Tokens/Sekunde für Flash-Lite angegeben, was ändert, wieviel Latenz-Hiding dein UI machen muss.

Flash-Lite ist die eigentliche Story für High-Volume-Claude-Workflows

Drücke Enter oder die Leertaste, um die Karte umzudrehen. Nutze die Pfeiltasten links und rechts, um zwischen den Karten zu wechseln.Begriff angezeigt.
1 / 6

Für High-Volume-, latenz-sensitive Claude-Workflows — Klassifikation, Extraktion, Moderation, Autocomplete — ist Flash-Lite bei $0.30/$2.50 mit 1M-Token-Kontext und 350 tok/s jetzt der offensichtliche Cross-Check gegen Claude Haiku 4.5. Es ist kein Sonnet-Ersatz, und du solltest es nicht für planungsintensive Agent-Loops nutzen. Aber wenn du in deinem Stack ein "günstiges Modell hinter einer Queue"-Tier hast, budgetiere einen Tag, um es zu A/B-testen.

Migration: was ein Claude-Nutzer tatsächlich ändern muss

Die Gemini-API-Oberfläche änderte sich mit 3.6. Trägst du einen Claude-shaped Call rüber, brechen vier Dinge.

Guided walkthrough1 of 6
  1. Nutze `gemini-3.6-flash` für den Workhorse oder `gemini-3.5-flash-lite` für das günstige Tier. Es gibt keine öffentliche Model-ID für 3.5 Flash Cyber. 3.5 Pro liefert noch nicht — pinne nicht darauf.

Minimaler 3.6-Flash-Call (Python SDK)

from google import genai

client = genai.Client()  # picks up GOOGLE_API_KEY
resp = client.models.generate_content(
  model="gemini-3.6-flash",
  contents="Extract the 3 riskiest lines from this diff and cite line numbers.",
  config={
      "thinking_level": "medium",   # was thinking_budget=<int>
      # do NOT pass temperature, top_p, top_k, candidate_count
      "tools": [{"computer_use": {}}],  # built-in, not a separate SDK
  },
)
print(resp.text)

Wann zu Gemini 3.6 Flash statt Claude greifen — und wann nicht

Pro tip
  • Greif zu 3.6 Flash: High-Volume-Tool-Loops, wo Token-Effizienz Kosten dominiert, und Workflows, die vom März-2026-Knowledge-Cutoff profitieren (14 Monate frischer als das ältere 3.5 Flash).
  • Greif zu Flash-Lite: Latenz-sensitive Klassifikation/Extraktion auf 1M-Token-Inputs, wo Haiku deine Baseline ist.
  • Bleib auf Claude: SWE-Bench-Pro-artige Real-Repo-Bug-Fixes, lange Agent-Runs, wo Extended-Thinking-Disziplin zählt, und überall wo du Sonnet-5-Planungsqualität schon vertraust.
  • Jag Flash Cyber nicht: außer du bist eine Regierung oder ein CodeMender-Partner, behandle seine Zahlen als Forschungssignal, nicht als Kaufentscheidung.

Für ein breiteres Gemini-vs-Claude-Framing, das vor diesem Release liegt, siehe Gemini for Claude users und das coding-fokussierte Claude vs GPT vs Gemini for coding. Für das Spiegelbild OpenAI-Launch zwei Wochen zuvor, GPT-5.6 Sol/Terra/Luna. Für die Cross-Modell-Porting-Regeln, die jeden dieser Swaps den Produktionskontakt überleben lassen, Porting Prompts Across Models.

Schnellcheck

Check yourself

0/4
  1. Welches Modell hat Google am 21. Juli 2026 **nicht** ausgeliefert?
  2. Warum understated der '17%-Output-Preis-Cut' den echten Kostendrop für 3.6 Flash?
  3. Welcher Sampling-Parameter ist auf Gemini 3.6 Flash noch valide?
  4. Was ist die echte Zugangsgeschichte für Gemini 3.5 Flash Cyber?

Quellen & weiterführende Lektüre