Claude Voice mit Opus & Sonnet (Juli 2026): Reasoning-First Voice vs. GPT-Live
- Verstehen, was Anthropic am 23. Juli 2026 tatsächlich ausgeliefert hat — und was es bewusst nicht verändert hat
- Wissen, wann man mitten im Gespräch zwischen Haiku, Sonnet und Opus wechselt und was sich dabei verändert
- Die Connected-App-Konnektoren (Gmail, Calendar, Docs, Slack) aus dem Voice-Modus heraus nutzen, ohne an die Grenzen des kostenlosen Tarifs zu stoßen
- Verstehen, warum Claudes turn-basierte Voice-Lösung eine andere Design-Wette ist als OpenAIs Full-Duplex-GPT-Live — und das richtige Werkzeug für die jeweilige Aufgabe wählen
Am 23. Juli 2026 hat Anthropic Claudes Voice-Modus für seine leistungsfähigeren Reasoning-Modelle geöffnet — Opus und Sonnet, neben Haiku — und hat Connected Apps (Gmail, Google Calendar, Google Docs, Slack und weitere) in das Voice-Erlebnis integriert. Zwei Wochen zuvor, am 8. Juli, hatte OpenAI GPT-Live ausgeliefert, ein sprach-natives Full-Duplex-System, das gleichzeitig zuhört und spricht. Selbe Woche, zwei sehr unterschiedliche Wetten darauf, was Voice AI sein sollte.
Diese Seite trennt die beiden voneinander, denn der Unterschied ist entscheidend dafür, wozu du tatsächlich greifen solltest.
Was Anthropic ausgeliefert hat (und was bewusst nicht)
Hier der nicht offensichtliche Teil: Anthropic hat den Voice-Stack selbst nicht aufgerüstet. Ein Unternehmenssprecher sagte TechCrunch und anderen, dass Claude sein turn-basiertes Design beibehält — "Claude hört zu, pausiert zum Nachdenken, antwortet dann" — und das zugrundeliegende Sprachmodell wurde mit diesem Release nicht verändert. Was sich geändert hat, ist das Reasoning-Modell hinter der Stimme: Du kannst jetzt Opus' Denken oder Sonnets Balance hinter das gesprochene Hin und Her setzen, wo du zuvor nur Haiku bekamst.
Dieser Rahmen erklärt alles andere auf dieser Seite:
- Erwarte tiefere Antworten, kein flüssigeres Gespräch.
- Erwarte, dass tool-lastige Voice-Anfragen tatsächlich funktionieren (eine E-Mail entwerfen, ein Meeting verschieben), weil das Modell hinter dem Mikrofon jetzt leistungsfähig genug ist, sie zu planen.
- Erwarte nicht Barge-in im GPT-Live-Stil, Backchannels oder dass das Modell "mhmm" murmelt, während du sprichst — das erfordert ein sprach-natives Full-Duplex-Modell, was Claude Voice (noch) nicht ist.
Wenn du zuletzt Opus im Text-Chat verwendet hast, startet Voice mit Opus — aber es wählt die schnellste Generation dieser Modellfamilie, um das Gespräch reaktionsfreudig zu halten. Deine Text-Modus-Gewohnheiten legen deine Voice-Standards fest. Das Modell im Text zu wechseln ist der einfachste Weg zu ändern, was Voice dir beim nächsten Antippen des Mikrofons vorsetzt.
Die turn-basierte Wette vs. Full-Duplex-GPT-Live
Beide Ankündigungen landeten in denselben 15 Tagen. Sie lösen unterschiedliche Probleme.
| Claude Voice (23. Juli 2026) | GPT-Live (8. Juli 2026) | |
|---|---|---|
| Architektur | Turn-basiert: STT → LLM → TTS-Pipeline (siehe Full-Duplex-Voice-AI) | Sprach-nativ Full-Duplex — ein Modell, das Audio direkt konsumiert und erzeugt |
| Unterbrechungen / Backchannels | Nein; hört zu, antwortet dann | Ja; kann unterbrechen, "mhmm" sagen, still bleiben |
| Modellstufen in Voice | Haiku, Sonnet, Opus (bezahlt); nur Haiku (kostenlos) | GPT-Live-1 (bezahlt), GPT-Live-1 mini (Standard, inkl. kostenlos) |
| Reasoning-Tiefe | Übernimmt dein Text-Modell — Opus kann jetzt in Voice denken | Schnelles konversationelles Front-End; delegiert schweres Reasoning an ein Frontier-Modell im Hintergrund |
| Connected Tools in Voice | Gmail, Google Calendar, Google Docs, Slack (bezahlt = mehrere; kostenlos = eines) | Voice-nativer Tool-Einsatz während des Gesprächs |
| Latenzprofil | Tiefe zuerst: schwereres Modell = tiefere Antwort, längere Pause vor dem Sprechen | Latenz zuerst: entworfen für ~menschenähnliches Turn-Taking |
| Entwickler-API | Zum Zeitpunkt des Schreibens keine Entwickler-Voice-API | GPT-Live noch nicht in der API; gpt-realtime bleibt das aktuelle Entwicklerprodukt |
Wähle Claude Voice, wenn du laut denken möchtest mit einem starken Reasoning-Modell und echte Arbeit in deinen Connected Apps per Stimme erledigen willst. Wähle GPT-Live, wenn das Gespräch selbst wichtiger ist als die Tiefe — Interviews, Nachhilfe, Sprachübungen, alles, wo Unterbrechung und schneller Austausch der Punkt sind. Beide können in derselben Woche richtig sein.
Anthropics eigene Formulierung ist verräterisch: "fokussiert auf Intelligenz und Tool-Zugriff." Das ist die ehrliche Art, das zu beschreiben, was sich geändert hat. Wenn dir jemand sagt "Opus Voice Mode fühlt sich natürlicher an" — tut es nicht. Es ist smarter und kann jetzt auf deinen Posteingang und Kalender zugreifen, aber das konversationelle Gefühl ist dieselbe turn-basierte Erfahrung wie zuvor.
Das Update zum Laufen bringen
- Das Upgrade wird in der Beta-Phase über Anthropics Mobile-Apps, Claude Desktop und die Web-App ausgerollt. Wenn du den Modell-Picker noch nicht siehst, prüfe auf ein App-Update und öffne das Voice-Sheet erneut.
- Voice greift standardmäßig auf das zuletzt im Text-Chat ausgewählte Modell zurück und läuft in der schnellsten Version dieser Familie. Warst du gestern im Text auf Opus, startet Voice heute mit Opus. Um den Standard zu ändern, wechsle das Modell zuerst in einem Text-Chat.
- In einem laufenden Voice-Anruf erlaubt dir der Modell-Picker, zwischen Haiku, Sonnet und Opus zu springen, ohne den Anruf zu beenden. Nutze ihn, wenn sich die Aufgabe ändert — erfassen mit Haiku, vertiefen mit Sonnet oder Opus.
- Füge Konnektoren (Gmail, Google Calendar, Google Docs, Slack) unter Einstellungen → Konnektoren hinzu. Bezahlte Pläne (Pro, Max, Team, Enterprise) erlauben mehrere; kostenlos ist auf Haiku und ein verbundenes Tool beschränkt.
- Anthropic warnt, dass die gleichzeitige Nutzung mehrerer Tools eine kurze Verzögerung hinzufügen kann und Tool-Ergebnisse in Voice möglicherweise nicht vollständig angezeigt werden. Ein häufiges Muster: per Stimme initiieren, dann in derselben Konversation zur Textansicht wechseln, um den entworfenen E-Mail-Text oder das zurückgegebene Dokument zu prüfen.
Voice-Anfrage, die den neuen Tool-Zugriff tatsächlich nutzt
"Reschedule my 3 pm with Sara to Thursday morning, draft a short apology email in Gmail, and add the new slot to the shared team calendar — read the draft back to me before sending."
Diese einzelne Äußerung funktioniert jetzt, weil (a) das Modell hinter dem Mikrofon leistungsfähig genug ist, die Sequenz zu planen, (b) Google Calendar- und Gmail-Konnektoren in Voice live sind und (c) "lies es mir vor dem Senden vor" genau der Kontrollpunkt ist, den du willst, wenn du den Bildschirm nicht sehen kannst.
Der Modell-Picker: wann zu was wechseln
Der Picker ist der einzelne nützlichste Hebel im Update. Faustregel:
- Haiku — erfassen, schnelle Antworten, unterwegs sprechen und alles im kostenlosen Tarif. Am günstigsten und schnellsten.
- Sonnet — die Standard-Balance. Ausreichend langes Hin und Her, Feedback zu einem Pitch, Planung einer kleinen Aufgabe, Entwurf von Nachrichten, die ein oder zwei Tools nutzen.
- Opus — tiefes Reasoning per Stimme: Strategie, Code-Review per Gehör, mehrstufige Tool-Sequenzen ("schau dir diese drei Dokumente an, fasse die Unterschiede zusammen, dann entwirf eine E-Mail"). Erwarte spürbar längere Pausen, bevor es zu sprechen beginnt — das ist die Tiefe, um die du gebeten hast.
Ein Power-Move: Starte einen Anruf mit Haiku, um schnell Kontext zu erfassen, wechsle dann zu Opus für den "denke jetzt über all das nach"-Moment. Du bekommst die Reaktionsfreudigkeit von Haiku während der chaotischen Einrichtung und die Tiefe von Opus nur dort, wo sie zählt — ohne Opus' Latenz für das gesamte Gespräch zu zahlen.
Connected Apps in Voice — was tatsächlich funktioniert
Zum Start sind die Konnektoren, von denen am konsistentesten berichtet wird, dass sie in Voice funktionieren, Gmail, Google Calendar, Google Docs und Slack. Mehrere Publikationen listen auch Canva und Notion auf — Anthropic liefert regelmäßig neue Konnektoren aus, betrachte also jede spezifische Liste als bewegliches Ziel und prüfe dein Einstellungen → Konnektoren-Sheet für das, was dir tatsächlich zur Verfügung steht.
Der kostenlose Tarif bekommt eine verbundene App; bezahlte Pläne bekommen mehrere. Diese Ein-App-Obergrenze ist der Punkt, an dem sich der kostenlose Tarif offensichtlich enger anfühlt — Voice ist der Ort, wo "alle meine Tools verbinden" sich bezahlt macht.
Freihändige Morgen-Triage
"Read me the subject lines and first sentences of unread emails from the last 12 hours, group them by whether they need a reply today, and add three follow-up reminders to my calendar for tomorrow morning."
Praktische Muster und Fallstricke
Einige Dinge, die es sich zu verinnerlichen lohnt:
- Die Sprache muss manuell festgelegt werden. Voice unterstützt Englisch, Französisch, Deutsch, Hindi, Indonesisch, Italienisch, Japanisch, Koreanisch, Portugiesisch (brasilianisch) und Spanisch. Du musst deine Sprache auswählen — das Modell erkennt sie nicht automatisch.
- Multi-Tool-Aufrufe fügen Latenz hinzu. Wenn die Antwort langsam ist, liegt es normalerweise daran, dass das Modell zwei oder drei Konnektoren nacheinander aufruft. Frage nach weniger Dingen pro Zug.
- Tool-Ergebnisse werden in Voice möglicherweise nicht vollständig angezeigt. Nutze Voice zum Initiieren; wechsle zur Textansicht desselben Chats, um zu prüfen, was Claude tatsächlich getan hat. Der Chat ist ein Artefakt — das Mikrofon und das Textfeld sind nur zwei Wege in ihn hinein.
- Voice steht stromabwärts deines Text-Chat-Gedächtnisses und deiner Präferenzen. Wenn du Memory verwendest, sieht Voice denselben persönlichen Kontext. Wenn du Reflect verwendest, zählen Voice-Sitzungen für deine monatliche Zusammenfassung.
- Dies ist kein Full-Duplex-System. Wenn du dich dabei ertappst, dir zu wünschen, sauber unterbrechen zu können oder ein "mhmm" zu hören, während du denkst — das ist ein Signal, dass deine Aufgabe eigentlich GPT-Live oder eine Forschungsdemo wie Kyutai Moshi verlangt, nicht Claude Voice. Anderes Werkzeug.
- Das Update vom 23. Juli 2026 hat das Modell hinter Claudes Stimme verändert — nicht den Voice-Stack. Dieselbe turn-basierte Architektur, tieferes Reasoning und echter Tool-Zugriff obendrauf.
- Voice übernimmt dein letztes Text-Chat-Modell und läuft in dessen schnellster Version. Ändere das Modell im Text, um deinen Voice-Standard zu ändern.
- Der Modell-Picker in einem laufenden Anruf erlaubt dir, mitten im Gespräch von Haiku → Sonnet → Opus zu springen — nutze ihn, um Haikus Reaktionsfreudigkeit für die Erfassung und Opus' Tiefe für die Auszahlung zu behalten.
- Kostenloser Tarif: nur Haiku + eine verbundene App. Der bezahlte Tarif ist der Ort, an dem Voice beginnt, sich wie ein vollwertiger Assistent anzufühlen, denn Multi-Tool-Zugriff ist der Ort, an dem das Modell seinen Wert unter Beweis stellt.
- Claudes Wette ist Intelligenz + Tools auf einer konventionellen Pipeline; OpenAIs GPT-Live setzt auf Full-Duplex-Konversation. Beide sind korrekte Antworten auf unterschiedliche Probleme.
Prüfe dich selbst
Prüfe dich selbst
0/4Karteikarten
Quellen & weiterführende Literatur
- Anthropic updates Claude voice mode with more capable models — TechCrunch (23. Juli 2026)
- Anthropic bringt Opus und Sonnet in den Claude Voice Mode — Unite.AI
- Anthropic fügt Modellauswahl für alle Nutzer zum Claude Voice Mode hinzu — SQ Magazine
- Claude Voice Mode fügt Sonnet, Opus und App-Konnektoren hinzu — TechMyMoney (23. Juli 2026)
- OpenAI veröffentlicht neue Voice-Modelle für natürlichere Live-Gespräche — TechCrunch (8. Juli 2026)
- Verwandte Seiten auf AILmanac: Full-Duplex-Voice-AI (GPT-Live, Moshi und das 200-ms-Problem) · Mit Claude sprechen (Voice Mode) · Konnektoren · Ein Modell wählen