Claude Voice con Opus e Sonnet (luglio 2026): voce reasoning-first vs GPT-Live
- Capire cosa Anthropic ha effettivamente rilasciato il 23 luglio 2026 — e cosa deliberatamente non ha cambiato
- Sapere quando passare tra Haiku, Sonnet e Opus a metà conversazione e cosa cambia quando lo fai
- Usare i connettori di app (Gmail, Calendar, Docs, Slack) dalla voce senza sbattere contro il tetto del piano free
- Capire perché la voce a turni di Claude è una scommessa di design diversa dal full-duplex di GPT-Live di OpenAI — e scegliere lo strumento giusto per il lavoro
Il 23 luglio 2026 Anthropic ha aperto la modalità voce di Claude ai suoi modelli di reasoning più pesanti — Opus e Sonnet, insieme a Haiku — e ha collegato le app connesse (Gmail, Google Calendar, Google Docs, Slack, tra le altre) all'esperienza vocale. Due settimane prima, l'8 luglio, OpenAI aveva rilasciato GPT-Live, un sistema full-duplex speech-native che ascolta e parla contemporaneamente. Stessa settimana, due scommesse molto diverse su cosa dovrebbe essere la voice AI.
Questa pagina separa le due, perché la differenza conta per quello che dovresti davvero usare.
Cosa ha rilasciato Anthropic (e cosa deliberatamente no)
Ecco la parte non ovvia: Anthropic non ha aggiornato lo stack vocale in sé. Un portavoce dell'azienda ha detto a TechCrunch e altri che Claude mantiene il suo design a turni — "Claude ascolta, si ferma per pensare, poi risponde" — e il modello vocale sottostante non è stato cambiato con questo rilascio. Ciò che è cambiato è il modello di reasoning dietro la voce: ora puoi mettere il pensiero di Opus o l'equilibrio di Sonnet dietro lo scambio parlato, mentre prima ottenevi solo Haiku.
Questa impostazione predice tutto il resto in questa pagina:
- Aspettati risposte più profonde, non conversazione più fluida.
- Aspettati che richieste vocali con molti tool funzionino davvero (scrivi una mail, sposta una riunione), perché il modello dietro il microfono è ora abbastanza capace da pianificarle.
- Non aspettarti barge-in in stile GPT-Live, backchannel, o il modello che mormora "mhmm" mentre parli — quello richiede un modello full-duplex speech-native, cosa che la voce di Claude non è (ancora).
Se hai usato per ultimo Opus in chat testuale, la voce parte con Opus — ma sceglie la generazione più veloce di quella famiglia di modelli per mantenere la conversazione reattiva. Le tue abitudini in modalità testo impostano i default vocali. Cambiare modello nel testo è il modo più semplice per cambiare ciò che la voce ti serve la prossima volta che tocchi il microfono.
La scommessa a turni vs il full-duplex di GPT-Live
Entrambi gli annunci sono arrivati negli stessi 15 giorni. Stanno risolvendo problemi diversi.
| Claude Voice (23 luglio 2026) | GPT-Live (8 luglio 2026) | |
|---|---|---|
| Architettura | A turni: pipeline STT → LLM → TTS (vedi voice AI full-duplex) | Full-duplex speech-native — un modello che consuma e produce audio direttamente |
| Interruzioni / backchannel | No; ascolta, poi risponde | Sì; può interrompere, dire "mhmm", stare zitto |
| Livelli di modello nella voce | Haiku, Sonnet, Opus (a pagamento); solo Haiku (free) | GPT-Live-1 (a pagamento), GPT-Live-1 mini (default, incl. free) |
| Profondità di reasoning | Eredita il tuo modello testuale — Opus ora può pensare nella voce | Front-end conversazionale veloce; delega il reasoning pesante a un modello frontier in background |
| Tool connessi nella voce | Gmail, Google Calendar, Google Docs, Slack (a pagamento = multipli; free = uno) | Uso di tool voice-native durante la conversazione |
| Profilo di latenza | Depth-first: modello più pesante = risposta più profonda, pausa più lunga prima che parli | Latency-first: progettato per turn-taking simile all'umano |
| API sviluppatori | Nessuna API vocale per sviluppatori al momento della scrittura | GPT-Live non ancora in API; gpt-realtime resta il prodotto sviluppatori attuale |
Scegli Claude voice quando vuoi pensare ad alta voce con un modello di reasoning forte e fare lavoro vero nelle tue app connesse tramite voce. Scegli GPT-Live quando la conversazione in sé conta più della profondità — interviste, tutoraggio, pratica linguistica, tutto ciò dove interruzione e scambio rapido sono il punto. Entrambi possono essere giusti nella stessa settimana.
L'inquadratura di Anthropic stessa è rivelatrice: "focused on intelligence and tool access." È il modo onesto di descrivere cosa è cambiato. Se qualcuno ti dice "la modalità voce Opus è più naturale" — non lo è. È più intelligente e ora può toccare la tua inbox e il calendario, ma la sensazione conversazionale è la stessa esperienza a turni di prima.
Far funzionare l'aggiornamento
- L'upgrade è in rollout beta sulle app mobile di Anthropic, Claude Desktop e l'app web. Se non vedi ancora il model picker, controlla un aggiornamento dell'app e riapri il pannello vocale.
- La voce di default usa l'ultimo modello che hai scelto in chat testuale, e usa la versione più veloce di quella famiglia. Se ieri eri su Opus nel testo, oggi la voce parte su Opus. Per cambiare il default, cambia modello prima in una chat testuale.
- Dentro una chiamata vocale live, il model picker ti fa saltare tra Haiku, Sonnet e Opus senza terminare la chiamata. Usalo quando il task cambia — capture su Haiku, approfondimento su Sonnet o Opus.
- Aggiungi connettori (Gmail, Google Calendar, Google Docs, Slack) sotto Impostazioni → Connettori. I piani a pagamento (Pro, Max, Team, Enterprise) ne permettono multipli; il free è limitato a Haiku e un tool connesso.
- Anthropic avverte che usare più tool contemporaneamente può aggiungere un breve ritardo, e i risultati dei tool potrebbero non essere visualizzati completamente nella voce. Pattern comune: inizia a voce, poi passa alla vista testo nella stessa chat per rivedere la mail scritta o il documento restituito.
Richiesta vocale che usa davvero il nuovo accesso ai tool
"Reschedule my 3 pm with Sara to Thursday morning, draft a short apology email in Gmail, and add the new slot to the shared team calendar — read the draft back to me before sending."
Quella singola frase ora funziona perché (a) il modello dietro il microfono è abbastanza capace da pianificare la sequenza, (b) i connettori Google Calendar e Gmail sono attivi nella voce, e (c) "read it back before sending" è esattamente il checkpoint che vuoi quando non puoi vedere lo schermo.
Il model picker: quando passare a cosa
Il picker è la leva singola più utile dell'aggiornamento. Regola pratica:
- Haiku — capture, risposte rapide, camminata-e-parlata, e tutto sul piano free. Il più economico e veloce.
- Sonnet — l'equilibrio di default. Scambio abbastanza lungo, feedback su un pitch, pianificazione di un piccolo task, stesura di messaggi che usano uno o due tool.
- Opus — reasoning profondo a voce: strategia, code review a orecchio, sequenze di tool multi-step ("guarda questi tre documenti, riassumi le differenze, poi scrivi una mail"). Aspettati pause visibilmente più lunghe prima che inizi a parlare — è la profondità che hai chiesto.
Una mossa da esperti: inizia una chiamata su Haiku per catturare il contesto in fretta, poi passa a Opus per il momento "ora pensa a tutto quello". Ottieni la reattività di Haiku durante il setup caotico e la profondità di Opus solo dove conta — senza pagare la latenza di Opus sull'intera conversazione.
App connesse nella voce — cosa funziona davvero
Al lancio, i connettori riportati come funzionanti nella voce più costantemente sono Gmail, Google Calendar, Google Docs e Slack. Diverse testate elencano anche Canva e Notion — Anthropic rilascia nuovi connettori regolarmente, quindi tratta qualsiasi elenco specifico come un bersaglio in movimento e controlla il tuo pannello Impostazioni → Connettori per vedere cosa è effettivamente disponibile per te.
Il piano free ottiene una app connessa; i piani a pagamento ne ottengono multipli. Quel tetto a una singola app è il punto in cui il piano free inizia a sembrare palesemente più stretto — la voce è dove "connettere tutti i miei tool" ripaga da solo.
Un triage mattutino a mani libere
"Read me the subject lines and first sentences of unread emails from the last 12 hours, group them by whether they need a reply today, and add three follow-up reminders to my calendar for tomorrow morning."
Pattern pratici e trappole
Alcune cose che vale la pena interiorizzare:
- La lingua va impostata manualmente. La voce supporta inglese, francese, tedesco, hindi, indonesiano, italiano, giapponese, coreano, portoghese (brasiliano) e spagnolo. Devi scegliere la tua lingua — il modello non la rileva automaticamente.
- Le chiamate multi-tool aggiungono latenza. Se la risposta è lenta, di solito è perché il modello sta chiamando due o tre connettori in sequenza. Chiedi meno cose per turno.
- I risultati dei tool potrebbero non essere visualizzati completamente nella voce. Usa la voce per iniziare; passa alla vista testo della stessa chat per ispezionare cosa Claude ha effettivamente fatto. La chat è un singolo artefatto — il microfono e il campo di testo sono solo due modi per entrarci.
- La voce è a valle della tua memoria e delle preferenze della chat testuale. Se usi Memory, la voce vede lo stesso contesto personale. Se usi Reflect, le sessioni vocali contano nel tuo recap mensile.
- Non è un sistema full-duplex. Se ti sorprendi a desiderare di poter interrompere pulitamente o sentire un "mhmm" mentre pensi — è un segnale che il tuo task in realtà vuole GPT-Live o una demo di ricerca come Kyutai Moshi, non Claude voice. Strumento diverso.
- L'aggiornamento del 23 luglio 2026 ha cambiato il modello dietro la voce di Claude — non lo stack vocale. Stessa architettura a turni, reasoning più profondo e accesso reale ai tool sopra.
- La voce eredita il tuo ultimo modello di chat testuale e usa la sua versione più veloce. Cambia modello nel testo per cambiare il default vocale.
- Il model picker dentro una chiamata live ti fa saltare Haiku → Sonnet → Opus a metà conversazione — usalo per mantenere la reattività di Haiku per la capture e la profondità di Opus per il momento della verità.
- Piano free: solo Haiku + una app connessa. Il piano a pagamento è dove la voce inizia a sembrare un vero assistente, perché l'accesso multi-tool è dove il modello guadagna il suo posto.
- La scommessa di Claude è intelligenza + tool su una pipeline convenzionale; la scommessa di OpenAI con GPT-Live è la conversazione full-duplex. Entrambe sono risposte corrette a problemi diversi.
Verifica
Verifica
0/4Flashcard
Fonti e approfondimenti
- Anthropic updates Claude voice mode with more capable models — TechCrunch (23 luglio 2026)
- Anthropic brings Opus and Sonnet to Claude Voice Mode — Unite.AI
- Anthropic adds model choice to Claude Voice Mode for all users — SQ Magazine
- Claude Voice Mode adds Sonnet, Opus, and app connectors — TechMyMoney (23 luglio 2026)
- OpenAI releases new voice models for more natural live conversations — TechCrunch (8 luglio 2026)
- Pagine correlate su AILmanac: Voice AI full-duplex (GPT-Live, Moshi e il problema dei 200 ms) · Parlare con Claude (modalità voce) · Connettori · Scegliere un modello