Passa al contenuto principale

Claude Voice con Opus e Sonnet (luglio 2026): voce reasoning-first vs GPT-Live

Principiante
What you'll learn
  • Capire cosa Anthropic ha effettivamente rilasciato il 23 luglio 2026 — e cosa deliberatamente non ha cambiato
  • Sapere quando passare tra Haiku, Sonnet e Opus a metà conversazione e cosa cambia quando lo fai
  • Usare i connettori di app (Gmail, Calendar, Docs, Slack) dalla voce senza sbattere contro il tetto del piano free
  • Capire perché la voce a turni di Claude è una scommessa di design diversa dal full-duplex di GPT-Live di OpenAI — e scegliere lo strumento giusto per il lavoro

Il 23 luglio 2026 Anthropic ha aperto la modalità voce di Claude ai suoi modelli di reasoning più pesanti — Opus e Sonnet, insieme a Haiku — e ha collegato le app connesse (Gmail, Google Calendar, Google Docs, Slack, tra le altre) all'esperienza vocale. Due settimane prima, l'8 luglio, OpenAI aveva rilasciato GPT-Live, un sistema full-duplex speech-native che ascolta e parla contemporaneamente. Stessa settimana, due scommesse molto diverse su cosa dovrebbe essere la voice AI.

Questa pagina separa le due, perché la differenza conta per quello che dovresti davvero usare.

Cosa ha rilasciato Anthropic (e cosa deliberatamente no)

Ecco la parte non ovvia: Anthropic non ha aggiornato lo stack vocale in sé. Un portavoce dell'azienda ha detto a TechCrunch e altri che Claude mantiene il suo design a turni — "Claude ascolta, si ferma per pensare, poi risponde" — e il modello vocale sottostante non è stato cambiato con questo rilascio. Ciò che è cambiato è il modello di reasoning dietro la voce: ora puoi mettere il pensiero di Opus o l'equilibrio di Sonnet dietro lo scambio parlato, mentre prima ottenevi solo Haiku.

Questa impostazione predice tutto il resto in questa pagina:

  • Aspettati risposte più profonde, non conversazione più fluida.
  • Aspettati che richieste vocali con molti tool funzionino davvero (scrivi una mail, sposta una riunione), perché il modello dietro il microfono è ora abbastanza capace da pianificarle.
  • Non aspettarti barge-in in stile GPT-Live, backchannel, o il modello che mormora "mhmm" mentre parli — quello richiede un modello full-duplex speech-native, cosa che la voce di Claude non è (ancora).
Pro tip

Se hai usato per ultimo Opus in chat testuale, la voce parte con Opus — ma sceglie la generazione più veloce di quella famiglia di modelli per mantenere la conversazione reattiva. Le tue abitudini in modalità testo impostano i default vocali. Cambiare modello nel testo è il modo più semplice per cambiare ciò che la voce ti serve la prossima volta che tocchi il microfono.

La scommessa a turni vs il full-duplex di GPT-Live

Entrambi gli annunci sono arrivati negli stessi 15 giorni. Stanno risolvendo problemi diversi.

Claude Voice (23 luglio 2026)GPT-Live (8 luglio 2026)
ArchitetturaA turni: pipeline STT → LLM → TTS (vedi voice AI full-duplex)Full-duplex speech-native — un modello che consuma e produce audio direttamente
Interruzioni / backchannelNo; ascolta, poi rispondeSì; può interrompere, dire "mhmm", stare zitto
Livelli di modello nella voceHaiku, Sonnet, Opus (a pagamento); solo Haiku (free)GPT-Live-1 (a pagamento), GPT-Live-1 mini (default, incl. free)
Profondità di reasoningEredita il tuo modello testuale — Opus ora può pensare nella voceFront-end conversazionale veloce; delega il reasoning pesante a un modello frontier in background
Tool connessi nella voceGmail, Google Calendar, Google Docs, Slack (a pagamento = multipli; free = uno)Uso di tool voice-native durante la conversazione
Profilo di latenzaDepth-first: modello più pesante = risposta più profonda, pausa più lunga prima che parliLatency-first: progettato per turn-taking simile all'umano
API sviluppatoriNessuna API vocale per sviluppatori al momento della scritturaGPT-Live non ancora in API; gpt-realtime resta il prodotto sviluppatori attuale

Scegli Claude voice quando vuoi pensare ad alta voce con un modello di reasoning forte e fare lavoro vero nelle tue app connesse tramite voce. Scegli GPT-Live quando la conversazione in sé conta più della profondità — interviste, tutoraggio, pratica linguistica, tutto ciò dove interruzione e scambio rapido sono il punto. Entrambi possono essere giusti nella stessa settimana.

Watch out

L'inquadratura di Anthropic stessa è rivelatrice: "focused on intelligence and tool access." È il modo onesto di descrivere cosa è cambiato. Se qualcuno ti dice "la modalità voce Opus è più naturale" — non lo è. È più intelligente e ora può toccare la tua inbox e il calendario, ma la sensazione conversazionale è la stessa esperienza a turni di prima.

Far funzionare l'aggiornamento

Guided walkthrough1 of 5
  1. L'upgrade è in rollout beta sulle app mobile di Anthropic, Claude Desktop e l'app web. Se non vedi ancora il model picker, controlla un aggiornamento dell'app e riapri il pannello vocale.

Richiesta vocale che usa davvero il nuovo accesso ai tool

"Reschedule my 3 pm with Sara to Thursday morning, draft a short apology email in Gmail, and add the new slot to the shared team calendar — read the draft back to me before sending."

Quella singola frase ora funziona perché (a) il modello dietro il microfono è abbastanza capace da pianificare la sequenza, (b) i connettori Google Calendar e Gmail sono attivi nella voce, e (c) "read it back before sending" è esattamente il checkpoint che vuoi quando non puoi vedere lo schermo.

Il model picker: quando passare a cosa

Il picker è la leva singola più utile dell'aggiornamento. Regola pratica:

  • Haiku — capture, risposte rapide, camminata-e-parlata, e tutto sul piano free. Il più economico e veloce.
  • Sonnet — l'equilibrio di default. Scambio abbastanza lungo, feedback su un pitch, pianificazione di un piccolo task, stesura di messaggi che usano uno o due tool.
  • Opus — reasoning profondo a voce: strategia, code review a orecchio, sequenze di tool multi-step ("guarda questi tre documenti, riassumi le differenze, poi scrivi una mail"). Aspettati pause visibilmente più lunghe prima che inizi a parlare — è la profondità che hai chiesto.
Pro tip

Una mossa da esperti: inizia una chiamata su Haiku per catturare il contesto in fretta, poi passa a Opus per il momento "ora pensa a tutto quello". Ottieni la reattività di Haiku durante il setup caotico e la profondità di Opus solo dove conta — senza pagare la latenza di Opus sull'intera conversazione.

App connesse nella voce — cosa funziona davvero

Al lancio, i connettori riportati come funzionanti nella voce più costantemente sono Gmail, Google Calendar, Google Docs e Slack. Diverse testate elencano anche Canva e Notion — Anthropic rilascia nuovi connettori regolarmente, quindi tratta qualsiasi elenco specifico come un bersaglio in movimento e controlla il tuo pannello Impostazioni → Connettori per vedere cosa è effettivamente disponibile per te.

Il piano free ottiene una app connessa; i piani a pagamento ne ottengono multipli. Quel tetto a una singola app è il punto in cui il piano free inizia a sembrare palesemente più stretto — la voce è dove "connettere tutti i miei tool" ripaga da solo.

Un triage mattutino a mani libere

"Read me the subject lines and first sentences of unread emails from the last 12 hours, group them by whether they need a reply today, and add three follow-up reminders to my calendar for tomorrow morning."

Pattern pratici e trappole

Alcune cose che vale la pena interiorizzare:

  • La lingua va impostata manualmente. La voce supporta inglese, francese, tedesco, hindi, indonesiano, italiano, giapponese, coreano, portoghese (brasiliano) e spagnolo. Devi scegliere la tua lingua — il modello non la rileva automaticamente.
  • Le chiamate multi-tool aggiungono latenza. Se la risposta è lenta, di solito è perché il modello sta chiamando due o tre connettori in sequenza. Chiedi meno cose per turno.
  • I risultati dei tool potrebbero non essere visualizzati completamente nella voce. Usa la voce per iniziare; passa alla vista testo della stessa chat per ispezionare cosa Claude ha effettivamente fatto. La chat è un singolo artefatto — il microfono e il campo di testo sono solo due modi per entrarci.
  • La voce è a valle della tua memoria e delle preferenze della chat testuale. Se usi Memory, la voce vede lo stesso contesto personale. Se usi Reflect, le sessioni vocali contano nel tuo recap mensile.
  • Non è un sistema full-duplex. Se ti sorprendi a desiderare di poter interrompere pulitamente o sentire un "mhmm" mentre pensi — è un segnale che il tuo task in realtà vuole GPT-Live o una demo di ricerca come Kyutai Moshi, non Claude voice. Strumento diverso.
Key takeaways
  • L'aggiornamento del 23 luglio 2026 ha cambiato il modello dietro la voce di Claude — non lo stack vocale. Stessa architettura a turni, reasoning più profondo e accesso reale ai tool sopra.
  • La voce eredita il tuo ultimo modello di chat testuale e usa la sua versione più veloce. Cambia modello nel testo per cambiare il default vocale.
  • Il model picker dentro una chiamata live ti fa saltare Haiku → Sonnet → Opus a metà conversazione — usalo per mantenere la reattività di Haiku per la capture e la profondità di Opus per il momento della verità.
  • Piano free: solo Haiku + una app connessa. Il piano a pagamento è dove la voce inizia a sembrare un vero assistente, perché l'accesso multi-tool è dove il modello guadagna il suo posto.
  • La scommessa di Claude è intelligenza + tool su una pipeline convenzionale; la scommessa di OpenAI con GPT-Live è la conversazione full-duplex. Entrambe sono risposte corrette a problemi diversi.

Verifica

Verifica

0/4
  1. L'aggiornamento Claude voice del 23 luglio 2026 — cosa è cambiato davvero sotto il cofano?
  2. Vuoi capture rapida all'inizio di una chiamata e sintesi profonda alla fine. Mossa migliore?
  3. Sei sul piano free e hai connesso Gmail. Ora provi ad aggiungere Google Calendar. Cosa succede?
  4. Un utente dice 'Claude voice su Opus sembra più naturale di prima.' È un'affermazione di cui dovresti fidarti?

Flashcard

Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 6

Fonti e approfondimenti