Aller au contenu principal

Claude Voice avec Opus et Sonnet (juillet 2026) : voix orientée raisonnement vs GPT-Live

Débutant
What you'll learn
  • Comprendre ce qu'Anthropic a réellement livré le 23 juillet 2026 — et ce qu'il n'a délibérément pas changé
  • Savoir quand basculer entre Haiku, Sonnet et Opus en cours de conversation, et ce qui change quand vous le faites
  • Utiliser les connecteurs d'apps (Gmail, Calendar, Docs, Slack) depuis la voix sans atteindre le plafond du plan gratuit
  • Voir pourquoi la voix en tour par tour de Claude est un pari de design différent du full-duplex GPT-Live d'OpenAI — et choisir le bon outil pour le travail

Le 23 juillet 2026, Anthropic a ouvert le mode voix de Claude à ses modèles de raisonnement plus lourds — Opus et Sonnet, aux côtés de Haiku — et a câblé les apps connectées (Gmail, Google Calendar, Google Docs, Slack, entre autres) dans l'expérience vocale. Deux semaines plus tôt, le 8 juillet, OpenAI avait livré GPT-Live, un système full-duplex natif de la parole qui écoute et parle simultanément. Même semaine, deux paris très différents sur ce que l'IA vocale devrait être.

Cette page les sépare, parce que la différence importe pour ce vers quoi vous devriez vraiment tendre la main.

Ce qu'Anthropic a livré (et ce qu'il n'a délibérément pas livré)

Voici la partie non évidente : Anthropic n'a pas mis à niveau la stack vocale elle-même. Un porte-parole de l'entreprise a dit à TechCrunch et à d'autres que Claude garde son design en tour par tour — "Claude écoute, s'arrête pour réfléchir, puis répond" — et le modèle vocal sous-jacent n'a pas été changé avec cette sortie. Ce qui a changé, c'est le modèle de raisonnement derrière la voix : vous pouvez maintenant mettre la réflexion d'Opus ou l'équilibre de Sonnet derrière l'échange parlé, là où avant vous n'aviez que Haiku.

Ce cadrage prédit tout le reste sur cette page :

  • Attendez-vous à des réponses plus profondes, pas à une conversation plus fluide.
  • Attendez-vous à ce que les requêtes vocales lourdes en outils fonctionnent réellement (rédiger un email, reprogrammer une réunion), parce que le modèle derrière le micro est maintenant assez capable pour les planifier.
  • Ne vous attendez pas à des interruptions style GPT-Live, des backchannels, ou le modèle murmurant "mhmm" pendant que vous parlez — cela nécessite un modèle full-duplex natif de la parole, ce que la voix Claude n'est pas (encore).
Pro tip

Si vous avez utilisé Opus en dernier en chat texte, la voix démarre avec Opus — mais elle choisit la génération la plus rapide de cette famille de modèles pour garder la conversation réactive. Vos habitudes en mode texte règlent vos défauts vocaux. Changer de modèle en texte est le plus simple pour changer ce que la voix vous donne la prochaine fois que vous tapez sur le micro.

Le pari du tour par tour vs le full-duplex GPT-Live

Les deux annonces sont tombées dans les mêmes 15 jours. Elles résolvent des problèmes différents.

Claude Voice (23 juillet 2026)GPT-Live (8 juillet 2026)
ArchitectureTour par tour : pipeline STT → LLM → TTS (voir IA vocale full-duplex)Natif de la parole full-duplex — un modèle qui consomme et produit de l'audio directement
Interruptions / backchannelsNon ; écoute, puis répondOui ; peut interrompre, dire "mhmm", rester silencieux
Niveaux de modèle en voixHaiku, Sonnet, Opus (payant) ; Haiku uniquement (gratuit)GPT-Live-1 (payant), GPT-Live-1 mini (défaut, incl. gratuit)
Profondeur de raisonnementHérite de votre modèle texte — Opus peut maintenant réfléchir en voixFront-end conversationnel rapide ; délègue le raisonnement lourd à un modèle de frontière en arrière-plan
Outils connectés en voixGmail, Google Calendar, Google Docs, Slack (payant = multiples ; gratuit = un)Usage d'outils natif à la voix pendant la conversation
Profil de latenceProfondeur d'abord : modèle plus lourd = réponse plus profonde, pause plus longue avant de parlerLatence d'abord : conçu pour un tour de parole ~humain
API développeurPas d'API voix développeur au moment de l'écritureGPT-Live pas encore en API ; gpt-realtime reste le produit développeur actuel

Choisissez la voix Claude quand vous voulez penser à voix haute avec un fort modèle de raisonnement et faire du vrai travail dans vos apps connectées à la voix. Choisissez GPT-Live quand la conversation elle-même compte plus que la profondeur — entretiens, tutorat, pratique de langue, tout où l'interruption et l'échange rapide sont le sujet. Les deux peuvent avoir raison la même semaine.

Watch out

Le cadrage propre d'Anthropic est un aveu : "axé sur l'intelligence et l'accès aux outils." C'est la façon honnête de décrire ce qui a changé. Si quelqu'un vous dit "le mode voix Opus est plus naturel" — il ne l'est pas. Il est plus intelligent et peut maintenant toucher votre boîte de réception et votre calendrier, mais le ressenti conversationnel est la même expérience en tour par tour qu'avant.

Faire fonctionner la mise à jour

Guided walkthrough1 of 5
  1. La mise à niveau est en cours de déploiement en beta à travers les apps mobiles d'Anthropic, Claude Desktop et l'app web. Si vous ne voyez pas encore le sélecteur de modèle, vérifiez une mise à jour de l'app et rouvrez la feuille vocale.

Requête vocale qui utilise vraiment le nouvel accès aux outils

"Reschedule my 3 pm with Sara to Thursday morning, draft a short apology email in Gmail, and add the new slot to the shared team calendar — read the draft back to me before sending."

Cet énoncé unique fonctionne maintenant parce que (a) le modèle derrière le micro est assez capable pour planifier la séquence, (b) les connecteurs Google Calendar et Gmail sont en direct en voix, et (c) "relis-le avant d'envoyer" est exactement le point de contrôle que vous voulez quand vous ne pouvez pas voir l'écran.

Le sélecteur de modèle : quand basculer vers quoi

Le sélecteur est le seul levier le plus utile de la mise à jour. Règle d'or :

  • Haiku — capture, réponses rapides, marcher-et-parler, et tout au plan gratuit. Le moins cher et le plus rapide.
  • Sonnet — l'équilibre par défaut. Échange assez long, feedback sur un pitch, planifier une petite tâche, rédiger des messages qui utilisent un ou deux outils.
  • Opus — raisonnement profond par la voix : stratégie, revue de code à l'oreille, séquences d'outils multi-étapes ("regarde ces trois docs, résume les différences, puis rédige un email"). Attendez-vous à des pauses visiblement plus longues avant qu'il commence à parler — c'est la profondeur que vous avez demandée.
Pro tip

Un mouvement de puissance : démarrez un appel sur Haiku pour capturer le contexte rapidement, puis basculez sur Opus pour le moment "maintenant réfléchis à tout ça". Vous obtenez la réactivité de Haiku pendant la mise en place brouillonne et la profondeur d'Opus seulement là où c'est important — sans payer la latence d'Opus sur toute la conversation.

Apps connectées en voix — ce qui marche vraiment

Au lancement, les connecteurs le plus systématiquement rapportés comme fonctionnant en voix sont Gmail, Google Calendar, Google Docs et Slack. Plusieurs médias listent aussi Canva et Notion — Anthropic livre régulièrement de nouveaux connecteurs, donc traitez toute liste spécifique comme une cible mouvante et vérifiez votre feuille Paramètres → Connecteurs pour ce qui est réellement disponible pour vous.

Le tier gratuit obtient une app connectée ; les plans payants en obtiennent plusieurs. Ce cap d'app unique est le point où le tier gratuit commence à sembler évidemment plus étroit — la voix est là où "connecter tous mes outils" se rentabilise.

Un triage matinal mains libres

"Read me the subject lines and first sentences of unread emails from the last 12 hours, group them by whether they need a reply today, and add three follow-up reminders to my calendar for tomorrow morning."

Patterns pratiques et pièges

Quelques choses qui valent la peine d'être intériorisées :

  • La langue doit être réglée manuellement. La voix supporte anglais, français, allemand, hindi, indonésien, italien, japonais, coréen, portugais (brésilien) et espagnol. Vous devez choisir votre langue — le modèle ne l'auto-détectera pas.
  • Les appels multi-outils ajoutent de la latence. Si la réponse est lente, c'est généralement parce que le modèle appelle deux ou trois connecteurs en séquence. Demandez moins de choses par tour.
  • Les résultats d'outils peuvent ne pas s'afficher entièrement en voix. Utilisez la voix pour initier ; basculez sur la vue texte du même chat pour inspecter ce que Claude a réellement fait. Le chat est un artefact — le micro et le champ texte sont juste deux façons d'y entrer.
  • La voix est en aval de votre mémoire de chat texte et de vos préférences. Si vous utilisez Memory, la voix voit le même contexte personnel. Si vous utilisez Reflect, les sessions vocales comptent pour votre récap mensuel.
  • Ce n'est pas un système full-duplex. Si vous vous surprenez à souhaiter pouvoir interrompre proprement ou entendre un "mhmm" pendant que vous réfléchissez — c'est un signal que votre tâche veut vraiment GPT-Live ou une démo de recherche comme Kyutai Moshi, pas la voix Claude. Outil différent.
Key takeaways
  • La mise à jour du 23 juillet 2026 a changé le modèle derrière la voix de Claude — pas la stack vocale. Même architecture en tour par tour, raisonnement plus profond et vrai accès aux outils par-dessus.
  • La voix hérite de votre dernier modèle chat texte et fait tourner sa version la plus rapide. Changez de modèle en texte pour changer votre défaut vocal.
  • Le sélecteur de modèle à l'intérieur d'un appel en direct vous laisse sauter Haiku → Sonnet → Opus en cours de conversation — utilisez-le pour garder la réactivité de Haiku pour la capture et la profondeur d'Opus pour la conclusion.
  • Tier gratuit : Haiku seulement + une app connectée. Le tier payant est là où la voix commence à ressembler à un assistant complet, parce que l'accès multi-outils est là où le modèle gagne son salaire.
  • Le pari de Claude est intelligence + outils sur un pipeline conventionnel ; le pari de GPT-Live d'OpenAI est sur la conversation full-duplex. Les deux sont de bonnes réponses à des problèmes différents.

Vérifiez-vous

Vérifiez-vous

0/4
  1. La mise à jour Claude voice du 23 juillet 2026 — qu'est-ce qui a réellement changé sous le capot ?
  2. Vous voulez une capture rapide au début d'un appel et une synthèse profonde à la fin. Meilleur mouvement ?
  3. Vous êtes sur le tier gratuit et vous avez connecté Gmail. Vous essayez maintenant d'ajouter Google Calendar. Que se passe-t-il ?
  4. Un utilisateur dit 'Claude voice sur Opus semble plus naturel qu'avant.' Est-ce une affirmation à laquelle vous devriez faire confiance ?

Flashcards

Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 6

Sources et lectures complémentaires