Claude Voice avec Opus et Sonnet (juillet 2026) : voix orientée raisonnement vs GPT-Live
- Comprendre ce qu'Anthropic a réellement livré le 23 juillet 2026 — et ce qu'il n'a délibérément pas changé
- Savoir quand basculer entre Haiku, Sonnet et Opus en cours de conversation, et ce qui change quand vous le faites
- Utiliser les connecteurs d'apps (Gmail, Calendar, Docs, Slack) depuis la voix sans atteindre le plafond du plan gratuit
- Voir pourquoi la voix en tour par tour de Claude est un pari de design différent du full-duplex GPT-Live d'OpenAI — et choisir le bon outil pour le travail
Le 23 juillet 2026, Anthropic a ouvert le mode voix de Claude à ses modèles de raisonnement plus lourds — Opus et Sonnet, aux côtés de Haiku — et a câblé les apps connectées (Gmail, Google Calendar, Google Docs, Slack, entre autres) dans l'expérience vocale. Deux semaines plus tôt, le 8 juillet, OpenAI avait livré GPT-Live, un système full-duplex natif de la parole qui écoute et parle simultanément. Même semaine, deux paris très différents sur ce que l'IA vocale devrait être.
Cette page les sépare, parce que la différence importe pour ce vers quoi vous devriez vraiment tendre la main.
Ce qu'Anthropic a livré (et ce qu'il n'a délibérément pas livré)
Voici la partie non évidente : Anthropic n'a pas mis à niveau la stack vocale elle-même. Un porte-parole de l'entreprise a dit à TechCrunch et à d'autres que Claude garde son design en tour par tour — "Claude écoute, s'arrête pour réfléchir, puis répond" — et le modèle vocal sous-jacent n'a pas été changé avec cette sortie. Ce qui a changé, c'est le modèle de raisonnement derrière la voix : vous pouvez maintenant mettre la réflexion d'Opus ou l'équilibre de Sonnet derrière l'échange parlé, là où avant vous n'aviez que Haiku.
Ce cadrage prédit tout le reste sur cette page :
- Attendez-vous à des réponses plus profondes, pas à une conversation plus fluide.
- Attendez-vous à ce que les requêtes vocales lourdes en outils fonctionnent réellement (rédiger un email, reprogrammer une réunion), parce que le modèle derrière le micro est maintenant assez capable pour les planifier.
- Ne vous attendez pas à des interruptions style GPT-Live, des backchannels, ou le modèle murmurant "mhmm" pendant que vous parlez — cela nécessite un modèle full-duplex natif de la parole, ce que la voix Claude n'est pas (encore).
Si vous avez utilisé Opus en dernier en chat texte, la voix démarre avec Opus — mais elle choisit la génération la plus rapide de cette famille de modèles pour garder la conversation réactive. Vos habitudes en mode texte règlent vos défauts vocaux. Changer de modèle en texte est le plus simple pour changer ce que la voix vous donne la prochaine fois que vous tapez sur le micro.
Le pari du tour par tour vs le full-duplex GPT-Live
Les deux annonces sont tombées dans les mêmes 15 jours. Elles résolvent des problèmes différents.
| Claude Voice (23 juillet 2026) | GPT-Live (8 juillet 2026) | |
|---|---|---|
| Architecture | Tour par tour : pipeline STT → LLM → TTS (voir IA vocale full-duplex) | Natif de la parole full-duplex — un modèle qui consomme et produit de l'audio directement |
| Interruptions / backchannels | Non ; écoute, puis répond | Oui ; peut interrompre, dire "mhmm", rester silencieux |
| Niveaux de modèle en voix | Haiku, Sonnet, Opus (payant) ; Haiku uniquement (gratuit) | GPT-Live-1 (payant), GPT-Live-1 mini (défaut, incl. gratuit) |
| Profondeur de raisonnement | Hérite de votre modèle texte — Opus peut maintenant réfléchir en voix | Front-end conversationnel rapide ; délègue le raisonnement lourd à un modèle de frontière en arrière-plan |
| Outils connectés en voix | Gmail, Google Calendar, Google Docs, Slack (payant = multiples ; gratuit = un) | Usage d'outils natif à la voix pendant la conversation |
| Profil de latence | Profondeur d'abord : modèle plus lourd = réponse plus profonde, pause plus longue avant de parler | Latence d'abord : conçu pour un tour de parole ~humain |
| API développeur | Pas d'API voix développeur au moment de l'écriture | GPT-Live pas encore en API ; gpt-realtime reste le produit développeur actuel |
Choisissez la voix Claude quand vous voulez penser à voix haute avec un fort modèle de raisonnement et faire du vrai travail dans vos apps connectées à la voix. Choisissez GPT-Live quand la conversation elle-même compte plus que la profondeur — entretiens, tutorat, pratique de langue, tout où l'interruption et l'échange rapide sont le sujet. Les deux peuvent avoir raison la même semaine.
Le cadrage propre d'Anthropic est un aveu : "axé sur l'intelligence et l'accès aux outils." C'est la façon honnête de décrire ce qui a changé. Si quelqu'un vous dit "le mode voix Opus est plus naturel" — il ne l'est pas. Il est plus intelligent et peut maintenant toucher votre boîte de réception et votre calendrier, mais le ressenti conversationnel est la même expérience en tour par tour qu'avant.
Faire fonctionner la mise à jour
- La mise à niveau est en cours de déploiement en beta à travers les apps mobiles d'Anthropic, Claude Desktop et l'app web. Si vous ne voyez pas encore le sélecteur de modèle, vérifiez une mise à jour de l'app et rouvrez la feuille vocale.
- La voix se met par défaut sur le dernier modèle que vous avez choisi en chat texte, et fait tourner la version la plus rapide de cette famille. Si vous étiez sur Opus en texte hier, la voix démarre sur Opus aujourd'hui. Pour changer le défaut, changez de modèle dans un chat texte d'abord.
- À l'intérieur d'un appel vocal en direct, le sélecteur de modèle vous laisse sauter entre Haiku, Sonnet et Opus sans terminer l'appel. Utilisez-le quand la tâche change — capturez sur Haiku, approfondissez sur Sonnet ou Opus.
- Ajoutez des connecteurs (Gmail, Google Calendar, Google Docs, Slack) sous Paramètres → Connecteurs. Les plans payants (Pro, Max, Team, Enterprise) permettent plusieurs ; le gratuit est limité à Haiku et un outil connecté.
- Anthropic prévient que l'usage de plusieurs outils à la fois peut ajouter un court délai, et les résultats d'outils peuvent ne pas s'afficher entièrement en voix. Un pattern courant : initier par la voix, puis basculer sur la vue texte dans le même chat pour revoir l'email rédigé ou le document retourné.
Requête vocale qui utilise vraiment le nouvel accès aux outils
"Reschedule my 3 pm with Sara to Thursday morning, draft a short apology email in Gmail, and add the new slot to the shared team calendar — read the draft back to me before sending."
Cet énoncé unique fonctionne maintenant parce que (a) le modèle derrière le micro est assez capable pour planifier la séquence, (b) les connecteurs Google Calendar et Gmail sont en direct en voix, et (c) "relis-le avant d'envoyer" est exactement le point de contrôle que vous voulez quand vous ne pouvez pas voir l'écran.
Le sélecteur de modèle : quand basculer vers quoi
Le sélecteur est le seul levier le plus utile de la mise à jour. Règle d'or :
- Haiku — capture, réponses rapides, marcher-et-parler, et tout au plan gratuit. Le moins cher et le plus rapide.
- Sonnet — l'équilibre par défaut. Échange assez long, feedback sur un pitch, planifier une petite tâche, rédiger des messages qui utilisent un ou deux outils.
- Opus — raisonnement profond par la voix : stratégie, revue de code à l'oreille, séquences d'outils multi-étapes ("regarde ces trois docs, résume les différences, puis rédige un email"). Attendez-vous à des pauses visiblement plus longues avant qu'il commence à parler — c'est la profondeur que vous avez demandée.
Un mouvement de puissance : démarrez un appel sur Haiku pour capturer le contexte rapidement, puis basculez sur Opus pour le moment "maintenant réfléchis à tout ça". Vous obtenez la réactivité de Haiku pendant la mise en place brouillonne et la profondeur d'Opus seulement là où c'est important — sans payer la latence d'Opus sur toute la conversation.
Apps connectées en voix — ce qui marche vraiment
Au lancement, les connecteurs le plus systématiquement rapportés comme fonctionnant en voix sont Gmail, Google Calendar, Google Docs et Slack. Plusieurs médias listent aussi Canva et Notion — Anthropic livre régulièrement de nouveaux connecteurs, donc traitez toute liste spécifique comme une cible mouvante et vérifiez votre feuille Paramètres → Connecteurs pour ce qui est réellement disponible pour vous.
Le tier gratuit obtient une app connectée ; les plans payants en obtiennent plusieurs. Ce cap d'app unique est le point où le tier gratuit commence à sembler évidemment plus étroit — la voix est là où "connecter tous mes outils" se rentabilise.
Un triage matinal mains libres
"Read me the subject lines and first sentences of unread emails from the last 12 hours, group them by whether they need a reply today, and add three follow-up reminders to my calendar for tomorrow morning."
Patterns pratiques et pièges
Quelques choses qui valent la peine d'être intériorisées :
- La langue doit être réglée manuellement. La voix supporte anglais, français, allemand, hindi, indonésien, italien, japonais, coréen, portugais (brésilien) et espagnol. Vous devez choisir votre langue — le modèle ne l'auto-détectera pas.
- Les appels multi-outils ajoutent de la latence. Si la réponse est lente, c'est généralement parce que le modèle appelle deux ou trois connecteurs en séquence. Demandez moins de choses par tour.
- Les résultats d'outils peuvent ne pas s'afficher entièrement en voix. Utilisez la voix pour initier ; basculez sur la vue texte du même chat pour inspecter ce que Claude a réellement fait. Le chat est un artefact — le micro et le champ texte sont juste deux façons d'y entrer.
- La voix est en aval de votre mémoire de chat texte et de vos préférences. Si vous utilisez Memory, la voix voit le même contexte personnel. Si vous utilisez Reflect, les sessions vocales comptent pour votre récap mensuel.
- Ce n'est pas un système full-duplex. Si vous vous surprenez à souhaiter pouvoir interrompre proprement ou entendre un "mhmm" pendant que vous réfléchissez — c'est un signal que votre tâche veut vraiment GPT-Live ou une démo de recherche comme Kyutai Moshi, pas la voix Claude. Outil différent.
- La mise à jour du 23 juillet 2026 a changé le modèle derrière la voix de Claude — pas la stack vocale. Même architecture en tour par tour, raisonnement plus profond et vrai accès aux outils par-dessus.
- La voix hérite de votre dernier modèle chat texte et fait tourner sa version la plus rapide. Changez de modèle en texte pour changer votre défaut vocal.
- Le sélecteur de modèle à l'intérieur d'un appel en direct vous laisse sauter Haiku → Sonnet → Opus en cours de conversation — utilisez-le pour garder la réactivité de Haiku pour la capture et la profondeur d'Opus pour la conclusion.
- Tier gratuit : Haiku seulement + une app connectée. Le tier payant est là où la voix commence à ressembler à un assistant complet, parce que l'accès multi-outils est là où le modèle gagne son salaire.
- Le pari de Claude est intelligence + outils sur un pipeline conventionnel ; le pari de GPT-Live d'OpenAI est sur la conversation full-duplex. Les deux sont de bonnes réponses à des problèmes différents.
Vérifiez-vous
Vérifiez-vous
0/4Flashcards
Sources et lectures complémentaires
- Anthropic met à jour le mode voix Claude avec des modèles plus capables — TechCrunch (23 juillet 2026)
- Anthropic apporte Opus et Sonnet au Claude Voice Mode — Unite.AI
- Anthropic ajoute le choix de modèle au Claude Voice Mode pour tous les utilisateurs — SQ Magazine
- Claude Voice Mode ajoute Sonnet, Opus et des connecteurs d'apps — TechMyMoney (23 juillet 2026)
- OpenAI publie de nouveaux modèles vocaux pour des conversations en direct plus naturelles — TechCrunch (8 juillet 2026)
- Pages connexes sur AILmanac : IA vocale full-duplex (GPT-Live, Moshi et le problème des 200 ms) · Parler à Claude (Voice Mode) · Connecteurs · Choisir un modèle