Claude 음성과 Opus & Sonnet (2026년 7월): 추론 우선 음성 vs GPT-Live
- Anthropic이 2026년 7월 23일 실제로 배포한 것 — 그리고 의도적으로 바꾸지 않은 것 이해
- 대화 도중 Haiku, Sonnet, Opus 사이를 언제 전환할지, 그리고 그 때 무엇이 바뀌는지 알기
- 연결 앱 커넥터(Gmail, Calendar, Docs, Slack)를 음성에서 무료 티어 상한에 걸리지 않고 사용
- 왜 Claude의 턴 기반 음성이 OpenAI의 풀 듀플렉스 GPT-Live와 다른 설계 베팅인지 보고 — 작업에 맞는 도구 고르기
2026년 7월 23일 Anthropic은 Claude 음성 모드를 자신의 더 무거운 추론 모델 — Opus와 Sonnet, Haiku와 함께 — 에 개방하고 연결 앱(Gmail, Google Calendar, Google Docs, Slack 등)을 음성 경험에 배선했습니다. 2주 전인 7월 8일 OpenAI는 동시에 듣고 말하는 speech-native 풀 듀플렉스 시스템 GPT-Live를 배포했습니다. 같은 주, 음성 AI가 무엇이어야 하는지에 대한 매우 다른 두 베팅.
이 페이지는 그 둘을 분리합니다. 차이가 실제로 무엇에 손을 뻗어야 할지에 중요하기 때문입니다.
Anthropic이 배포한 것 (그리고 의도적으로 안 한 것)
여기 명백하지 않은 부분: Anthropic은 음성 스택 자체를 업그레이드하지 않았습니다. 회사 대변인은 TechCrunch와 다른 곳에 Claude가 턴 기반 설계 — "Claude가 듣고, 멈춰서 생각하고, 답한다" — 를 유지하며 이 릴리스로 기저의 음성 모델은 바뀌지 않았다고 말했습니다. 바뀐 것은 음성 뒤의 추론 모델입니다: 이전에는 Haiku만 받았던 곳에 이제 Opus의 사고나 Sonnet의 균형을 말하는 왔다갔다 뒤에 둘 수 있습니다.
그 프레이밍이 이 페이지의 모든 것을 예측합니다:
- 더 매끄러운 대화가 아니라 더 깊은 답을 예상하세요.
- 도구 집약적 음성 요청이 실제로 작동하기를 예상하세요(이메일 초안, 미팅 재조정). 마이크 뒤의 모델이 이제 그것을 계획하기에 충분히 유능하기 때문입니다.
- GPT-Live 스타일의 barge-in, backchannel, 여러분이 말하는 동안 모델이 "음"이라 웅얼거리는 것은 기대하지 마세요 — 그것은 풀 듀플렉스 speech-native 모델을 요하며, Claude 음성은 (아직) 그것이 아닙니다.
텍스트 채팅에서 마지막으로 Opus를 썼다면 음성은 Opus로 시작합니다 — 하지만 대화를 반응적으로 유지하려고 그 모델 계열의 가장 빠른 세대를 고릅니다. 텍스트 모드 습관이 음성 기본값을 설정합니다. 텍스트에서 모델을 전환하는 것이 다음번에 마이크를 두드릴 때 음성이 무엇을 건네줄지 바꾸는 가장 쉬운 방법입니다.
턴 기반 베팅 vs 풀 듀플렉스 GPT-Live
두 발표가 같은 15일에 착지했습니다. 서로 다른 문제를 해결하고 있습니다.
| Claude Voice (2026년 7월 23일) | GPT-Live (2026년 7월 8일) | |
|---|---|---|
| 아키텍처 | 턴 기반: STT → LLM → TTS 파이프라인(full-duplex voice AI 참조) | Speech-native 풀 듀플렉스 — 오디오를 직접 소비하고 생성하는 하나의 모델 |
| 인터럽트 / backchannel | 없음; 듣고 답함 | 있음; barge in 가능, "음" 말할 수 있음, 조용히 있을 수 있음 |
| 음성의 모델 티어 | Haiku, Sonnet, Opus (유료); Haiku만 (무료) | GPT-Live-1 (유료), GPT-Live-1 mini (기본, 무료 포함) |
| 추론 깊이 | 텍스트 모델 상속 — 이제 Opus가 음성에서 사고 가능 | 빠른 대화형 프런트엔드; 무거운 추론을 백그라운드의 프런티어 모델에 위임 |
| 음성의 연결 도구 | Gmail, Google Calendar, Google Docs, Slack (유료 = 다수; 무료 = 하나) | 대화 중 음성 네이티브 도구 사용 |
| 지연 프로파일 | 깊이 우선: 더 무거운 모델 = 더 깊은 답, 말하기 전 더 긴 멈춤 | 지연 우선: ~인간 같은 턴 취하기를 위해 설계 |
| 개발자 API | 작성 시점에 개발자 음성 API 없음 | GPT-Live 아직 API에 없음; gpt-realtime이 현재 개발자 제품으로 남음 |
Claude 음성을 고르세요 — 강한 추론 모델과 함께 소리 내어 생각하고 연결 앱에서 음성으로 실제 작업을 하고 싶을 때. GPT-Live를 고르세요 — 대화 자체가 깊이보다 중요할 때: 인터뷰, 튜터링, 언어 연습, 인터럽션과 빠른 교환이 요점인 어떤 것이든. 둘 다 같은 주에 옳을 수 있습니다.
Anthropic 자체 프레이밍이 힌트를 줍니다: "지능과 도구 접근에 집중." 그것이 무엇이 바뀌었는지 정직하게 묘사하는 방식입니다. 누군가가 여러분에게 "Opus 음성 모드가 더 자연스러워"라고 말한다면 — 그렇지 않습니다. 더 똑똑해졌고 이제 여러분의 인박스와 캘린더를 건드릴 수 있지만, 대화 느낌은 이전과 같은 턴 기반 경험입니다.
업데이트 작동시키기
- 업그레이드는 Anthropic의 모바일 앱, Claude Desktop, 웹 앱 전반에서 베타로 롤아웃 중입니다. 모델 선택기가 아직 보이지 않으면 앱 업데이트를 확인하고 음성 시트를 다시 여세요.
- 음성은 텍스트 채팅에서 마지막으로 고른 모델로 기본 설정되며 그 계열의 가장 빠른 버전을 실행합니다. 어제 텍스트에서 Opus였다면 오늘 음성은 Opus로 시작합니다. 기본을 바꾸려면 먼저 텍스트 채팅에서 모델을 전환하세요.
- 라이브 음성 통화 안에서 모델 선택기가 통화를 끝내지 않고 Haiku, Sonnet, Opus 사이를 점프하게 합니다. 작업이 바뀔 때 사용 — Haiku에서 캡처, Sonnet이나 Opus에서 깊이 파기.
- Settings → Connectors에서 커넥터(Gmail, Google Calendar, Google Docs, Slack) 추가. 유료 요금제(Pro, Max, Team, Enterprise)는 다수 허용; 무료는 Haiku와 하나의 연결 도구로 제한.
- Anthropic은 여러 도구를 한 번에 쓰면 짧은 지연이 추가될 수 있고 도구 결과가 음성에 완전히 표시되지 않을 수 있다고 경고합니다. 흔한 패턴: 음성으로 시작, 그런 다음 같은 채팅의 텍스트 뷰로 전환하여 초안 이메일이나 반환된 문서를 리뷰.
Voice request that actually uses the new tool access
"Reschedule my 3 pm with Sara to Thursday morning, draft a short apology email in Gmail, and add the new slot to the shared team calendar — read the draft back to me before sending."
그 한 발화가 이제 작동합니다. 왜냐하면 (a) 마이크 뒤의 모델이 시퀀스를 계획하기에 충분히 유능하고, (b) Google Calendar와 Gmail 커넥터가 음성에 살아 있고, (c) "보내기 전에 다시 읽어줘"가 화면을 볼 수 없을 때 정확히 원하는 체크포인트이기 때문입니다.
모델 선택기: 언제 무엇으로 전환할지
선택기는 업데이트에서 가장 유용한 단일 레버입니다. 원칙:
- Haiku — 캡처, 빠른 답, 걷고 말하기, 그리고 무료 티어의 모든 것. 가장 싸고 빠름.
- Sonnet — 기본 균형. 충분한 왔다갔다, 피치 피드백, 작은 작업 계획, 한두 도구를 쓰는 메시지 초안.
- Opus — 음성으로 깊은 추론: 전략, 귀로 코드 리뷰, 다단계 도구 시퀀스("이 세 문서를 봐, 차이를 요약해, 그런 다음 이메일 초안 작성"). 말하기 시작 전 눈에 띄게 더 긴 멈춤 예상 — 그것이 여러분이 요청한 깊이입니다.
파워 무브: Haiku에서 통화를 시작해 컨텍스트를 빨리 캡처하고, "이제 그 모든 것을 생각해" 순간에는 Opus로 전환. 지저분한 셋업 동안 Haiku의 반응성을 얻고, 중요할 때만 Opus의 깊이를 얻습니다 — 전체 대화에 Opus의 지연을 지불하지 않고.
음성의 연결 앱 — 실제로 무엇이 작동하나
출시 시 음성에서 가장 일관되게 작동한다고 보고된 커넥터는 Gmail, Google Calendar, Google Docs, Slack입니다. 여러 매체는 Canva와 Notion도 나열합니다 — Anthropic은 새 커넥터를 정기적으로 배포하므로 어떤 특정 목록이든 움직이는 타깃으로 취급하고 여러분에게 실제 사용 가능한 것은 Settings → Connectors 시트를 확인하세요.
무료 티어는 연결 앱 하나를 받습니다; 유료 요금제는 다수를 받습니다. 그 단일 앱 상한이 무료 티어가 명백히 좁아지기 시작하는 지점입니다 — 음성은 "내 모든 도구 연결"이 스스로 값을 하는 곳입니다.
A hands-free morning triage
"Read me the subject lines and first sentences of unread emails from the last 12 hours, group them by whether they need a reply today, and add three follow-up reminders to my calendar for tomorrow morning."
실용 패턴과 함정
내면화할 가치가 있는 몇 가지:
- 언어는 수동으로 설정해야 합니다. 음성은 영어, 프랑스어, 독일어, 힌디어, 인도네시아어, 이탈리아어, 일본어, 한국어, 포르투갈어(브라질), 스페인어를 지원합니다. 언어를 골라야 합니다 — 모델은 자동 감지하지 않습니다.
- 다중 도구 호출은 지연을 더합니다. 응답이 느리면 보통 모델이 두세 커넥터를 순차 호출하기 때문입니다. 턴당 더 적은 것을 요청하세요.
- 도구 결과가 음성에 완전히 표시되지 않을 수 있습니다. 음성으로 시작; 같은 채팅의 텍스트 뷰로 전환하여 Claude가 실제로 무엇을 했는지 검사. 채팅은 하나의 아티팩트입니다 — 마이크와 텍스트 필드는 그것으로 들어가는 두 방법일 뿐.
- 음성은 여러분의 텍스트 채팅 메모리와 선호의 하류입니다. Memory를 사용하면 음성이 같은 개인 컨텍스트를 봅니다. Reflect를 사용하면 음성 세션이 월별 요약에 카운트됩니다.
- 이것은 풀 듀플렉스 시스템이 아닙니다. 여러분이 깔끔하게 인터럽트하거나 생각하는 동안 "음"을 듣기를 바라는 자신을 발견한다면 — 그것은 여러분 작업이 실제로 GPT-Live나 Kyutai Moshi 같은 연구 데모를 원한다는 신호이지, Claude 음성이 아닙니다. 다른 도구.
- 2026년 7월 23일 업데이트는 Claude 음성 뒤의 모델을 바꿨습니다 — 음성 스택이 아니라. 같은 턴 기반 아키텍처, 그 위의 더 깊은 추론과 실제 도구 접근.
- 음성은 여러분의 마지막 텍스트 채팅 모델을 상속하고 그 가장 빠른 버전을 실행합니다. 음성 기본을 바꾸려면 텍스트에서 모델 변경.
- 라이브 통화 안의 모델 선택기가 대화 도중 Haiku → Sonnet → Opus를 점프하게 합니다 — 캡처를 위해 Haiku의 반응성을, 페이오프를 위해 Opus의 깊이를 유지하는 데 사용.
- 무료 티어: Haiku만 + 연결 앱 하나. 유료 티어는 음성이 완전한 어시스턴트처럼 느껴지기 시작하는 곳입니다. 다중 도구 접근이 모델이 값을 하는 곳이기 때문.
- Claude의 베팅은 전통적 파이프라인에서의 지능 + 도구; OpenAI의 GPT-Live는 풀 듀플렉스 대화에 베팅. 둘 다 서로 다른 문제에 대한 옳은 답.
확인해 보세요
Check yourself
0/4Flashcards
Sources & further reading
- Anthropic updates Claude voice mode with more capable models — TechCrunch (July 23, 2026)
- Anthropic brings Opus and Sonnet to Claude Voice Mode — Unite.AI
- Anthropic adds model choice to Claude Voice Mode for all users — SQ Magazine
- Claude Voice Mode adds Sonnet, Opus, and app connectors — TechMyMoney (July 23, 2026)
- OpenAI releases new voice models for more natural live conversations — TechCrunch (July 8, 2026)
- 관련 페이지: Full-duplex voice AI (GPT-Live, Moshi, and the 200 ms problem) · Talking to Claude (Voice Mode) · Connectors · Choosing a Model