본문으로 건너뛰기

Claude 음성과 Opus & Sonnet (2026년 7월): 추론 우선 음성 vs GPT-Live

초급
What you'll learn
  • Anthropic이 2026년 7월 23일 실제로 배포한 것 — 그리고 의도적으로 바꾸지 않은 것 이해
  • 대화 도중 Haiku, Sonnet, Opus 사이를 언제 전환할지, 그리고 그 때 무엇이 바뀌는지 알기
  • 연결 앱 커넥터(Gmail, Calendar, Docs, Slack)를 음성에서 무료 티어 상한에 걸리지 않고 사용
  • 왜 Claude의 턴 기반 음성이 OpenAI의 풀 듀플렉스 GPT-Live와 다른 설계 베팅인지 보고 — 작업에 맞는 도구 고르기

2026년 7월 23일 Anthropic은 Claude 음성 모드를 자신의 더 무거운 추론 모델 — Opus와 Sonnet, Haiku와 함께 — 에 개방하고 연결 앱(Gmail, Google Calendar, Google Docs, Slack 등)을 음성 경험에 배선했습니다. 2주 전인 7월 8일 OpenAI는 동시에 듣고 말하는 speech-native 풀 듀플렉스 시스템 GPT-Live를 배포했습니다. 같은 주, 음성 AI가 무엇이어야 하는지에 대한 매우 다른 두 베팅.

이 페이지는 그 둘을 분리합니다. 차이가 실제로 무엇에 손을 뻗어야 할지에 중요하기 때문입니다.

Anthropic이 배포한 것 (그리고 의도적으로 안 한 것)

여기 명백하지 않은 부분: Anthropic은 음성 스택 자체를 업그레이드하지 않았습니다. 회사 대변인은 TechCrunch와 다른 곳에 Claude가 턴 기반 설계 — "Claude가 듣고, 멈춰서 생각하고, 답한다" — 를 유지하며 이 릴리스로 기저의 음성 모델은 바뀌지 않았다고 말했습니다. 바뀐 것은 음성 뒤의 추론 모델입니다: 이전에는 Haiku만 받았던 곳에 이제 Opus의 사고나 Sonnet의 균형을 말하는 왔다갔다 뒤에 둘 수 있습니다.

그 프레이밍이 이 페이지의 모든 것을 예측합니다:

  • 더 매끄러운 대화가 아니라 더 깊은 답을 예상하세요.
  • 도구 집약적 음성 요청이 실제로 작동하기를 예상하세요(이메일 초안, 미팅 재조정). 마이크 뒤의 모델이 이제 그것을 계획하기에 충분히 유능하기 때문입니다.
  • GPT-Live 스타일의 barge-in, backchannel, 여러분이 말하는 동안 모델이 "음"이라 웅얼거리는 것은 기대하지 마세요 — 그것은 풀 듀플렉스 speech-native 모델을 요하며, Claude 음성은 (아직) 그것이 아닙니다.
Pro tip

텍스트 채팅에서 마지막으로 Opus를 썼다면 음성은 Opus로 시작합니다 — 하지만 대화를 반응적으로 유지하려고 그 모델 계열의 가장 빠른 세대를 고릅니다. 텍스트 모드 습관이 음성 기본값을 설정합니다. 텍스트에서 모델을 전환하는 것이 다음번에 마이크를 두드릴 때 음성이 무엇을 건네줄지 바꾸는 가장 쉬운 방법입니다.

턴 기반 베팅 vs 풀 듀플렉스 GPT-Live

두 발표가 같은 15일에 착지했습니다. 서로 다른 문제를 해결하고 있습니다.

Claude Voice (2026년 7월 23일)GPT-Live (2026년 7월 8일)
아키텍처턴 기반: STT → LLM → TTS 파이프라인(full-duplex voice AI 참조)Speech-native 풀 듀플렉스 — 오디오를 직접 소비하고 생성하는 하나의 모델
인터럽트 / backchannel없음; 듣고 답함있음; barge in 가능, "음" 말할 수 있음, 조용히 있을 수 있음
음성의 모델 티어Haiku, Sonnet, Opus (유료); Haiku만 (무료)GPT-Live-1 (유료), GPT-Live-1 mini (기본, 무료 포함)
추론 깊이텍스트 모델 상속 — 이제 Opus가 음성에서 사고 가능빠른 대화형 프런트엔드; 무거운 추론을 백그라운드의 프런티어 모델에 위임
음성의 연결 도구Gmail, Google Calendar, Google Docs, Slack (유료 = 다수; 무료 = 하나)대화 중 음성 네이티브 도구 사용
지연 프로파일깊이 우선: 더 무거운 모델 = 더 깊은 답, 말하기 전 더 긴 멈춤지연 우선: ~인간 같은 턴 취하기를 위해 설계
개발자 API작성 시점에 개발자 음성 API 없음GPT-Live 아직 API에 없음; gpt-realtime이 현재 개발자 제품으로 남음

Claude 음성을 고르세요 — 강한 추론 모델과 함께 소리 내어 생각하고 연결 앱에서 음성으로 실제 작업을 하고 싶을 때. GPT-Live를 고르세요대화 자체가 깊이보다 중요할 때: 인터뷰, 튜터링, 언어 연습, 인터럽션과 빠른 교환이 요점인 어떤 것이든. 둘 다 같은 주에 옳을 수 있습니다.

Watch out

Anthropic 자체 프레이밍이 힌트를 줍니다: "지능과 도구 접근에 집중." 그것이 무엇이 바뀌었는지 정직하게 묘사하는 방식입니다. 누군가가 여러분에게 "Opus 음성 모드가 더 자연스러워"라고 말한다면 — 그렇지 않습니다. 더 똑똑해졌고 이제 여러분의 인박스와 캘린더를 건드릴 수 있지만, 대화 느낌은 이전과 같은 턴 기반 경험입니다.

업데이트 작동시키기

Guided walkthrough1 of 5
  1. 업그레이드는 Anthropic의 모바일 앱, Claude Desktop, 웹 앱 전반에서 베타로 롤아웃 중입니다. 모델 선택기가 아직 보이지 않으면 앱 업데이트를 확인하고 음성 시트를 다시 여세요.

Voice request that actually uses the new tool access

"Reschedule my 3 pm with Sara to Thursday morning, draft a short apology email in Gmail, and add the new slot to the shared team calendar — read the draft back to me before sending."

그 한 발화가 이제 작동합니다. 왜냐하면 (a) 마이크 뒤의 모델이 시퀀스를 계획하기에 충분히 유능하고, (b) Google Calendar와 Gmail 커넥터가 음성에 살아 있고, (c) "보내기 전에 다시 읽어줘"가 화면을 볼 수 없을 때 정확히 원하는 체크포인트이기 때문입니다.

모델 선택기: 언제 무엇으로 전환할지

선택기는 업데이트에서 가장 유용한 단일 레버입니다. 원칙:

  • Haiku — 캡처, 빠른 답, 걷고 말하기, 그리고 무료 티어의 모든 것. 가장 싸고 빠름.
  • Sonnet — 기본 균형. 충분한 왔다갔다, 피치 피드백, 작은 작업 계획, 한두 도구를 쓰는 메시지 초안.
  • Opus — 음성으로 깊은 추론: 전략, 귀로 코드 리뷰, 다단계 도구 시퀀스("이 세 문서를 봐, 차이를 요약해, 그런 다음 이메일 초안 작성"). 말하기 시작 전 눈에 띄게 더 긴 멈춤 예상 — 그것이 여러분이 요청한 깊이입니다.
Pro tip

파워 무브: Haiku에서 통화를 시작해 컨텍스트를 빨리 캡처하고, "이제 그 모든 것을 생각해" 순간에는 Opus로 전환. 지저분한 셋업 동안 Haiku의 반응성을 얻고, 중요할 때만 Opus의 깊이를 얻습니다 — 전체 대화에 Opus의 지연을 지불하지 않고.

음성의 연결 앱 — 실제로 무엇이 작동하나

출시 시 음성에서 가장 일관되게 작동한다고 보고된 커넥터는 Gmail, Google Calendar, Google Docs, Slack입니다. 여러 매체는 Canva와 Notion도 나열합니다 — Anthropic은 새 커넥터를 정기적으로 배포하므로 어떤 특정 목록이든 움직이는 타깃으로 취급하고 여러분에게 실제 사용 가능한 것은 Settings → Connectors 시트를 확인하세요.

무료 티어는 연결 앱 하나를 받습니다; 유료 요금제는 다수를 받습니다. 그 단일 앱 상한이 무료 티어가 명백히 좁아지기 시작하는 지점입니다 — 음성은 "내 모든 도구 연결"이 스스로 값을 하는 곳입니다.

A hands-free morning triage

"Read me the subject lines and first sentences of unread emails from the last 12 hours, group them by whether they need a reply today, and add three follow-up reminders to my calendar for tomorrow morning."

실용 패턴과 함정

내면화할 가치가 있는 몇 가지:

  • 언어는 수동으로 설정해야 합니다. 음성은 영어, 프랑스어, 독일어, 힌디어, 인도네시아어, 이탈리아어, 일본어, 한국어, 포르투갈어(브라질), 스페인어를 지원합니다. 언어를 골라야 합니다 — 모델은 자동 감지하지 않습니다.
  • 다중 도구 호출은 지연을 더합니다. 응답이 느리면 보통 모델이 두세 커넥터를 순차 호출하기 때문입니다. 턴당 더 적은 것을 요청하세요.
  • 도구 결과가 음성에 완전히 표시되지 않을 수 있습니다. 음성으로 시작; 같은 채팅의 텍스트 뷰로 전환하여 Claude가 실제로 무엇을 했는지 검사. 채팅은 하나의 아티팩트입니다 — 마이크와 텍스트 필드는 그것으로 들어가는 두 방법일 뿐.
  • 음성은 여러분의 텍스트 채팅 메모리와 선호의 하류입니다. Memory를 사용하면 음성이 같은 개인 컨텍스트를 봅니다. Reflect를 사용하면 음성 세션이 월별 요약에 카운트됩니다.
  • 이것은 풀 듀플렉스 시스템이 아닙니다. 여러분이 깔끔하게 인터럽트하거나 생각하는 동안 "음"을 듣기를 바라는 자신을 발견한다면 — 그것은 여러분 작업이 실제로 GPT-Live나 Kyutai Moshi 같은 연구 데모를 원한다는 신호이지, Claude 음성이 아닙니다. 다른 도구.
Key takeaways
  • 2026년 7월 23일 업데이트는 Claude 음성 뒤의 모델을 바꿨습니다 — 음성 스택이 아니라. 같은 턴 기반 아키텍처, 그 위의 더 깊은 추론과 실제 도구 접근.
  • 음성은 여러분의 마지막 텍스트 채팅 모델을 상속하고 그 가장 빠른 버전을 실행합니다. 음성 기본을 바꾸려면 텍스트에서 모델 변경.
  • 라이브 통화 안의 모델 선택기가 대화 도중 Haiku → Sonnet → Opus를 점프하게 합니다 — 캡처를 위해 Haiku의 반응성을, 페이오프를 위해 Opus의 깊이를 유지하는 데 사용.
  • 무료 티어: Haiku만 + 연결 앱 하나. 유료 티어는 음성이 완전한 어시스턴트처럼 느껴지기 시작하는 곳입니다. 다중 도구 접근이 모델이 값을 하는 곳이기 때문.
  • Claude의 베팅은 전통적 파이프라인에서의 지능 + 도구; OpenAI의 GPT-Live는 풀 듀플렉스 대화에 베팅. 둘 다 서로 다른 문제에 대한 옳은 답.

확인해 보세요

Check yourself

0/4
  1. 2026년 7월 23일 Claude 음성 업데이트 — 후드 아래에서 실제로 무엇이 바뀌었나요?
  2. 통화 시작에 빠른 캡처와 끝에 깊은 종합을 원합니다. 최선의 움직임?
  3. 무료 티어에 있고 Gmail을 연결했습니다. 이제 Google Calendar를 추가하려 합니다. 어떻게 되나요?
  4. 사용자가 'Opus의 Claude 음성이 이전보다 더 자연스럽다'고 말합니다. 신뢰할 만한 주장인가요?

Flashcards

Enter 또는 스페이스 키를 눌러 카드를 뒤집습니다. 좌우 화살표 키로 카드를 이동할 수 있습니다.용어가 표시되었습니다.
1 / 6

Sources & further reading