Opus と Sonnet の Claude 音声(2026 年 7 月): 推論優先の音声 vs GPT-Live
- Anthropic が 2026 年 7 月 23 日に実際に出荷したもの — と意図的に変更しなかったものを理解する
- 会話中に Haiku、Sonnet、Opus を切り替える時、そして切り替えたときに何が変わるかを知る
- 無料段階の上限に達せずに、コネクトアプリコネクタ(Gmail、Calendar、Docs、Slack)を音声から使う
- Claude のターンベース音声が OpenAI の全二重 GPT-Live と異なる設計上の賭けである理由を見て、仕事に適したツールを選ぶ
2026 年 7 月 23 日、Anthropic は Claude の音声モードを重い推論モデル — Haiku と並んで Opus と Sonnet — に開放し、コネクトアプリ(Gmail、Google Calendar、Google Docs、Slack など)を音声体験に配線しました。2 週間前の 7 月 8 日、OpenAI は GPT-Live を出荷しました。これは同時に聞き話す音声ネイティブの全二重システム。同じ週、音声 AI がどうあるべきかについての 2 つのまったく異なる賭け。
このページはその 2 つを分解します。実際に手に取るべきものにとって違いは重要だからです。
Anthropic が出荷したもの(そして意図的にしなかったもの)
ここが非自明な部分: Anthropic は音声スタック自体をアップグレードしていません。会社のスポークスパーソンが TechCrunch などに、Claude は ターンベース設計 —「Claude は聞き、考えるために一時停止し、それから答える」 を維持し、このリリースで基礎音声モデルは変更されなかったと伝えました。変わったのは音声の背後にある推論モデル: 以前は Haiku のみでしたが、今は Opus の思考や Sonnet のバランスを音声の相互応答の背後に配置できます。
その枠付けがこのページのすべてを予測します:
- より深い回答を期待する、より滑らかな会話ではなく。
- ツール重視の音声リクエストが実際に機能することを期待する(メール下書き、会議の再スケジュール)。マイクの背後のモデルが計画するのに十分能力があるから。
- GPT-Live 風の割り込み、バックチャネル、あなたが話している間にモデルが「うんうん」とつぶやくことは期待しない — それは全二重の音声ネイティブモデルを必要とし、Claude 音声はそうではない(まだ)。
最後にテキストチャットで Opus を使ったなら、音声は Opus で始まる — しかし会話を応答性良く保つためにそのモデルファミリーの最速世代を選ぶ。あなたのテキストモードの習慣が音声のデフォルトを設定する。テキストでモデルを切り替えるのが、次にマイクをタップしたときに音声が渡すものを変える最も簡単な方法。
ターンベースの賭け vs 全二重 GPT-Live
両方の発表が同じ 15 日以内に着陸しました。異なる問題を解いています。
| Claude Voice(2026 年 7 月 23 日) | GPT-Live(2026 年 7 月 8 日) | |
|---|---|---|
| アーキテクチャ | ターンベース: STT → LLM → TTS パイプライン(全二重音声 AI を参照) | 音声ネイティブ全二重 — 音声を直接消費し生成する 1 モデル |
| 割り込み / バックチャネル | なし。聞いてから答える | あり。割り込め、「うんうん」と言え、静かにいられる |
| 音声内のモデル段階 | Haiku、Sonnet、Opus(有料)。Haiku のみ(無料) | GPT-Live-1(有料)、GPT-Live-1 mini(デフォルト、無料含む) |
| 推論深度 | テキストモデルを継承 — Opus は今音声で考えられる | 高速会話フロントエンド。重い推論はバックグラウンドのフロンティアモデルに委任 |
| 音声内のコネクトツール | Gmail、Google Calendar、Google Docs、Slack(有料 = 複数、無料 = 1 つ) | 会話中の音声ネイティブツール使用 |
| レイテンシプロファイル | 深度優先: 重いモデル = 深い回答、話す前の長い一時停止 | レイテンシ優先: 人間らしいターンテイキングに設計 |
| 開発者 API | 執筆時点で開発者音声 API なし | GPT-Live はまだ API になし。gpt-realtime が現在の開発者製品のまま |
Claude 音声を選ぶ — 強い推論モデルで声に出して考え、コネクトアプリで実仕事を音声で終わらせたい時。GPT-Live を選ぶ — 深度より会話自体が重要な時。インタビュー、家庭教師、言語練習、割り込みと素早い交換が要点の何か。同じ週に両方が正しいこともあります。
Anthropic 自身の枠付けは決定的です: 「インテリジェンスとツールアクセスに焦点」。それが変わったことを正直に説明する方法。「Opus 音声モードはより自然」と誰かが言うなら — そうではありません。より賢く、あなたの受信箱とカレンダーに触れられますが、会話の感触は以前と同じターンベース体験です。
アップデートを動かす
- アップグレードは Anthropic のモバイルアプリ、Claude Desktop、Web アプリでベータでロールアウト中。モデルピッカーがまだ見えないなら、アプリ更新をチェックして音声シートを再度開く。
- 音声はテキストチャットで最後に選んだモデルにデフォルトし、そのファミリーの最速版を実行する。昨日テキストで Opus にいたなら、今日音声は Opus で始まる。デフォルトを変えるには、まずテキストチャットでモデルを切り替える。
- ライブ音声通話内で、モデルピッカーが通話を終了せずに Haiku、Sonnet、Opus 間をジャンプさせる。タスクが変わるときに使う — Haiku でキャプチャ、Sonnet または Opus で深める。
- 設定 → コネクタでコネクタ(Gmail、Google Calendar、Google Docs、Slack)を追加。有料プラン(Pro、Max、Team、Enterprise)は複数を許可。無料は Haiku と 1 つのコネクトツールに制限。
- Anthropic は複数のツールを一度に使うと短い遅延が加わり、ツール結果が音声で完全に表示されない可能性があると警告。よくあるパターン: 音声で開始し、同じチャット内のテキストビューに切り替えて下書きメールや返された文書を確認する。
新しいツールアクセスを実際に使う音声リクエスト
"Reschedule my 3 pm with Sara to Thursday morning, draft a short apology email in Gmail, and add the new slot to the shared team calendar — read the draft back to me before sending."
その 1 つの発言が動くのは (a) マイクの背後のモデルがシーケンスを計画するのに十分能力があること、(b) Google Calendar と Gmail のコネクタが音声でライブであること、そして (c) 「送信前に読み返す」が画面が見えないときに欲しいまさにチェックポイントだから。
モデルピッカー: いつ何に切り替えるか
ピッカーはこのアップデートで最も有用な単一レバー。目安:
- Haiku — キャプチャ、素早い回答、歩きながら話す、無料段階のすべて。最安で最速。
- Sonnet — デフォルトのバランス。十分長い相互応答、ピッチへのフィードバック、小さいタスクの計画、1〜2 のツールを使うメッセージの下書き。
- Opus — 音声での深い推論: 戦略、耳でのコードレビュー、複数ステップのツールシーケンス(「これら 3 つの文書を見て、差分を要約し、それからメールを下書き」)。話し始める前に目に見える長い一時停止を期待 — それが求めた深度。
パワームーブ: 通話を Haiku で始めて素早くコンテキストをキャプチャし、その後「今、それら全部について考える」瞬間に Opus に切り替える。散らかったセットアップ中に Haiku の応答性を、重要な場所でのみ Opus の深度を得る — 会話全体で Opus のレイテンシを支払わずに。
音声内のコネクトアプリ — 実際に何が動くか
ローンチ時、音声で動作すると最も一貫して報告されているコネクタは Gmail、Google Calendar、Google Docs、Slack。複数の媒体は Canva と Notion も挙げています — Anthropic は定期的に新しいコネクタを出荷するので、特定のリストは動くターゲットとして扱い、設定 → コネクタシートで実際に利用可能なものをチェックしてください。
無料段階は1つのコネクトアプリ。有料プランは複数を得ます。その単一アプリ上限が、無料段階が明らかに狭く感じ始める場所です — 音声は「すべてのツールを接続」が元を取る場所。
ハンズフリーの朝のトリアージ
"Read me the subject lines and first sentences of unread emails from the last 12 hours, group them by whether they need a reply today, and add three follow-up reminders to my calendar for tomorrow morning."
実用パターンと落とし穴
内在化する価値のあるいくつか:
- 言語は手動で設定する必要がある。 音声は英語、フランス語、ドイツ語、ヒンディー語、インドネシア語、イタリア語、日本語、韓国語、ポルトガル語(ブラジル)、スペイン語をサポート。言語を選ぶ必要がある — モデルは自動検出しない。
- マルチツールコールはレイテンシを加える。 応答が遅い場合、通常はモデルが 2〜3 のコネクタを順番に呼んでいるから。ターンあたり少なく求める。
- ツール結果は音声で完全に表示されない可能性。 音声で開始し、同じチャットのテキストビューに切り替えて Claude が実際に何をしたか確認する。チャットは 1 つのアーティファクト — マイクとテキストフィールドはただそれへの 2 つの入り口。
- 音声はあなたのテキストチャットのメモリと設定の下流。 メモリ を使うなら、音声は同じ個人コンテキストを見る。Reflect を使うなら、音声セッションは月次リキャップにカウント。
- これは全二重システムではない。 きれいに割り込みたい、考えている間に「うんうん」を聞きたいと思う自分に気付いたら — それはタスクが実際には GPT-Live や Kyutai Moshi のような研究デモを欲していて、Claude 音声ではないシグナル。異なるツール。
- 2026 年 7 月 23 日のアップデートは Claude の音声の背後のモデルを変えた — 音声スタックではない。同じターンベースアーキテクチャ、その上により深い推論と実ツールアクセス。
- 音声は最後のテキストチャットモデルを継承し、その最速版を実行。音声デフォルトを変えるにはテキストでモデルを切り替える。
- ライブ通話内のモデルピッカーが会話中に Haiku → Sonnet → Opus をジャンプさせる — キャプチャに Haiku の応答性、報いに Opus の深度を保つ。
- 無料段階: Haiku のみ + 1 つのコネクトアプリ。有料段階は音声が完全なアシスタントに感じ始める場所。マルチツールアクセスがモデルが元を取る場所だから。
- Claude の賭けは従来のパイプラインでのインテリジェンス + ツール。OpenAI の GPT-Live は全二重会話に賭ける。両方とも異なる問題に対する正しい答え。
自分を確認する
自分を確認する
0/4フラッシュカード
出典とさらに読む
- Anthropic が Claude 音声モードをより能力のあるモデルで更新 — TechCrunch(2026 年 7 月 23 日)
- Anthropic が Opus と Sonnet を Claude Voice Mode に — Unite.AI
- Anthropic が全ユーザーの Claude Voice Mode にモデル選択を追加 — SQ Magazine
- Claude Voice Mode が Sonnet、Opus、アプリコネクタを追加 — TechMyMoney(2026 年 7 月 23 日)
- OpenAI がより自然なライブ会話のための新音声モデルをリリース — TechCrunch(2026 年 7 月 8 日)
- AILmanac 関連ページ: 全二重音声 AI(GPT-Live、Moshi、そして 200 ms 問題) · Claude と話す(音声モード) · コネクタ · モデル選び