メインコンテンツまでスキップ

全二重音声AI:なぜ音声エージェントは突然本物になったのか

初級

10年間、コンピュータと話すとは、人間のふりをするトランシーバーと交互に順番を取ることでした。2026年7月8日、OpenAIはGPT-Liveを出荷しました — 話しながら聞く音声モデルで — トランシーバーの時代は公式に終わり始めました。このページは、内部で実際に何が変わったのか、なぜ古い音声スタックがロボット的に感じられる運命だったのか、そして誇張なしに2026年の音声エージェントの状況全体をどう判断するかを説明します。

What you'll learn
  • 古典的なSTT → LLM → TTSパイプラインがなぜ常に遅く感じられたのかを理解する — それは磨き不足ではなく物理だ
  • 全二重が何を意味するかを知る:聞くのと話すのを同時に行う1つの音声ネイティブモデル
  • GPT-Liveと現在の音声状況(OpenAI、Google、ElevenLabs、Anthropic、オープンモデル)について検証済みの事実を得る
  • 音声エージェントが今日、真に実用可能なのはいつか — そして何がまだ壊れるかを知る

200ミリ秒の問題

ここに、このページのほかのすべてを説明する事実があります:人間は互いに約0〜200ミリ秒で応答する。 10言語にわたる画期的な言語横断研究(Stivers et al., PNAS 2009)は、応答間隙がテストされたすべての文化で0ミリ秒付近に集まることを見出しました — 私たちは相手が話し終える前にルーチンで答え始めます。脳が相手のターンの終わりを予測するからです。

さて、古典的な音声アシスタントスタックと比べてみましょう。それは互いに接着された3つの別々のモデルのパイプラインでした:

  1. **STT(音声認識)**があなたの音声をテキストに書き起こし、
  2. LLMが書き起こしを読んで返信を書き、
  3. **TTS(音声合成)**が返信を音声に戻す。

各段階は次が始まる前に(おおむね)終わらなければならないので、その遅延が積み重なります。さらに悪いことに、パイプラインはあなたがいつ話し終えたかを知りません — 音声には「送信」ボタンがありません — なのでエンジニアは**VAD(音声活動検出)**の沈黙タイマーをボルト留めしました:おおよそ0.5秒から1秒の沈黙を待ってから、ターンが終わったと推測します。その単一のハックが、古典的な2つの失敗モードの両方を説明します:考えるために文の途中で止まるとボットが割り込み、きっぱり話し終えてもそれでも沈黙タイマーを待って座り込む。すべて足し合わせると、人間が約0〜200ミリ秒を期待する場所で1〜3秒の無音が生まれます — モデルが一言も言う前に、桁違いに遅いのです。

そしてもっと悪化します:パイプラインはトランシーバーのように半二重です。ボットが話している間、それは聞いていません。特別なエンジニアリングなしに割り込む(「バージイン」する)ことはできず、ボットはあなたが話している間に「うんうん」と言うことも決してできず、あらゆるオーバーラップ — 会話の最も人間的な部分 — は構造上、単に不可能です。

「全二重」が実際に意味するもの

**全二重(full-duplex)は電気通信の用語です:両方向が同時に伝送する(電話)、対して半二重(half-duplex)**は交互に切り替わる(トランシーバー)。AI音声に適用すると:

  • モデルは聞くのと話すのを同時に行う。 「あなたのターン / 私のターン」という状態機械はなく — 入力音声が連続的に流れ込む一方で、出力音声が流れ出ます。
  • 音声ネイティブである。 1つのモデルが音声を直接消費し生成します。3つのモデルがテキストを渡し合う代わりに。書き起こし段階も合成段階もなく、積み重なるレイテンシもなく — 情報の損失もありません(トーン、ためらい、皮肉、感情が生き残ります。それらが決してテキストに平坦化されなかったからです)。
  • ターンの取り合いはタイマーではなく学習された振る舞いになる。 GPT-Liveに関するOpenAIの説明によれば、モデルは「毎秒何度も」相互作用の決定をします:話すか、聞き続けるか、止めるか、相づちを打つか、割り込むか、ツールを呼ぶか。沈黙検出のハックは消えます。モデルが人間のようにターンの終わりを予測するからです。
  • 相づちとバージインが無料で付いてくる。 あなたが話している間に「うんうん」とつぶやいたり(バックチャネル)、あなたが割り込んだ瞬間に文の途中で止まったり(バージイン)、あなたが考えている間に黙っていたり — パイプラインでは不可能かハックだったすべて — ができます。

ほとんど知られていないこと:全二重は2026年にOpenAIが発明したものではない。 フランスのラボKyutaiは2024年にMoshiをオープンソース化しました — 約160ms理論値 / 約200ms実用値のレイテンシを持つ全二重音声モデルで、2つの並列音声ストリーム(あなたのものと自分のもの)をモデル化し、時間整列されたテキストトークンの「内なる独白(Inner Monologue)」を使って自分の発話を言語的に一貫させます。今日、重みをダウンロードしてローカルで実行できます。今月変わったのは、全二重が研究デモから数億人のChatGPTユーザーのためのデフォルトインターフェースになったことです。

GPT-Live:OpenAIが実際に出荷したもの

OpenAIの発表とローンチ報道(2026年7月8日)に対して検証済み:

  • 2つのモデル:GPT-Live-1とGPT-Live-1 mini。 miniはChatGPT VoiceのデフォルトとしてAdvanced Voice Modeを置き換え(無料ティアを含む)、より大きなGPT-Live-1は有料ティア向けです。TechCrunchは、すでに1億5,000万人以上がChatGPTの音声機能を使っていると報じています。
  • 真の全二重アーキテクチャ。 出力を生成しながら入力を連続処理し、話す/聞く/止める/割り込む/ツールの決定を毎秒何度も行います。相づち(「うんうん」「うん」)を打ち、速い往復を処理し — 注目すべきことに — 黙ったまま、呼ばれるまでコンテキストを吸収し続けることができます。
  • フロンティアモデルへの委任。 Web検索、より深い推論、エージェント的な作業のために、GPT-LiveはタスクをOpenAIのフロンティアモデル(ローンチ時はGPT-5.5)にバックグラウンドで委ね、結果が返ってくる間もあなたと話し続けます。音声モデルは会話のフロントエンドで、重い思考は別の場所で起きます。この「速い話し手 + 遅い思考者」の分業が、注視すべきアーキテクチャパターンです。
  • ライブ翻訳は、連続的な聞きながら話す設計から自然に生まれます — モデルはあなたの文を、あなたが言うのとほぼ同時に別の言語でレンダリングできます。(ローンチ報道は、一部の言語でアクセント品質がまだ不均一だと指摘しました。)
  • ローンチ時に開発者APIなし。 GPT-Liveは今のところChatGPT製品です。OpenAIはAPIアクセスが来るとし、サインアップフォームを用意しています。ビルダーには、Realtime API上のgpt-realtimeが現行の開発者製品です(下記参照)。
  • ローンチ時の既知の制限: 音声セッション内でのビデオ/画面共有なし、主要言語以外での不均一な品質、そしてOpenAIは感情的依存の影響を監視していると述べています。

音声の状況、検証済み(2026年7月)

プレイヤー存在するもの全二重?備考
OpenAI — GPT-LiveChatGPT Voice(コンシューマー)はい — 音声ネイティブ難しいタスクを会話の途中でフロンティアモデルに委任;まだAPIなし
OpenAI — Realtime API(gpt-realtime)開発者API、GA音声対音声、単一モデル本番音声エージェント:SIP電話、リモートMCPサーバー、画像入力
Google — Gemini Live API開発者API(AI Studio / Vertex、GA)ネイティブ音声、ストリーミングバージイン、「プロアクティブ音声」(関連するときだけ話す)、感情的な対話、ツール使用 + Google検索
ElevenLabs — Agentsエージェントプラットフォーム(2026年3月ローンチ)独自のターン取りモデルによるオーケストレートされたスタックTTS/STT + ターン取り + ツール呼び出し;70以上の言語;500ms未満の初回ターン主張;電話/Web/アプリチャネル
Anthropic — ClaudeClaudeアプリの音声モード;Claude Codeでのプッシュトゥトーク/voice(2026年3月、多言語が2026年6月にベータ卒業)いいえ — ターンベース話して、保存された書き起こし付きで話された返信を得る。検証日時点で音声ネイティブの全二重モデルは発表されていない — 誰にもそうでないと言わせるな
Kyutai — Moshiオープンウェイト + コード(GitHub、Hugging Face)はい — オープンソースの証明約160〜200msレイテンシ、デュアルストリーム音声、「内なる独白」;ローカルで実行

その表からほとんどの報道が見逃す2つの要点:(1) 今日「音声エージェント」は2つの異なるアーキテクチャを意味します — 真に音声ネイティブな全二重モデル(GPT-Live、Moshi、Geminiのネイティブ音声)対、学習されたターン取りモデルを上に載せた非常に速く、よくオーケストレートされたパイプライン(ElevenLabs Agents)。どちらも良く感じられ得ますが、発話をオーバーラップできるのは前者だけです。(2) オープンソースの選択肢は本物です:Moshiは、自分のハードウェアで全二重を実行できることを証明しており、それはあなたのユースケースが音声をクラウドに送れない場合に重要です(その判断枠組みはモデルを選ぶを参照)。

全二重の会話が実際にどう流れるか

Guided walkthrough1 of 5
  1. 録音してから送信、はない。あなたのマイク音声はフレームごとにトークンにエンコードされ(Moshiのコーデックは80msフレームを使う)、届くにつれてモデルに供給される — モデルが文の途中でも。

音声エージェントが今実用可能になったとき — そして何がまだ壊れるか

今、真に実用可能:

  • カスタマーサポートと電話ワークフロー。 1秒未満のターン取りにバージインが加わり、2大クレーム要因を取り除きます。Realtime APIのSIPサポートとElevenLabs Agentsは、まさにこれを狙っています。
  • ハンズフリーと目が塞がった用途。 運転、料理、フィールドワーク、アクセシビリティ — 相互作用がついに発話に追いつきます(Claudeアプリの音声モードは、すでにこれのキャプチャ・書き起こし版をカバーしています)。
  • ライブ翻訳と語学練習。 聞きながら話すことが、ほぼ同時通訳と自然な会話ドリルを初めて可能にします。
  • エージェントのフロントエンドとしての音声。 委任パターン — 速い音声モデルと話しつつ、遅いフロンティアモデルが作業する — は、「長時間走るエージェント的作業」を音声で管理するというOpenAIの表明した賭けです。

まだ壊れる:

  • 幻覚された音声。 音声ネイティブモデルは、事実だけでなくでも幻覚し得ます:言語のドリフト、崩れた名前や数字、外れたアクセント(GPT-Liveのローンチ翻訳デモはまさにこの批判を招きました)。確認していない話された数字を決して信じないでください。
  • 騒がしい環境とクロストーク。 常時開いたマイクはすべてを聞きます — わきの会話、テレビ、2人目の話し手。全二重はモデルを周囲の音によりさらされやすくし、その逆ではありません。
  • リアルタイムアクションの安全性。 会話速度で行動するモデルは、聞き間違えた文に会話速度で行動し得ます。お金、メッセージ、削除に触れるあらゆる音声エージェントには、明示的な話された確認ゲートと読み取り専用デフォルトへの傾きが必要です — どのエージェントとも同じルール(Foundations参照)ですが、より低忠実度の入力チャネルで。
  • 感情的依存。 相づちを打ち、ためらい、あなたに決して飽きないシステムは、友人のように感じられるよう設計されています。OpenAI自身がこれの監視をフラグ付けしています。それに応じて設計(し、使用)してください。

音声エージェントのシステムプロンプトの骨格(音声ネイティブモデルとパイプラインの両方で機能)

You are a voice assistant for {company}. You are SPEAKING, not writing.

Style:
- Short sentences. One idea per sentence. No lists, no markdown, no URLs read aloud.
- If the user interrupts, stop immediately and address what they said.
- If the user pauses mid-thought, stay silent. Do not fill silence.

Safety:
- Before ANY action that sends, buys, deletes, or changes something:
say back exactly what you will do and wait for a clear spoken "yes".
- Repeat numbers, names, and addresses back for confirmation — always.
- If audio is unclear or noisy, say what you think you heard and ask.
- If asked for something outside {scope}, say so and offer a human handoff.

理解度チェック

0/4
  1. 古典的なSTT → LLM → TTSスタックはなぜ常に遅く感じられたのですか?
  2. 全二重モデルが、半二重パイプラインには構造上できないことは何ですか?
  3. GPT-Liveは、Web検索や深い推論が必要な質問をどう処理しますか?
  4. GPT-Liveがローンチする*前に*真だったのは、次のうちどれですか?
音声AIの語彙
Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 8
Key takeaways
  • 古いスタックは作りが悪かったのではなく — 構造的に遅すぎた:積み重なったSTT/LLM/TTSレイテンシに沈黙タイマーが加わり、人間が期待する約0〜200msに対して遅かった
  • 全二重 = 話しながら聞く1つの音声ネイティブモデル;バージイン、相づち、意図的な沈黙が、ハックではなく学習された振る舞いになる
  • GPT-Live(2026年7月8日)はChatGPTで全二重を主流化し、委任を切り開く:速い音声モデルがフロントに、フロンティアモデルの推論がバックグラウンドに
  • 状況は2つに分かれる:音声ネイティブの全二重(GPT-Live、Geminiのネイティブ音声、Moshi — 2024年からオープンソース)対、学習されたターン取りを持つ速いオーケストレートされたパイプライン(ElevenLabs Agents);Claudeの音声はターンベースのまま
  • 音声エージェントは今やサポート、ハンズフリー、翻訳に実用可能 — だが音声の幻覚、騒がしい部屋、リアルタイムアクションの安全性は依然として確認ゲートを要求する

次に

出典とさらに読む