AI

GPT-LiveがChatGPTに全二重音声をもたらす — AIの正体を明かしていたあの間が消えた

Adrian Kessler

OpenAIは2026年7月10日、ターン制のAdvanced Voice ModeをGPT-Liveに置き換え、毎週1億5,000万人の音声ユーザーを同時処理アーキテクチャへ自動移行させた。オプトインの画面も、廃止日の告知もなかった。

ChatGPTとの音声のやり取りが終わるたびに生じていた間には、見慣れた合図があった。モデルが処理を終え、返答を生成し、それからようやく発言権が戻ってくる。ターン制と呼ばれるそのリズムが、商用音声AIの大半を最初期の展開から規定してきた。OpenAIはそれをGPT-Liveで廃止した。

GPT-Liveは全二重アーキテクチャで動作し、入力音声を処理しながら同時に返答を生成する。OpenAIは2026年7月10日、Go・Plus・Proの有料プラン加入者にGPT-Live-1を、無料ユーザーにGPT-Live-1 miniを展開した。オプトインの案内はなく、Advanced Voice Modeはグローバルに置き換えられた。

実際に変わるのは、モデルの発話中に割り込んで止められることだ。GPT-Liveは短いあいづち、質問、方向転換を、どちらかの話者がターンを終える前に受け取れる。「うん」「そうですね」といった短い応答で注意を示したり、相手がまだ考えている間は静かに待ったりできる。ウェブ検索、深い推論、複雑な作業が必要になると、裏でフロンティアモデルに静かに委ね、結果をライブのやり取りに戻す。

全二重アーキテクチャは、GPT-Liveが発話内容をよりよく「理解する」ことを意味しない。それは、会話の「リズム」により自然に応じることを意味する。この区別は重要だ。初期ユーザーは、モデル自身の積極さが生み出すパターンを報告している。長く密度の高い説明に対して、GPT-Liveが全体の意味を処理し終える前に発言を肯定してしまうことがあり、一部のユーザーはあいづちが過剰に感じられると指摘した。システムは完全にOpenAIのサーバーで動作するため、すべての音声会話は低遅延の接続に依存する。1億5,000万人の週次ユーザー全員が同等の接続を持つわけではなく、インフラが遅い地域ではGPT-Liveのリアルタイムの野心がネットワークの実態を超える可能性がある。

OpenAIは音声を使っているユーザー全員を、同意を求めずに新システムへ移行させた。同社はGPT-Liveをアップグレードと位置づけており、全二重化は会話の流れを実際に改善する。しかし同時に、何百万人ものユーザーが期待値を合わせていたインタラクションモデルの変更でもあり、旧システムの廃止日は告知されていない。

現在のChatGPT加入者に対する料金変更は発表されていない。開発者と企業向けのAPIロールアウトが予定されており、早期アクセスの登録はすでに受け付けている。OpenAIはAdvanced Voice Modeの正式廃止日を確認していない。

タグ: , , , , ,

ディスカッション

0件のコメントがあります。