AI

OpenAIの音声AIが「待ち時間」をなくした — 料金は1分あたり$0.05

Susan Hill

現在市場にあるすべての音声AIは、発話前に待つよう指示する。OpenAIのGPT-Live-1は違う。同モデルはOpenAIのAPIを通じて利用可能で、人間が電話で行うように、割り込み、間、重なり合う発話を処理しながら、同時に聞き、話す。

音声レイヤーの料金は1分あたり0.05ドル——30分の会話で1.50ドル、または会話1,000分あたり50ドルとなる。開発者は推論バックエンドとして、OpenAI自社のGPT-6 Astra、またはツール呼び出しやビジネスロジックを処理する互換モデルを別途支払う。音声レイヤーは会話のメカニクスを管理し、推論レイヤーはAIが実際に何を言い、何をするかを決定する。

この分離が実際に意味すること:カスタマーサービスのボットは、「待って、実は別のオプションが欲しい」という発言を文の途中で聞き取り、用意された回答をそのまま続けるのではなく、それに応答できる。語学チューターは、生徒が単語につまずくのを、言い終わるのを待たずに捉えられる。予約システムは、人が繰り返し、考えを変え、互いに話し重なるような現実の電話に対処できる。

同時双方向音声処理をテストするために特別に設計された評価指標Full Duplex Benchにおいて、GPT-Live-1は前身のGPT-Realtime-2.1より30パーセンテージポイント高いスコアを獲得した。推論バックエンドとしてGPT-6 Astraと組み合わせると、会話の切れ目なく複雑なマルチステップクエリをテストするカスタマーサービスベンチマークTau3でトップとなる。

2層アーキテクチャは意図的な設計上の選択を反映している。音声タイミングと推論は別々に課金される。なぜなら、それらは異なるスケールをするからだ:軽量のチュータリングアプリを構築するスタートアップは、GPT-6 Astra上で数千の同時カスタマーサービスコールを実行するエンタープライズよりも、両方のレイヤーで支払いが少なくなる。音声の最低料金は、背後で何が動いていようと、1分0.05ドルである。

GPT-Live-1が変えないのは回答の質である。音声レイヤーはAIがいつ、どのように話すかを処理する——何を知っているかではない。タイミングの良い悪い回答は依然として悪い回答である。カスタマーサービスアプリケーションを構築する開発者は、両方のレイヤーを別々に評価する必要があり、推論バックエンドは音声レイヤー自体よりも請求額を増やす可能性がある。またOpenAIは、低帯域環境やノイズの多い電話回線において、フルデュプレックスアーキテクチャがどのように動作するかについてのデータを公開していない。これらの環境では継続的な音声入力の維持がより困難である。

GPT-Live-1は現在OpenAIのAPIで利用可能である。同社はこのモデルを搭載した消費者向け製品を発表していないが、ChatGPTの音声モードの将来バージョンが同じ基本アーキテクチャを採用する可能性があることを示唆している。0.05ドル/分の料金はローンチ時に適用される。OpenAIは料金変更のタイムラインや、音声レイヤーとの使用が承認されたサードパーティの推論モデルのリストを公開していない。

タグ: , , , , ,

ディスカッション

0件のコメントがあります。