AI

Gemini 3.8 Live、AIカスタマーサービスの無表情に終止符

Adrian Kessler
Googleで追加する

Gemini 3.8 Live with Live Avatarは、Googleの音声間変換モデルにリアルタイム動画のレイヤーを組み合わせたシステムだ。会話を止めることなくバックグラウンドでツールを呼び出しながら、唇の動きや表情を生成する。言語も自動で検出され、通話中に話す言語が切り替わっても、引き継ぎやシステムの再読み込み、聞き取れるほどの間を挟まず、アバターが対応する。

動画を後から重ねる従来の手法と異なるのは、音声と映像の生成が順番に行われるのではなく、同じリアルタイム推論経路で処理される点だ。この連携によって遅延が抑えられ、自然な会話のテンポが保たれる。Googleは音声と映像の出力の両方に、目立たない形でSynthIDの電子透かしを埋め込む。ストリームを録画して後から再生した場合でも、毎秒のデータにAI生成であることを示す機械可読タグが付与される。透かしは再エンコード後も残るため、書き出したクリップでも出所を検証できる。

この技術が実運用の規模で何を可能にするのかを最も明確に示しているのが、インド全土で企業向け導入を手がけるEqual AIだ。同社ではインドの9言語を同時に稼働させ、対応言語は合計97言語に及ぶなか、1日あたり100万件を超えるライブ通話を処理している。同等の稼働時間とシフト体制を人間のオペレーターで確保するなら、この処理量は経済的に現実的ではない。導入を支える設計思想の前提にあるのは、概念実証ではなく処理能力だ。

今回の発表で明らかにされていないのは価格だ。Googleは料金を公表せず、問い合わせ先として法人営業チームを案内している。組織が自社の参照画像からアバターを作るカスタムアバター機能を利用するには、セルフサービスではなく、別途の確認手続きを経たうえで企業向けの許可リストに登録される必要がある。LiveモデルのExtended Thinking機能は現在も非公開プレビューにとどまり、GoogleのほかのGemini製品と比べて推論の深さに制約がある。同時に利用できるセッション数の上限も明らかにされていない。価格や容量を公表せず個別に交渉する今回の限定的な提供形態は、段階的な企業向けリリースでGoogleが取ってきた方針に沿うものだ。

Gemini 3.8 Live with Live Avatarは現在、Gemini EnterpriseコンソールとLive APIから利用でき、米国と欧州連合にエンドポイントが設けられている。LiveモデルのExtended Thinkingについては、現在の非公開プレビュー参加者以外への提供時期は公表されていない。

この技術が答えを出すわけではない問いに、導入する企業が向き合うことになる。自動応答だと示す視覚的な手がかりをなくすことで、ユーザーの体験は向上するのか。それとも、自動応答が行われていると正直に伝える最後の目印まで失われるのか。

タグ: , , , , ,

Googleで追加する

ディスカッション

0件のコメントがあります。