AI

Gemini 3.5 Transcribe公開:Googleが85言語の音声をリアルタイム自動補正

Adrian Kessler

Gemini 3.5 Transcribeは、単に発言を書き起こすだけではない。発言者が言おうとした意図を汲み取り、本来伝えたかった内容に変換する。話し手が途中で言い直した場合——「火曜日、いや水曜日にスケジュールを入れて」——モデルは「水曜日」を出力し、訂正部分は破棄する。フィラーワードは消える。背景雑音があっても処理は止まらない。結果として得られるのは、生の音声キャプチャではなく、洗練された整形済みテキストだ。

インタビュー、ポッドキャスト、あるいは多言語コンテンツを収録するすべての関係者にとって、この違いこそがワークフローの根幹である。現在市販されているどの文字起こしツールも「発言内容の書き起こし」はこなす。しかし、その後処理を行う人間の編集者が、それ以外のすべてを担ってきた。Googleは今、その編集者機能をモデルそのものに組み込もうとしている。

このモデルは、APIの2つの異なるパスをサポートする。Live APIは、サブ秒レベルのレイテンシで双方向の連続ストリーミングを処理する——リアルタイム音声エージェント、カスタマーサービスボット、即時文字起こしが必要なあらゆる用途向けだ。Interactions APIは、録音済み音声——会議全般、通話ログ、インタビュー——を処理し、タイムスタンプ付きで最大3名の発話者を識別する。両APIとも、独立系ベンチマーク企業Artificial Analysisの測定で、ストリーミングモードでは4.0%、非ストリーミングモードでは2.6%のワードエラー率を達成している。Googleの従来型音声認識モデルChirp 3では、最終的な文字起こしに70%多い処理時間を要していた。

一般消費者向けの展開はより控えめだ。Androidでは、Gboard RamblerがすでにGemini 3.5 Transcribeを音声入力に活用している。GeminiのmacOSアプリは、Speak to Window機能を通じて英語での入力をサポートしている。Chrome対応は「近日公開」とされており、ユーザーはアプリを切り替えることなく、Web上のあらゆる入力欄——返信、投稿、フォーム——に直接音声で入力できるようになる。そのロールアウトの具体的な日程は未確認である。

モデルの限界も考慮すべきだ。複数話者の識別は最大3名までに制限されており、パネルディスカッションや円卓会議など、より多くの参加者がいる場面では回避策が必要となる。一般消費者向けのRamblerアプリは現在「一部の国と言語」でのみ利用可能で、モデルがサポートする85言語のすべてには対応していない。GoogleはAPIの価格を発表しておらず、現在Google AI Studioを通じてパブリックプレビューとして提供されている。エンタープライズ向けアクセスはGemini Enterprise Agent Platformを通じて提供され、価格は個別交渉となる。小規模なクリエイターにとって、コストの問題は依然として未解決である。

競合との比較も重要だ。OpenAIのWhisperは、現在も独立系開発者の間でデフォルトの選択肢であり、英語の音声ではワードエラー率5〜7%台を記録しており、フィラー除去や整形処理には後処理用のコードが必要となる。AssemblyAIやDeepgramといったサービスは話者分離機能を提供するが、Gemini 3.5 Transcribeがデフォルトで適用する、自然言語による補正機能は組み込まれていない。性能差は測定可能だが、85言語の中でも難易度の高い言語——地域アクセント、リソースの少ない言語、ノイズの多い環境——においてどの程度の性能を維持するかは、独立したテストによって確認する必要がある。

Googleの長期的な方向性を最もよく示している機能は、Chromeとの統合だ。Web上のあらゆる入力欄で音声入力が可能になれば、このモデルはもはや開発者向けツールではなく、人々が文字を入力するためのインフラとなる。その変更のロールアウト時期は未確認である。

タグ: , , , , ,

ディスカッション

0件のコメントがあります。