音声には常に、一時停止、繰り返し、「えー」や「ただの言い分」が含まれますが、Google はこれらを画面上のテキストに変換すべきではないと考えています。 Google は、ユーザーの「整理されていない話し言葉」を構造化テキストに自動的に変換することに焦点を当てた、新世代の音声認識モデル Gemini 3.5 Transcribe をリリースしました。つなぎ言葉は途中で削除され、途中で話者の自己修正の意味も理解でき、変更前後の内容をコピーしません。
関係者によると、このモデルは以前のバージョンよりも高い認識精度で85以上の言語を自動的に検出でき、カスタマイズされた語彙や特殊なスペルを学習できるという。また、注文番号や郵便番号などの英数字が混在する文字列の抽出機能も向上しています。事前に録音された音声ファイルの場合、Gemini 3.5 Transcribe は最大 3 人の講演者のスピーチをマークし、逐語的なタイムスタンプを添付することもできます。この機能は、ポッドキャストの逐語的トランスクリプトを整理するのに実用的です。
Gemini 3.5 Transcribe は現在、Pixel 11 シリーズの携帯電話を含む Android デバイス上の Rambler 機能の基礎となるモデルです。 Gemini アプリの macOS バージョンでは、他の Gemini モデルと組み合わせてエージェント タイプのタスクを実行することもできます。
さらに注目すべきはChrome部分です。 Google は、まもなく Chrome Web ページのあらゆる入力フィールドで音声入力を使用できるようになると発表しました。これは、特定のアプリやフォームに限定されないことを意味します。ユーザーはメッセージに直接返信したり、テキストを投稿したり、話すことで Gemini に音声コマンドを与えることができます。なお、このモデルはGoogleのエージェントベース開発プラットフォームGoogle Antigravityにも参入しており、順次Search Live、Gemini Live、Docs、Keep、Gmailに追加され、開発者はAPI接続を通じて利用できるようになる。
Google は、Chrome の音声入力機能を他のサービスと統合するための正確な開始日をまだ発表していません。