講話總有停頓、重複、「呃」跟「就是說」,但 Google 認為這些不該原封不動變成螢幕上的文字。Google 發表新一代語音辨識模型 Gemini 3.5 Transcribe,主打把使用者「未經整理的口語」自動轉換成結構化文字,中間會拿掉填充詞,也能理解說話者中途自我修正的意思,不會把改口前後的內容都照抄一遍。
官方表示,這個模型能自動偵測超過 85 種語言,辨識精準度優於先前版本,並且可以學習自訂詞彙與特殊拼法,對於訂單編號、郵遞區號這類英數混合字串也有較好的擷取能力。針對事先錄好的音檔,Gemini 3.5 Transcribe 還能替最多三位講者標記發言,並附上逐字時間戳記,這種功能對整理 Podcast 逐字稿會有實際用途。
Gemini 3.5 Transcribe 目前已經是 Android 裝置上 Rambler 功能的底層模型,包括 Pixel 11 系列手機;在 macOS 版 Gemini App 中,它也能與其他 Gemini 模型搭配執行代理型任務。
比較值得留意的是 Chrome 的部分。Google 表示不久後將能在 Chrome 網頁的任意輸入欄位使用語音輸入,等於不限定在特定 App 或表單,使用者可以直接用講的來回覆訊息、發文,或是對 Gemini 下語音指令。除此之外,這個模型也已經進駐 Google 的代理型開發平台 Google Antigravity,並將陸續加入 Search Live、Gemini Live、Docs、Keep 與 Gmail,開發者則可透過 API 串接使用。
Google 尚未公布 Chrome 語音輸入功能與其他服務整合的確切上線時間。