讲话总有停顿、重复、「呃」跟「就是说」,但 Google 认为这些不该原封不动变成屏幕上的文字。Google 发表新一代语音辨识模型 Gemini 3.5 Transcribe,主打把用户「未经整理的口语」自动转换成结构化文字,中间会拿掉填充词,也能理解说话者中途自我修正的意思,不会把改口前后的内容都照抄一遍。
官方表示,这个模型能自动侦测超过 85 种语言,辨识精准度优于先前版本,并且可以学习自订词汇与特殊拼法,对于订单编号、邮递区号这类英数混合字符串也有较好的截取能力。针对事先录好的音档,Gemini 3.5 Transcribe 还能替最多三位讲者标记发言,并附上逐字时间戳记,这种功能对整理 Podcast 逐字稿会有实际用途。
Gemini 3.5 Transcribe 目前已经是 Android 设备上 Rambler 功能的底层模型,包括 Pixel 11 系列手机;在 macOS 版 Gemini App 中,它也能与其他 Gemini 模型搭配运行代理型任务。
比较值得留意的是 Chrome 的部分。Google 表示不久后将能在 Chrome 网页的任意输入字段使用语音输入,等于不限定在特定 App 或表单,用户可以直接用讲的来回复消息、发文,或是对 Gemini 下语音指令。除此之外,这个模型也已经进驻 Google 的代理型开发平台 Google Antigravity,并将陆续加入 Search Live、Gemini Live、Docs、Keep 与 Gmail,开发者则可透过 API 串接使用。
Google 尚未公布 Chrome 语音输入功能与其他服务集成的确切上线时间。