말에는 항상 일시 정지, 반복, "어" 및 "그냥 말하는 사람"이 있지만 Google은 이러한 내용이 화면의 텍스트로 바뀌어서는 안 된다고 믿습니다. Google은 사용자의 "조직화되지 않은 음성 언어"를 구조화된 텍스트로 자동 변환하는 데 중점을 둔 차세대 음성 인식 모델인 Gemini 3.5 Transcribe를 출시했습니다. 채움말은 중간에 제거되며 화자의 자가수정의 의미도 중간에 이해할 수 있으며 변경 전후의 내용을 복사하지 않습니다.
관계자에 따르면 이 모델은 이전 버전보다 향상된 인식 정확도로 85개 이상의 언어를 자동으로 감지할 수 있으며 맞춤형 어휘와 특수 철자를 학습할 수 있다고 합니다. 또한 주문 번호 및 우편번호와 같은 혼합 영숫자 문자열에 대한 추출 기능이 향상되었습니다. 사전 녹음된 오디오 파일의 경우 Gemini 3.5 Transcribe는 최대 3명의 화자의 연설을 표시하고 축어적 타임 스탬프를 첨부할 수도 있습니다. 이 기능은 팟캐스트의 내용을 그대로 정리하는 데 실용적으로 사용됩니다.
Gemini 3.5 Transcribe는 현재 Pixel 11 휴대폰 시리즈를 포함한 Android 기기의 Rambler 기능을 위한 기본 모델입니다. macOS 버전의 Gemini 앱에서는 다른 Gemini 모델과 페어링하여 에이전트 유형 작업을 수행할 수도 있습니다.
더욱 주목되는 것은 크롬 부분이다. 구글은 곧 크롬 웹페이지의 모든 입력 필드에서 음성 입력을 사용할 수 있게 될 것이라고 밝혔습니다. 이는 특정 앱이나 양식에만 국한되지 않는다는 의미입니다. 사용자는 메시지에 직접 답장하거나 문자를 게시하거나 말을 통해 Gemini에게 음성 명령을 내릴 수 있습니다. 또한 이 모델은 구글의 에이전트 기반 개발 플랫폼인 구글 안티그래비티(Google Antigravity)에도 진입했으며, 점차 서치 라이브(Search Live), 제미니 라이브(Gemini Live), 독스(Docs), 킵(Keep), 지메일(Gmail)에도 추가될 예정이며, 개발자들은 API 연결을 통해 사용할 수 있다.
Google은 아직 Chrome의 음성 입력 기능이 다른 서비스와 통합될 정확한 출시 날짜를 발표하지 않았습니다.