มีการหยุดชั่วคราว การกล่าวซ้ำ "เอ่อ" และ "เพียงแค่พูด" เสมอในคำพูด แต่ Google เชื่อว่าสิ่งเหล่านี้ไม่ควรถูกเปลี่ยนเป็นข้อความบนหน้าจอ Google ได้เปิดตัวโมเดลการรู้จำเสียงรุ่นใหม่ Gemini 3.5 Transcribe ซึ่งมุ่งเน้นไปที่การแปลง "ภาษาพูดที่ไม่มีการรวบรวม" ของผู้ใช้ให้เป็นข้อความที่มีโครงสร้างโดยอัตโนมัติ คำเติมจะถูกลบออกตรงกลางและสามารถเข้าใจความหมายของการแก้ไขตนเองของผู้พูดที่อยู่ตรงกลางได้และจะไม่คัดลอกเนื้อหาก่อนและหลังการเปลี่ยนแปลง
เจ้าหน้าที่กล่าวว่าโมเดลนี้สามารถตรวจจับภาษาได้มากกว่า 85 ภาษาโดยอัตโนมัติ โดยมีความแม่นยำในการจดจำที่ดีกว่าเวอร์ชันก่อนๆ และสามารถเรียนรู้คำศัพท์ที่กำหนดเองและการสะกดแบบพิเศษได้ นอกจากนี้ยังมีความสามารถในการแยกสตริงตัวอักษรและตัวเลขแบบผสม เช่น หมายเลขคำสั่งซื้อและรหัสไปรษณีย์ที่ดีกว่าอีกด้วย สำหรับไฟล์เสียงที่บันทึกไว้ล่วงหน้า Gemini 3.5 Transcribe ยังสามารถทำเครื่องหมายคำพูดของผู้พูดได้สูงสุดสามคนและแนบการประทับเวลาแบบคำต่อคำ คุณลักษณะนี้มีประโยชน์จริงสำหรับการจัดระเบียบสำเนาคำต่อคำของพอดแคสต์






