Gemini 3.5 Transcribe เปิดพรีวิวสาธารณะ: อัตราผิดพลาดของคำแบบสตรีม 4.0% Google อ้างว่าเป็นโมเดลแปลงเสียงเป็นข้อความที่แม่นยำที่สุด
Google DeepMind เปิดพรีวิวสาธารณะของ Gemini 3.5 Transcribe เมื่อวันที่ 26 สิงหาคม พ.ศ. 2569 อัตราผิดพลาดของคำที่วัดโดย Artificial Analysis อยู่ที่ 4.0% แบบสตรีม และ 2.6% แบบไม่สตรีม ลดเวลาการผลิตบทถอดเสียงฉบับสมบูรณ์ลงราว 70% เมื่อเทียบกับ Chirp 3 รองรับกว่า 85 ภาษา พร้อมตัดคำฟุ่มเฟือยและจัดรูปแบบอัตโนมัติ
เมื่อวันที่ 26 สิงหาคม พ.ศ. 2569 Google DeepMind ได้เปิดพรีวิวสาธารณะของ Gemini 3.5 Transcribe โดยวางตำแหน่งอย่างเป็นทางการว่าเป็น“โมเดลแปลงเสียงเป็นข้อความที่แม่นยำที่สุด” ทั้งนี้มิใช่การประกาศล่วงหน้า หากแต่เป็นเวอร์ชันที่ส่งมอบแล้วและนักพัฒนาสามารถเรียกใช้ได้ทันทีในวันเดียวกัน
ตัวเลขสองชุด: สตรีม 4.0% และไม่สตรีม 2.6%
อัตราผิดพลาดของคำ (WER) ที่วัดโดย Artificial Analysis ซึ่งเป็นหน่วยงานภายนอก แบ่งเป็นสองโหมด ได้แก่ โหมดสตรีมแบบเรียลไทม์อยู่ที่ 4.0% และโหมดไม่สตรีมซึ่งรับไฟล์เสียงทั้งช่วงก่อนประมวลผลอยู่ที่ 2.6% ส่วนบนเกณฑ์มาตรฐานสาธารณะข้ามภาษา FLEURS ทั้งสองโหมดอยู่ที่ 5.50% และ 5.04% ตามลำดับ เนื่องจาก FLEURS เป็นคลังข้อมูลสาธารณะข้ามภาษาที่ครอบคลุมภาษาและสำเนียงหลากหลายกว่า ตัวเลขจึงสูงกว่าค่าเฉลี่ยชุดแรกโดยธรรมชาติ ทั้งสองชุดมาจากแหล่งประเมินคนละแหล่ง จึงไม่ควรนำมาเทียบกันในลักษณะ“ภายในกับสาธารณะ” ประเด็นที่ควรสังเกตคือช่องว่างระหว่างสองโหมดแคบลงอย่างชัดเจนบน FLEURS
ด้านความสามารถ ได้เติมเต็มสิ่งที่เดิมต้องอาศัยการแก้ไขภายหลังไว้ในคราวเดียว ดังนี้
- รองรับมากกว่า 85 ภาษา พร้อมตรวจจับภาษาโดยอัตโนมัติ
- สำหรับไฟล์เสียงที่บันทึกไว้ล่วงหน้า สามารถระบุเวลาและแยกผู้พูดได้สูงสุด 3 คน (speaker diarization) โดยการรองรับเกิน 3 คนยังอยู่ในขั้นทดลอง
- กำหนดคลังคำศัพท์เฉพาะได้ เพื่อให้ชื่อเฉพาะ ชื่อแบรนด์ และรหัสสินค้าไม่ผิดเพี้ยน
- ตัดคำติดอ่างและคำฟุ่มเฟือยประเภท“เอ่อ”“คือว่า”ออกโดยอัตโนมัติ
- จัดรูปแบบผลลัพธ์อัตโนมัติเป็นย่อหน้าที่อ่านได้ มิใช่ข้อความยาวติดกัน
- ทำ function calling ร่วมกับโมเดล Gemini อื่นได้ เชื่อมต่อขั้นตอนถัดไปทันทีหลังถอดเสียง
การเปลี่ยนแปลงที่แท้จริงคือความเร็ว มิใช่เพียงความแม่นยำ
เมื่อเทียบกับ Chirp 3 รุ่นก่อนหน้า (ปี พ.ศ. 2568) Gemini 3.5 Transcribe ลดเวลาในการผลิตบทถอดเสียงฉบับสมบูรณ์ (time to final transcription) ลงราว 70% ความแม่นยำนั้นพัฒนาขึ้นทุกปีอยู่แล้ว แต่การตัดเวลาช่วงนี้ลงเจ็ดสิบเปอร์เซ็นต์ต่างหากที่เปลี่ยน“เสียง”จากไฟล์ที่ใช้ย้อนหลัง ให้กลายเป็นอินเทอร์เฟซแบบเรียลไทม์ เช่น การประชุมที่ได้บันทึกไปพร้อมกัน หรือสายบริการลูกค้าที่มีบทสรุปขึ้นระหว่างสนทนา เงื่อนไขของสถานการณ์เหล่านี้ขึ้นอยู่กับว่าได้ข้อความที่ใช้งานได้เร็วเพียงใด มิใช่ทศนิยมของอัตราผิดพลาด
ขอบเขตการเปิดใช้: ทั้งฝั่งองค์กรและผู้บริโภค
ฝั่งนักพัฒนาสามารถใช้งานผ่าน Gemini API (Google AI Studio), Google Antigravity และ Gemini Enterprise Agent Platform ส่วน Gemini Enterprise for Customer Experience ระบุว่าจะตามมาในเร็ววัน ซึ่งสะท้อนเจตนาที่จะฝังการถอดเสียงเข้าไปในแพลตฟอร์มบริการลูกค้าโดยตรง ฝั่งผู้บริโภคได้เข้าสู่ Gemini app บน macOS และฟีเจอร์ Rambler ของ Gboard บน Android แล้ว โดย Chrome ระบุว่าจะรองรับในลำดับถัดไป อนึ่ง เวอร์ชัน macOS ขณะนี้ยังเป็นภาษาอังกฤษ และ Rambler เปิดให้ใช้เพียงบางประเทศและบางภาษาก่อน ทั้งนี้ยังมิได้ประกาศราคาอย่างเป็นทางการ
นัยสำคัญต่อผู้บริหาร
คุณค่าของข้อมูลเสียง ไม่ว่าจะเป็นบันทึกการประชุม สายบริการลูกค้า หรือการสัมภาษณ์หน้างาน แต่เดิมติดขัดที่ต้นทุนการเรียบเรียง เพราะการจ้างคนถอดเสียงและขัดเกลามีราคาสูงจนทำได้เฉพาะเรื่องสำคัญ สิ่งที่ถูกบีบต้นทุนลงในครั้งนี้จึงมิใช่“การรู้จำ” หากแต่เป็นแรงงานช่วง“จากบทถอดคำต่อคำสู่บันทึกที่ใช้งานได้” เพราะคำฟุ่มเฟือยถูกตัดและย่อหน้าถูกจัดให้โดยอัตโนมัติ หากประสงค์จะทดลอง ควรเลือกการประชุมที่มีบันทึกจากคนอยู่แล้วมาเทียบเคียง ตรวจว่าฉบับ AI ตกหล่นสิ่งใด แล้วจึงตัดสินใจปรับกระบวนการ พร้อมกันนี้มีข้อจำกัดสองประการที่ต้องพิจารณาก่อน ได้แก่ ระยะพรีวิวสาธารณะยังไม่มีราคา จึงยังตั้งงบประมาณไม่ได้ และการแยกผู้พูดรองรับอย่างเสถียรที่ 3 คน หากเกินกว่านั้นยังอยู่ในขั้นทดลอง อีกทั้งความสามารถนี้ใช้กับไฟล์เสียงที่บันทึกไว้ล่วงหน้า มิใช่การสตรีมแบบเรียลไทม์ จึงควรทดสอบด้วยตนเองก่อนใช้งานจริง นอกจากนี้ก่อนนำมาใช้ในองค์กรควรตรวจสอบระเบียบการจัดเก็บและถิ่นที่ตั้งของข้อมูลเสียงให้ชัดเจน
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี