Meta เปิดตัว Muse Voice Transcribe: โมเดลเดียวถอดเสียงแบบเรียลไทม์ แยกผู้พูดได้กว่า 20 คน ค่าใช้จ่ายชั่วโมงละ 0.18 ดอลลาร์
Meta Superintelligence Labs เปิดตัว Muse Voice Transcribe เมื่อ 1 กันยายน โมเดลรับรู้เสียงแบบเรียลไทม์ตัวแรก ทำทั้งถอดเสียงสตรีมมิง แยกผู้พูดกว่า 20 คน และตรวจจับจุดจบประโยคในโมเดลเดียว รองรับการสลับภาษาในประโยคเดียวกัน WER 3.1% ราคา API 3 ดอลลาร์ต่อ 1,000 นาทีเสียง
เมื่อวันที่ 1 กันยายน 2569 (10:00 น. เวลาแปซิฟิก) Meta ได้ประกาศเปิดตัว Muse Voice Transcribe ผ่าน research.meta.ai ซึ่งเป็นโมเดล “รับรู้เสียงแบบเรียลไทม์” ตัวแรกจาก Meta Superintelligence Labs อยู่ในตระกูล Muse Spark ใช้สถาปัตยกรรมมัลติโมดัลแบบ autoregressive โดยตัดเสียงเป็นช่วงละ 80 มิลลิวินาทีแล้วแปลงเป็น soft token ป้อนเข้าโมเดล จึงฟังไปพร้อมกับพิมพ์ข้อความออกมาได้ทันที ไม่ต้องรอให้จบการบันทึกทั้งหมด
สเปกหลักที่ Meta ประกาศอย่างเป็นทางการมีดังนี้
- โมเดลเดียวทำสามงานพร้อมกัน: ถอดเสียงแบบสตรีมมิง แยกผู้พูดได้มากกว่า 20 คน (ใครกำลังพูด) และตรวจจับจุดจบประโยค โดยไม่ต้องต่อขั้นตอนประมวลผลเพิ่มภายหลัง
- ฝึกด้วยข้อมูลกว่า 70 ภาษา ในจำนวนนี้ 25 ภาษาผ่านการตรวจสอบครบถ้วน รวมถึงจีน ญี่ปุ่น เวียดนาม และสเปน รองรับการสลับภาษา (code-switching) ภายในประโยคเดียวกัน
- สามารถใส่ “ตัวชี้นำ” ด้านภาษา คำสำคัญ หรือบริบท เพื่อเพิ่มความแม่นยำของชื่อเฉพาะ เช่น ชื่อบุคคลหรือชื่อสินค้า
- ความหน่วงแบบปรับตัว: กำหนดเวลาแสดงผลตามความยากของคำ คำง่ายออกก่อน คำยากรอเพิ่มเล็กน้อย
- รองรับการบันทึกต่อเนื่องนานกว่าหนึ่งชั่วโมงโดยตรง
ตัวเลขทางการระบุอัตราคำผิด (WER) แบบสตรีมมิงที่ 3.1% และอัตราความผิดพลาดในการแยกผู้พูด 17.5% (วัดจากชุดทดสอบ AMI-IHM, AMI-SDM และ VoxConverse) และในวันเปิดตัวได้ขึ้นเป็นอันดับหนึ่งทั้งในตารางถอดเสียงสตรีมมิงของ Artificial Analysis และตารางแยกผู้พูดสาธารณะ
ความหมายเชิงเทคนิค: รวมสามท่อเป็นท่อเดียว
ที่ผ่านมาการทำบันทึกการประชุมแบบคำต่อคำมักต่อกันสามส่วน คือ โมเดลถอดเสียง โมเดลแยกผู้พูด และกฎตัดประโยค ซึ่งความหน่วงและข้อผิดพลาดของแต่ละส่วนจะทบกัน Muse Voice Transcribe นำทั้งสามงานมาไว้ในโมเดล autoregressive ตัวเดียว จึงควบคุมความหน่วงได้และใช้บริบทร่วมกัน โมเดลรู้ว่าประโยคก่อนหน้าใครพูด การตัดประโยคกับการแยกผู้พูดจึงอ้างอิงกันได้ ส่วนการตัดเสียงทุก 80 มิลลิวินาทีร่วมกับความหน่วงแบบปรับตัวคือวิธีสร้างสมดุลระหว่าง “ทันที” กับ “แม่นยำ” อย่างเป็นรูปธรรม
เทียบกับคู่แข่งและช่องทางการใช้งาน
Meta ตั้งราคา Meta Model API ที่ 3 ดอลลาร์ต่อ 1,000 นาทีเสียง (ประมาณชั่วโมงละ 0.18 ดอลลาร์) โดยรวมฟังก์ชันแยกผู้พูดแล้ว บริการประเภทเดียวกันส่วนใหญ่ตั้งราคาสูงกว่านี้และมักคิดค่าแยกผู้พูดเพิ่มต่างหาก จึงถือเป็นราคาในกลุ่มต่ำของตลาด ใช้งานได้ทันทีผ่านสามช่องทาง ได้แก่ Meta Model API, Muse Code และ Meta AI for Mac (กดปุ่ม Fn เพื่อพิมพ์ด้วยเสียง) Meta ยังระบุว่าไม่เก็บไฟล์เสียงถาวร และบันทึกคำต่อคำจะติดป้ายว่า “สร้างโดย AI อาจมีข้อผิดพลาด”
ความหมายสำหรับผู้บริหาร
ทีมสามภาษาไต้หวัน จีน ไทย ในประเทศไทยมักประชุมโดยสลับภาษาจีน ไทย และอังกฤษ การจดบันทึกด้วยคนทั้งช้าและตกหล่นง่าย ความสามารถสลับภาษาในประโยคและแยกผู้พูดอัตโนมัติของโมเดลนี้ บวกกับต้นทุนประมาณ 6 บาทต่อชั่วโมง (ตามอัตราแลกเปลี่ยน) คุ้มค่าที่จะประเมินเพื่อนำมาแทนการจดบันทึกการประชุมด้วยคน แต่ภาษาไทยไม่อยู่ใน 25 ภาษาที่ผ่านการตรวจสอบครบถ้วน ก่อนนำมาใช้จริงจึงควรทดสอบด้วยไฟล์เสียงประชุมจริงเพื่อวัดความแม่นยำของช่วงภาษาไทยก่อน แล้วค่อยตัดสินใจใช้เต็มรูปแบบ
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี