xAI เปิดตัว Grok Voice Transcribe 2.0 บริษัทระบุแม่นยำขึ้น 2 เท่า ราคาเท่าเดิม
xAI เปิดตัวโมเดลแปลงเสียงเป็นข้อความ Grok Voice Transcribe 2.0 เมื่อวันที่ 18 กันยายน พ.ศ. 2569 บริษัทระบุว่าแม่นยำเป็น 2 เท่าของรุ่น 1.0 ราคาคงเดิมที่ 0.10 ดอลลาร์ต่อชั่วโมงสำหรับแบบแบตช์ และ 0.20 ดอลลาร์ต่อชั่วโมงสำหรับแบบสตรีมมิง จุดพัฒนาที่ใหญ่ที่สุดคือการถอดเสียงหลายภาษาที่สลับภาษากลางบทสนทนาได้
xAI (SpaceXAI) เปิดตัวโมเดลแปลงเสียงเป็นข้อความรุ่นใหม่ Grok Voice Transcribe 2.0 เมื่อวันที่ 18 กันยายน พ.ศ. 2569 โดยมีรหัสโมเดลใน API ว่า grok-voice-transcribe-2.0 และเปิดให้ใช้งานจริงได้ทันที รุ่นใหม่ให้บริการควบคู่กับรุ่น 1.0 ซึ่งยังคงเป็นค่าเริ่มต้นของ API นักพัฒนาต้องระบุรหัสโมเดลใหม่เองจึงจะเปลี่ยนมาใช้รุ่น 2.0
บริษัทระบุว่ารุ่น 2.0 มีความแม่นยำเป็น 2 เท่าของรุ่น 1.0 โดยราคาไม่เปลี่ยนแปลง คือ 0.10 ดอลลาร์สหรัฐต่อไฟล์เสียงหนึ่งชั่วโมงสำหรับการถอดเสียงแบบแบตช์ และ 0.20 ดอลลาร์ต่อชั่วโมงสำหรับแบบสตรีมมิงเรียลไทม์ นอกจากนี้ xAI เผยว่า Grok Voice ประมวลผลสายบริการลูกค้าหลายหมื่นสายต่อวัน ถอดเสียงบรรยายวิดีโอไปแล้วหลายล้านชั่วโมง และยังขับเคลื่อนผู้ช่วยเสียง Grok ในรถยนต์ Tesla
มีอะไรใหม่ในรุ่นนี้
ตามประกาศของบริษัทและเอกสารสำหรับนักพัฒนา (release notes) ความสามารถหลักของรุ่น 2.0 มีดังนี้
- เวลากำกับรายคำ (timestamp) พร้อมคะแนนความเชื่อมั่นของแต่ละคำ
- การแยกผู้พูด (diarization) โดยไม่มีค่าใช้จ่ายเพิ่ม
- ถอดเสียงแบบหลายช่องสัญญาณได้สูงสุด 8 ช่อง
- การกำหนดคำสำคัญ (keyword biasing) ได้สูงสุด 100 คำต่อคำขอ เพื่อให้จดจำชื่อเฉพาะและชื่อสินค้าได้แม่นยำขึ้น
- จัดรูปแบบตัวเลข วันที่ สกุลเงิน หมายเลขโทรศัพท์ และอีเมลโดยอัตโนมัติ
- ตัดคำฟุ่มเฟือยอย่าง “เอ่อ อืม” ออก
- การตัดช่วงประโยคอัจฉริยะสำหรับ voice agent
ก้าวกระโดดที่สุดคือเรื่องหลายภาษา
xAI ระบุว่าการถอดเสียงหลายภาษาเป็นจุดที่พัฒนามากที่สุด รองรับหลายสิบภาษา ตรวจจับภาษาได้เอง และเมื่อผู้พูดเปลี่ยนภาษากลางการบันทึก โมเดลสามารถเปลี่ยนตามได้และถอดเสียงทั้งไฟล์เสร็จในครั้งเดียว โดยไม่ต้องตัดไฟล์แยกตามภาษาก่อน ข้อนี้มีความหมายอย่างยิ่งกับบทสนทนาที่พูดไทยปนอังกฤษหรือจีนปนอังกฤษ เพราะการที่ผู้พูดสลับภาษากลางคัน หรือมีหลายภาษาปนอยู่ในไฟล์เสียงเดียวกัน เป็นโจทย์ยากของการถอดเสียงมาโดยตลอด
เปรียบเทียบกับรุ่นก่อนและคู่แข่ง
ผลทดสอบที่บริษัทเปิดเผยคือ รุ่น 2.0 ทำได้ดีกว่ารุ่น 1.0 ในชุดทดสอบภายในทั้งสี่ชุด และในชุดทดสอบสายบริการลูกค้าภาษาอังกฤษคุณภาพ 8 kHz รุ่น 2.0 ทำคะแนนนำทุกโมเดลที่นำมาทดสอบ อย่างไรก็ตาม ผลเหล่านี้เป็นการทดสอบภายในของ xAI เอง และการ “นำ” จำกัดเฉพาะชุดทดสอบเสียงโทรศัพท์ภาษาอังกฤษ ไม่ใช่การจัดอันดับรอบด้านจากบุคคลที่สาม ทั้งนี้ 8 kHz คืออัตราสุ่มสัญญาณของสายโทรศัพท์แบบดั้งเดิม ซึ่งคุณภาพเสียงต่ำกว่าการบันทึกการประชุมมาก การที่บริษัทเลือกนำเสนอชุดข้อมูลนี้อาจสะท้อนว่าศูนย์บริการลูกค้าเป็นเป้าหมายสำคัญ
ในภาพรวมของตลาด ต้นเดือนนี้ Meta เพิ่งเปิดตัว Muse Voice Transcribe ขณะที่ OpenAI และ Google ต่างก็มีบริการถอดเสียงของตนเอง การแปลงเสียงเป็นข้อความกำลังกลายเป็นบริการพื้นฐานราคาถูก การแข่งขันจึงหันไปที่รายละเอียดการใช้งานจริง เช่น คุณภาพเสียงโทรศัพท์ การพูดหลายภาษาปนกัน และการจัดรูปแบบข้อความ การที่ xAI เลือก “เพิ่มความแม่นยำโดยไม่ขึ้นราคา” จึงอาจมองได้ว่าเป็นการใช้ความคุ้มค่าเพื่อชิงปริมาณงานจากบริการลูกค้าองค์กรและแพลตฟอร์มวิดีโอ
ความหมายต่อผู้บริหาร
หากคำนวณตามราคาที่ประกาศ การถอดเสียงสายบริการลูกค้า 1,000 ชั่วโมงแบบแบตช์มีต้นทุนราว 100 ดอลลาร์ ซึ่งต่ำพอที่จะ “ถอดทั้งหมดและวิเคราะห์ทั้งหมด” แทนการสุ่มฟัง สำหรับธุรกิจในประเทศไทยที่พนักงานและลูกค้ามักพูดไทย จีน และอังกฤษปนกัน การถอดเสียงที่ตามการสลับภาษาได้คือก้าวสำคัญในการเปลี่ยนสายโทรศัพท์และบันทึกการประชุมให้เป็นข้อมูลที่ค้นหาได้ ขอแนะนำให้เลือกไฟล์เสียงจริงชุดหนึ่งมาทดสอบเทียบระหว่างรุ่น 1.0 รุ่น 2.0 และเครื่องมือที่ใช้อยู่ โดยเน้นตรวจความถูกต้องของภาษาไทย ชื่อบุคคล และชื่อสินค้า พร้อมใช้ฟังก์ชันกำหนดคำสำคัญใส่ศัพท์เฉพาะของบริษัท ก่อนตัดสินใจนำมาใช้ และสำหรับไฟล์เสียงที่มีข้อมูลส่วนบุคคลของลูกค้า ต้องตรวจสอบให้สอดคล้องกับข้อกำหนดด้านการแจ้งและการจัดเก็บตาม PDPA ของไทยก่อน
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี