คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 216/303 ตอน ดูสารบัญคอร์ส

SpaceXAI (เดิม xAI) เปิดตัว Grok Voice Think Fast 2.0: ลดเวลาเสียงแรกลงครึ่งหนึ่ง ประหยัด token การให้เหตุผลราว 60%

03/08/2026 287
5:47
SpaceXAI (เดิม xAI) เปิดตัว Grok Voice Think Fast 2.0: ลดเวลาเสียงแรกลงครึ่งหนึ่ง ประหยัด token การให้เหตุผลราว 60%
ภาพ/Photo by BENCE BOROS on Unsplash

SpaceXAI (เดิมคือ xAI) เปิดตัวโมเดล speech-to-speech รุ่นใหม่ grok-voice-think-fast-2.0 เมื่อ 29 ก.ค. 2026 ลดเวลาเสียงแรกจาก 1.25 วินาที เหลือ 0.70 วินาที คะแนนรวมจากการจัดอันดับภายนอกอยู่ที่ 82.9% พร้อมเปิดให้ใช้ Agent Builder และตั้งแต่ 5 ส.ค. ชื่อเรียก API จะชี้ไปยังรุ่นใหม่โดยอัตโนมัติ

SpaceXAI (เดิมคือ xAI ซึ่งเปลี่ยนชื่อหลังถูก SpaceX ควบรวมกิจการในเดือนกรกฎาคม 2026) ได้เปิดตัวโมเดลเสียงสู่เสียง (speech-to-speech) รุ่นใหม่ grok-voice-think-fast-2.0 เมื่อวันที่ 29 กรกฎาคม 2026 พร้อมเปิดให้ใช้งาน Agent Builder ในเวลาเดียวกัน โดยกำหนดราคาที่ 0.08 ดอลลาร์สหรัฐต่อนาทีของเสียง การเปลี่ยนแปลงด้านสเปกที่ชัดเจนที่สุดคือความเร็วในการเริ่มพูด เวลาถึงเสียงแรก (time to first audio) ลดลงจาก 1.25 วินาทีในรุ่นก่อน เหลือ 0.70 วินาที หรือเกือบครึ่งหนึ่ง ส่วนต่าง 0.55 วินาทีนี้เป็นตัวชี้ขาดว่าบทสนทนาจะฟังดูเหมือนกำลังคุยกัน หรือกำลังรอเครื่องคิด

ส่วนใดมาจากภายนอก ส่วนใดบริษัทรายงานเอง

การตีความข่าวนี้ต้องแยกแหล่งที่มาของข้อมูลให้ชัดก่อน มิฉะนั้นจะประเมินสูงเกินจริง

  • การจัดอันดับโดยบุคคลที่สาม (Artificial Analysis speech-to-speech): คะแนนรวม 82.9% ขณะที่รุ่นก่อน Think Fast 1.0 อยู่ที่ 75.7% หมวด agentic 56.5% (รุ่นก่อน 52.1%) หมวดการสนทนา 95.1%
  • ข้อมูลที่ SpaceXAI รายงานเอง ด้านความแม่นยำ: การถอดเสียงจากการทดสอบ 24 ภาษาและวลีหลายพันรายการ ดีกว่า Deepgram Nova 3 และ ElevenLabs Scribe v2 ราว 1.5 ถึง 2.0 เท่า และดีกว่ารุ่นก่อนของตนเอง 1.4 เท่า โดยในสภาพแวดล้อมที่มีเสียงรบกวน ช่องว่างขยายเป็นราว 10 เท่า
  • ข้อมูลที่ SpaceXAI รายงานเอง ด้านประสิทธิภาพ: ค่ามัธยฐานการใช้ token สำหรับการให้เหตุผล ลดลงเหลือ 0.4 เท่าของรุ่นก่อน หรือประหยัดราว 60%

กล่าวอีกนัยหนึ่ง คะแนนรวม 82.9% มีบุคคลที่สามรับรอง ส่วนความแม่นยำที่สูงกว่า 10 เท่า เป็นผลจากเงื่อนไขการทดสอบของบริษัทเอง ทั้งสองส่วนควรพิจารณา แต่ไม่ควรถูกนำเสนอด้วยระดับความน่าเชื่อถือเดียวกัน

ความหมายเชิงเทคนิค: คิดไปพูดไปพร้อมกัน

ความหน่วงต่ำกับคุณภาพสูงเป็นสิ่งที่ขัดแย้งกันมานานในโมเดลเสียง เพราะยิ่งคิดมากก็ยิ่งเริ่มพูดช้า วิธีการของรุ่นนี้คือให้การให้เหตุผลกับการเปล่งเสียงดำเนินไปพร้อมกัน โมเดลพูดไปด้วยและคิดเนื้อหาถัดไปไปด้วย เมื่อรวมกับค่ามัธยฐานการใช้ token ที่ลดเหลือ 0.4 เท่า ผลลัพธ์จริงไม่ได้มีเพียงความลื่นไหลของเสียง แต่ที่สำคัญกว่าคือการเรียกใช้เครื่องมือ (tool use) ตอบสนองเร็วขึ้น เมื่อผู้ช่วยเสียงต้องตรวจสอบคำสั่งซื้อ แก้ไขการจอง หรือส่งใบงาน ช่วงเงียบระหว่างกลางจะสั้นลงอย่างเห็นได้ชัด คะแนนหมวด agentic ที่เพิ่มจาก 52.1% เป็น 56.5% สอดคล้องกับทิศทางนี้ แต่ตัวเลข 56.5% ก็บอกตามตรงว่า การให้ตัวแทนเสียงทำงานหลายขั้นตอนโดยอัตโนมัติ ยังห่างจากระดับที่ปล่อยไว้ได้โดยไม่ต้องดูแล

การเปลี่ยนเวอร์ชัน: อัปเกรดอัตโนมัติ 5 สิงหาคม

สิ่งที่นักพัฒนาต้องให้ความสนใจมากที่สุดคือกำหนดเวลา ชื่อเรียก API grok-voice-latest จะชี้ไปยังโมเดลนี้โดยอัตโนมัติตั้งแต่วันที่ 5 สิงหาคม 2026 เป็นต้นไป

  • หากต้องการใช้รุ่นใหม่: ไม่ต้องดำเนินการใด ๆ ระบบจะอัปเกรดให้เองตามกำหนด
  • หากต้องการคงรุ่นเดิม: ต้องระบุ grok-voice-think-fast-1.0 ด้วยตนเอง

การออกแบบให้อัปเกรดโดยปริยายเช่นนี้สะดวกสำหรับทีมส่วนใหญ่ แต่สำหรับผลิตภัณฑ์ที่ปรับแต่งน้ำเสียง การประมวลผลข้อความถอดเสียง หรือคาดการณ์ความหน่วงไว้ตามรุ่นเดิม อาจเกิดพฤติกรรมที่ไม่ได้คาดหมายในวันดังกล่าว

ความหมายต่อผู้บริหาร

นับจาก Grok Voice เปิดให้ใช้งานสาธารณะครั้งแรกในเดือนมิถุนายน 2026 ตามด้วยโมเดลรุ่น GPT-Live และโหมดเสียงของ Anthropic ส่วนต่อประสานด้วยเสียงได้เปลี่ยนจากของสาธิตมาเป็นสินค้าที่เปรียบเทียบสเปกกันได้ภายในเวลาเพียงสองเดือน สำหรับธุรกิจแนวหน้าที่ใช้โทรศัพท์และการพูดจำนวนมาก ทั้งศูนย์บริการลูกค้า หน้าร้าน การจองร้านอาหาร และเคาน์เตอร์โรงแรม สิ่งที่ควรติดตามจริง ๆ ไม่ใช่ว่า AI พูดได้หรือไม่ แต่คือตัวชี้วัดสามข้อที่วัดผลได้

  • ความหน่วงของเสียงแรก
  • ความแม่นยำในการถอดเสียงภายใต้สภาพแวดล้อมที่มีเสียงรบกวน
  • อัตราความสำเร็จของการเรียกใช้เครื่องมือ

หากองค์กรของท่านกำลังประเมินระบบบริการลูกค้าด้วยเสียง ขอแนะนำให้บันทึกบทสนทนาจริงจากหน้างานที่เสียงดังที่สุดของท่านเอง เช่น ห้องครัว พื้นที่ขาย หรือหน่วยงานก่อสร้าง เพื่อนำมาทดสอบ แทนที่จะฟังการสาธิตในสำนักงานที่เงียบสงบ เพราะตัวเลขดีกว่า 10 เท่าในที่เสียงดังที่บริษัทรายงานเอง คุ้มค่าที่ท่านจะพิสูจน์ด้วยเสียงรบกวนของท่านเองสักครั้ง

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Google DeepMind เปิดตัว Gemini Robotics 2 มอบ “ปัญญาทั้งร่างกาย” ให้หุ่นยนต์ฮิวแมนนอยด์

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว