คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 284/303 ตอน ดูสารบัญคอร์ส

Gemini 3.8 Flash TTS เปิดให้ใช้งานทั่วไป: บรรยายเสียงที่ต้องการก็สร้างเสียงได้ ต้นทุนเสียงลดลงกว่าครึ่ง

22/09/2026 115
4:47
Gemini 3.8 Flash TTS เปิดให้ใช้งานทั่วไป: บรรยายเสียงที่ต้องการก็สร้างเสียงได้ ต้นทุนเสียงลดลงกว่าครึ่ง
ภาพ/Photo by Kit (formerly ConvertKit) on Unsplash

Google ประกาศใน Gemini API changelog วันที่ 22 กันยายน พ.ศ. 2569 ว่าโมเดลแปลงข้อความเป็นเสียง Gemini 3.8 Flash TTS และ Flash-Lite TTS เข้าสู่สถานะ GA แทนที่ Gemini 3.1 Flash TTS Preview จุดเด่นคือคุณภาพระดับห้องอัดและการออกแบบเสียงด้วยคำบรรยาย ค่าเอาต์พุตเสียงลดจาก 20 เหลือ 9 ดอลลาร์ต่อล้านโทเคน

เมื่อวันที่ 22 กันยายน พ.ศ. 2569 Google ประกาศผ่าน changelog อย่างเป็นทางการของ Gemini API ว่าโมเดลแปลงข้อความเป็นเสียงสองรุ่น คือ Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS ได้เข้าสู่สถานะ GA (generally available นักพัฒนาทั่วไปนำไปใช้ในระบบจริงได้) แทนที่ Gemini 3.1 Flash TTS Preview ที่ใช้อยู่เดิม สื่อเทคโนโลยีภายนอกหลายแห่งบันทึกข่าวนี้เป็นวันที่ 23 กันยายน แต่วันที่ในบันทึกเวอร์ชันอย่างเป็นทางการคือวันที่ 22 กันยายน

สเปกและราคา: การแบ่งบทบาทของสองสายผลิตภัณฑ์

การเปิดใช้งานครั้งนี้แบ่งสายผลิตภัณฑ์เสียงออกเป็นสองแบบ ให้เลือกตามความต้องการด้านภาษาและงบประมาณ

  • Flash TTS รองรับรายการภาษาครบถ้วน อัตราค่าเสียงสูงกว่า เหมาะกับตลาดหลายภาษา
  • Flash-Lite TTS รายการภาษาสั้นกว่า อัตราค่าบริการต่ำกว่า เหมาะกับงานภาษาเดียวที่มีปริมาณมาก

อัตรามาตรฐานของ Flash TTS คือ อินพุตข้อความ 0.50 ดอลลาร์ต่อล้านโทเคน และเอาต์พุตเสียง 9.00 ดอลลาร์ต่อล้านโทเคน โดยระบุว่าเป็นราคาโปรโมชันถึงสิ้นปี พ.ศ. 2569 และจะปรับเป็น 1.00 กับ 18.00 ดอลลาร์ตั้งแต่วันที่ 1 มกราคม พ.ศ. 2570 ส่วนเสียงคิดค่าบริการที่ 25 โทเคนต่อวินาที คำนวณแล้วตกประมาณ 0.02 เซนต์ต่อเสียงหนึ่งวินาที

ความหมายเชิงเทคนิค: จากการเลือกเสียง สู่การบรรยายเสียง

ทางการเน้นความสามารถสองด้าน ด้านแรกคือคุณภาพเสียงระดับ studio-grade หรือระดับห้องอัด ด้านที่สองคือ voice design หรือการออกแบบเสียง นอกจากการเลือกเสียงจากรายการสำเร็จรูปที่มีอยู่เดิมแล้ว ผู้ใช้ยังเขียนบรรยายคุณลักษณะของเสียงที่ต้องการเป็นข้อความ แล้วให้โมเดลสร้างเสียงตามนั้นได้ด้วย นอกจากนี้ยังคัดลอกเสียงจากตัวอย่างสั้น ๆ ได้ พร้อมกลไกตรวจสอบคำยินยอมประกอบ

การเปลี่ยนแปลงนี้น่าจับตา เพราะเดิมการปรับเสียงให้เข้ากับแบรนด์ถูกจำกัดด้วยคลังเสียงที่ผู้ให้บริการอัดไว้ล่วงหน้า แต่ตอนนี้ตัวเสียงเองกลายเป็นพารามิเตอร์ที่ระบุด้วยภาษาธรรมชาติได้ สำหรับองค์กรที่ต้องรักษาน้ำเสียงของแบรนด์ให้สม่ำเสมอ นี่คือทางเลือกใหม่ที่เพิ่มจาก “เลือกอันที่ใกล้เคียงที่สุด” เป็น “บอกให้ชัดว่าต้องการอะไร”

เทียบกับรุ่นก่อน: สัญญาณของการลดราคากว่าครึ่ง

Gemini 3.1 Flash TTS Preview ที่ถูกแทนที่มีอัตราเอาต์พุตเสียงอยู่ที่ 20.00 ดอลลาร์ต่อล้านโทเคน ราคาใหม่ 9.00 ดอลลาร์จึงลดลงกว่าครึ่ง และเกิดขึ้นพร้อมกับการยกระดับจาก Preview เป็น GA ที่ใช้ในระบบจริงได้ เมื่อทั้งราคาและความเสถียรขยับไปในทางที่ดีพร้อมกัน มักหมายความว่าผู้ให้บริการควบคุมต้นทุนการประมวลผลเบื้องหลังได้แล้ว และหมายความว่าฟังก์ชันเสียงกำลังเปลี่ยนจากของเสริมเชิงทดลอง มาเป็นองค์ประกอบพื้นฐานที่เขียนลงในสเปกผลิตภัณฑ์จริงได้

ความหมายต่อผู้บริหาร

เมื่อต้นทุนส่วนเพิ่มของเสียงหนึ่งวินาทีเหลือ 0.02 เซนต์ ข้อเสนอภายในที่เคยถูกปัดตกเพราะค่าอัดเสียงและค่าพากย์ ควรนำกลับมาคำนวณใหม่ ทั้งเสียงบริการลูกค้าหลายภาษา คู่มือแนะนำการใช้สินค้า เสียงบรรยายสำหรับการอบรม และเสียงประกาศในร้าน แต่อย่าลืมสองเรื่อง คืออัตราค่าบริการจะปรับขึ้นเป็นสองเท่าของราคาโปรโมชันปัจจุบันตั้งแต่วันที่ 1 มกราคม พ.ศ. 2570 งบประมาณระยะยาวจึงต้องประเมินด้วยตัวเลขหลังปรับ และกลไกคำยินยอมสำหรับการคัดลอกเสียงถือเป็นหลักฐานที่ต้องจัดเก็บภายใต้กรอบ PDPA ของไทยเช่นกัน ไม่ใช่รายละเอียดทางเทคนิค แต่เป็นบันทึกการปฏิบัติตามกฎหมาย

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ChatGPT บนมือถือเชื่อมเสียงเข้ากับเอเจนต์ Work: สั่งด้วยเสียงให้ร่างเอกสาร เขียนอีเมล และสรุป Slack

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว