คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 236/303 ตอน ดูสารบัญคอร์ส

DeepMind ส่ง SL2T แปลภาษามือเป็นข้อความมากับ Pixel 11 : AI ภาษามือเข้าสู่ฟีเจอร์ในตัวเครื่อง

28/08/2026 189
≈5:18
DeepMind ส่ง SL2T แปลภาษามือเป็นข้อความมากับ Pixel 11 : AI ภาษามือเข้าสู่ฟีเจอร์ในตัวเครื่อง
ภาพ/Photo by Nic Rosenau on Unsplash

เมื่อวันที่ 12 สิงหาคม พ.ศ. 2569 Google DeepMind ประกาศว่าโมเดลแปลภาษามือเป็นข้อความ SL2T ออกมาพร้อม Pixel 11 ผนวกเข้ากับ Gboard และ Live Transcribe โดยไม่คิดค่าใช้จ่ายเพิ่ม ฝึกจากวิดีโอกว่า 100,000 ชั่วโมง ครอบคลุมภาษามือกว่า 50 ระบบ ระยะแรกเปิดเฉพาะ ASL เป็นภาษาอังกฤษ ภาพต้นฉบับถูกทิ้งทันที มีเพียงจุดพิกัดที่ส่งขึ้นเซิร์ฟเวอร์

เมื่อวันที่ 12 สิงหาคม พ.ศ. 2569 Google DeepMind ออกประกาศว่า โมเดลแปลภาษามือเป็นข้อความ SL2T ออกมาพร้อมเครื่อง Pixel 11 และถูกผนวกเข้ากับฟังก์ชันของระบบที่มีอยู่เดิมสองส่วน ได้แก่ การพิมพ์ด้วยภาษามือใน Gboard และการถอดความแบบเรียลไทม์ใน Live Transcribe ผู้ใช้ไม่ต้องเสียค่าใช้จ่ายเพิ่มและไม่ต้องติดตั้งแอปแยก โดย Google ระบุว่านี่เป็นครั้งแรกที่ AI ภาษามือออกจากห้องทดลอง เข้าสู่ฟีเจอร์ของสินค้าที่วางจำหน่ายจริง

สิ่งที่ออกมาพร้อมเครื่องคืออะไร

SL2T ฝึกจากวิดีโอมากกว่า 100,000 ชั่วโมง ครอบคลุมภาษามือกว่า 50 ระบบ โดยราวหนึ่งในสี่เป็นภาษามืออเมริกัน (ASL) แต่ทิศทางการแปลที่เปิดใช้จริงในระยะแรกมีเพียงเส้นทางเดียว คือ ASL เป็นภาษาอังกฤษ กล่าวคือโมเดลเห็นภาษามาแล้วจำนวนมาก แต่ที่ส่งมอบจริงมีเพียงภาษาเดียว ช่องว่างตรงนี้คือการบ้านของเวอร์ชันถัดไป

ในเชิงรูปแบบการใช้งาน สิ่งนี้ไม่ใช่แอปแปลภาษาแยกต่างหาก แต่เชื่อมเข้ากับแป้นพิมพ์และเครื่องมือถอดความที่ผู้ใช้ใช้อยู่แล้ว ผู้ใช้ทำท่าต่อหน้ากล้อง ข้อความจะปรากฏในช่องพิมพ์เดิมของ Gboard เทียบเท่ากับการพิมพ์ด้วยเสียงของคนทั่วไป แนวทางนี้ไม่ต้องเปิดแอปใหม่และผลลัพธ์ยังตกอยู่ในช่องพิมพ์เดิม แลกกับการที่ต้องเปิดกล้องและให้สิทธิ์เข้าถึงกล้อง

ภาพต้นฉบับไม่ออกจากเครื่อง : ทางเลือกของสถาปัตยกรรมแบบผสม

SL2T ใช้สถาปัตยกรรมแบบผสม ฝั่งอุปกรณ์ใช้ MediaPipe Holistic ติดตามจุดสำคัญราว 130 จุดบนใบหน้า ลำตัว และมือทั้งสองข้างแบบเฟรมต่อเฟรม แล้วแปลงเป็นจุดพิกัดเชิงเรขาคณิต จากนั้นส่งเฉพาะจุดพิกัดขึ้นเซิร์ฟเวอร์เพื่อแปล ส่วนภาพต้นฉบับถูกทิ้งทันที และ SL2T แปลลำดับพิกัดเป็นข้อความโดยตรง ข้ามขั้นตอนการกำกับกลาง (gloss) แบบเดิม

การออกแบบนี้ตอบสองโจทย์พร้อมกัน คือการรู้จำภาษามือจำเป็นต้องเห็นใบหน้าเพราะสีหน้าคือส่วนหนึ่งของไวยากรณ์ การส่งเพียงพิกัดจึงลดความเสี่ยงที่ภาพจะรั่วไหลได้มาก และข้อมูลพิกัดมีขนาดเล็กกว่าสตรีมวิดีโอมาก จึงเหมาะกับการแปลแบบเรียลไทม์ แต่ต้องย้ำว่าจุดสำคัญบนใบหน้าและมือยังถือเป็นข้อมูลชีวมิติที่ระบุตัวบุคคลได้ การส่งขึ้นเซิร์ฟเวอร์ (ซึ่งมักเป็นการส่งข้ามประเทศ) ยังคงเป็นการประมวลผลข้อมูลส่วนบุคคล หน้าที่ในการแจ้งและขอความยินยอมตาม PDPA และ GDPR จึงไม่หายไป ทั้งนี้ทางการยังไม่เปิดเผยตัวเลขความหน่วงต้นทางถึงปลายทางและจำนวนพารามิเตอร์

ควรอ่านคะแนน 70 BLEURT อย่างไร

DeepMind ระบุว่า SL2T ทำคะแนน 70 BLEURT บนเกณฑ์ FLEURS-ASL แบบ zero-shot และอ้างว่าสูงกว่าคะแนนสาธารณะใด ๆ ที่เคยมีอย่างมีนัยสำคัญ คำว่า zero-shot ในที่นี้หมายถึงไม่ได้ปรับจูนเพิ่มกับชุดข้อมูลของเกณฑ์นี้โดยเฉพาะ มิใช่ว่าโมเดลไม่เคยเรียน ASL เพราะข้อมูลฝึกราวหนึ่งในสี่เป็น ASL อยู่แล้ว ตัวเลขนี้เป็นคะแนนที่ผู้ผลิตรายงานเอง และ ณ วันที่ 12 สิงหาคม พ.ศ. 2569 ยังไม่มีการทำซ้ำโดยบุคคลที่สามอย่างอิสระ สื่ออย่าง SiliconANGLE, Engadget และ Unite.AI รายงานในวันเดียวกัน แต่เป็นการยืนยันข่าวการเปิดตัว มิใช่การทดสอบอิสระ เกณฑ์ตัดสินจริงยังอยู่ที่หน้างาน ทั้งร้านสาขาที่แสงไม่ดีและข้างสายการผลิตที่ผู้ใช้สวมถุงมือ

ความหมายสำหรับผู้บริหาร

เมื่อมองข่าวนี้ในมุมการบริหาร มีสามประเด็นที่ควรบันทึกไว้

  1. โครงสร้างต้นทุนของการสื่อสารแบบไร้อุปสรรคเปลี่ยนไป เดิมการจัดล่ามภาษามือให้เพื่อนร่วมงานที่บกพร่องทางการได้ยินเป็นเรื่องของตารางเวรและงบประมาณ เมื่อความสามารถนี้ติดมากับโทรศัพท์ของพนักงานเองโดยไม่มีค่าใช้จ่ายเพิ่ม โจทย์จึงเปลี่ยนจากการตั้งงบเป็นการปรับกระบวนการทำงาน
  2. เปิดเพียงทิศทางเดียว จึงยังไม่ควรทุ่มทั้งหมด ทิศทางที่เปิดในระยะแรกมีเพียง ASL เป็นภาษาอังกฤษ ไม่รวมภาษามือไทย (ส่วนข้อมูลฝึกที่ครอบคลุมกว่า 50 ระบบเป็นคนละเรื่องกัน) แนวทางที่ทำได้คือทดลองในวงจำกัดและบันทึกข้อผิดพลาดจริง
  3. จุดที่ข้อมูลไปตกต้องอธิบายให้ชัด แต่อย่าถือเป็นการยกเว้นความรับผิด การที่ภาพต้นฉบับไม่ออกจากเครื่องควรสื่อสารกับพนักงานและฝ่ายกฎหมาย แต่จุดพิกัดที่ส่งออกไปยังเป็นข้อมูลส่วนบุคคล ก่อนนำมาใช้จึงต้องทำขั้นตอนแจ้งและขอความยินยอมตาม PDPA ให้ครบ

สรุปสั้น ๆ คือ ทดลองในวงเล็กก่อน บันทึกข้อผิดพลาดจริง แล้วค่อยพิจารณาว่าจะบรรจุลงระเบียบปฏิบัติหรือไม่

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Google เปิดตัว Gemini 3.7 Flash: รุ่นหลักสำหรับงานเขียนโค้ดและงานเอเจนต์ ราคาครึ่งเดียวถึงสิ้นปี

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว