คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 255/303 ตอน ดูสารบัญคอร์ส

Gemini เปิดตัวความเข้าใจวิดีโอแบบ agentic โมเดลเลือกเองว่าจะดูช่วงไหนและผ่านโหมดใด ประหยัดโทเค็นสูงสุด 88%

01/09/2026 188
≈4:17
Gemini เปิดตัวความเข้าใจวิดีโอแบบ agentic โมเดลเลือกเองว่าจะดูช่วงไหนและผ่านโหมดใด ประหยัดโทเค็นสูงสุด 88%
ภาพ/Photo by Clay Banks on Unsplash

วันที่ 1 กันยายน 2569 Google เปิดตัวความเข้าใจวิดีโอแบบ agentic บน Gemini 3.7 Flash, 3.6 Flash และ 3.5 Flash-Lite โดยโมเดลตัดสินใจเองว่าจะดูช่วงใด ด้วยความเร็วเท่าใด และผ่านโหมดใด ตัวเลขทางการระบุว่าลดโทเค็นได้สูงสุด 88% ลดต้นทุนสูงสุด 66% และเพิ่มความแม่นยำได้สูงสุด 7%

วันที่ 1 กันยายน 2569 Google ประกาศเปิดตัวความสามารถ “ความเข้าใจวิดีโอแบบ agentic” (agentic video understanding) บนโมเดลสามรุ่น ได้แก่ Gemini 3.7 Flash, Gemini 3.6 Flash และ Gemini 3.5 Flash-Lite ประเด็นสำคัญมิใช่การเปลี่ยนไปใช้โมเดลที่ใหญ่ขึ้น หากแต่เป็นการเปลี่ยน “วิธีที่โมเดลดูวิดีโอ”

เดิมทีโมเดลประมวลผลวิดีโอด้วยอัตราเฟรมคงที่ (fixed frame rate) คือรับภาพทั้งเรื่องตั้งแต่ต้นจนจบ ไม่ว่าจะเป็นภาพกล้องวงจรปิดความยาวสองชั่วโมงหรือคลิปสายการผลิตสองนาที ก็ผ่านกระบวนการเดียวกัน แนวทางใหม่คืนอำนาจตัดสินใจให้โมเดล ทั้งเลือกช่วงที่จะดู เลือกความเร็ว (ช่วงใดข้าม ช่วงใดชะลอดูทีละเฟรม) และเลือกโหมดในการดึงข้อมูล ระหว่างภาพ เสียง หรือข้อความถอดเสียง จากเดิมที่ต้อง “ดูให้จบแล้วจึงตอบ” กลายเป็น “ค้นหาเองว่าคำตอบอยู่ช่วงใด”

ตัวเลขทางการ: ประหยัดต้นทุนพร้อมความแม่นยำที่สูงขึ้น

ผลลัพธ์ที่ Google เปิดเผยมีสามตัวเลข และไปในทิศทางเดียวกัน

  • ลดการใช้โทเค็นได้สูงสุด 88%
  • ลดต้นทุนการวิเคราะห์ได้สูงสุด 66%
  • เพิ่มความแม่นยำได้สูงสุด 7%

การที่ทั้งสามด้านดีขึ้นพร้อมกันคือสาระสำคัญของข่าวนี้ เพราะการปรับปรุงประสิทธิภาพโดยทั่วไปมักต้องแลกความแม่นยำกับต้นทุน แต่กรณีนี้ตรรกะต่างออกไป เมื่อโมเดลไม่ถูกบังคับให้บรรจุเฟรมที่ไม่เกี่ยวข้องจำนวนมากเข้าสู่บริบท สัญญาณรบกวนจึงลดลงและการวินิจฉัยชัดเจนขึ้น ทั้งนี้ Gemini 3.7 Flash เมื่อใช้ร่วมกับความเข้าใจแบบ agentic ให้ผลดีที่สุดทั้งด้านคุณภาพโดยรวมและความคุ้มค่าระหว่างคุณภาพกับต้นทุน

ความสามารถหลักสี่ประการและการให้บริการ

  • การระบุตำแหน่งช่วงเวลาระดับต่ำกว่าวินาที (sub-second moment retrieval) ระบุได้ว่าภาพที่ต้องการปรากฏในวินาทีใด นำไปตัดต่ออัตโนมัติได้ทันที
  • วิเคราะห์วิดีโอความยาวมากโดยโทเค็นไม่บานปลาย ช่วยลดความจำเป็นในการตัดแบ่งไฟล์เป็นท่อน ๆ ได้อย่างมาก
  • การตรวจจับความผิดปกติ ด้วยการสุ่มตัวอย่างซ้ำแบบปรับตัว (adaptive resampling) ซึ่งเทียบได้กับการดูเร็วในช่วงปกติและชะลอลงในช่วงน่าสงสัย
  • การนับการกระทำและวัตถุ นับจำนวนคน จำนวนชิ้นงาน และการกระทำซ้ำได้แม่นยำขึ้น

ด้านการให้บริการ ความสามารถนี้ใช้งานได้ทันทีบน Google AI Studio และ Gemini Enterprise Agent Platform ส่วน Gemini App จะเปิดให้ใช้ในภายหลัง ราคาคิดตามอัตราโทเค็นมาตรฐานของ Gemini API โดยไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับฟีเจอร์นี้ จึงมิใช่แพ็กเกจระดับสูงที่ต้องเจรจาสัญญาใหม่ หากแต่เป็นการยกระดับที่รวมอยู่ในโครงสร้างราคาเดิม

ความหมายต่อผู้บริหาร

ข้อมูลภาพภายในองค์กรส่วนใหญ่เป็นสินทรัพย์ที่หลับใหล คือถูกเรียกดูต่อเมื่อเกิดเหตุแล้วเท่านั้น ไม่ว่าจะเป็นกล้องหน้างานก่อสร้าง ภาพบันทึกสายการผลิต ภาพลูกค้าหน้าร้าน หรือภาพบันทึกการประชุมและหน้างาน ปริมาณมากเกินกว่าจะดูไหว เมื่อต้นทุนการวิเคราะห์ลดลงได้มากที่สุดเหลือราวหนึ่งในสาม และลดความจำเป็นในการตัดแบ่งไฟล์ลงอย่างมาก ข้อมูลชุดนี้จึงมีโอกาสเปลี่ยนจาก “หลักฐานย้อนหลัง” มาเป็น “สัญญาณประจำวัน” เป็นครั้งแรก หากประสงค์จะทดลอง ควรเลือกแหล่งภาพที่บันทึกไว้อยู่แล้วแต่ไม่เคยมีผู้ใดดูจนจบ แล้วตั้งคำถามที่แคบมาก เช่น สัปดาห์นี้มีการเข้าพื้นที่โดยไม่สวมหมวกนิรภัยกี่ครั้ง แทนการสั่งให้สรุปวิดีโอทั้งเรื่อง เพราะคำถามที่แคบเท่านั้นจึงจะได้ประโยชน์จากการระบุตำแหน่งระดับต่ำกว่าวินาทีและการนับ

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Google เปิดตัว Gemini 3.8 Flash และ Flash Cyber: Flash รุ่นที่สามในสามสัปดาห์ ราคาเริ่มต้นคงไว้ถึงสิ้นปี

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว