Gemini เปิดตัวความเข้าใจวิดีโอแบบ agentic โมเดลเลือกเองว่าจะดูช่วงไหนและผ่านโหมดใด ประหยัดโทเค็นสูงสุด 88%
วันที่ 1 กันยายน 2569 Google เปิดตัวความเข้าใจวิดีโอแบบ agentic บน Gemini 3.7 Flash, 3.6 Flash และ 3.5 Flash-Lite โดยโมเดลตัดสินใจเองว่าจะดูช่วงใด ด้วยความเร็วเท่าใด และผ่านโหมดใด ตัวเลขทางการระบุว่าลดโทเค็นได้สูงสุด 88% ลดต้นทุนสูงสุด 66% และเพิ่มความแม่นยำได้สูงสุด 7%
วันที่ 1 กันยายน 2569 Google ประกาศเปิดตัวความสามารถ “ความเข้าใจวิดีโอแบบ agentic” (agentic video understanding) บนโมเดลสามรุ่น ได้แก่ Gemini 3.7 Flash, Gemini 3.6 Flash และ Gemini 3.5 Flash-Lite ประเด็นสำคัญมิใช่การเปลี่ยนไปใช้โมเดลที่ใหญ่ขึ้น หากแต่เป็นการเปลี่ยน “วิธีที่โมเดลดูวิดีโอ”
เดิมทีโมเดลประมวลผลวิดีโอด้วยอัตราเฟรมคงที่ (fixed frame rate) คือรับภาพทั้งเรื่องตั้งแต่ต้นจนจบ ไม่ว่าจะเป็นภาพกล้องวงจรปิดความยาวสองชั่วโมงหรือคลิปสายการผลิตสองนาที ก็ผ่านกระบวนการเดียวกัน แนวทางใหม่คืนอำนาจตัดสินใจให้โมเดล ทั้งเลือกช่วงที่จะดู เลือกความเร็ว (ช่วงใดข้าม ช่วงใดชะลอดูทีละเฟรม) และเลือกโหมดในการดึงข้อมูล ระหว่างภาพ เสียง หรือข้อความถอดเสียง จากเดิมที่ต้อง “ดูให้จบแล้วจึงตอบ” กลายเป็น “ค้นหาเองว่าคำตอบอยู่ช่วงใด”
ตัวเลขทางการ: ประหยัดต้นทุนพร้อมความแม่นยำที่สูงขึ้น
ผลลัพธ์ที่ Google เปิดเผยมีสามตัวเลข และไปในทิศทางเดียวกัน
- ลดการใช้โทเค็นได้สูงสุด 88%
- ลดต้นทุนการวิเคราะห์ได้สูงสุด 66%
- เพิ่มความแม่นยำได้สูงสุด 7%
การที่ทั้งสามด้านดีขึ้นพร้อมกันคือสาระสำคัญของข่าวนี้ เพราะการปรับปรุงประสิทธิภาพโดยทั่วไปมักต้องแลกความแม่นยำกับต้นทุน แต่กรณีนี้ตรรกะต่างออกไป เมื่อโมเดลไม่ถูกบังคับให้บรรจุเฟรมที่ไม่เกี่ยวข้องจำนวนมากเข้าสู่บริบท สัญญาณรบกวนจึงลดลงและการวินิจฉัยชัดเจนขึ้น ทั้งนี้ Gemini 3.7 Flash เมื่อใช้ร่วมกับความเข้าใจแบบ agentic ให้ผลดีที่สุดทั้งด้านคุณภาพโดยรวมและความคุ้มค่าระหว่างคุณภาพกับต้นทุน
ความสามารถหลักสี่ประการและการให้บริการ
- การระบุตำแหน่งช่วงเวลาระดับต่ำกว่าวินาที (sub-second moment retrieval) ระบุได้ว่าภาพที่ต้องการปรากฏในวินาทีใด นำไปตัดต่ออัตโนมัติได้ทันที
- วิเคราะห์วิดีโอความยาวมากโดยโทเค็นไม่บานปลาย ช่วยลดความจำเป็นในการตัดแบ่งไฟล์เป็นท่อน ๆ ได้อย่างมาก
- การตรวจจับความผิดปกติ ด้วยการสุ่มตัวอย่างซ้ำแบบปรับตัว (adaptive resampling) ซึ่งเทียบได้กับการดูเร็วในช่วงปกติและชะลอลงในช่วงน่าสงสัย
- การนับการกระทำและวัตถุ นับจำนวนคน จำนวนชิ้นงาน และการกระทำซ้ำได้แม่นยำขึ้น
ด้านการให้บริการ ความสามารถนี้ใช้งานได้ทันทีบน Google AI Studio และ Gemini Enterprise Agent Platform ส่วน Gemini App จะเปิดให้ใช้ในภายหลัง ราคาคิดตามอัตราโทเค็นมาตรฐานของ Gemini API โดยไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับฟีเจอร์นี้ จึงมิใช่แพ็กเกจระดับสูงที่ต้องเจรจาสัญญาใหม่ หากแต่เป็นการยกระดับที่รวมอยู่ในโครงสร้างราคาเดิม
ความหมายต่อผู้บริหาร
ข้อมูลภาพภายในองค์กรส่วนใหญ่เป็นสินทรัพย์ที่หลับใหล คือถูกเรียกดูต่อเมื่อเกิดเหตุแล้วเท่านั้น ไม่ว่าจะเป็นกล้องหน้างานก่อสร้าง ภาพบันทึกสายการผลิต ภาพลูกค้าหน้าร้าน หรือภาพบันทึกการประชุมและหน้างาน ปริมาณมากเกินกว่าจะดูไหว เมื่อต้นทุนการวิเคราะห์ลดลงได้มากที่สุดเหลือราวหนึ่งในสาม และลดความจำเป็นในการตัดแบ่งไฟล์ลงอย่างมาก ข้อมูลชุดนี้จึงมีโอกาสเปลี่ยนจาก “หลักฐานย้อนหลัง” มาเป็น “สัญญาณประจำวัน” เป็นครั้งแรก หากประสงค์จะทดลอง ควรเลือกแหล่งภาพที่บันทึกไว้อยู่แล้วแต่ไม่เคยมีผู้ใดดูจนจบ แล้วตั้งคำถามที่แคบมาก เช่น สัปดาห์นี้มีการเข้าพื้นที่โดยไม่สวมหมวกนิรภัยกี่ครั้ง แทนการสั่งให้สรุปวิดีโอทั้งเรื่อง เพราะคำถามที่แคบเท่านั้นจึงจะได้ประโยชน์จากการระบุตำแหน่งระดับต่ำกว่าวินาทีและการนับ
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี