Google เปิดตัว Gemini Omni 1.1 Flash: โมเดลสร้างวิดีโอเพิ่มฟีเจอร์ต่อฉาก กำหนดเฟรมแรก–สุดท้าย โหมดร่าง 360p และเอาต์พุต 4K
Google DeepMind เปิดตัวโมเดลสร้างวิดีโอ Gemini Omni 1.1 Flash เมื่อ 27 สิงหาคม พ.ศ. 2569: ฟีเจอร์ต่อฉากวิเคราะห์บริบท 10 วินาทีก่อนหน้า กำหนดเฟรมแรก–สุดท้ายได้ เพิ่มโหมดร่าง 360p (เร็วกว่า 720p สูงสุด 60% ต้นทุนหนึ่งในสาม) และเอาต์พุต 1080p/4K ใช้งานได้ทันทีผ่าน Gemini API บทความนี้วิเคราะห์ความหมายทางเทคนิค กลยุทธ์ราคาแบ่งระดับ และนัยสำหรับผู้บริหาร
เมื่อวันที่ 27 สิงหาคม พ.ศ. 2569 (เวลาสหรัฐฯ ฝั่งตะวันตก) Google DeepMind ประกาศเปิดตัว Gemini Omni 1.1 Flash ผ่านบล็อกทางการของ Google โดยผู้เขียนคือ Anish Nangia และ Alisa Fortin ผู้จัดการผลิตภัณฑ์ โมเดลรุ่นนี้เป็นเวอร์ชันใหม่ของโมเดลมัลติโมดัลสำหรับสร้างและตัดต่อวิดีโอ เปิดให้ใช้งานทันทีผ่าน Gemini API (Google AI Studio) และ Gemini Enterprise Agent Platform ส่วนเครื่องมือสร้างสรรค์ Google Flow เปิดให้สมาชิก AI Plus/Pro/Ultra และฟีเจอร์ต่อฉากใน Gemini App เปิดให้สมาชิก Plus/Pro/Ultra ทั่วโลก
ฟีเจอร์ใหม่ 5 รายการ: จาก “สร้างครั้งเดียว” สู่ “งานผลิตที่ต่อยอดและควบคุมได้”
- ต่อฉาก (Scene Extension): โมเดลวิเคราะห์บริบท 10 วินาทีก่อนหน้า (รุ่นก่อนดูเพียง 1 วินาทีสุดท้าย) ต่อได้ครั้งละ 10 วินาที สูงสุด 40 วินาที โดยรักษาตัวละคร แสง และการเล่าเรื่องให้สอดคล้องกัน
- กำหนดเฟรมแรกและเฟรมสุดท้าย: ให้ภาพเริ่มต้นและภาพจบ โมเดลจะสร้างช็อตต่อเนื่องและการเคลื่อนกล้องตรงกลางให้อัตโนมัติ
- โหมดร่าง 360p: เร็วกว่าโหมดมาตรฐาน 720p สูงสุด 60% และต้นทุนเพียงหนึ่งในสาม เหมาะสำหรับทำต้นแบบอย่างรวดเร็ว
- เอาต์พุตความละเอียดสูง 1080p/4K: สำหรับงานผลิตระดับมืออาชีพและการส่งมอบจริง
- วิดีโออ้างอิง: อัปโหลดคลิปภายนอกได้สูงสุด 3 วินาที เพื่อใช้เป็นตัวอ้างอิงสไตล์ของตัวละครหรือการเคลื่อนไหว
ราคาคิดตาม “วินาทีของวิดีโอที่สร้าง”: 360p อยู่ที่ 0.03 ดอลลาร์สหรัฐ 720p อยู่ที่ 0.10 ดอลลาร์ 1080p อยู่ที่ 0.15 ดอลลาร์ และ 4K อยู่ที่ 0.30 ดอลลาร์
ความหมายทางเทคนิค: ขยายหน้าต่างบริบทจาก 1 วินาทีเป็น 10 วินาที
ปัญหาเรื้อรังของโมเดลสร้างวิดีโอคือ “ยิ่งต่อยิ่งเพี้ยน” ตัวละครเปลี่ยนหน้า แสงกระโดด ท่าทางไม่ต่อเนื่อง รุ่นก่อนใช้เพียง 1 วินาทีสุดท้ายเป็นฐานในการต่อ โมเดลจึงไม่รู้ว่าก่อนหน้านั้นเกิดอะไรขึ้น 1.1 Flash ขยายบริบทอ้างอิงเป็น 10 วินาที เท่ากับให้โมเดลจดจำช็อตทั้งช่วงได้ครบ การเล่าเรื่องจึงต่อเนื่องได้ ส่วนการกำหนดเฟรมแรก–สุดท้ายคือการนำวิธีทำงานแบบ “คีย์เฟรม” ของอุตสาหกรรมแอนิเมชันมาใส่ในโมเดลสร้างสรรค์: มนุษย์กำหนดจุดเริ่มและจุดจบ เครื่องรับหน้าที่เติมช่วงกลาง สองสิ่งนี้รวมกันทำให้วิดีโอที่สร้างด้วย AI เริ่มมี “ความสามารถในการกำกับ” ไม่ใช่แค่ผลลัพธ์สุ่มแบบเสี่ยงโชค
เทียบกับคู่แข่ง: ใช้ราคาแบ่งระดับเปิดจังหวะ “ร่างก่อน แล้วค่อยขัดเกลา”
โหมดร่าง 360p คือการออกแบบที่ใช้งานได้จริงที่สุดในรอบนี้ เครื่องมือสร้างวิดีโอส่วนใหญ่ไม่มีระดับราคาสำหรับร่างความละเอียดต่ำแยกต่างหาก การแก้พรอมป์ซ้ำ ๆ จึงมักถูกคิดในราคาของเอาต์พุตจริง ต้นทุนการลองผิดลองถูกจึงบานปลายอย่างรวดเร็ว Google ตั้งราคาโหมดร่างไว้เพียงหนึ่งในสามของโหมดมาตรฐาน 720p และเร็วขึ้นสูงสุด 60% เป็นการชี้นำผู้ใช้อย่างชัดเจนว่า “ลองซ้ำด้วย 360p เมื่อลงตัวแล้วค่อยออก 4K” สอดคล้องกับตรรกะ “ต้นแบบก่อน ผลิตจริงทีหลัง” ของอุตสาหกรรมซอฟต์แวร์ หากคิดที่ 4K วินาทีละ 0.30 ดอลลาร์ คลิป 30 วินาทีจะอยู่ที่ราว 9 ดอลลาร์ สื่ออย่าง the-decoder และ Neowin รายงานข่าวนี้ตามในวันเดียวกัน และเมื่อดูจากกลยุทธ์เปิดตัวผ่าน API ก่อนพร้อมราคาที่โปร่งใส ชัดเจนว่า Google มุ่งเป้าไปที่ตลาดนักพัฒนา แข่งโดยตรงกับ OpenAI Sora, Kling ของ Kuaishou และ Runway
ความหมายสำหรับผู้บริหาร
สำหรับผู้บริหารที่ทำธุรกิจอีคอมเมิร์ซ ค้าปลีก หรือโรงแรมในประเทศไทย ประเด็นสำคัญของข่าวนี้ไม่ใช่ “AI ทำวิดีโอได้อีกแล้ว” แต่คือโครงสร้างต้นทุนของกระบวนการผลิตเปลี่ยนไป: ต้นทุนการลองผิดลองถูกของคลิปการตลาดลดลงเหลือไม่กี่เซนต์ต่อวินาที และยังกำหนดภาพเริ่ม–จบเพื่อล็อกโทนของแบรนด์ได้ หากทีมมีวัตถุดิบอยู่แล้ว ให้ลองใช้โหมดร่าง 360p ทำสามถึงห้าเวอร์ชัน เมื่อภายในตัดสินใจแล้วจึงออก 4K เพื่อเผยแพร่ ย่นเวลาส่งงานไปกลับกับผู้รับจ้างตัดต่อให้เหลือภายในหนึ่งวัน
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี