Google DeepMind เปิดตัว Genie 3: พิมพ์ข้อความเดียว ก้าวเข้าสู่โลกที่ AI สร้างขึ้นแบบเรียลไทม์
Google DeepMind เปิดตัวโมเดลโลกสากล Genie 3 เมื่อวันที่ 5 สิงหาคม 2025 เพียงป้อนข้อความก็สร้างสภาพแวดล้อม 3 มิติแบบเคลื่อนไหวที่สำรวจได้ทันที ด้วยอัตรารีเฟรช 24 เฟรมต่อวินาที ความละเอียด 720p และคงความสม่ำเสมอได้นานหลายนาที เปิดให้ผู้ใช้ Google AI Ultra ทดสอบก่อน
เมื่อวันที่ 5 สิงหาคม 2025 Google DeepMind ได้เปิดตัวผลงานวิจัยล่าสุด Genie 3 ซึ่งเป็น "โมเดลโลกสากล" (world model) แตกต่างจาก AI สร้างเนื้อหาแบบเดิมที่ทำได้เพียงสร้างภาพนิ่งหรือวิดีโอสั้นความยาวคงที่ จุดเด่นของ Genie 3 คือ ผู้ใช้เพียงป้อนข้อความสั่งการ ระบบก็สามารถสร้างสภาพแวดล้อมเชิงโต้ตอบแบบเคลื่อนไหวที่ "เดินเข้าไปได้" ทันที ภาพจะประมวลผลแบบเรียลไทม์ตามการเคลื่อนไหวและการกระทำของผู้ใช้ ราวกับกำลังเล่นวิดีโอเกมที่ AI สร้างขึ้นสดๆ
ตามข้อมูลที่เผยแพร่ในบล็อกทางการ ภาพสภาพแวดล้อมที่ Genie 3 สร้างขึ้นมีอัตรารีเฟรชสูงถึง 24 เฟรมต่อวินาที ความละเอียด 720p และสามารถคงความสม่ำเสมอของสภาพแวดล้อมได้นานหลายนาทีแม้ผู้ใช้จะสำรวจต่อเนื่อง กล่าวคือ เมื่อผู้ใช้เดินไปข้างหน้าแล้วหันกลับมา ฉากและตำแหน่งวัตถุที่เคยผ่านมาก่อนหน้านี้ยังคงเหมือนเดิม ไม่ได้ถูกสุ่มสร้างใหม่ทุกเฟรม ในช่วงเปิดตัว ฟีเจอร์นี้เปิดให้เฉพาะผู้ใช้ที่สมัครสมาชิก Google AI Ultra แบบเสียเงินทดสอบก่อน ยังไม่เปิดให้สาธารณชนทั่วไปใช้งาน
ความหมายเชิงเทคนิค: จาก "สร้างภาพ" สู่ "สร้างโลกทั้งใบ"
ตลอดปีที่ผ่านมา เครื่องมือสร้างวิดีโอด้วย AI (เช่น Sora, Veo) แก้ปัญหา "แปลงข้อความเป็นวิดีโอ" ซึ่งโดยพื้นฐานยังเป็นเนื้อหาเชิงเส้นที่คำนวณไว้ล่วงหน้า ผู้ใช้ทำได้เพียงรับชมแบบพาสซีฟ แต่ Genie 3 แก้ปัญหาในระดับที่แตกต่างไปโดยสิ้นเชิง คือการโต้ตอบแบบเรียลไทม์และความสม่ำเสมอเชิงพื้นที่ นั่นหมายความว่าภายในโมเดลต้องสร้างการแทนค่า (representation) ที่ต่อเนื่องเกี่ยวกับ "โลกใบนี้มีหน้าตาอย่างไร" ไม่ใช่แค่ทำนายภาพทีละเฟรม นี่คือเหตุผลที่ Google DeepMind จัดวางตำแหน่งให้เป็น "โมเดลโลก" ไม่ใช่ "โมเดลสร้างวิดีโอ" เพราะมันใกล้เคียงกับบทบาทของเกมเอนจินมากกว่า เพียงแต่เนื้อหาไม่ได้สร้างด้วยมนุษย์ แต่ AI สร้างขึ้นแบบเรียลไทม์
เปรียบเทียบกับรุ่นก่อนและวงการ
ก่อนหน้านี้ Google DeepMind มีผลงานวิจัยโมเดลโลกอย่าง Genie 1 และ Genie 2 มาแล้ว แต่ระยะเวลาที่โต้ตอบได้และความเสถียรของภาพยังห่างไกลจาก Genie 3 ที่เปิดตัวครั้งนี้มาก "ความสม่ำเสมอนานหลายนาที" เมื่อเทียบกับโมเดลโลกในอดีตที่ส่วนใหญ่คงภาพเสถียรได้เพียงไม่กี่วินาทีถึงไม่กี่สิบวินาที ถือเป็นความก้าวหน้าข้ามรุ่นที่ชัดเจน วงการมองว่าโมเดลโลกเป็นโครงสร้างพื้นฐานสำคัญสู่ AI เอเจนต์ที่ทรงพลังยิ่งขึ้นและสภาพแวดล้อมฝึกฝน embodied AI หาก AI ต้องเรียนรู้การกระทำในโลกจริง การฝึกฝนจำนวนมากในสภาพแวดล้อมจำลองที่ AI สร้างขึ้นซึ่งต้นทุนต่ำและควบคุมได้ ย่อมปลอดภัยและประหยัดกว่าการลองผิดลองถูกในโลกจริงโดยตรง
สำหรับผู้บริหาร Genie 3 ในปัจจุบันยังเป็นการสาธิตเทคโนโลยีเชิงวิจัย ยังไม่ใช่เครื่องมือที่นำไปใช้ในธุรกิจได้โดยตรง แต่ทิศทางที่ควรจับตาคือ ต้นทุนการสร้างฉากฝึกอบรมจำลองและประสบการณ์พื้นที่เสมือนอาจลดลงอย่างมากในอนาคต ธุรกิจที่พึ่งพาการจำลองสถานการณ์จริงเพื่อฝึกอบรมพนักงาน (เช่น การซ้อมความปลอดภัยในสายการผลิต หรือการรับมือสถานการณ์หน้างานในโรงแรมและการท่องเที่ยว) หรือธุรกิจที่ต้องการพื้นที่จัดแสดงเสมือนต้นทุนต่ำ (เช่น บูธอีคอมเมิร์ซ ห้องตัวอย่างพรีเซลอสังหาริมทรัพย์) ควรติดตามอย่างต่อเนื่องว่าเทคโนโลยีโมเดลโลกเช่นนี้จะเปิดให้ใช้เชิงพาณิชย์เมื่อใด
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี