คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 119/217 ตอน ดูสารบัญคอร์ส

Google DeepMind เปิดตัว Genie 3: พิมพ์ข้อความเดียว ก้าวเข้าสู่โลกที่ AI สร้างขึ้นแบบเรียลไทม์

05/08/2025 134
4:35
Google DeepMind เปิดตัว Genie 3: พิมพ์ข้อความเดียว ก้าวเข้าสู่โลกที่ AI สร้างขึ้นแบบเรียลไทม์

Google DeepMind เปิดตัวโมเดลโลกสากล Genie 3 เมื่อวันที่ 5 สิงหาคม 2025 เพียงป้อนข้อความก็สร้างสภาพแวดล้อม 3 มิติแบบเคลื่อนไหวที่สำรวจได้ทันที ด้วยอัตรารีเฟรช 24 เฟรมต่อวินาที ความละเอียด 720p และคงความสม่ำเสมอได้นานหลายนาที เปิดให้ผู้ใช้ Google AI Ultra ทดสอบก่อน

เมื่อวันที่ 5 สิงหาคม 2025 Google DeepMind ได้เปิดตัวผลงานวิจัยล่าสุด Genie 3 ซึ่งเป็น "โมเดลโลกสากล" (world model) แตกต่างจาก AI สร้างเนื้อหาแบบเดิมที่ทำได้เพียงสร้างภาพนิ่งหรือวิดีโอสั้นความยาวคงที่ จุดเด่นของ Genie 3 คือ ผู้ใช้เพียงป้อนข้อความสั่งการ ระบบก็สามารถสร้างสภาพแวดล้อมเชิงโต้ตอบแบบเคลื่อนไหวที่ "เดินเข้าไปได้" ทันที ภาพจะประมวลผลแบบเรียลไทม์ตามการเคลื่อนไหวและการกระทำของผู้ใช้ ราวกับกำลังเล่นวิดีโอเกมที่ AI สร้างขึ้นสดๆ

ตามข้อมูลที่เผยแพร่ในบล็อกทางการ ภาพสภาพแวดล้อมที่ Genie 3 สร้างขึ้นมีอัตรารีเฟรชสูงถึง 24 เฟรมต่อวินาที ความละเอียด 720p และสามารถคงความสม่ำเสมอของสภาพแวดล้อมได้นานหลายนาทีแม้ผู้ใช้จะสำรวจต่อเนื่อง กล่าวคือ เมื่อผู้ใช้เดินไปข้างหน้าแล้วหันกลับมา ฉากและตำแหน่งวัตถุที่เคยผ่านมาก่อนหน้านี้ยังคงเหมือนเดิม ไม่ได้ถูกสุ่มสร้างใหม่ทุกเฟรม ในช่วงเปิดตัว ฟีเจอร์นี้เปิดให้เฉพาะผู้ใช้ที่สมัครสมาชิก Google AI Ultra แบบเสียเงินทดสอบก่อน ยังไม่เปิดให้สาธารณชนทั่วไปใช้งาน

ความหมายเชิงเทคนิค: จาก "สร้างภาพ" สู่ "สร้างโลกทั้งใบ"

ตลอดปีที่ผ่านมา เครื่องมือสร้างวิดีโอด้วย AI (เช่น Sora, Veo) แก้ปัญหา "แปลงข้อความเป็นวิดีโอ" ซึ่งโดยพื้นฐานยังเป็นเนื้อหาเชิงเส้นที่คำนวณไว้ล่วงหน้า ผู้ใช้ทำได้เพียงรับชมแบบพาสซีฟ แต่ Genie 3 แก้ปัญหาในระดับที่แตกต่างไปโดยสิ้นเชิง คือการโต้ตอบแบบเรียลไทม์และความสม่ำเสมอเชิงพื้นที่ นั่นหมายความว่าภายในโมเดลต้องสร้างการแทนค่า (representation) ที่ต่อเนื่องเกี่ยวกับ "โลกใบนี้มีหน้าตาอย่างไร" ไม่ใช่แค่ทำนายภาพทีละเฟรม นี่คือเหตุผลที่ Google DeepMind จัดวางตำแหน่งให้เป็น "โมเดลโลก" ไม่ใช่ "โมเดลสร้างวิดีโอ" เพราะมันใกล้เคียงกับบทบาทของเกมเอนจินมากกว่า เพียงแต่เนื้อหาไม่ได้สร้างด้วยมนุษย์ แต่ AI สร้างขึ้นแบบเรียลไทม์

เปรียบเทียบกับรุ่นก่อนและวงการ

ก่อนหน้านี้ Google DeepMind มีผลงานวิจัยโมเดลโลกอย่าง Genie 1 และ Genie 2 มาแล้ว แต่ระยะเวลาที่โต้ตอบได้และความเสถียรของภาพยังห่างไกลจาก Genie 3 ที่เปิดตัวครั้งนี้มาก "ความสม่ำเสมอนานหลายนาที" เมื่อเทียบกับโมเดลโลกในอดีตที่ส่วนใหญ่คงภาพเสถียรได้เพียงไม่กี่วินาทีถึงไม่กี่สิบวินาที ถือเป็นความก้าวหน้าข้ามรุ่นที่ชัดเจน วงการมองว่าโมเดลโลกเป็นโครงสร้างพื้นฐานสำคัญสู่ AI เอเจนต์ที่ทรงพลังยิ่งขึ้นและสภาพแวดล้อมฝึกฝน embodied AI หาก AI ต้องเรียนรู้การกระทำในโลกจริง การฝึกฝนจำนวนมากในสภาพแวดล้อมจำลองที่ AI สร้างขึ้นซึ่งต้นทุนต่ำและควบคุมได้ ย่อมปลอดภัยและประหยัดกว่าการลองผิดลองถูกในโลกจริงโดยตรง

สำหรับผู้บริหาร Genie 3 ในปัจจุบันยังเป็นการสาธิตเทคโนโลยีเชิงวิจัย ยังไม่ใช่เครื่องมือที่นำไปใช้ในธุรกิจได้โดยตรง แต่ทิศทางที่ควรจับตาคือ ต้นทุนการสร้างฉากฝึกอบรมจำลองและประสบการณ์พื้นที่เสมือนอาจลดลงอย่างมากในอนาคต ธุรกิจที่พึ่งพาการจำลองสถานการณ์จริงเพื่อฝึกอบรมพนักงาน (เช่น การซ้อมความปลอดภัยในสายการผลิต หรือการรับมือสถานการณ์หน้างานในโรงแรมและการท่องเที่ยว) หรือธุรกิจที่ต้องการพื้นที่จัดแสดงเสมือนต้นทุนต่ำ (เช่น บูธอีคอมเมิร์ซ ห้องตัวอย่างพรีเซลอสังหาริมทรัพย์) ควรติดตามอย่างต่อเนื่องว่าเทคโนโลยีโมเดลโลกเช่นนี้จะเปิดให้ใช้เชิงพาณิชย์เมื่อใด

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร OpenAI เปิดตัว GPT-5 อย่างเป็นทางการ ระบบเดียวที่ตัดสินใจเองว่าจะ "ตอบเร็ว" หรือ "คิดลึก"

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว