คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 29/217 ตอน ดูสารบัญคอร์ส

OpenAI เปิดตัว Sora: โมเดลแปลงข้อความเป็นวิดีโอ สร้างวิดีโอความละเอียดสูงได้นานสุด 60 วินาที

15/02/2024 126
4:46
OpenAI เปิดตัว Sora: โมเดลแปลงข้อความเป็นวิดีโอ สร้างวิดีโอความละเอียดสูงได้นานสุด 60 วินาที

OpenAI เปิดตัวโมเดลแปลงข้อความเป็นวิดีโอ Sora เมื่อวันที่ 15 กุมภาพันธ์ 2024 สามารถสร้างวิดีโอความละเอียดสูงยาวสุด 60 วินาทีจากคำบรรยาย แสดงศักยภาพจำลองโลกจริงเช่นความคงอยู่ของวัตถุ ปัจจุบันเปิดให้เฉพาะทีม red team และศิลปิน/ผู้สร้างภาพยนตร์บางส่วนทดสอบความปลอดภัย ยังไม่เปิดให้สาธารณชนใช้งาน

เมื่อวันที่ 15 กุมภาพันธ์ 2024 OpenAI ได้เปิดตัวโมเดลใหม่ชื่อ Sora ซึ่งเป็นโมเดล "แปลงข้อความเป็นวิดีโอ" (text-to-video) ผู้ใช้เพียงป้อนคำบรรยายเป็นข้อความ Sora ก็สามารถสร้างวิดีโอความยาวสูงสุด 60 วินาที ที่มีรายละเอียดคมชัดและการเคลื่อนกล้องที่ลื่นไหล เมื่อเทียบกับโมเดลสร้างวิดีโอที่เปิดเผยต่อสาธารณะในขณะนั้น ความยาวและคุณภาพภาพของ Sora ถือเป็นความก้าวหน้าที่ชัดเจน อย่างไรก็ตาม OpenAI ระบุชัดเจนว่า Sora ในขณะนี้อยู่ในสถานะ "research preview" เท่านั้น ยังไม่เปิดให้บุคคลทั่วไปใช้งาน โดยช่วงแรกเปิดให้เฉพาะทีม red team (ทดสอบความปลอดภัยและความเสี่ยงในการนำไปใช้ในทางที่ผิด) และศิลปินด้านภาพและผู้สร้างภาพยนตร์ที่ได้รับเชิญจำนวนหนึ่ง (เพื่อทดลองสร้างสรรค์และเก็บข้อมูลย้อนกลับ) ยังไม่มีช่องทางสมัครใช้งานสาธารณะหรือกำหนดวันเปิดตัวจริง

นัยสำคัญเชิงเทคนิค: จาก "คลิปสั้น" สู่ "การจำลองโลก"

จุดเด่นทางเทคนิคที่ได้รับความสนใจมากที่สุดของ Sora ไม่ใช่ความละเอียดหรือความยาวของวิดีโอ แต่เป็นสิ่งที่ OpenAI เน้นย้ำในบทความเปิดตัว คือ "ความคงอยู่ของวัตถุ" (object permanence) และความสามารถในการจำลองโลกทางกายภาพ กล่าวคือ ตัวละครและวัตถุในวิดีโอยังคงรูปลักษณ์ที่สอดคล้องกันและพฤติกรรมทางฟิสิกส์ที่สมเหตุสมผล แม้จะเคลื่อนที่ มีการบดบัง หรือมีปฏิสัมพันธ์เกิดขึ้น ต่างจากโมเดลสร้างวิดีโอรุ่นก่อนที่มักเกิดภาพบิดเบี้ยว กะพริบ หรือขาดความต่อเนื่องเชิงตรรกะ OpenAI วางตำแหน่ง Sora ไว้เป็นทิศทางการวิจัยเบื้องต้นสู่ "ตัวจำลองโลก" (world simulators) ซึ่งบ่งบอกว่าเป้าหมายระยะยาวไม่ใช่แค่เครื่องมือสร้างวิดีโอ แต่เป็นก้าวหนึ่งที่ทำให้ AI เข้าใจและจำลองกฎเกณฑ์การเคลื่อนไหวของโลกจริงได้

ช่องว่างเทียบกับโมเดลสร้างวิดีโอรุ่นก่อนหน้า

ก่อนหน้าการเปิดตัว Sora เครื่องมือแปลงข้อความเป็นวิดีโอที่มีอยู่ในตลาด (เช่น Runway Gen-2, Pika) ส่วนใหญ่สร้างวิดีโอได้เพียงไม่กี่วินาที ความละเอียดจำกัด และมักเกิดปัญหาวัตถุผิดรูปหรือความต่อเนื่องไม่สมบูรณ์ ความยาว 60 วินาทีและความเสถียรของภาพที่ Sora แสดงให้เห็น จึงเทียบเท่าการก้าวกระโดดข้ามรุ่นในขณะนั้น และเป็นเหตุผลที่ข่าวนี้สร้างความสนใจอย่างมากในวงการทันที เนื่องจากแนวทางเทคนิคของคู่แข่งส่วนใหญ่ถูกทิ้งห่างในพริบตา

ปฏิกิริยาจากวงการ: ทั้งตื่นตาตื่นใจและระมัดระวัง

เนื่องจาก OpenAI เปิดเผยเพียงวิดีโอตัวอย่างที่คัดสรรและคำอธิบายจำกัด โดยไม่เปิดให้ทดสอบสาธารณะหรือเผยรายละเอียดทางเทคนิคทั้งหมด ปฏิกิริยาจากวงการจึงแบ่งเป็นสองฝ่าย ฝ่ายหนึ่งคือผู้สร้างสรรค์และสื่อเทคโนโลยีที่ชื่นชมความสมจริงของวิดีโอตัวอย่าง มองว่านี่เป็นสัญญาณว่าต้นทุนการผลิตวิดีโอคอนเทนต์จะลดลงอย่างมาก อีกฝ่ายคือผู้เชี่ยวชาญและนักวิจัยที่เตือนว่าวิดีโอตัวอย่างผ่านการคัดกรองมาแล้ว อัตราความสำเร็จจริง กรณีล้มเหลว และต้นทุนการประมวลผลยังคงเป็นสิ่งที่ไม่ทราบแน่ชัด และยังไม่มีบุคคลภายนอกทดสอบยืนยันได้จริง การที่ OpenAI เลือกให้ทีม red team และศิลปิน/ผู้สร้างภาพยนตร์บางส่วนได้รับเชิญทดสอบก่อน ก็ถูกมองว่าเป็นท่าทีระมัดระวังของบริษัทต่อความเสี่ยงในการนำ AI สร้างสื่อไปใช้ในทางที่ผิด เช่น วิดีโอข่าวปลอม

สำหรับผู้บริหาร ข่าวนี้ยังไม่ใช่ "เครื่องมือที่นำไปใช้ได้ทันที" แต่ควรบันทึกและติดตามไว้ เพราะเมื่อเทคโนโลยีแปลงข้อความเป็นวิดีโอก้าวข้ามขีดจำกัดด้านคุณภาพและความยาวได้แล้ว โครงสร้างต้นทุนการผลิตสำหรับการตลาดคอนเทนต์ คลิปฝึกอบรม หรือการนำเสนอสินค้า อาจถูกเขียนใหม่ทั้งหมด การติดตามจังหวะพัฒนาการทางเทคนิคล่วงหน้าจะช่วยให้ตัดสินใจได้รวดเร็วเมื่อเครื่องมือเปิดใช้งานจริง

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Google เปิดตัวโมเดลโอเพนซอร์ส Gemma เจาะกลุ่มอุปกรณ์ปลายทางและสภาพแวดล้อมทรัพยากรจำกัด

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว