Meta เปิดตัว V-JEPA 2 โมเดลโลกจำลองแบบโอเพนซอร์ส วางแผนหุ่นยนต์แบบ Zero-Shot
เมื่อวันที่ 11 มิถุนายน พ.ศ. 2568 Meta AI เปิดตัว V-JEPA 2 โมเดลโลกจำลอง (world model) แบบวิดีโอที่เรียนรู้ด้วยตนเอง ฝึกด้วยวิดีโอกว่า 1 ล้านชั่วโมงและข้อมูลหุ่นยนต์จริงราว 62 ชั่วโมง ช่วยให้ AI เข้าใจ ทำนาย และวางแผนการปฏิสัมพันธ์กับโลกทางกายภาพ พร้อมเปิดซอร์สโค้ดให้ใช้งาน
เมื่อวันที่ 11 มิถุนายน พ.ศ. 2568 Meta AI ได้เปิดตัว V-JEPA 2 (Video Joint Embedding Predictive Architecture 2) โมเดล "โลกจำลอง" (world model) ที่เรียนรู้ผ่านวิดีโอแบบเรียนรู้ด้วยตนเอง (self-supervised) กล่าวคือ AI ไม่เพียงแค่ "ดูออก" ว่าภาพในวิดีโอคืออะไร แต่ยังเข้าใจกฎการทำงานของโลกทางกายภาพ เช่น วัตถุเคลื่อนที่อย่างไร เกิดอะไรขึ้นหลังการชน และสถานะถัดไปจะเป็นอย่างไร โมเดลนี้ฝึกด้วยวิดีโอจากอินเทอร์เน็ตกว่า 1 ล้านชั่วโมง ร่วมกับข้อมูลการทำงานจริงของหุ่นยนต์ประมาณ 62 ชั่วโมงเพื่อปรับจูนเพิ่มเติม ทำให้โมเดลมีความสามารถ "เข้าใจ ทำนาย และวางแผน" การปฏิสัมพันธ์กับโลกทางกายภาพ Meta ยังเปิดซอร์สโมเดลนี้ให้สาธารณะใช้งาน พร้อมเผยแพร่มาตรฐานทดสอบด้านการให้เหตุผลเชิงฟิสิกส์ใหม่ 3 รายการ
ความหมายเชิงเทคนิค: จาก "ดูวิดีโอออก" สู่ "ทำนายโลกทางกายภาพ"
ที่ผ่านมาโมเดล AI ด้านวิดีโอส่วนใหญ่เน้นการจดจำและอธิบายเนื้อหาในภาพ เช่น "นี่คือแมวกำลังกระโดด" จุดเปลี่ยนสำคัญของ V-JEPA 2 อยู่ที่ "สถาปัตยกรรมเชิงทำนาย" (Predictive Architecture) กล่าวคือโมเดลไม่ได้สร้างวิดีโอขึ้นใหม่ทีละพิกเซล แต่ทำนายสิ่งที่จะเกิดขึ้นต่อไปในวิดีโอในรูปแบบ "พื้นที่การแทนค่า" (representation space) ที่เป็นนามธรรม การออกแบบเช่นนี้ทำให้โมเดลเข้าใจกฎฟิสิกส์ เช่น ความเฉื่อยของวัตถุ การเปลี่ยนวิถีหลังการชน โดยใช้ทรัพยากรการประมวลผลน้อยลง และรองรับการวางแผนหุ่นยนต์ในสภาพแวดล้อมที่ไม่คุ้นเคย Meta เน้นย้ำว่าโมเดลสามารถทำ "การวางแผนหุ่นยนต์แบบ Zero-Shot" ได้ คือไม่ต้องฝึกเพิ่มเติมสำหรับวัตถุหรือสถานที่เฉพาะ ก็สามารถโต้ตอบกับวัตถุที่ไม่เคยเห็นมาก่อนในสภาพแวดล้อมใหม่ได้ ซึ่งเป็นความสามารถที่มีประโยชน์มากสำหรับการพัฒนาหุ่นยนต์ เพราะการรวมกันของวัตถุและสถานการณ์ในโลกจริงมีแทบไม่จำกัด ไม่สามารถติดป้ายข้อมูลฝึกได้ทีละอย่าง
บริบทอุตสาหกรรม: การแข่งขันในสนาม AI เชิงกายภาพทวีความเข้มข้น
โมเดลโลกจำลองเป็นสนามใหม่ที่วงการ AI ให้ความสำคัญในช่วงไม่กี่ปีที่ผ่านมา โดย NVIDIA ได้เปิดตัวแพลตฟอร์มโลกจำลอง Cosmos ตั้งแต่ต้นปี พ.ศ. 2568 มุ่งเป้าไปที่แอปพลิเคชัน AI เชิงกายภาพ เช่น หุ่นยนต์และรถยนต์ขับเคลื่อนอัตโนมัติ ขณะที่ Google และผู้เล่นรายอื่นก็ต่างทุ่มเทวิจัยในด้านนี้เช่นกัน ในการเปิดตัวครั้งนี้ Meta ไม่ได้ให้ข้อมูลเปรียบเทียบประสิทธิภาพเชิงปริมาณโดยตรงกับคู่แข่งอย่าง NVIDIA Cosmos ดังนั้นประสิทธิภาพการประมวลผลและความแม่นยำในการวางแผนของ V-JEPA 2 เมื่อเทียบกับคู่แข่ง จึงยังต้องรอการทดสอบอิสระจากบุคคลที่สามและการใช้งานจริงในอุตสาหกรรมเพื่อยืนยัน สิ่งที่แน่ชัดคือ บริษัทเทคโนโลยีรายใหญ่หลายแห่งกำลังทุ่มทรัพยากรพัฒนาโมเดลโลกจำลองพร้อมกัน สะท้อนว่าเทคโนโลยีนี้ถูกมองเป็นโครงสร้างพื้นฐานสำคัญสำหรับการพัฒนาหุ่นยนต์และ AI เชิงกายภาพในระยะถัดไป
ปฏิกิริยาในวงการ: กลยุทธ์โอเพนซอร์สที่ Meta ยึดมาต่อเนื่อง
การเลือกเปิดซอร์ส V-JEPA 2 สอดคล้องกับแนวทางที่ Meta ทำมาตั้งแต่ตระกูล Llama ซึ่งตรงข้ามกับแนวทางแบบปิดของ OpenAI และ Google ที่เน้นให้บริการผ่าน API การเปิดซอร์สหมายความว่าสถาบันวิจัยและสตาร์ทอัพทั่วโลกสามารถนำโมเดลไปใช้พัฒนาหุ่นยนต์ได้โดยตรง ซึ่งอาจเร่งความก้าวหน้าโดยรวมของสาขา AI ที่มีร่างกาย (Embodied AI) แต่ก็สะท้อนว่า Meta เลือกใช้ระบบนิเวศแบบเปิดแทนการให้สิทธิ์เชิงพาณิชย์ เพื่อช่วงชิงอิทธิพลในสนามแข่งขันโลกจำลองที่กำลังเติบโต ส่วนมาตรฐานทดสอบด้านการให้เหตุผลเชิงฟิสิกส์ 3 รายการที่เปิดตัวพร้อมกัน ก็ถูกมองว่าเป็นความพยายามของ Meta ในการสร้างมาตรฐานวัดผลร่วมของอุตสาหกรรม คล้ายกับบทบาทของ MMLU หรือ HellaSwag ในยุคโมเดลภาษา
ความหมายต่อผู้บริหาร
เทคโนโลยีโลกจำลองอย่าง V-JEPA 2 คือก้าวสำคัญที่ทำให้หุ่นยนต์และระบบอัตโนมัติทางกายภาพก้าวสู่ความ "เอนกประสงค์" มากขึ้น — ระบบหุ่นยนต์ที่เคยต้องฝึกเฉพาะสำหรับแต่ละสถานการณ์ ในอนาคตอาจลดอุปสรรคในการนำไปใช้ลงได้มากผ่านโมเดลโลกจำลองแบบนี้ สำหรับผู้บริหารในอุตสาหกรรมที่พึ่งพาระบบอัตโนมัติทางกายภาพ เช่น การผลิต คลังสินค้า และโลจิสติกส์ ควรติดตามความก้าวหน้าเทคโนโลยีนี้อย่างต่อเนื่อง เพราะอาจลดต้นทุนและอุปสรรคทางเทคนิคในการนำหุ่นยนต์มาใช้ในช่วง 1-2 ปีข้างหน้า ควรบรรจุไว้ในแผนติดตามเทคโนโลยีระยะกลางถึงระยะยาวขององค์กร
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี