อีลอน มัสก์ ทำตามสัญญา: xAI เปิดซอร์ส Grok-1 โมเดล 3.14 แสนล้านพารามิเตอร์
xAI เปิดเผยน้ำหนักโมเดลและสถาปัตยกรรมของ Grok-1 ภายใต้ลิขสิทธิ์ Apache 2.0 โมเดล Mixture-of-Experts ขนาด 314 พันล้านพารามิเตอร์ ถือเป็นโมเดล MoE โอเพนซอร์สที่ใหญ่ที่สุดในขณะนั้น แต่เป็นเวอร์ชันฐานที่ยังไม่ผ่านการปรับแต่งสำหรับการสนทนา
เมื่อวันที่ 17 มีนาคม 2567 บริษัท xAI ของ Elon Musk ได้ทำตามคำมั่นสัญญาก่อนหน้านี้ ด้วยการเปิดเผยน้ำหนักโมเดล (model weights) และสถาปัตยกรรมเครือข่ายของ Grok-1 ภายใต้ลิขสิทธิ์ Apache 2.0 อย่างเต็มรูปแบบ ทำให้ทุกคนสามารถดาวน์โหลด ใช้งาน ดัดแปลง หรือแม้แต่นำไปใช้เชิงพาณิชย์ได้อย่างอิสระ ตามประกาศอย่างเป็นทางการของ xAI ระบุว่า Grok-1 เป็นโมเดลสถาปัตยกรรม Mixture-of-Experts (MoE) ที่มีพารามิเตอร์มากถึง 314,000 ล้านตัว ถือเป็นโมเดล MoE แบบโอเพนซอร์สที่มีขนาดใหญ่ที่สุดที่เคยเปิดเผยต่อสาธารณะในขณะนั้น ที่ต้องเน้นย้ำเป็นพิเศษคือ เวอร์ชันที่เปิดเผยครั้งนี้เป็น checkpoint ของโมเดลฐาน (base model) ที่ผ่านการเทรนล่วงหน้าเสร็จสิ้นเมื่อเดือนตุลาคม 2566 เท่านั้น ยังไม่ผ่านการปรับแต่ง (fine-tuning) สำหรับงานเฉพาะทาง เช่น การสนทนาโต้ตอบหรือการทำตามคำสั่ง ดังนั้นนักพัฒนาที่ต้องการนำไปใช้เป็นแชทบอทโดยตรง จึงยังต้องปรับแต่งเพิ่มเติมเอง
นัยสำคัญทางเทคนิค: หมุดหมายของสถาปัตยกรรม MoE ที่เปิดเผยต่อสาธารณะ
แนวคิดหลักของสถาปัตยกรรม Mixture-of-Experts (MoE) คือการแบ่งโมเดลออกเป็นเครือข่ายย่อยแบบ “ผู้เชี่ยวชาญ” (experts) หลายชุด โดยแต่ละครั้งที่ประมวลผลจะเปิดใช้งานเฉพาะผู้เชี่ยวชาญบางส่วนเท่านั้น แทนที่จะให้พารามิเตอร์ทั้งหมดทำงานพร้อมกัน การออกแบบเช่นนี้ช่วยให้สามารถรักษาปริมาณพารามิเตอร์รวมที่มหาศาลและขีดความสามารถด้านความรู้ของโมเดลไว้ได้ พร้อมกับควบคุมต้นทุนการประมวลผลจริง การที่ Grok-1 เปิดซอร์สด้วยขนาด 314,000 ล้านพารามิเตอร์ เท่ากับเป็นการเปิดเผยสถาปัตยกรรม MoE ขนาดใหญ่มากที่หาได้ยากในวงการ ให้ชุมชนวิจัยได้ตรวจสอบและวิเคราะห์รายละเอียดเชิงวิศวกรรมของสถาปัตยกรรมประเภทนี้เป็นครั้งแรกอย่างเป็นรูปธรรม ซึ่งมีความสำคัญเชิงสัญลักษณ์ต่อความเข้าใจของแวดวงวิชาการและชุมชนโอเพนซอร์สในเรื่อง “วิธีเทรนและปรับใช้งานโมเดลแบบ sparse ขนาดใหญ่มาก”
เทียบกับคู่แข่ง: จุดเปลี่ยนของท่าทีเรื่องโอเพนซอร์ส
เมื่อเทียบกับโมเดลระดับแนวหน้าอย่าง GPT-4 ของ OpenAI หรือ Gemini ของ Google ที่เลือกเส้นทางปิดซอร์สทั้งหมด xAI เลือกเปิดเผยโมเดลฐานที่มีขนาดใกล้เคียงกันต่อสาธารณะ ซึ่งสอดคล้องกับแนวทางที่ Meta ผลักดันระบบนิเวศโอเพนซอร์สผ่านตระกูล Llama แต่ขนาด 314,000 ล้านพารามิเตอร์ของ Grok-1 นั้นใหญ่กว่าโมเดลโอเพนซอร์สส่วนใหญ่ในขณะนั้นมาก (เช่น Llama 2 ที่มีขนาดใหญ่สุดเพียงระดับ 7 หมื่นล้านพารามิเตอร์) ทำให้ Grok-1 กลายเป็นสัญญาณที่บ่งชี้ว่าช่องว่างขนาดระหว่างค่ายโอเพนซอร์สและปิดซอร์สกำลังแคบลงอย่างมีนัยสำคัญ และเปิดประเด็นถกเถียงใหม่ว่า “โมเดลโอเพนซอร์สขนาดใหญ่จะไล่ทันโมเดลเรือธงแบบปิดซอร์สได้หรือไม่”
ปฏิกิริยาในวงการ: กระแสกับความใช้งานจริงคู่ขนาน
เนื่องจากเวอร์ชันที่เปิดเผยยังไม่ผ่านการปรับแต่งสำหรับการสนทนา และขนาดไฟล์น้ำหนักโมเดลใหญ่มาก (สูงถึงหลายร้อยกิกะไบต์) นักพัฒนาส่วนใหญ่จึงยากที่จะรันหรือปรับแต่งบนฮาร์ดแวร์ระดับผู้บริโภคได้โดยตรง ปฏิกิริยาจากวงการจึงออกมาในลักษณะ “กระแสความสนใจมากกว่าความพร้อมใช้งานทันที” ด้านหนึ่งชื่นชมที่ xAI ทำตามคำมั่นเรื่องโอเพนซอร์สและเพิ่มความโปร่งใส อีกด้านก็ชี้ว่าการจะทำให้ Grok-1 “ใช้งานได้ดีจริง” ยังต้องอาศัยพลังประมวลผลและการลงทุนด้านวิศวกรรมอีกมากในการปรับแต่งต่อไป
สำหรับผู้บริหาร ข่าวนี้สะท้อนว่าภูมิทัศน์การแข่งขันของโมเดล AI พื้นฐานกำลังเปลี่ยนแปลงอย่างรวดเร็ว เส้นแบ่งระหว่างโอเพนซอร์สกับปิดซอร์สไม่ใช่สิ่งตายตัวอีกต่อไป องค์กรที่กำลังประเมินการนำ AI มาใช้ นอกจากจับตาบริการ API แบบปิดแล้ว ยังควรติดตามความเร็วในการพัฒนาของระบบนิเวศโมเดลโอเพนซอร์ส เพื่อใช้เป็นดัชนีอ้างอิงสำหรับการเลือกเทคโนโลยีและวางแผนบุคลากรในอนาคต
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี