NVIDIA เปิดตัว Llama-3.1-Nemotron-70B-Instruct: ไม่ต้องฝึกใหม่ทั้งหมดก็ทำให้โมเดลโอเพนซอร์สเก่งขึ้นได้
NVIDIA เปิดตัว Llama-3.1-Nemotron-70B-Instruct ในช่วงกลางเดือนตุลาคม 2024 โดยนำ Llama 3.1 70B ของ Meta มาปรับแต่งด้วยเทคนิคการจัดแนว (Alignment) ของตนเอง อ้างว่าผลการทดสอบด้านการทำตามคำสั่งดีกว่าโมเดลต้นฉบับและบางกรณีดีกว่าโมเดลที่ใหญ่กว่า
NVIDIA เปิดตัวโมเดลใหม่ชื่อ "Llama-3.1-Nemotron-70B-Instruct" ในช่วงกลางเดือนตุลาคม 2024 พร้อมเผยแพร่น้ำหนักโมเดลบนแพลตฟอร์ม Hugging Face ให้นักวิจัยและภาคธุรกิจนำไปทดสอบใช้งาน โมเดลนี้ไม่ได้ถูกฝึกขึ้นใหม่ตั้งแต่ต้น แต่ใช้ Llama 3.1 70B ที่ Meta เปิดเผยไว้ก่อนหน้าเป็นฐาน แล้วทีมงาน NVIDIA นำเทคนิคการจัดแนว (Alignment) ที่พัฒนาขึ้นเอง มาปรับจูนเพิ่มเติมโดยเน้นที่ "การปรับให้สอดคล้องกับความต้องการของมนุษย์" (Human Preference Optimization) เป้าหมายคือให้โมเดลเข้าใจและทำตามคำสั่งของผู้ใช้ได้แม่นยำขึ้น จากข้อมูลผลการทดสอบที่ NVIDIA เปิดเผย โมเดลรุ่นนี้ทำคะแนนในการทดสอบมาตรฐานหลายรายการที่เน้นการทำตามคำสั่งอย่างเคร่งครัด ได้ดีกว่า Llama 3.1 70B ต้นฉบับ และในบางรายการยังดีกว่าโมเดลที่มีขนาดใหญ่กว่าด้วยซ้ำ
ความหมายเชิงเทคนิค: การปรับจูนก็เป็นอีกเส้นทางหนึ่งได้
ประเด็นที่น่าสนใจของข่าวนี้ไม่ได้อยู่ที่ขนาดพารามิเตอร์หรือสถาปัตยกรรมใหม่ แต่อยู่ที่การแสดงให้เห็นแนวทางอีกเส้นทางหนึ่งในการยกระดับประสิทธิภาพของ AI ตลอดปีที่ผ่านมาแนวโน้มหลักของวงการคือ "ทำโมเดลให้ใหญ่ขึ้น" แต่ครั้งนี้ NVIDIA เลือกยืนอยู่บนฐานของ Llama 3.1 70B ที่ Meta ฝึกไว้แล้ว เพียงใช้การปรับจูนแนว Alignment ก็ทำให้ประสิทธิภาพดีขึ้นอย่างชัดเจน นี่สะท้อนว่าการลงทุนในเทคนิคการจัดแนวอาจให้ผลตอบแทนที่คุ้มค่ามาก ไม่จำเป็นต้องเผาพลังประมวลผลฝึกโมเดลพื้นฐานใหม่ทั้งหมด เพียงนำโมเดลโอเพนซอร์สที่ดีอยู่แล้วมาปรับจูนด้วยข้อมูลความชอบของมนุษย์ที่ออกแบบมาอย่างพิถีพิถัน ก็สามารถดึงประสิทธิภาพเพิ่มเติมออกมาได้
เปรียบเทียบกับรุ่นต้นฉบับและคู่แข่ง
เมื่อเทียบกับ Llama 3.1 70B ต้นฉบับ Nemotron มีการพัฒนาที่ชัดเจนเป็นพิเศษในมิติ "การทำตามคำสั่ง" โมเดลไม่ได้ "ทำไม่ได้" แต่เป็นเพราะ "ยังไม่ถูกสอนให้เข้าใจว่ามนุษย์ต้องการอะไรจริงๆ" การที่ NVIDIA อ้างว่าผลการทดสอบบางส่วนดีกว่าโมเดลที่มีขนาดใหญ่กว่า เท่ากับเป็นการชนะด้วยความแม่นยำมากกว่าพลังดิบ ซึ่งสอดคล้องกับแนวโน้มล่าสุดที่วงการ AI พัฒนาไปพร้อมกันทั้งสายทาง "เล็กแต่แม่น" และสาย "ใหญ่ครบเครื่อง"
ปฏิกิริยาจากวงการ
เนื่องจาก Nemotron สร้างขึ้นบนฐานของ Llama 3.1 ที่ Meta เปิดเป็นโอเพนซอร์ส การเปิดตัวครั้งนี้จึงตอกย้ำคุณค่าของระบบนิเวศโอเพนซอร์สอีกครั้ง ทีมงานใดก็ตามที่มีความสามารถด้านเทคนิคการปรับจูน สามารถนำโมเดลพื้นฐานที่ผู้อื่นเปิดเผยไว้มา "เพิ่มมูลค่า" และเปิดตัวเป็นเวอร์ชันปรับปรุงของตนเองได้ ทำให้ในชุมชนโอเพนซอร์สเริ่มมีโมเดลที่ปรับแต่งเฉพาะทาง (เช่น การทำตามคำสั่ง หรือการเขียนโค้ด) เพิ่มมากขึ้นเรื่อยๆ ข่าวนี้เตือนผู้บริหารว่า เมื่อประเมินว่าจะนำโมเดล AI ตัวไหนมาใช้ในองค์กร นอกจากดู "ขนาดพารามิเตอร์" ควรให้ความสำคัญกับผลการทดสอบจริงในเรื่อง "การเข้าใจและทำตามคำสั่งได้แม่นยำ" มากกว่า เพราะผู้ช่วย AI ภายในองค์กรส่วนใหญ่ถูกนำไปใช้ทำงานที่มีเป้าหมายชัดเจน โมเดลที่ผ่านการปรับจูนแนว Alignment มักตอบโจทย์การใช้งานจริงได้ดีกว่าโมเดลที่ใหญ่กว่าเพียงอย่างเดียว
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี