คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 66/217 ตอน ดูสารบัญคอร์ส

NVIDIA เปิดตัว Llama-3.1-Nemotron-70B-Instruct: ไม่ต้องฝึกใหม่ทั้งหมดก็ทำให้โมเดลโอเพนซอร์สเก่งขึ้นได้

15/10/2024 174
4:07
NVIDIA เปิดตัว Llama-3.1-Nemotron-70B-Instruct: ไม่ต้องฝึกใหม่ทั้งหมดก็ทำให้โมเดลโอเพนซอร์สเก่งขึ้นได้

NVIDIA เปิดตัว Llama-3.1-Nemotron-70B-Instruct ในช่วงกลางเดือนตุลาคม 2024 โดยนำ Llama 3.1 70B ของ Meta มาปรับแต่งด้วยเทคนิคการจัดแนว (Alignment) ของตนเอง อ้างว่าผลการทดสอบด้านการทำตามคำสั่งดีกว่าโมเดลต้นฉบับและบางกรณีดีกว่าโมเดลที่ใหญ่กว่า

NVIDIA เปิดตัวโมเดลใหม่ชื่อ "Llama-3.1-Nemotron-70B-Instruct" ในช่วงกลางเดือนตุลาคม 2024 พร้อมเผยแพร่น้ำหนักโมเดลบนแพลตฟอร์ม Hugging Face ให้นักวิจัยและภาคธุรกิจนำไปทดสอบใช้งาน โมเดลนี้ไม่ได้ถูกฝึกขึ้นใหม่ตั้งแต่ต้น แต่ใช้ Llama 3.1 70B ที่ Meta เปิดเผยไว้ก่อนหน้าเป็นฐาน แล้วทีมงาน NVIDIA นำเทคนิคการจัดแนว (Alignment) ที่พัฒนาขึ้นเอง มาปรับจูนเพิ่มเติมโดยเน้นที่ "การปรับให้สอดคล้องกับความต้องการของมนุษย์" (Human Preference Optimization) เป้าหมายคือให้โมเดลเข้าใจและทำตามคำสั่งของผู้ใช้ได้แม่นยำขึ้น จากข้อมูลผลการทดสอบที่ NVIDIA เปิดเผย โมเดลรุ่นนี้ทำคะแนนในการทดสอบมาตรฐานหลายรายการที่เน้นการทำตามคำสั่งอย่างเคร่งครัด ได้ดีกว่า Llama 3.1 70B ต้นฉบับ และในบางรายการยังดีกว่าโมเดลที่มีขนาดใหญ่กว่าด้วยซ้ำ

ความหมายเชิงเทคนิค: การปรับจูนก็เป็นอีกเส้นทางหนึ่งได้

ประเด็นที่น่าสนใจของข่าวนี้ไม่ได้อยู่ที่ขนาดพารามิเตอร์หรือสถาปัตยกรรมใหม่ แต่อยู่ที่การแสดงให้เห็นแนวทางอีกเส้นทางหนึ่งในการยกระดับประสิทธิภาพของ AI ตลอดปีที่ผ่านมาแนวโน้มหลักของวงการคือ "ทำโมเดลให้ใหญ่ขึ้น" แต่ครั้งนี้ NVIDIA เลือกยืนอยู่บนฐานของ Llama 3.1 70B ที่ Meta ฝึกไว้แล้ว เพียงใช้การปรับจูนแนว Alignment ก็ทำให้ประสิทธิภาพดีขึ้นอย่างชัดเจน นี่สะท้อนว่าการลงทุนในเทคนิคการจัดแนวอาจให้ผลตอบแทนที่คุ้มค่ามาก ไม่จำเป็นต้องเผาพลังประมวลผลฝึกโมเดลพื้นฐานใหม่ทั้งหมด เพียงนำโมเดลโอเพนซอร์สที่ดีอยู่แล้วมาปรับจูนด้วยข้อมูลความชอบของมนุษย์ที่ออกแบบมาอย่างพิถีพิถัน ก็สามารถดึงประสิทธิภาพเพิ่มเติมออกมาได้

เปรียบเทียบกับรุ่นต้นฉบับและคู่แข่ง

เมื่อเทียบกับ Llama 3.1 70B ต้นฉบับ Nemotron มีการพัฒนาที่ชัดเจนเป็นพิเศษในมิติ "การทำตามคำสั่ง" โมเดลไม่ได้ "ทำไม่ได้" แต่เป็นเพราะ "ยังไม่ถูกสอนให้เข้าใจว่ามนุษย์ต้องการอะไรจริงๆ" การที่ NVIDIA อ้างว่าผลการทดสอบบางส่วนดีกว่าโมเดลที่มีขนาดใหญ่กว่า เท่ากับเป็นการชนะด้วยความแม่นยำมากกว่าพลังดิบ ซึ่งสอดคล้องกับแนวโน้มล่าสุดที่วงการ AI พัฒนาไปพร้อมกันทั้งสายทาง "เล็กแต่แม่น" และสาย "ใหญ่ครบเครื่อง"

ปฏิกิริยาจากวงการ

เนื่องจาก Nemotron สร้างขึ้นบนฐานของ Llama 3.1 ที่ Meta เปิดเป็นโอเพนซอร์ส การเปิดตัวครั้งนี้จึงตอกย้ำคุณค่าของระบบนิเวศโอเพนซอร์สอีกครั้ง ทีมงานใดก็ตามที่มีความสามารถด้านเทคนิคการปรับจูน สามารถนำโมเดลพื้นฐานที่ผู้อื่นเปิดเผยไว้มา "เพิ่มมูลค่า" และเปิดตัวเป็นเวอร์ชันปรับปรุงของตนเองได้ ทำให้ในชุมชนโอเพนซอร์สเริ่มมีโมเดลที่ปรับแต่งเฉพาะทาง (เช่น การทำตามคำสั่ง หรือการเขียนโค้ด) เพิ่มมากขึ้นเรื่อยๆ ข่าวนี้เตือนผู้บริหารว่า เมื่อประเมินว่าจะนำโมเดล AI ตัวไหนมาใช้ในองค์กร นอกจากดู "ขนาดพารามิเตอร์" ควรให้ความสำคัญกับผลการทดสอบจริงในเรื่อง "การเข้าใจและทำตามคำสั่งได้แม่นยำ" มากกว่า เพราะผู้ช่วย AI ภายในองค์กรส่วนใหญ่ถูกนำไปใช้ทำงานที่มีเป้าหมายชัดเจน โมเดลที่ผ่านการปรับจูนแนว Alignment มักตอบโจทย์การใช้งานจริงได้ดีกว่าโมเดลที่ใหญ่กว่าเพียงอย่างเดียว

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Stability AI เปิดตัว Stable Diffusion 3.5 โมเดลสร้างภาพโอเพนซอร์สที่ทรงพลังที่สุด

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว