Meta เปิดตัว Llama 3.3 โมเดล 7 หมื่นล้านพารามิเตอร์ ประสิทธิภาพใกล้เคียงรุ่นเรือธง 405B
Meta เปิดตัว Llama 3.3 เมื่อวันที่ 6 ธันวาคม 2567 โมเดลภาษาขนาดใหญ่แบบหลายภาษา 7 หมื่นล้านพารามิเตอร์ บริษัทระบุว่าในงานด้านการทำตามคำสั่งมีประสิทธิภาพเหนือกว่า Llama 3.1 70B รุ่นก่อนหน้า และประสิทธิภาพใกล้เคียงกับ Llama 3.1 405B โมเดลเรือธงที่มีขนาดใหญ่กว่ามาก
เมื่อวันที่ 6 ธันวาคม 2567 Meta ได้เปิดตัวโมเดลภาษาขนาดใหญ่แบบโอเพนซอร์สรุ่นล่าสุด Llama 3.3 ซึ่งเป็นโมเดลหลายภาษาขนาด 7 หมื่นล้านพารามิเตอร์ (70B) ที่ผ่านการฝึกล่วงหน้าขนาดใหญ่และปรับจูนตามคำสั่ง (instruction tuning) ก่อนเผยแพร่ ทาง Meta ระบุในการ์ดโมเดลอย่างชัดเจนว่า Llama 3.3 70B มีประสิทธิภาพในงานประเภทการทำตามคำสั่งเหนือกว่า Llama 3.1 70B รุ่นก่อนหน้าที่มีขนาดเท่ากัน และมีประสิทธิภาพใกล้เคียงกับ Llama 3.1 405B ซึ่งเป็นโมเดลเรือธงที่มีพารามิเตอร์มากกว่าตนเองหลายเท่า น้ำหนักโมเดลได้เผยแพร่บน Hugging Face แล้ว นักพัฒนาสามารถดาวน์โหลดไปใช้งานหรือปรับแต่งเพิ่มเติมได้โดยตรง
นัยทางเทคนิค: โมเดลเล็กลงแต่ประสิทธิภาพใกล้เคียงโมเดลใหญ่
จุดที่น่าสนใจที่สุดของ Llama 3.3 ไม่ใช่การเพิ่มจำนวนพารามิเตอร์ แต่คือการยกระดับ “ประสิทธิภาพต่อขนาด” Meta ปรับปรุงวิธีการฝึกและกระบวนการจัดการข้อมูล ทำให้โมเดลขนาด 7 หมื่นล้านพารามิเตอร์สามารถทำงานด้านการทำตามคำสั่ง การให้เหตุผล และความเข้าใจหลายภาษาได้ในระดับที่แต่ก่อนต้องใช้โมเดลขนาดใหญ่กว่าหลายเท่า โดยมีประสิทธิภาพใกล้เคียงกับรุ่นเรือธงอย่าง Llama 3.1 405B นั่นหมายความว่าทรัพยากรประมวลผลเท่าเดิมสามารถรองรับคำขอได้มากขึ้น หรือใช้ฮาร์ดแวร์ที่ต่ำลงเพื่อให้ได้ความสามารถใกล้เคียงโมเดลขนาดใหญ่ ซึ่งส่งผลโดยตรงต่อการลดต้นทุนและความหน่วงในการประมวลผล
เปรียบเทียบกับรุ่นก่อนหน้าและคู่แข่ง
เมื่อเทียบกับ Llama 3.1 70B ที่เปิดตัวในเดือนกันยายน 2567 Meta ระบุว่า Llama 3.3 มีความก้าวหน้าอย่างชัดเจนในขนาดพารามิเตอร์เท่ากัน ส่วนเมื่อเทียบกับ Llama 3.1 405B ซึ่งมีพารามิเตอร์มากกว่าเกือบหกเท่า Llama 3.3 70B ก็ยังระบุว่าให้ประสิทธิภาพที่ใกล้เคียงกัน ที่ควรสังเกตคือ Llama 3.2 90B ซึ่งเปิดตัวในเดือนเดียวกันเป็นโมเดลมัลติโมดัลที่เน้นความเข้าใจภาพ จึงไม่ใช่กลุ่มเปรียบเทียบโดยตรงกับ Llama 3.3 ที่เน้นการทำตามคำสั่งแบบข้อความล้วน ฐานการเปรียบเทียบระหว่างสองรุ่นนี้จึงไม่เท่าเทียมกันทั้งหมด แนวโน้ม “ประสิทธิภาพข้ามระดับ” เช่นนี้สอดคล้องกับทิศทางการแข่งขันของวงการโอเพนซอร์สในช่วงครึ่งปีที่ผ่านมาที่เน้น “ประสิทธิภาพเหนือขนาด” และยังสอดรับกับแนวโน้มที่ Anthropic และ OpenAI ต่างก็ทยอยเปิดตัวโมเดลขนาดกลางถึงเล็กที่มีประสิทธิภาพสูง (เช่น Claude 3.5 Haiku, o1-mini) แสดงให้เห็นว่าทั้งฝั่งโอเพนซอร์สและฝั่งเชิงพาณิชย์ต่างเร่งลดต้นทุนการประมวลผลต่อหน่วยพร้อมกัน
ปฏิกิริยาจากวงการ
ชุมชนโอเพนซอร์สมองว่า Llama 3.3 เป็น “โมเดลคุ้มค่า” ที่ไม่ได้มุ่งทำลายสถิติโมเดลขนาดใหญ่ที่สุด แต่ยกระดับเพดานของโมเดลขนาดกลางให้สูงขึ้น ทำให้ธุรกิจขนาดกลางและเล็ก รวมถึงนักพัฒนาอิสระ สามารถใช้ทรัพยากร GPU น้อยลงแต่ได้ประสบการณ์ใกล้เคียงโมเดลเรือธง กลยุทธ์นี้ยังตอกย้ำตำแหน่งของ Meta ในระบบนิเวศโอเพนซอร์ส ด้วยการเผยแพร่โมเดลประสิทธิภาพสูงที่ปรับใช้และปรับแต่งได้อย่างต่อเนื่อง เพื่อดึงดูดนักพัฒนาให้อยู่ในระบบนิเวศ Llama ต่อไป และสร้างความแตกต่างจากโมเดล API แบบปิด
นัยสำหรับผู้บริหาร
ข่าวนี้เตือนผู้บริหารว่า การนำ AI มาใช้ไม่จำเป็นต้องเลือกโมเดล “ใหญ่ที่สุด แพงที่สุด” เสมอไป การยกระดับประสิทธิภาพมักคุ้มค่ากว่าการขยายขนาดโมเดล หากองค์กรกำลังพิจารณาแชทบอทบริการลูกค้าหรือระบบถาม-ตอบความรู้ภายใน ควรใช้ “ทำได้แค่ไหนภายใต้งบเท่าเดิม” เป็นตัวชี้วัดหลักในการตัดสินใจจัดซื้อและนำไปใช้ ไม่ใช่ดูแค่อันดับจำนวนพารามิเตอร์ของโมเดล
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี