Mistral เปิดตัว Shieldstral 1.0-3B: เขียนนโยบายความปลอดภัยเป็นคำถามภาษาคน เปลี่ยนกฎได้โดยไม่ต้องเทรนใหม่
เมื่อวันที่ 4 สิงหาคม พ.ศ. 2569 Mistral AI เปิดตัว Shieldstral 1.0-3B ตัวจำแนกความปลอดภัยแบบมัลติโมดัลขนาด 3B แบบ open weights ลิขสิทธิ์ Apache 2.0 รันได้บน GPU 16GB เพียงตัวเดียว จุดเด่นคือกำหนดนโยบายเป็นคำถามภาษาธรรมชาติ ณ เวลาอนุมาน โดยไม่ต้องเทรนโมเดลใหม่
เมื่อวันที่ 4 สิงหาคม พ.ศ. 2569 Mistral AI ได้ประกาศบนหน้าข่าวอย่างเป็นทางการ เปิดตัว Shieldstral 1.0-3B ตัวจำแนกความปลอดภัยแบบมัลติโมดัลขนาด 3 พันล้านพารามิเตอร์ แบบ open weights ภายใต้ลิขสิทธิ์ Apache 2.0 โดยเผยแพร่น้ำหนักโมเดลบน Hugging Face(mistralai/Shieldstral-1.0-3B)และสามารถรันได้บน NVIDIA GPU ขนาด 16GB เพียงการ์ดเดียว หน้าที่ของโมเดลคือประเมินว่าข้อความหรือรูปภาพหนึ่งชิ้นละเมิดกฎเกณฑ์หรือไม่ พร้อมคืนค่าคะแนนความปลอดภัยที่ผ่านการปรับเทียบแล้ว
จุดเปลี่ยนสำคัญ: เขียนนโยบายเป็นคำถามภาษาธรรมชาติ
โมเดล guardrail แบบเดิมจะฝังหมวดหมู่ความเสี่ยงที่ตายตัวไว้ตั้งแต่ขั้นตอนการฝึก หากต้องการเพิ่มหรือแก้ไขกฎเพียงข้อเดียว มักต้องฝึกโมเดลใหม่ทั้งชุด แต่ Shieldstral เปลี่ยนให้ผู้พัฒนากำหนดนโยบายเป็นคำถามภาษาธรรมชาติ ณ เวลาอนุมาน โมเดลจะตอบตามคำถามที่ให้ในขณะนั้น โดยไม่ต้องเทรนใหม่แม้แต่ครั้งเดียว
โครงสร้างเป็นแบบถาม-ตอบทวิภาค สามส่วน ได้แก่
- instruction: อธิบายบริบทของการประเมินครั้งนี้
- query: คำถามใช่หรือไม่ใช่หนึ่งประโยค ซึ่งก็คือตัวนโยบายเอง
- document: เนื้อหาที่ต้องการให้ตัดสิน
การประมวลผลไปข้างหน้าเพียงรอบเดียวจะสร้างคะแนนจาก logits ของคำว่า yes/no และย่อคำตัดสินให้เหลือโทเคนเดียว ผลลัพธ์จึงไม่คลุมเครือ อีกทั้งข้อความและรูปภาพยังใช้อินเทอร์เฟซเดียวกัน
สเปกและตัวเลข: 3B สู้กับโมเดลใหญ่กว่าเจ็ดเท่า
โมเดลฐานคือ Ministral-3-3B-Base-2512 ทำงานร่วมกับตัวเข้ารหัสภาพ Pixtral บริบทการฝึก 32k และใช้ข้อมูลฝึกเป็นคู่เปรียบเทียบ(contrastive pairs)จำนวน 54.1 ล้านคู่ ซึ่งใช้แยกกรณีที่เนื้อหาคล้ายกันแต่ฝ่ายหนึ่งผ่านเกณฑ์และอีกฝ่ายละเมิด ครอบคลุม 12 ภาษา ทางบริษัทเปรียบเทียบกับโมเดล guard แบบเปิดจำนวนสิบตัว(รวมถึง GPT-OSS-Safeguard-20B และ OmniGuard-7B)ได้ผลดังนี้ ความปลอดภัยด้านข้อความ F1 เฉลี่ย 84.9% ความปลอดภัยแบบมัลติโมดัล F1 เฉลี่ย 83.8% และความสามารถปรับตามนโยบาย F1 91.3% โดยระบุว่าเทียบเคียงได้กับโมเดลที่ใหญ่กว่าถึงเจ็ดเท่า เนื่องจากเป็น open weights ที่องค์กรนำไปติดตั้งเอง ทางบริษัทจึงไม่ได้ประกาศราคา
ข้อจำกัดที่บริษัทยอมรับเอง
Mistral ระบุจุดอ่อนไว้ในประกาศของตนอย่างตรงไปตรงมาว่า ความครอบคลุมทางภาษายังไม่สม่ำเสมอ ภาษาอาหรับและภาษาอินโดนีเซียยังตามหลังโมเดลเปรียบเทียบบางตัว ส่วนทิศทางงานในอนาคตคือการขยายความครอบคลุมหลายภาษา ความเสถียรกับเอกสารยาว และความปลอดภัยแบบมัลติโมดัลที่กว้างขึ้น กล่าวอีกนัยหนึ่ง คะแนนเฉลี่ยจาก benchmark ไม่ได้แปลว่าทุกภาษาจะดีเท่ากัน
ความหมายต่อผู้บริหาร
แนวทางที่เปลี่ยนนโยบายได้โดยไม่ต้องเทรนใหม่ไม่ใช่สิ่งที่ Shieldstral ริเริ่มเป็นรายแรก เพราะโมเดล guard แบบ open weights อย่าง GPT-OSS-Safeguard ก็ทำได้มาก่อน แต่ความสำคัญของ Shieldstral คือทำให้ต้นทุนและเกณฑ์ขั้นต่ำในการนำไปใช้ลดลงอย่างมาก เหลือเพียงโมเดลขนาด 3B บน GPU 16GB ใบเดียว เมื่อองค์กรติดตั้งใช้งานเอง ก็เขียนนิยามว่าอะไรคือการละเมิดด้วยภาษาของตนเองได้ และเนื้อหาที่ตรวจไม่ต้องออกนอกเครือข่ายบริษัทเลย อำนาจในการกำกับเนื้อหาและธรรมาภิบาลข้อมูลจึงกลับมาอยู่ในมือองค์กรแทนผู้ให้บริการ API ภายนอก และเมื่อกฎหมายหรือระเบียบบริษัทเปลี่ยน ก็เพียงแก้คำถามหนึ่งประโยคก็มีผลในวันเดียวกัน ไม่ต้องรอผู้ให้บริการอัปเดตโมเดล แต่ต้องเตือนกันตามตรงว่า โมเดลขนาด 3B ยังตัดสินผิดได้ และบริษัทเองก็ยอมรับว่าผลลัพธ์ในภาษาที่ไม่ใช่อังกฤษยังไม่สม่ำเสมอ องค์กรไทยที่จะนำไปใช้กับโพสต์ภาษาไทย บทสนทนาฝ่ายบริการลูกค้า หรือคอมเมนต์ในไลฟ์ ควรสุ่มทดสอบกับข้อมูลจริงของตนเองก่อนเสมอ ไม่ควรเชื่อตัวเลข benchmark ทั้งหมดโดยไม่ตรวจสอบ
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี