Stability AI เปิดตัว Stable Diffusion 3.5 โมเดลสร้างภาพแบบเปิดที่ทรงพลังที่สุด
Stability AI เปิดตัวชุดโมเดล Stable Diffusion 3.5 เมื่อวันที่ 22 ตุลาคม 2024 ประกอบด้วยรุ่น Large ขนาด 8.1 พันล้านพารามิเตอร์ และรุ่น Large Turbo ที่สร้างภาพได้ใน 4 ขั้นตอน เปิดให้ดาวน์โหลดบน Hugging Face ทันที ส่วนรุ่น Medium ขนาด 2.5 พันล้านพารามิเตอร์จะตามมาในวันที่ 29 ตุลาคม โดยทั้งหมดใช้สัญญาอนุญาตแบบเปิด ใช้งานเชิงพาณิชย์ฟรีหากรายได้ต่อปีไม่เกิน 1 ล้านดอลลาร์สหรัฐ
เมื่อวันที่ 22 ตุลาคม 2024 บริษัท Stability AI ผู้พัฒนาโมเดลสร้างภาพด้วย AI ได้ประกาศเปิดตัวชุดโมเดล Stable Diffusion 3.5 อย่างเป็นทางการ โดยระบุว่าเป็นตระกูลโมเดลสร้างภาพแบบเปิด (open) ที่ทรงพลังที่สุดในขณะนี้ การเปิดตัวครั้งนี้มีสามรุ่นพร้อมกัน ได้แก่ Stable Diffusion 3.5 Large และ Stable Diffusion 3.5 Large Turbo ซึ่งทั้งสองรุ่นสามารถดาวน์โหลดได้ทันทีบนแพลตฟอร์ม Hugging Face ส่วนรุ่นที่เบากว่าอย่าง Stable Diffusion 3.5 Medium จะตามมาในอีกหนึ่งสัปดาห์ถัดไปคือวันที่ 29 ตุลาคม
สเปกและฟังก์ชัน: มีรุ่นรองรับตั้งแต่ระดับมืออาชีพถึงผู้ใช้ทั่วไป
Stable Diffusion 3.5 Large มีขนาด 8.1 พันล้านพารามิเตอร์ ทางบริษัทวางตำแหน่งให้เหมาะกับงานระดับมืออาชีพ สามารถสร้างภาพความละเอียดสูงระดับ 1 ล้านพิกเซล เหมาะกับงานภาพโฆษณา การแต่งภาพผลิตภัณฑ์ที่ต้องการคุณภาพสูง ส่วน Large Turbo เป็นรุ่นกลั่น (distilled) จาก Large โดยใช้เทคนิคบีบอัดโมเดลเพื่อลดจำนวนขั้นตอนการสร้างภาพลงอย่างมาก เหลือเพียง 4 ขั้นตอนก็สามารถสร้างภาพคุณภาพสูงได้ ทำให้ระยะเวลารอคอยสั้นลงมาก เหมาะกับงานที่ต้องการสร้างภาพร่างอย่างรวดเร็วและทำซ้ำหลายรอบ ส่วนรุ่น Medium ที่จะตามมามีเพียง 2.5 พันล้านพารามิเตอร์ ออกแบบมาให้รันได้บนการ์ดจอหรือโน้ตบุ๊กระดับผู้บริโภคทั่วไป ลดข้อจำกัดด้านฮาร์ดแวร์ลง
รูปแบบสัญญาอนุญาต: รายได้ต่ำกว่า 1 ล้านดอลลาร์ใช้เชิงพาณิชย์ได้ฟรี
อีกประเด็นสำคัญของการเปิดตัวครั้งนี้คือกลยุทธ์ด้านสัญญาอนุญาต โดยทั้งชุดใช้สัญญาอนุญาตชุมชนแบบเปิดของ Stability AI (Community License) การใช้งานที่ไม่ใช่เชิงพาณิชย์ เช่น ส่วนบุคคลหรือการวิจัย ใช้งานได้ฟรีทั้งหมด แม้แต่การใช้งานเชิงพาณิชย์ หากบริษัทมีรายได้ต่อปีไม่เกิน 1 ล้านดอลลาร์สหรัฐ ก็สามารถใช้น้ำหนักโมเดลได้ฟรีเช่นกัน การออกแบบเกณฑ์นี้ชัดเจนว่ามุ่งเป้าไปที่ธุรกิจขนาดกลางและเล็ก ผู้สร้างสรรค์รายบุคคล และนักพัฒนาอิสระ ให้สามารถนำโมเดลไปผนวกกับผลิตภัณฑ์หรือบริการได้โดยไม่ต้องเสียค่าลิขสิทธิ์ก่อน จนกว่าธุรกิจจะเติบโตถึงระดับหนึ่งจึงค่อยเจรจาสัญญาอนุญาตเชิงพาณิชย์ต่างหาก นับเป็นแนวคิดการเก็บค่าธรรมเนียมแบบค่อยเป็นค่อยไปที่ค่อนข้างเป็นมิตร
เปรียบเทียบกับรุ่นก่อนหน้าและคู่แข่งในตลาด
เมื่อเทียบกับ Stable Diffusion รุ่นก่อนหน้า ชุด 3.5 มีการปรับปรุงทั้งสถาปัตยกรรมและข้อมูลฝึกฝน ทางบริษัทเน้นย้ำว่าคุณภาพการสร้างภาพ ความแม่นยำในการเข้าใจคำสั่ง และความหลากหลายของภาพดีขึ้น โดยเฉพาะจุดอ่อนเดิมของ AI สร้างภาพ เช่น ท่าทางของคนและรายละเอียดของมือ ได้รับการปรับปรุงอย่างตรงจุด ในแง่ตำแหน่ง "โมเดลแบบเปิด" นั้น Stable Diffusion 3.5 สานต่อกลยุทธ์ที่ Stability AI ใช้มาตลอดในการสร้างความแตกต่างจากบริการแบบปิดที่เสียเงินอย่าง OpenAI DALL-E หรือ Midjourney ซึ่งไม่เปิดน้ำหนักโมเดล ใช้ได้เฉพาะผ่าน API หรือหน้าจอเท่านั้น ขณะที่ Stability AI เลือกให้นักพัฒนาสามารถดาวน์โหลด ปรับแต่ง หรือแม้แต่ติดตั้งใช้งานส่วนตัวได้ ซึ่งเป็นจุดขายที่ชัดเจนสำหรับองค์กรและชุมชนนักพัฒนาที่ต้องการควบคุมความเป็นส่วนตัวของข้อมูลหรือต้องการปรับแต่งเฉพาะทาง การเปิดตัวสามรุ่นพร้อมกันครอบคลุมตั้งแต่ระดับมืออาชีพถึงผู้บริโภคทั่วไป ก็สะท้อนว่าบริษัทต้องการตอบโจทย์ทั้งความเร็ว คุณภาพ และต้นทุนฮาร์ดแวร์ที่แตกต่างกัน
ความหมายต่อผู้บริหาร
สำหรับผู้บริหารด้านการตลาด อีคอมเมิร์ซ การดูแลชุมชนออนไลน์ หรือธุรกิจที่ต้องใช้สื่อภาพจำนวนมาก โมเดลสร้างภาพคุณภาพสูงที่เปิดกว้างและใช้เชิงพาณิชย์ได้ฟรีเช่นนี้ หมายถึงต้นทุนในการผลิตภาพโฆษณา ภาพประกอบสินค้า หรือภาพประกอบโพสต์บนโซเชียลกำลังลดลงอย่างต่อเนื่อง แม้บริษัทจะไม่มีทีมออกแบบเฉพาะทาง เพียงมีความสามารถด้านเทคนิคพื้นฐานในการผนวกระบบ ก็สามารถพิจารณานำเครื่องมือเหล่านี้มาใช้เร่งรอบการผลิตเนื้อหาภาพได้ และควรติดตามว่าเครื่องมือหน้าจอใช้งานที่ชุมชนโอเพนซอร์สจะพัฒนาตามมาในอนาคตจะใช้งานง่ายสำหรับผู้ที่ไม่มีพื้นฐานด้านเทคนิคมากขึ้นหรือไม่
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี