คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 32/303 ตอน ดูสารบัญคอร์ส

Stability AI เปิดตัว Stable Diffusion 3 รุ่นพรีวิวเบื้องต้น: ก้าวกระโดดด้านการจัดวางหลายวัตถุและการสะกดข้อความ

22/02/2024 97
≈4:13
Stability AI เปิดตัว Stable Diffusion 3 รุ่นพรีวิวเบื้องต้น: ก้าวกระโดดด้านการจัดวางหลายวัตถุและการสะกดข้อความ
ภาพ/Photo by Firosnv. Photography on Unsplash

เมื่อวันที่ 22 กุมภาพันธ์ พ.ศ. 2567 Stability AI เปิดตัว Stable Diffusion 3 รุ่นพรีวิวเบื้องต้น ด้วยสถาปัตยกรรม diffusion transformer และเทคนิค flow matching ใหม่ ช่วยยกระดับการสร้างภาพหลายวัตถุและการสะกดข้อความในภาพอย่างมาก มีโมเดลตั้งแต่ 800 ล้านถึง 8 พันล้านพารามิเตอร์ ปัจจุบันเปิดให้ลงชื่อรอสิทธิ์เข้าใช้งานเท่านั้น

เมื่อวันที่ 22 กุมภาพันธ์ พ.ศ. 2567 บริษัทโมเดลสร้างภาพ Stability AI ได้ประกาศเปิดตัว Stable Diffusion 3 รุ่นพรีวิวเบื้องต้น ซึ่งเป็นเจนเนอเรชันล่าสุดของโมเดลสร้างภาพเรือธงของบริษัท แตกต่างจากรุ่นก่อนหน้าอย่าง Stable Diffusion XL ตรงที่ SD3 ยกเลิกสถาปัตยกรรม diffusion แบบ U-Net เดิม และเปลี่ยนมาใช้สถาปัตยกรรมใหม่ที่เรียกว่า diffusion transformer ควบคู่กับเทคนิคการฝึกโมเดลแบบ flow matching การเปิดตัวครั้งนี้มีโมเดลหลายขนาดตั้งแต่ 800 ล้านถึง 8 พันล้านพารามิเตอร์ ให้ผู้ใช้เลือกใช้ตามทรัพยากรประมวลผลและความต้องการ ปัจจุบัน SD3 ยังไม่เปิดให้ใช้งานอย่างเป็นทางการ เปิดเพียงให้ลงทะเบียนรอสิทธิ์เข้าใช้งานผ่านเว็บไซต์ทางการเท่านั้น

ความสำคัญเชิงเทคนิค: การเปลี่ยนสถาปัตยกรรมจาก U-Net สู่ Transformer

โมเดล diffusion กระแสหลักในอดีตส่วนใหญ่ใช้สถาปัตยกรรม U-Net แบบ convolution เป็นพื้นฐาน แต่ SD3 เปลี่ยนมาใช้สถาปัตยกรรม transformer ในการประมวลผลกระบวนการ diffusion ซึ่งใกล้เคียงกับแนวทางเทคนิคที่โมเดลภาษา (เช่นตระกูล GPT) ใช้มากขึ้น ในทางทฤษฎีจึงเอื้อต่อการขยายขนาดโมเดลและความสามารถแบบหลายรูปแบบ (multimodal) เมื่อผนวกกับ flow matching ซึ่งเป็นวิธีฝึกโมเดลด้วยเส้นทางความน่าจะเป็นแบบใหม่ ตัวอย่างที่ทางการนำเสนอแสดงให้เห็นว่า เมื่อ SD3 สร้างภาพที่มีหลายวัตถุในภาพเดียวกัน ความมั่นคงขององค์ประกอบภาพและรายละเอียดดีกว่ารุ่นก่อนหน้าอย่างชัดเจน ขณะเดียวกัน ความสามารถในการสะกดข้อความในภาพอย่างถูกต้อง (เช่น ป้าย ข้อความสโลแกน) ก็ดีขึ้นอย่างมีนัยสำคัญ ซึ่งเป็นจุดอ่อนที่โมเดลสร้างภาพในอดีตยอมรับกันโดยทั่วไป

เปรียบเทียบกับรุ่นก่อนหน้าและคู่แข่ง: พรีวิว ไม่ใช่การเปิดตัวจริง

Stable Diffusion XL มักพบปัญหาภาพบิดเบี้ยว แขนขาซ้ำซ้อน หรือข้อความสะกดผิดเพี้ยนเมื่อสร้างภาพหลายวัตถุหรือมีข้อความ ซึ่งเป็นจุดที่ถูกนำไปเปรียบเทียบกับคู่แข่งอย่าง Midjourney และ DALL·E 3 อยู่เสมอ การที่ Stability AI เลือกเปิดตัวพรีวิว SD3 ในช่วงที่ DALL·E 3 (ผนวกเข้ากับ ChatGPT แล้ว) กำลังได้รับความนิยมสูง ถูกมองว่าเป็นการตอบโต้เชิงบวกจากฝั่งโมเดลเปิดกว้างต่อโมเดลเชิงพาณิชย์แบบปิด การออกแบบโมเดลหลายขนาดยังทำให้ SD3 มีโอกาสตอบโจทย์ทั้งการใช้งานบนคลาวด์และการติดตั้งใช้งานบนเครื่องท้องถิ่น ที่น่าสังเกตคือครั้งนี้เป็นเพียงพรีวิวเบื้องต้น พร้อมระบบลงชื่อรอสิทธิ์ ยังไม่มีไฟล์โมเดลให้ดาวน์โหลดหรือ API สาธารณะ และยังไม่มีการประกาศกำหนดการเปิดตัวอย่างเป็นทางการหรือเงื่อนไขใบอนุญาต วงการส่วนใหญ่ตีความว่า Stability AI ต้องการสร้างกระแสก่อนเปิดตัวจริง พร้อมสังเกตความคิดเห็นผู้ใช้เพื่อปรับเวอร์ชันสุดท้าย

ความหมายต่อผู้บริหาร

สำหรับผู้บริหารทีมการตลาด อีคอมเมิร์ซ หรือทีมคอนเทนต์ ความคืบหน้าด้านการสะกดข้อความที่แม่นยำ และความมั่นคงของการจัดวางหลายวัตถุ หมายความว่าในอนาคตอาจสามารถนำภาพที่สร้างด้วย AI ไปใช้ในสื่อการตลาดที่มีข้อความโดยตรงได้มั่นใจมากขึ้น (เช่น ป้ายโปรโมชัน ภาพประกอบโพสต์โซเชียล) ไม่ใช่เพียงร่างไอเดีย เนื่องจากยังอยู่ในขั้นรอสิทธิ์ ผู้บริหารสามารถติดตามกำหนดการเปิดตัวไว้ก่อน และเริ่มวางแผนกระบวนการตรวจสอบสื่อและการนำเครื่องมือ AI มาใช้งาน

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Mistral AI เปิดตัวโมเดลเรือธง Mistral Large จับมือ Microsoft Azure

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว