OpenAI เปิดตัว GPT-4o โมเดลมัลติโมดัลแบบเรียลไทม์
OpenAI เปิดตัวโมเดลเรือธงใหม่ GPT-4o ในงาน Spring Update ซึ่งสามารถประมวลผลเสียง ภาพ และข้อความแบบเรียลไทม์ ความหน่วงในการตอบสนองใกล้เคียงบทสนทนาจริง และเปิดให้ผู้ใช้ฟรีได้ใช้โมเดลล้ำสมัยที่สุดเป็นครั้งแรก
วันที่ 13 พฤษภาคม 2024 OpenAI ประกาศเปิดตัวโมเดลเรือธงรุ่นใหม่ GPT-4o ผ่านการถ่ายทอดสดในงาน "Spring Update" โดยตัวอักษร "o" ย่อมาจาก omni หรือ "รอบด้าน" จุดเด่นสำคัญที่สุดของ GPT-4o คือความสามารถในการประมวลผลเสียง ภาพ และข้อความแบบเรียลไทม์ในโมเดลเดียว ความหน่วงในการตอบสนองด้วยเสียงลดลงอย่างมาก เหลือเฉลี่ยเพียง 232 มิลลิวินาที ใกล้เคียงกับความเร็วของบทสนทนาระหว่างมนุษย์จริง ในการสาธิต โมเดลสามารถตรวจจับน้ำเสียงของผู้ใช้แบบทันที หยุดพูดและตอบสนองใหม่ทันทีเมื่อถูกขัดจังหวะ อีกทั้งยังสามารถมองผ่านกล้องเพื่ออธิบายภาพที่เห็นแบบเรียลไทม์ และประเมินสภาวะอารมณ์ของผู้ใช้ได้ด้วย OpenAI ยังเปิดตัวแอปพลิเคชัน ChatGPT เวอร์ชันเดสก์ท็อปพร้อมกัน และประกาศว่า GPT-4o จะเปิดให้ผู้ใช้ ChatGPT เวอร์ชันฟรีใช้งานได้ (โดยมีโควตาจำกัด) ส่วนผู้ใช้แบบชำระเงินจะได้โควตาการใช้งานที่สูงกว่า
นัยทางเทคนิค: ผู้ช่วยเสียงเปลี่ยนจาก "พูดสลับกัน" สู่บทสนทนาจริง
ที่ผ่านมา ผู้ช่วยเสียง (รวมถึงโหมดเสียงเดิมของ ChatGPT) มักประมวลผลแบบสามขั้นตอน คือ แปลงเสียงเป็นข้อความ → ให้โมเดลเข้าใจ → แปลงข้อความกลับเป็นเสียง ซึ่งแต่ละขั้นตอนสะสมความหน่วงจนต้องใช้เวลานานพอสมควรกว่าจะตอบกลับ และยากที่จะขัดจังหวะบทสนทนาได้ GPT-4o เปลี่ยนมาใช้โมเดลเดียวประมวลผลเสียงเข้า-ออกโดยตรง ไม่ต้องผ่านการแปลงกลางใด ๆ จึงลดความหน่วงลงเหลือ 232 มิลลิวินาที ใกล้เคียงความเร็วปฏิกิริยาของมนุษย์ นี่หมายความว่าอินเทอร์เฟซการสื่อสารด้วยเสียง (ผู้ช่วยเสียง แชทบอทบริการลูกค้า การฝึกสอน) มีโอกาสครั้งแรกที่จะทำ "การขัดจังหวะตามธรรมชาติ ตอบสนองแบบทันที" แทนรูปแบบเดิมที่ต้องบันทึก-รอ-เล่นเสียง
เทียบกับรุ่นก่อน: การเปิดให้ใช้ฟรีคือการปรับกลยุทธ์
ด้านความสามารถ GPT-4o เป็นการต่อยอดและรวมความสามารถจาก GPT-4 Turbo แต่จุดเปลี่ยนที่แท้จริงอยู่ที่กลยุทธ์ทางธุรกิจ นี่เป็นครั้งแรกที่ OpenAI เปิดให้ "โมเดลล้ำสมัยที่สุดในขณะนั้น" ใช้งานได้โดยตรงสำหรับผู้ใช้ฟรี (แม้จะมีโควตาจำกัด) แทนที่จะสงวนโมเดลล่าสุดไว้เฉพาะผู้สมัครสมาชิกแบบชำระเงินเหมือนที่ผ่านมา การเคลื่อนไหวนี้ถูกมองว่าเป็นการตอบโต้แรงกดดันจาก Google (ซึ่งเพิ่งวางกลยุทธ์ด้วยตระกูล Gemini 1.5) และฝ่ายโมเดลโอเพนซอร์ส (เช่น Llama, Grok ที่ใช้งานได้ฟรี) โดยการขยายฐานผู้ใช้ฟรีเพื่อรักษาฐานผู้ใช้และความเป็นผู้นำของแบรนด์ ChatGPT ไว้
ปฏิกิริยาในวงการ: มัลติโมดัลแบบเรียลไทม์กลายเป็นจุดแข่งขันรอบใหม่
หลังการเปิดตัว วงการเทคโนโลยีและสื่อส่วนใหญ่มุ่งความสนใจไปที่ว่า "การโต้ตอบด้วยเสียงและภาพแบบเรียลไทม์" จะกลายเป็นมาตรฐานใหม่ของอินเทอร์เฟซระหว่างมนุษย์กับเครื่องจักรหรือไม่ ไม่ใช่แค่การอัปเกรดเครื่องมือแชทธรรมดา นักวิเคราะห์ส่วนใหญ่เห็นตรงกันว่า GPT-4o ทำได้ทั้ง "ความเร็วในการตอบสนอง" และ "ความเข้าใจแบบมัลติโมดัล" พร้อมกัน ซึ่งเท่ากับยกระดับมาตรฐานประสบการณ์ของผู้ช่วยเสียงใหม่ทั้งหมด และทำให้ผลิตภัณฑ์เสียง/มัลติโมดัลรุ่นถัดไปของค่ายอื่น (Google, Meta) ต้องเทียบกับมาตรฐาน "เกือบเรียลไทม์" นี้
สำหรับผู้บริหาร การเปิดตัวครั้งนี้มีนัยสำคัญคือ การโต้ตอบด้วย AI แบบเรียลไทม์ทั้งเสียงและภาพ เริ่มมีความพร้อมทางเทคนิคเป็นครั้งแรกที่จะเป็นอินเทอร์เฟซหน้างานจริง (บทสนทนากับลูกค้า การแนะนำสินค้าหน้าร้าน การตรวจสอบหน้างาน) และการเปิดให้ใช้ฟรีช่วยลดต้นทุนในการทดลองใช้ของทีมงาน ควรติดตามในเดือนต่อ ๆ ไปว่าจะมีแอปพลิเคชันที่ใกล้เคียงกับสถานการณ์ธุรกิจจริงมากขึ้นหรือไม่
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี