คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 43/217 ตอน ดูสารบัญคอร์ส

OpenAI เปิดตัว GPT-4o โมเดลมัลติโมดัลแบบเรียลไทม์

13/05/2024 214
4:34
OpenAI เปิดตัว GPT-4o โมเดลมัลติโมดัลแบบเรียลไทม์

OpenAI เปิดตัวโมเดลเรือธงใหม่ GPT-4o ในงาน Spring Update ซึ่งสามารถประมวลผลเสียง ภาพ และข้อความแบบเรียลไทม์ ความหน่วงในการตอบสนองใกล้เคียงบทสนทนาจริง และเปิดให้ผู้ใช้ฟรีได้ใช้โมเดลล้ำสมัยที่สุดเป็นครั้งแรก

วันที่ 13 พฤษภาคม 2024 OpenAI ประกาศเปิดตัวโมเดลเรือธงรุ่นใหม่ GPT-4o ผ่านการถ่ายทอดสดในงาน "Spring Update" โดยตัวอักษร "o" ย่อมาจาก omni หรือ "รอบด้าน" จุดเด่นสำคัญที่สุดของ GPT-4o คือความสามารถในการประมวลผลเสียง ภาพ และข้อความแบบเรียลไทม์ในโมเดลเดียว ความหน่วงในการตอบสนองด้วยเสียงลดลงอย่างมาก เหลือเฉลี่ยเพียง 232 มิลลิวินาที ใกล้เคียงกับความเร็วของบทสนทนาระหว่างมนุษย์จริง ในการสาธิต โมเดลสามารถตรวจจับน้ำเสียงของผู้ใช้แบบทันที หยุดพูดและตอบสนองใหม่ทันทีเมื่อถูกขัดจังหวะ อีกทั้งยังสามารถมองผ่านกล้องเพื่ออธิบายภาพที่เห็นแบบเรียลไทม์ และประเมินสภาวะอารมณ์ของผู้ใช้ได้ด้วย OpenAI ยังเปิดตัวแอปพลิเคชัน ChatGPT เวอร์ชันเดสก์ท็อปพร้อมกัน และประกาศว่า GPT-4o จะเปิดให้ผู้ใช้ ChatGPT เวอร์ชันฟรีใช้งานได้ (โดยมีโควตาจำกัด) ส่วนผู้ใช้แบบชำระเงินจะได้โควตาการใช้งานที่สูงกว่า

นัยทางเทคนิค: ผู้ช่วยเสียงเปลี่ยนจาก "พูดสลับกัน" สู่บทสนทนาจริง

ที่ผ่านมา ผู้ช่วยเสียง (รวมถึงโหมดเสียงเดิมของ ChatGPT) มักประมวลผลแบบสามขั้นตอน คือ แปลงเสียงเป็นข้อความ → ให้โมเดลเข้าใจ → แปลงข้อความกลับเป็นเสียง ซึ่งแต่ละขั้นตอนสะสมความหน่วงจนต้องใช้เวลานานพอสมควรกว่าจะตอบกลับ และยากที่จะขัดจังหวะบทสนทนาได้ GPT-4o เปลี่ยนมาใช้โมเดลเดียวประมวลผลเสียงเข้า-ออกโดยตรง ไม่ต้องผ่านการแปลงกลางใด ๆ จึงลดความหน่วงลงเหลือ 232 มิลลิวินาที ใกล้เคียงความเร็วปฏิกิริยาของมนุษย์ นี่หมายความว่าอินเทอร์เฟซการสื่อสารด้วยเสียง (ผู้ช่วยเสียง แชทบอทบริการลูกค้า การฝึกสอน) มีโอกาสครั้งแรกที่จะทำ "การขัดจังหวะตามธรรมชาติ ตอบสนองแบบทันที" แทนรูปแบบเดิมที่ต้องบันทึก-รอ-เล่นเสียง

เทียบกับรุ่นก่อน: การเปิดให้ใช้ฟรีคือการปรับกลยุทธ์

ด้านความสามารถ GPT-4o เป็นการต่อยอดและรวมความสามารถจาก GPT-4 Turbo แต่จุดเปลี่ยนที่แท้จริงอยู่ที่กลยุทธ์ทางธุรกิจ นี่เป็นครั้งแรกที่ OpenAI เปิดให้ "โมเดลล้ำสมัยที่สุดในขณะนั้น" ใช้งานได้โดยตรงสำหรับผู้ใช้ฟรี (แม้จะมีโควตาจำกัด) แทนที่จะสงวนโมเดลล่าสุดไว้เฉพาะผู้สมัครสมาชิกแบบชำระเงินเหมือนที่ผ่านมา การเคลื่อนไหวนี้ถูกมองว่าเป็นการตอบโต้แรงกดดันจาก Google (ซึ่งเพิ่งวางกลยุทธ์ด้วยตระกูล Gemini 1.5) และฝ่ายโมเดลโอเพนซอร์ส (เช่น Llama, Grok ที่ใช้งานได้ฟรี) โดยการขยายฐานผู้ใช้ฟรีเพื่อรักษาฐานผู้ใช้และความเป็นผู้นำของแบรนด์ ChatGPT ไว้

ปฏิกิริยาในวงการ: มัลติโมดัลแบบเรียลไทม์กลายเป็นจุดแข่งขันรอบใหม่

หลังการเปิดตัว วงการเทคโนโลยีและสื่อส่วนใหญ่มุ่งความสนใจไปที่ว่า "การโต้ตอบด้วยเสียงและภาพแบบเรียลไทม์" จะกลายเป็นมาตรฐานใหม่ของอินเทอร์เฟซระหว่างมนุษย์กับเครื่องจักรหรือไม่ ไม่ใช่แค่การอัปเกรดเครื่องมือแชทธรรมดา นักวิเคราะห์ส่วนใหญ่เห็นตรงกันว่า GPT-4o ทำได้ทั้ง "ความเร็วในการตอบสนอง" และ "ความเข้าใจแบบมัลติโมดัล" พร้อมกัน ซึ่งเท่ากับยกระดับมาตรฐานประสบการณ์ของผู้ช่วยเสียงใหม่ทั้งหมด และทำให้ผลิตภัณฑ์เสียง/มัลติโมดัลรุ่นถัดไปของค่ายอื่น (Google, Meta) ต้องเทียบกับมาตรฐาน "เกือบเรียลไทม์" นี้

สำหรับผู้บริหาร การเปิดตัวครั้งนี้มีนัยสำคัญคือ การโต้ตอบด้วย AI แบบเรียลไทม์ทั้งเสียงและภาพ เริ่มมีความพร้อมทางเทคนิคเป็นครั้งแรกที่จะเป็นอินเทอร์เฟซหน้างานจริง (บทสนทนากับลูกค้า การแนะนำสินค้าหน้าร้าน การตรวจสอบหน้างาน) และการเปิดให้ใช้ฟรีช่วยลดต้นทุนในการทดลองใช้ของทีมงาน ควรติดตามในเดือนต่อ ๆ ไปว่าจะมีแอปพลิเคชันที่ใกล้เคียงกับสถานการณ์ธุรกิจจริงมากขึ้นหรือไม่

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Google I/O 2024: เปิดตัว Gemini 1.5 ทั่วโลก, Project Astra และ AI Overviews สรุปผลการค้นหาแบบเต็มรูปแบบ

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว