คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 97/303 ตอน ดูสารบัญคอร์ส

OpenAI ผนวกฟีเจอร์สร้างภาพเข้ากับ GPT-4o โดยตรง กระแสภาพสไตล์จิบลิดังพลุแตกข้ามคืน

25/03/2025 327
≈3:25
OpenAI ผนวกฟีเจอร์สร้างภาพเข้ากับ GPT-4o โดยตรง กระแสภาพสไตล์จิบลิดังพลุแตกข้ามคืน
ภาพ/Photo by Zach M on Unsplash

OpenAI ประกาศเมื่อวันที่ 25 มีนาคม 2568 ว่าได้ผนวกความสามารถสร้างภาพเข้ากับ GPT-4o โดยตรง แทนที่ DALL·E 3 เดิม สามารถแสดงข้อความในภาพได้แม่นยำ ปรับแก้ภาพผ่านบทสนทนาได้ และโด่งดังจากกระแสภาพสไตล์จิบลิ

เมื่อวันที่ 25 มีนาคม 2568 OpenAI ประกาศผนวกความสามารถในการสร้างภาพเข้ากับโมเดล GPT-4o โดยตรง เปิดตัวเป็นเครื่องมือสร้างภาพที่บริษัทระบุว่า "ล้ำหน้าที่สุดเท่าที่เคยมีมา" ฟีเจอร์นี้ไม่ใช่ระบบ DALL·E 3 แยกต่างหากอีกต่อไป แต่ฝังอยู่ในตัว GPT-4o เอง และเริ่มเปิดให้ใช้งานใน ChatGPT และ Sora สำหรับผู้ใช้ทุกระดับ ทั้ง Plus, Pro, Team และผู้ใช้ฟรี

ตามคำอธิบายอย่างเป็นทางการ วิธีการสร้างภาพแบบใหม่นี้ให้ผลลัพธ์ที่แม่นยำและสมจริงยิ่งขึ้น จุดเด่นสำคัญที่สุดคือสามารถแสดงข้อความในภาพได้อย่างถูกต้อง ซึ่งเป็นจุดอ่อนที่เครื่องมือสร้างภาพตระกูล DALL·E เผชิญมานาน มักเกิดตัวอักษรบิดเบี้ยวหรือสะกดผิดบนป้ายหรือข้อความในภาพ เนื่องจากความสามารถนี้ฝังอยู่ในตัวโมเดลสนทนาโดยตรง ผู้ใช้จึงสามารถปรับแก้ภาพผ่านบทสนทนาภาษาธรรมชาติได้ต่อเนื่อง และ GPT-4o ยังจดจำบริบทของบทสนทนารวมถึงภาพที่เคยอัปโหลดก่อนหน้า เพื่อรักษาความต่อเนื่องของภาพในชุดเดียวกัน

ความหมายเชิงเทคนิค: จาก "เรียกใช้เครื่องมือภายนอก" สู่ "ความสามารถในตัวโมเดล"

แต่เดิม การสร้างภาพใน ChatGPT คือการที่โมเดลข้อความเรียกใช้โมเดล DALL·E ซึ่งเป็นระบบแยกต่างหากมาทำงานร่วมกัน การเปลี่ยนแปลงครั้งนี้คือการ "หลอมรวม" ความสามารถสร้างภาพเข้ากับตัวโมเดลมัลติโมดัล GPT-4o โดยตรง ทำให้โมเดลเข้าใจบริบทข้อความ ภาพก่อนหน้า และเจตนาการแก้ไขของผู้ใช้ไปพร้อมกัน สร้างหรือแก้ไขภาพได้ในขั้นตอนเดียว นี่คือเหตุผลที่ผู้ใช้สามารถปรับแต่งภาพต่อเนื่องเหมือนสนทนา แทนที่จะต้องสั่งสร้างภาพใหม่ทุกครั้งแยกกัน

ปฏิกิริยาในวงการ: กระแสแชร์ภาพกลายเป็นปรากฏการณ์ไวรัลโดยไม่ตั้งใจ

หลังเปิดตัวฟีเจอร์นี้ ความสามารถในการแปลงภาพถ่ายจริงให้เป็นภาพสไตล์แอนิเมชันจิบลิ (Studio Ghibli) ก่อให้เกิดกระแสแชร์และพูดถึงอย่างกว้างขวางบนโซเชียลมีเดีย ผู้ใช้จำนวนมากนำภาพตัวเอง ครอบครัว และสัตว์เลี้ยงมาแปลงเป็นสไตล์มิยาซากิแล้วโพสต์ลงแพลตฟอร์มโซเชียล เกิดเป็นกระแสไวรัลที่เกิดขึ้นเองโดยไม่ได้วางแผน ปรากฏการณ์นี้ยังนำไปสู่การถกเถียงในวงกว้างเกี่ยวกับการเลียนแบบสไตล์งานศิลป์และขอบเขตลิขสิทธิ์ ซึ่งกลายเป็นประเด็นคู่ขนานไปกับการเปิดตัวฟีเจอร์นี้

ความหมายสำหรับผู้บริหาร

การสร้างภาพที่เคยต้องเปิดเครื่องมือแยกต่างหากและสั่งงานเฉพาะทาง กลายมาเป็นสิ่งที่ทำได้ทันทีระหว่างการสนทนา หมายความว่าอุปสรรคในการผลิตสื่อภาพสำหรับการตลาด โซเชียลมีเดีย หรือหน้าร้านลดลงอย่างมาก ผู้บริหารและพนักงานหน้างานสามารถสร้างภาพโปรโมชัน ภาพเมนู หรือร่างโปสเตอร์กิจกรรมได้เองผ่านบทสนทนาโดยไม่ต้องรอทีมออกแบบ ควรพิจารณาว่าความสามารถนี้ช่วยเติมเต็มช่องว่างด้านการผลิตสื่อภาพอย่างรวดเร็วในทีมได้หรือไม่

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Meta เปิดตัว Llama 4: โมเดลโอเพนซอร์สใช้สถาปัตยกรรมผู้เชี่ยวชาญผสมเป็นครั้งแรก

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว