Google เปิดตัว "Nano Banana": โมเดลภาพ Gemini 2.5 Flash Image เปิดใช้งานอย่างเป็นทางการ
Google DeepMind เปิดตัวโมเดลภาพใหม่ Gemini 2.5 Flash Image (ชื่อเล่น Nano Banana) ใน Gemini App เมื่อวันที่ 26 สิงหาคม 2568 ชูจุดเด่นผสานหลายภาพเป็นภาพเดียว รักษาความสอดคล้องของตัวละคร แก้ไขภาพด้วยคำสั่งภาษาธรรมชาติ งานส่วนใหญ่เสร็จภายใน 10 วินาที ถือเป็นโมเดลแก้ไขภาพที่ได้คะแนนสูงสุดในขณะนี้
เมื่อวันที่ 26 สิงหาคม 2568 Google ได้เปิดตัวโมเดลภาพรุ่นใหม่ใน Gemini App อย่างเป็นทางการในชื่อ Gemini 2.5 Flash Image หรือชื่อเล่นที่ตลาดเรียกกันว่า "Nano Banana" พัฒนาโดย Google DeepMind ตามประกาศบนบล็อกทางการของ Google โมเดลนี้ครองอันดับสูงสุดในการประเมินผลด้านการแก้ไขภาพระดับโลกในปัจจุบัน โดยมีความสามารถหลัก 3 ประการ ได้แก่ หนึ่ง สามารถผสานภาพหลายภาพให้กลายเป็นภาพเดียว สอง สามารถรักษาความสอดคล้องของตัวละครไว้ได้ในขณะที่ดำเนินเรื่องราวต่อเนื่อง (เช่น ตัวละครเดิมเปลี่ยนฉากหรือท่าทางแต่หน้าตายังคงเดิม) และสาม สามารถรับคำสั่งแก้ไขภาพที่แม่นยำผ่านภาษาธรรมชาติ เช่น "เปลี่ยนพื้นหลังเป็นภาพกลางคืน" หรือ "ใส่แว่นตาให้เขา" โดยโมเดลจะเข้าใจความหมายและแก้ไขเฉพาะจุดได้อย่างแม่นยำ แทนที่จะสร้างภาพทั้งภาพขึ้นใหม่
ความเร็วเป็นอีกจุดเด่นสำคัญของการเปิดตัวครั้งนี้ ทาง Google ระบุว่างานแก้ไขภาพส่วนใหญ่เสร็จสิ้นภายใน 10 วินาที ส่วนคำขอมาตรฐาน (เช่น คำสั่งแก้ไขภาพเดียว) ใช้เวลาเพียง 1-2 วินาทีก็สามารถได้ผลลัพธ์ ความเร็วในการตอบสนองระดับนี้ใกล้เคียงกับประสบการณ์ "แก้ไขแบบเรียลไทม์" ซึ่งแตกต่างอย่างชัดเจนจากโมเดลสร้างภาพในอดีตที่มักต้องรอหลายสิบวินาทีถึงหลายนาที
ความหมายเชิงเทคนิค: จาก "การสร้างภาพ" สู่ "การเข้าใจแล้วแก้ไข"
การแข่งขันของโมเดลสร้างภาพในปีที่ผ่านมา ส่วนใหญ่เน้นการ "สร้างภาพใหม่ทั้งหมดจากข้อความ" โดยแข่งกันที่คุณภาพ สไตล์ และองค์ประกอบภาพ จุดต่างของ Nano Banana คือการเน้น "การแก้ไข" มากกว่า "การวาดใหม่" คือคงตัวละคร องค์ประกอบภาพ และตรรกะแสงเงาของภาพต้นฉบับไว้ แล้วแก้ไขเฉพาะส่วนที่คำสั่งระบุ ซึ่งต้องอาศัยความเข้าใจเชิงความหมายของเนื้อหาภาพที่ลึกกว่าการสร้างพิกเซลใหม่ตามคำสั่ง ทาง Google ยังระบุด้วยว่าโมเดลนี้ใช้ "ความรู้เกี่ยวกับโลก" ของ Gemini เองในการสร้างและแก้ไขภาพ หมายความว่าไม่ได้เพียงแค่จดจำองค์ประกอบในภาพ แต่ยังใช้เหตุผลเชิงสามัญสำนึกเพื่อตัดสินว่าการแก้ไขนั้นสมเหตุสมผลหรือไม่ (เช่น เมื่อเปลี่ยนฤดูกาลก็ควรปรับแสงเงาและเครื่องแต่งกายให้สอดคล้องกันด้วย) ความสามารถ "เข้าใจแล้วแก้ไข" นี้ถือเป็นก้าวสำคัญที่ทำให้โมเดลภาพก้าวจากเครื่องมือสร้างความบันเทิงไปสู่เครื่องมือเพิ่มผลผลิตที่ใช้งานได้จริง
เทียบกับรุ่นก่อนหน้าและโมเดลร่วมยุค
เมื่อเทียบกับความสามารถสร้างภาพของ Google เองในอดีต Nano Banana ก้าวหน้าอย่างชัดเจนในด้านความสอดคล้องของตัวละครและการผสานหลายภาพ ซึ่งปัญหาตัวละครเดิม "หน้าตาเพี้ยน" ในแต่ละภาพเป็นจุดอ่อนที่มีมานานของโมเดลสร้างภาพ ในช่วงครึ่งปีแรกของปี 2568 OpenAI, Midjourney และผู้ให้บริการรายอื่นยังคงพัฒนาคุณภาพการสร้างภาพอย่างต่อเนื่อง แต่ส่วนใหญ่ยังใช้ "การสร้างภาพเดี่ยว" เป็นสถานการณ์การใช้งานหลัก ส่วน Nano Banana เน้นที่ "การผสานหลายภาพ + การแก้ไขต่อเนื่อง + ความเร็วระดับวินาที" ซึ่งตรงกับความต้องการในขั้นตอนการทำงานจริงที่ต้องแก้ไขซ้ำและปรับทีละขั้น มากกว่าการผลิตงานสำเร็จเพียงครั้งเดียว หลังเปิดตัว ข่าวนี้ได้จุดกระแสถกเถียงอย่างรวดเร็วในโซเชียลมีเดียและกลุ่มนักออกแบบ นักการตลาด หลายคนนำไปเปรียบเทียบกับเครื่องมือแก้ไขภาพที่มีอยู่เดิม (เช่นฟีเจอร์ AI ของ Photoshop) โดยเห็นว่าความหน่วงต่ำและการสั่งงานด้วยภาษาธรรมชาติช่วยลดอุปสรรคสำหรับ "ผู้ที่ไม่มีพื้นฐานด้านการออกแบบ" ในการแก้ไขภาพได้อย่างมาก นี่ยังถูกมองว่าเป็นการแสดงจุดยืนสำคัญของ Google ในสนามแข่งขันสร้างภาพ จากที่เคยเป็น "ผู้ตาม" กลายเป็น "ผู้นำอันดับหนึ่ง"
ความหมายสำหรับผู้บริหาร
สำหรับผู้บริหารที่ต้องผลิตสื่อการตลาด ภาพสินค้า หรือภาพประกอบโพสต์โซเชียลจำนวนมาก Nano Banana หมายถึง "อุปสรรคในการแก้ไขภาพ" ถูกลดลงไปอีกขั้น ไม่จำเป็นต้องมีทักษะออกแบบมืออาชีพ เพียงพิมพ์คำสั่งประโยคเดียวก็ปรับภาพได้ และเร็วพอที่จะแก้ไขให้ทุกคนดูได้ทันทีระหว่างประชุม ลองให้ทีมการตลาดหรือพนักงานหน้าร้านนำภาพสินค้าที่มีอยู่แล้วมาทดลองสั่งเปลี่ยนพื้นหลัง ฤดูกาล หรือรูปแบบการจัดวางด้วยคำสั่งภาษาธรรมชาติ แล้วประเมินว่าผลลัพธ์ที่ได้นำไปใช้งานจริงได้เลยหรือไม่ เพื่อพิจารณาว่าจะช่วยลดต้นทุนเวลาในการผลิตสื่อและการประสานงานกับนักออกแบบภายนอกได้มากน้อยเพียงใด
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี