คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 245/303 ตอน ดูสารบัญคอร์ส

โมเดลสายหลักของ DeepSeek รองรับอินพุตภาพครั้งแรก: เปิดตัว V4-Flash-Vision-Exp บน API

28/08/2026 161
≈5:04
โมเดลสายหลักของ DeepSeek รองรับอินพุตภาพครั้งแรก: เปิดตัว V4-Flash-Vision-Exp บน API
ภาพ/Photo by Sumaid pal Singh Bakshi on Unsplash

วันที่ 21 สิงหาคม พ.ศ. 2569 DeepSeek ประกาศผ่านบันทึกการเปลี่ยนแปลง API อย่างเป็นทางการ (api-docs.deepseek.com/updates/) ว่าโมเดลความเข้าใจภาพเชิงมัลติโมดัลรุ่นทดลอง DeepSeek-V4-Flash-Vision-Exp พร้อมให้เรียกใช้งานแล้ว โดยต่อยอดจาก V4-Flash ที่มีพารามิเตอร์รวม 284B/แอ็กทีฟ 13B และคอนเท็กซ์ 1M โทเค็น เพิ่มความสามารถในการเข้าใจรูปภาพและภาพหน้าจอ พร้อมคะแนน Chartography 64.3 ที่ผู้ผลิตรายงานเอง บทความนี้แยกแยะข้อเท็จจริง ความหมายเชิงเทคนิค และส่วนลดที่ต้องหักจากคำว่า «ใกล้เคียง Opus-4.8»

วันที่ 21 สิงหาคม พ.ศ. 2569 DeepSeek ประกาศผ่านบันทึกการเปลี่ยนแปลง API อย่างเป็นทางการ (api-docs.deepseek.com/updates/) ว่าโมเดลความเข้าใจภาพเชิงมัลติโมดัลรุ่นทดลอง DeepSeek-V4-Flash-Vision-Exp เปิดให้ใช้งานบนแพลตฟอร์ม DeepSeek API แล้ว นักพัฒนาเพียงกำหนดพารามิเตอร์เป็น model='deepseek-v4-flash-vision-exp' ก็เรียกใช้ได้ทันที และในเวลาเดียวกันโมเดลนี้ยังปรากฏบนบัญชีทางการของ DeepSeek บน Hugging Face ด้วย (แต่ทางการยังไม่ได้ระบุว่ามีการเปิดเผยน้ำหนักโมเดลหรือไม่) นับเป็นครั้งแรกที่โมเดลสายหลักด้านสนทนาและเอเจนต์ของ DeepSeek รองรับอินพุตเชิงภาพ

ประเด็นสำคัญที่ทางการเปิดเผยมีดังนี้

  • ฐานของโมเดล: ต่อยอดจาก V4-Flash เดิม ซึ่งเป็นสถาปัตยกรรม MoE พารามิเตอร์รวม 284B แอ็กทีฟ 13B และหน้าต่างคอนเท็กซ์ 1M โทเค็น
  • ความสามารถใหม่: อ่านอินพุตเชิงภาพ เช่น รูปภาพและภาพหน้าจอ พร้อมต่อยอดความสามารถด้านข้อความ การให้เหตุผล และการทำงานแบบเอเจนต์ที่มีอยู่เดิม
  • ผลคะแนนที่รายงานเอง: ในการทดสอบมาตรฐานสำหรับเอเจนต์ที่ต้องอาศัยความเข้าใจภาพ ดีขึ้นอย่างมีนัยสำคัญเมื่อเทียบกับ V4-Flash และความสามารถเชิงเอเจนต์แบบมัลติโมดัล «ใกล้เคียง Opus-4.8» โดยคะแนน Chartography ที่ประกาศคือ 64.3
  • สถานะเวอร์ชัน: ระบุชัดเจนว่าเป็นรุ่นทดลอง (experimental) ไม่ใช่เวอร์ชันเสถียร

ความหมายเชิงเทคนิค: จาก «อ่านตัวอักษรออก» สู่ «มองหน้าจอเข้าใจ»

ตลอดปีที่ผ่านมา เส้นทางของ DeepSeek ชัดเจนมาก คือผลักความสามารถด้านการให้เหตุผลและการทำงานแบบเอเจนต์ของโมเดลข้อความให้สุดทาง พร้อมกดต้นทุนให้ต่ำที่สุด การที่ V4-Pro เข้าสู่เวอร์ชันใช้งานจริงเมื่อวันที่ 13 สิงหาคม (เพียงปรับสตริงเวอร์ชันบนหน้าราคา ยังไม่เปิดเผยน้ำหนักโมเดล) และการเปิดซอร์ส Harness v0.1 ในวันเดียวกัน ล้วนเป็นส่วนต่อขยายของเส้นทางนี้ แต่ตราบใดที่โมเดลยังมองไม่เห็นภาพ เอเจนต์ก็ทำได้เพียงเรียก API และอินเทอร์เฟซข้อความ พอเจอรายงาน แผนภูมิ ภาพหน้าจอระบบหลังบ้าน หรือเอกสารสแกน ก็จะสะดุดทันที สิ่งที่ทางการเลือกหยิบมาพูดคือ «การทดสอบมาตรฐานสำหรับเอเจนต์ที่ต้องเข้าใจภาพ» ไม่ใช่การถามตอบเกี่ยวกับรูปภาพทั่วไป นี่คือสัญญาณในตัวเองว่า DeepSeek ไม่ได้ต้องการแชตบอตที่ดูรูปเป็น แต่ต้องการเอเจนต์ที่มองหน้าจอเข้าใจแล้วลงมือทำงานต่อได้

«ใกล้เคียง Opus-4.8» ต้องหักส่วนลดกี่ชั้น

วลีนี้คือประโยคที่สะดุดตาที่สุดในข่าว แต่ต้องหักส่วนลดสามชั้น

  1. เทียบกับรุ่นก่อนหน้า: Opus 4.8 เปิดตัวเมื่อวันที่ 28 พฤษภาคม พ.ศ. 2569 ขณะที่ Anthropic เปิดตัว Claude Opus 5 ไปแล้วเมื่อวันที่ 24 กรกฎาคม การใช้รุ่นเมื่อสามเดือนก่อนซึ่งถูกแทนที่ไปแล้วเป็นเกณฑ์เทียบ จึงไม่เท่ากับ «ไล่ทันแนวหน้าปัจจุบัน»
  2. ตัวเลขมาจากผู้ผลิตเอง: ขณะนี้ยังไม่มีสถาบันประเมินอิสระให้ข้อมูลเปรียบเทียบ และยังไม่มีการทำซ้ำผลอย่างอิสระจากภายนอก
  3. รุ่นทดลองก็คือรุ่นทดลอง: เมื่อทางการระบุเองว่าเป็น experimental ย่อมหมายความว่าอินเทอร์เฟซ ราคา หรือแม้แต่ความสามารถ อาจเปลี่ยนได้ตลอดเวลา และไม่รับประกันระดับบริการที่เสถียร

การอ่านข่าวนี้อย่างสมเหตุสมผลคือ DeepSeek ได้เติมช่อง «มี» ในด้านมัลติโมดัลแล้ว และตั้งเป้าไปที่งานเชิงเอเจนต์ตั้งแต่ก้าวแรก ส่วนคำถามว่า «ใช้ได้ดีแค่ไหน» ต้องรอเวอร์ชันเสถียรและการตรวจสอบซ้ำจากบุคคลที่สาม

ความหมายต่อผู้บริหาร

ยังไม่จำเป็นต้องรีบนำโมเดลรุ่นทดลองเข้าสู่กระบวนการทำงานจริง แต่สิ่งที่ควรทำตั้งแต่วันนี้คือ สำรวจว่างานใดในองค์กรติดอยู่ที่ «ข้อมูลอยู่บนหน้าจอเท่านั้น» เช่น ภาพถ่ายใบส่งของ หน้าจอตรวจสอบสายการผลิต หรือรายงานกระทบยอด จุดเหล่านี้ซึ่งเดิมต้องพึ่งสายตาและมือคน กำลังกลายเป็นอินพุตที่โมเดลรับเข้าไปได้โดยตรง เมื่อเวอร์ชันเสถียรมาถึง ผู้ที่นำหน้าไม่ใช่เพราะเทคโนโลยี แต่เพราะรู้อยู่แล้วว่าจะให้มันทำอะไร

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร NVIDIA Groq 3 LPX เข้าสู่การผลิตเต็มรูปแบบ: 3,400 โทเคนต่อวินาที เปลี่ยนเวลารอของ Agentic AI

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว