โมเดลสายหลักของ DeepSeek รองรับอินพุตภาพครั้งแรก: เปิดตัว V4-Flash-Vision-Exp บน API
วันที่ 21 สิงหาคม พ.ศ. 2569 DeepSeek ประกาศผ่านบันทึกการเปลี่ยนแปลง API อย่างเป็นทางการ (api-docs.deepseek.com/updates/) ว่าโมเดลความเข้าใจภาพเชิงมัลติโมดัลรุ่นทดลอง DeepSeek-V4-Flash-Vision-Exp พร้อมให้เรียกใช้งานแล้ว โดยต่อยอดจาก V4-Flash ที่มีพารามิเตอร์รวม 284B/แอ็กทีฟ 13B และคอนเท็กซ์ 1M โทเค็น เพิ่มความสามารถในการเข้าใจรูปภาพและภาพหน้าจอ พร้อมคะแนน Chartography 64.3 ที่ผู้ผลิตรายงานเอง บทความนี้แยกแยะข้อเท็จจริง ความหมายเชิงเทคนิค และส่วนลดที่ต้องหักจากคำว่า «ใกล้เคียง Opus-4.8»
วันที่ 21 สิงหาคม พ.ศ. 2569 DeepSeek ประกาศผ่านบันทึกการเปลี่ยนแปลง API อย่างเป็นทางการ (api-docs.deepseek.com/updates/) ว่าโมเดลความเข้าใจภาพเชิงมัลติโมดัลรุ่นทดลอง DeepSeek-V4-Flash-Vision-Exp เปิดให้ใช้งานบนแพลตฟอร์ม DeepSeek API แล้ว นักพัฒนาเพียงกำหนดพารามิเตอร์เป็น model='deepseek-v4-flash-vision-exp' ก็เรียกใช้ได้ทันที และในเวลาเดียวกันโมเดลนี้ยังปรากฏบนบัญชีทางการของ DeepSeek บน Hugging Face ด้วย (แต่ทางการยังไม่ได้ระบุว่ามีการเปิดเผยน้ำหนักโมเดลหรือไม่) นับเป็นครั้งแรกที่โมเดลสายหลักด้านสนทนาและเอเจนต์ของ DeepSeek รองรับอินพุตเชิงภาพ
ประเด็นสำคัญที่ทางการเปิดเผยมีดังนี้
- ฐานของโมเดล: ต่อยอดจาก V4-Flash เดิม ซึ่งเป็นสถาปัตยกรรม MoE พารามิเตอร์รวม 284B แอ็กทีฟ 13B และหน้าต่างคอนเท็กซ์ 1M โทเค็น
- ความสามารถใหม่: อ่านอินพุตเชิงภาพ เช่น รูปภาพและภาพหน้าจอ พร้อมต่อยอดความสามารถด้านข้อความ การให้เหตุผล และการทำงานแบบเอเจนต์ที่มีอยู่เดิม
- ผลคะแนนที่รายงานเอง: ในการทดสอบมาตรฐานสำหรับเอเจนต์ที่ต้องอาศัยความเข้าใจภาพ ดีขึ้นอย่างมีนัยสำคัญเมื่อเทียบกับ V4-Flash และความสามารถเชิงเอเจนต์แบบมัลติโมดัล «ใกล้เคียง Opus-4.8» โดยคะแนน Chartography ที่ประกาศคือ 64.3
- สถานะเวอร์ชัน: ระบุชัดเจนว่าเป็นรุ่นทดลอง (experimental) ไม่ใช่เวอร์ชันเสถียร
ความหมายเชิงเทคนิค: จาก «อ่านตัวอักษรออก» สู่ «มองหน้าจอเข้าใจ»
ตลอดปีที่ผ่านมา เส้นทางของ DeepSeek ชัดเจนมาก คือผลักความสามารถด้านการให้เหตุผลและการทำงานแบบเอเจนต์ของโมเดลข้อความให้สุดทาง พร้อมกดต้นทุนให้ต่ำที่สุด การที่ V4-Pro เข้าสู่เวอร์ชันใช้งานจริงเมื่อวันที่ 13 สิงหาคม (เพียงปรับสตริงเวอร์ชันบนหน้าราคา ยังไม่เปิดเผยน้ำหนักโมเดล) และการเปิดซอร์ส Harness v0.1 ในวันเดียวกัน ล้วนเป็นส่วนต่อขยายของเส้นทางนี้ แต่ตราบใดที่โมเดลยังมองไม่เห็นภาพ เอเจนต์ก็ทำได้เพียงเรียก API และอินเทอร์เฟซข้อความ พอเจอรายงาน แผนภูมิ ภาพหน้าจอระบบหลังบ้าน หรือเอกสารสแกน ก็จะสะดุดทันที สิ่งที่ทางการเลือกหยิบมาพูดคือ «การทดสอบมาตรฐานสำหรับเอเจนต์ที่ต้องเข้าใจภาพ» ไม่ใช่การถามตอบเกี่ยวกับรูปภาพทั่วไป นี่คือสัญญาณในตัวเองว่า DeepSeek ไม่ได้ต้องการแชตบอตที่ดูรูปเป็น แต่ต้องการเอเจนต์ที่มองหน้าจอเข้าใจแล้วลงมือทำงานต่อได้
«ใกล้เคียง Opus-4.8» ต้องหักส่วนลดกี่ชั้น
วลีนี้คือประโยคที่สะดุดตาที่สุดในข่าว แต่ต้องหักส่วนลดสามชั้น
- เทียบกับรุ่นก่อนหน้า: Opus 4.8 เปิดตัวเมื่อวันที่ 28 พฤษภาคม พ.ศ. 2569 ขณะที่ Anthropic เปิดตัว Claude Opus 5 ไปแล้วเมื่อวันที่ 24 กรกฎาคม การใช้รุ่นเมื่อสามเดือนก่อนซึ่งถูกแทนที่ไปแล้วเป็นเกณฑ์เทียบ จึงไม่เท่ากับ «ไล่ทันแนวหน้าปัจจุบัน»
- ตัวเลขมาจากผู้ผลิตเอง: ขณะนี้ยังไม่มีสถาบันประเมินอิสระให้ข้อมูลเปรียบเทียบ และยังไม่มีการทำซ้ำผลอย่างอิสระจากภายนอก
- รุ่นทดลองก็คือรุ่นทดลอง: เมื่อทางการระบุเองว่าเป็น experimental ย่อมหมายความว่าอินเทอร์เฟซ ราคา หรือแม้แต่ความสามารถ อาจเปลี่ยนได้ตลอดเวลา และไม่รับประกันระดับบริการที่เสถียร
การอ่านข่าวนี้อย่างสมเหตุสมผลคือ DeepSeek ได้เติมช่อง «มี» ในด้านมัลติโมดัลแล้ว และตั้งเป้าไปที่งานเชิงเอเจนต์ตั้งแต่ก้าวแรก ส่วนคำถามว่า «ใช้ได้ดีแค่ไหน» ต้องรอเวอร์ชันเสถียรและการตรวจสอบซ้ำจากบุคคลที่สาม
ความหมายต่อผู้บริหาร
ยังไม่จำเป็นต้องรีบนำโมเดลรุ่นทดลองเข้าสู่กระบวนการทำงานจริง แต่สิ่งที่ควรทำตั้งแต่วันนี้คือ สำรวจว่างานใดในองค์กรติดอยู่ที่ «ข้อมูลอยู่บนหน้าจอเท่านั้น» เช่น ภาพถ่ายใบส่งของ หน้าจอตรวจสอบสายการผลิต หรือรายงานกระทบยอด จุดเหล่านี้ซึ่งเดิมต้องพึ่งสายตาและมือคน กำลังกลายเป็นอินพุตที่โมเดลรับเข้าไปได้โดยตรง เมื่อเวอร์ชันเสถียรมาถึง ผู้ที่นำหน้าไม่ใช่เพราะเทคโนโลยี แต่เพราะรู้อยู่แล้วว่าจะให้มันทำอะไร
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี