คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 218/303 ตอน ดูสารบัญคอร์ส

DeepSeek-V4-Flash-0731: ไม่แตะสถาปัตยกรรมเลย เปลี่ยนแค่ post-training ก็แซงรุ่นเรือธงของตัวเอง

03/08/2026 246
≈6:02
DeepSeek-V4-Flash-0731: ไม่แตะสถาปัตยกรรมเลย เปลี่ยนแค่ post-training ก็แซงรุ่นเรือธงของตัวเอง
ภาพ/Photo by Jackson Sophat on Unsplash

วันที่ 31 กรกฎาคม 2569 DeepSeek ปล่อยเช็กพอยต์ใหม่ V4-Flash-0731 ซึ่งเป็นการอัปเดตครั้งแรกของสายผลิตภัณฑ์ Flash หลังจากตระกูล V4 เข้าสู่สถานะ GA เมื่อ 20 กรกฎาคม โดยคงสถาปัตยกรรมเดิมจากรุ่น preview เดือนเมษายนทุกประการ (พารามิเตอร์รวม 284B และพารามิเตอร์ที่ทำงานจริง 13B แบบ MoE รวมถึงคอนเท็กซ์ 1M token) เปลี่ยนเพียงไปป์ไลน์ post-training ใหม่ทั้งชุด ผลทดสอบที่บริษัทรายงานเองเหนือกว่ารุ่นเรือธง V4-Pro Preview พร้อมปล่อยน้ำหนักโมเดลใหม่บน Hugging Face ด้วยสัญญาอนุญาต MIT แบบไม่ต้องขออนุมัติ

วันที่ 31 กรกฎาคม 2569 DeepSeek ปล่อยเช็กพอยต์ใหม่ DeepSeek-V4-Flash-0731 ซึ่งเป็นการอัปเดตเวอร์ชันครั้งแรกของสายผลิตภัณฑ์ Flash นับตั้งแต่ตระกูล V4 (รวมถึง deepseek-v4-flash) เปลี่ยนจากรุ่นพรีวิวเข้าสู่สถานะพร้อมใช้งานทั่วไป (GA) เมื่อวันที่ 20 กรกฎาคม ประเด็นที่น่าสนใจที่สุดไม่ใช่การที่โมเดลใหญ่ขึ้น แต่คือโมเดลไม่ได้ใหญ่ขึ้นเลยแม้แต่น้อย สถาปัตยกรรมและสเปกเหมือนเดิมทุกประการ ได้แก่ พารามิเตอร์รวม 284B พารามิเตอร์ที่ทำงานจริง (active) 13B แบบ MoE และความยาวคอนเท็กซ์ 1M token ทางบริษัทระบุชัดว่าสิ่งที่เปลี่ยนมีเพียงอย่างเดียว คือการเขียนไปป์ไลน์ post-training ขึ้นใหม่ทั้งชุดแล้วฝึกโมเดลใหม่

ครั้งนี้ยังเป็นการเติมข้อมูลที่ยังค้างคาตั้งแต่วัน GA นั่นคือเรื่องการปล่อยน้ำหนักโมเดล โดยน้ำหนักรุ่นใหม่เผยแพร่บน Hugging Face ภายใต้สัญญาอนุญาต MIT แบบไม่ต้องขออนุมัติ (non-gated) ดาวน์โหลดได้โดยไม่ต้องยื่นขออนุมัติ ซึ่งเป็นการสานต่อแนวทางโอเพนซอร์สของรุ่น preview เดือนเมษายน ส่วนราคายังใช้โครงสร้างเดิมตั้งแต่ GA คือ อินพุต 0.14 ดอลลาร์ และเอาต์พุต 0.28 ดอลลาร์ต่อล้านโทเคน ในฐานะอัตราฐาน (ช่วงนอกพีค) ขณะที่ช่วงพีคคือ 9 ถึง 12 นาฬิกา และ 14 ถึง 18 นาฬิกาของทุกวัน ยังคิดในอัตรา 2 เท่า ดังนั้นการประเมินค่าใช้จ่ายจึงดูเฉพาะอัตราฐานไม่ได้

ชนะรุ่นเรือธงในทุกรายการที่เผยแพร่ แต่เป็นตัวเลขที่ผู้ผลิตรายงานเอง

ในผลทดสอบมาตรฐานด้าน agentic และการเขียนโค้ดที่ DeepSeek เผยแพร่ V4-Flash-0731 เหนือกว่าสายเรือธงที่ราคาสูงกว่าทุกรายการ โดยตัวเลขตัวแทนสามชุดมีดังนี้

  • Terminal Bench 2.1: 82.7 เทียบกับ 72.1
  • NL2Repo: 54.2 เทียบกับ 38.5
  • Cybergym: 76.7 เทียบกับ 52.7

มีสองข้อที่ต้องระบุอย่างตรงไปตรงมา ข้อแรก ต้องสังเกตว่าคู่เทียบที่บริษัทใช้ครั้งนี้คือ V4-Pro Preview ไม่ใช่ V4-Pro เวอร์ชัน GA ของวันที่ 20 กรกฎาคม ทั้งสองไม่ได้มาจาก post-training ชุดเดียวกัน จึงไม่ควรนำระยะห่างนี้ไปเทียบกับรุ่นเรือธงปัจจุบันโดยตรง ข้อสอง ตัวเลขทั้งหมดนี้เป็นผลที่ผู้ผลิตรายงานเอง และรันบน evaluation harness ที่ยังไม่เปิดเผยต่อสาธารณะ ไม่ใช่การตรวจสอบโดยบุคคลที่สาม ชื่อการทดสอบที่เหมือนกันไม่ได้แปลว่าวิธีรันเหมือนกัน และเมื่อ harness ไม่เปิดเผยก็ไม่มีทางทำซ้ำผลได้ นอกจากนี้ยังมีตัวเลขอีกรายการหนึ่งคือ DeepSWE ที่ฝั่งรุ่นเรือธงต่ำผิดปกติ บทความนี้จึงยังไม่นำมาอ้างอิงจนกว่าจะมีการเปิดเผยเงื่อนไขการทดสอบต้นทาง

สมรภูมิหลักของการเพิ่มขีดความสามารถกำลังย้ายจากพารามิเตอร์ไปสู่ post-training

การตรึงสถาปัตยกรรมไว้แล้วเปลี่ยนเฉพาะ post-training เท่ากับการทดลองแบบมีกลุ่มควบคุมโดยประมาณ กล่าวคือ ขนาดพารามิเตอร์ ความยาวคอนเท็กซ์ และการออกแบบแบบ sparse ล้วนเป็นค่าคงที่ ตัวแปรเดียวคือสูตรข้อมูลและกระบวนการเสริมแรงในช่วงท้ายของการฝึก หากตัวเลขทางการเป็นจริง ย่อมหมายความว่าในงานที่ต้องตัดสินใจเป็นลูกโซ่ยาวอย่างงาน agentic และการเขียนโค้ด ผลได้จาก post-training มากพอที่จะกลบความต่างของขนาดพารามิเตอร์ไปแล้ว

เรื่องนี้อธิบายได้ว่าเหตุใดสาย Flash ที่ราคาถูกกว่าจึงแซงสาย Pro ที่แพงกว่าได้ เพราะคู่เทียบอย่าง Pro Preview คือผลลัพธ์จาก post-training รุ่นก่อนหน้า ขณะที่ Flash-0731 ใช้ไปป์ไลน์ใหม่ การที่ภายในบริษัทเดียวกันเกิดสภาพ "ของถูกเก่งกว่าของแพง" ถือเป็นสัญญาณเตือนต่อตรรกะการตั้งราคาของทั้งอุตสาหกรรมว่า จำนวนพารามิเตอร์และราคาไม่ใช่ตัวแทนที่เชื่อถือได้ของขีดความสามารถอีกต่อไป

สัญญาอนุญาต MIT แบบไม่ต้องขออนุมัติเป็นอีกสัญญาณหนึ่ง เมื่อน้ำหนักโมเดลหลัง GA ยังดาวน์โหลดได้อย่างอิสระและใช้เชิงพาณิชย์ได้โดยไม่ต้องขออนุมัติ ต้นทุนของการติดตั้งใช้งานเองจึงเหลือเพียงค่าฮาร์ดแวร์ ซึ่งมีความหมายอย่างยิ่งต่อองค์กรที่ข้อมูลออกนอกประเทศไม่ได้ หรือจำเป็นต้องประมวลผลข้อมูลอ่อนไหวภายในศูนย์ข้อมูลของตนเอง

ความหมายต่อผู้บริหาร

บทเรียนที่ใช้ได้จริงที่สุดคือ อายุความสดของข้อสรุปจากการประเมินโมเดลกำลังสั้นลงอย่างรวดเร็ว การเปรียบเทียบเพื่อเลือกโมเดลเมื่อครึ่งปีก่อนอาจพลิกกลับทั้งหมดเพียงเพราะผู้ให้บริการเปลี่ยนไปป์ไลน์ post-training หนึ่งครั้ง ทั้งที่ภายนอกอย่างพารามิเตอร์ ราคา และหมายเลขเวอร์ชันแทบมองไม่เห็นความต่าง การเลือกโมเดลจึงไม่ควรเป็นการตัดสินใจครั้งเดียวจบ แต่ควรมีจังหวะทบทวนซ้ำอย่างสม่ำเสมอ หากทีมของท่านใช้ AI จัดการงานเขียนโค้ดหรืองาน agentic หลายขั้นตอนอยู่แล้ว ลองนำงานจริงของบริษัทมารันเทียบระหว่างเช็กพอยต์เก่ากับใหม่ แล้ววัดด้วยเกณฑ์ตรวจรับของท่านเอง เพราะ harness ของผู้ขายไม่เปิดเผย แต่ harness ของท่านเองคือสิ่งเดียวที่ทำซ้ำได้

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร OpenAI เปิดตัว "Sign in with ChatGPT" รุ่นเบตา: บัญชี ChatGPT กลายเป็นตัวตนสำหรับเข้าสู่ระบบข้ามแพลตฟอร์ม

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว