คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 135/217 ตอน ดูสารบัญคอร์ส

DeepSeek เปิดซอร์ส DeepSeek-OCR: ใช้ “การบีบอัดภาพ” ให้ AI อ่านเอกสารได้ 2 แสนหน้าต่อวัน

20/10/2025 136
6:36
DeepSeek เปิดซอร์ส DeepSeek-OCR: ใช้ “การบีบอัดภาพ” ให้ AI อ่านเอกสารได้ 2 แสนหน้าต่อวัน

DeepSeek เปิดซอร์ส DeepSeek-OCR บน GitHub ภายใต้สัญญาอนุญาต MIT เมื่อวันที่ 20 ตุลาคม 2025 ด้วยเทคโนโลยีหลัก “Contexts Optical Compression” ที่แปลงข้อความยาวเป็นวิชวลโทเคนแล้วถอดรหัสกลับ ประมวลผลได้กว่า 2 แสนหน้าต่อวันด้วย GPU A100 หนึ่งตัว ลดต้นทุนการประมวลผลข้อมูลสำหรับฝึก AI อย่างมาก

วันที่ 20 ตุลาคม 2025 บริษัท AI สัญชาติจีน DeepSeek ได้เปิดซอร์สโมเดลใหม่ DeepSeek-OCR บน GitHub ภายใต้สัญญาอนุญาต MIT (ใช้เชิงพาณิชย์ ดัดแปลง และเผยแพร่ต่อได้อย่างเสรี) นี่คือระบบรู้จำตัวอักษรด้วยแสง (OCR) และเข้าใจโครงสร้างเอกสารแบบ end-to-end ที่เปิดซอร์สเต็มรูปแบบ จุดยืนของทางการไม่ใช่แค่ “อ่านตัวอักษรจากภาพสแกน” แต่มุ่งแก้ปัญหาความไม่มีประสิทธิภาพและต้นทุนสูงเมื่อโมเดลภาษาขนาดใหญ่ต้องประมวลผลเอกสารยาว ๆ ตามข้อมูลที่ทางการเปิดเผย GPU NVIDIA A100-40G เพียงตัวเดียวสามารถประมวลผลเอกสารได้มากกว่า 200,000 หน้าต่อวัน โดยมีเป้าหมายหลักคือใช้ผลิตข้อมูลข้อความปริมาณมากสำหรับฝึกโมเดลภาษาขนาดใหญ่ (LLM) และโมเดลภาษา-ภาพ (VLM)

เทคโนโลยีหลัก: “ถ่ายภาพ” ตัวอักษรแล้วบีบอัด

จุดเด่นที่สุดของ DeepSeek-OCR คือแนวทางเทคนิคที่เรียกว่า “Contexts Optical Compression” หรือการบีบอัดภาพเชิงบริบท OCR แบบดั้งเดิมจะรู้จำตัวอักษรในภาพแล้วแปลงออกมาเป็นข้อความทีละตัว แต่เมื่อเจอเอกสารยาว ปริมาณข้อความที่มากขึ้นจะทำให้จำนวนโทเคนที่โมเดล AI ต้องประมวลผลพุ่งสูงขึ้นตามไปด้วย ต้นทุนการคำนวณก็สูงขึ้นเป็นเงาตามตัว DeepSeek-OCR ใช้แนวทางตรงกันข้าม คือบีบอัดข้อความจำนวนมากให้กลายเป็น “วิชวลโทเคน” จำนวนน้อยก่อน แล้วจึงใช้ตัวถอดรหัสขนาดเบาแปลงวิชวลโทเคนเหล่านั้นกลับมาเป็นข้อความฉบับเต็ม ข้อดีสำคัญคือ ข้อความเนื้อหาเดียวกัน เมื่อแทนด้วยวิชวลโทเคนจะใช้ทรัพยากรการประมวลผลน้อยกว่าการแทนด้วยข้อความโทเคนโดยตรงมาก จึงเพิ่มความเร็วในการประมวลผลเอกสารยาวได้อย่างมาก พร้อมลดต้นทุนการคำนวณไปในตัว

ความแตกต่างจาก OCR แบบเดิมและเครื่องมือที่มีอยู่

เครื่องมือ OCR ในตลาดส่วนใหญ่ถูกปรับแต่งเพื่อเพิ่ม “ความแม่นยำในการรู้จำต่อหนึ่งหน้า” เมื่อต้องประมวลผลเอกสารยาว ผลลัพธ์แต่ละหน้าต้องถูกนำมาต่อกันแล้วส่งให้ AI ประมวลผลทีละส่วน DeepSeek-OCR กลับตั้งเป้าออกแบบให้ “ประสิทธิภาพการประมวลผลเอกสารยาว” เป็นแกนหลัก และเปิดซอร์สทั้งน้ำหนักโมเดลและโค้ด ให้นักพัฒนานำไปติดตั้งใช้งานหรือฝึกปรับแต่งเองได้โดยตรง แทนที่จะต้องใช้ผ่าน API แบบเสียเงิน แนวทางนี้สอดคล้องกับสไตล์เดิมของ DeepSeek (เช่น DeepSeek-V3.2-Exp, DeepSeek-V3.1) คือใช้โมเดลเปิดซอร์สสร้างฐานนักพัฒนาและระบบนิเวศแอปพลิเคชันอย่างรวดเร็ว พร้อมแสดงจุดแข็งด้านแนวทางเทคนิคของตนเอง

ปฏิกิริยาจากวงการ: ต้นทุนประมวลผลข้อมูลคือสนามแข่งขัน AI ที่ซ่อนอยู่

หลัง DeepSeek-OCR เปิดตัว ชุมชนนักพัฒนาให้ความสนใจตัวเลขประสิทธิภาพ “2 แสนหน้าต่อวัน” และความหมายที่มีต่อห่วงโซ่การผลิตข้อมูลฝึกของบริษัท AI ปัจจุบันการฝึกและปรับแต่งโมเดลภาษาขนาดใหญ่กระแสหลักพึ่งพาการแปลง PDF เอกสารสแกน แบบฟอร์มสแกนต่าง ๆ ให้กลายเป็นข้อมูลข้อความที่สะอาดเป็นอย่างมาก ขั้นตอนนี้มักใช้ทรัพยากรคำนวณและแรงงานคนจำนวนมาก หาก DeepSeek-OCR รักษาความแม่นยำไว้ได้พร้อมลดต้นทุนขั้นตอนนี้ลง ก็เท่ากับลดอุปสรรคของการพัฒนาโมเดล AI โดยรวมทางอ้อม นี่คือเหตุผลที่นักพัฒนาหลายฝ่ายมองว่านี่เป็นเครื่องมือระดับโครงสร้างพื้นฐาน ไม่ใช่แค่ “ซอฟต์แวร์รู้จำตัวอักษร” ธรรมดา

สำหรับผู้บริหาร ความสำคัญของข่าวนี้ไม่ได้อยู่ที่เทคโนโลยี OCR เอง แต่อยู่ที่มันตอกย้ำอีกครั้งว่า การแข่งขัน AI ในระยะต่อไปไม่ได้วัดกันแค่ที่ “โมเดลฉลาดแค่ไหน” แต่วัดที่ “ประสิทธิภาพและต้นทุนในการประมวลผลข้อมูล” หากองค์กรของท่านยังมีสัญญากระดาษ รายงาน บันทึกตรวจสอบจำนวนมากที่รอการแปลงเป็นดิจิทัล ความก้าวหน้าของเครื่องมือเปิดซอร์สแบบนี้บ่งชี้ว่าในอนาคตอุปสรรคในการแปลงเอกสารภายในให้ค้นหาและวิเคราะห์ได้จะลดลงเรื่อย ๆ ควรติดตามว่าจะมีเวอร์ชันเชิงพาณิชย์หรือเครื่องมือที่นำไปใช้งานได้ง่ายขึ้นตามมาหรือไม่

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร xAI เปิดตัว Grokipedia สารานุกรมที่สร้างโดย AI ทั้งหมด

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว