專欄 AI 管理編年史 第 135/217 講 查看課程目錄

DeepSeek開源DeepSeek-OCR:用「視覺壓縮」讓AI一天讀懂20萬頁文件

20/10/2025 135
3:59
DeepSeek開源DeepSeek-OCR:用「視覺壓縮」讓AI一天讀懂20萬頁文件

DeepSeek於2025年10月20日在GitHub以MIT授權釋出DeepSeek-OCR,核心技術「上下文光學壓縮」把長文字轉成精簡視覺token再還原,單張A100顯卡每日可處理逾20萬頁文件,大幅降低長文件辨識與AI訓練資料處理的運算成本。

2025年10月20日,中國AI公司DeepSeek在GitHub以MIT授權(可自由商用、修改、再散布)公開釋出新模型DeepSeek-OCR。這是一套端到端的開源文件光學辨識(OCR)與版面理解系統,官方定位不只是「掃描文字」,而是要解決大型語言模型處理長文件時效率低、成本高的問題。根據官方公布的實測數據,單張NVIDIA A100-40G GPU一天可以處理超過20萬頁文件資料,主要用途是為大型語言模型(LLM)與視覺語言模型(VLM)的訓練,快速產生大量可用的文字資料。

核心技術:把文字「拍成照片」再壓縮

DeepSeek-OCR最特別之處在於它的技術路線——官方稱之為「上下文光學壓縮」(Contexts Optical Compression)。傳統OCR是把圖片中的文字逐字辨識輸出,但面對長篇文件,文字量一大,AI模型要處理的token數就會暴增,運算成本隨之飆升。DeepSeek-OCR反其道而行:先把大量文字「視覺化」壓縮成少量的視覺token,再透過輕量化解碼器把這些視覺token還原回完整文字。同樣的文字內容,用視覺token表示所需的運算資源遠少於直接用文字token表示,因此能大幅提高長文件的處理速度,同時壓低運算成本。

與傳統OCR、既有工具的差異

市面上OCR工具多數是針對「單頁掃描辨識精準度」優化,處理長文件時仍需把每頁結果串接、再交由後端AI逐段消化。DeepSeek-OCR則是把「長文件處理效率」本身當成設計目標,並開源釋出模型權重與程式碼,讓開發者可以直接部署、自行訓練調整,而非透過付費API使用。這延續了DeepSeek過去(如DeepSeek-V3.2-Exp、DeepSeek-V3.1)一貫的開源策略:快速累積開發者社群與應用生態,同時展示自身工程優化能力。

業界反應:資料處理成本是AI競賽的隱藏戰場

DeepSeek-OCR釋出後,開發者社群關注焦點多集中在「20萬頁/日」這個效率數字,以及它對AI訓練資料生產鏈的意義。主流大型語言模型的訓練與微調,高度仰賴把PDF、掃描件、表單等非結構化文件轉換成乾淨文字語料,這道前置工程往往耗費大量算力與人力。DeepSeek-OCR若能維持辨識準確度、同時壓低這道工序的成本,等於間接降低整個AI模型開發的門檻,這也是多方開發者將其視為基礎設施層級工具的原因。

對管理者而言,這則新聞再次證明:AI競賽的下一階段比的不只是模型聰不聰明,更是「處理資料的效率與成本」。企業內部如果堆積大量紙本合約、報表、檢驗紀錄等文件亟待數位化,這類開源工具的成熟,代表未來把內部文件轉為可搜尋、可分析資料的門檻會持續降低,值得留意後續是否有更好用的商用化版本或整合工具出現。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 xAI上線Grokipedia:AI全自動生成的百科全書

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策