专栏 AI 管理编年史 第 135/217 讲 查看课程目录

DeepSeek开源DeepSeek-OCR:用“视觉压缩”让AI一天读懂20万页文档

20/10/2025 137
3:59
DeepSeek开源DeepSeek-OCR:用“视觉压缩”让AI一天读懂20万页文档

DeepSeek于2025年10月20日在GitHub以MIT许可证发布DeepSeek-OCR,核心技术“上下文光学压缩”把长文本转成精简视觉token再还原,单张A100显卡每日可处理超20万页文档,大幅降低长文档识别与AI训练数据处理的运算成本。

2025年10月20日,中国AI公司DeepSeek在GitHub以MIT许可证(可自由商用、修改、再分发)公开发布新模型DeepSeek-OCR。这是一套端到端的开源文档光学识别(OCR)与版面理解系统,官方定位不只是“扫描识字”,而是要解决大语言模型处理长文档时效率低、成本高的问题。根据官方公布的实测数据,单张NVIDIA A100-40G GPU一天可以处理超过20万页文档数据,主要用途是为大语言模型(LLM)与视觉语言模型(VLM)的训练,快速生成大量可用的文本数据。

核心技术:把文字“拍成照片”再压缩

DeepSeek-OCR最特别之处在于它的技术路线——官方称之为“上下文光学压缩”(Contexts Optical Compression)。传统OCR是把图片中的文字逐字识别输出,但面对长篇文档,文字量一大,AI模型要处理的token数就会暴增,运算成本随之飙升。DeepSeek-OCR反其道而行:先把大量文字“视觉化”压缩成少量的视觉token,再通过轻量化解码器把这些视觉token还原回完整文字。同样的文字内容,用视觉token表示所需的运算资源远少于直接用文字token表示,因此能大幅提高长文档的处理速度,同时压低运算成本。

与传统OCR、既有工具的差异

市面上OCR工具多数是针对“单页扫描识别精度”优化,处理长文档时仍需把每页结果拼接、再交由后端AI逐段消化。DeepSeek-OCR则是把“长文档处理效率”本身当成设计目标,并开源发布模型权重与代码,让开发者可以直接部署、自行训练调整,而非通过付费API使用。这延续了DeepSeek过去(如DeepSeek-V3.2-Exp、DeepSeek-V3.1)一贯的开源策略:快速累积开发者社区与应用生态,同时展示自身工程优化能力。

业界反应:数据处理成本是AI竞赛的隐藏战场

DeepSeek-OCR发布后,开发者社区关注焦点多集中在“20万页/日”这个效率数字,以及它对AI训练数据生产链的意义。主流大语言模型的训练与微调,高度依赖把PDF、扫描件、表单等非结构化文档转换成干净文本语料,这道前置工程往往耗费大量算力与人力。DeepSeek-OCR若能维持识别准确度、同时压低这道工序的成本,等于间接降低整个AI模型开发的门槛,这也是多方开发者将其视为基础设施层级工具的原因。

对管理者而言,这则新闻再次证明:AI竞赛的下一阶段比拼的不只是模型聪不聪明,更是“处理数据的效率与成本”。企业内部如果堆积大量纸质合同、报表、检验记录等文档亟待数字化,这类开源工具的成熟,意味着未来把内部文档转为可搜索、可分析数据的门槛会持续降低,值得留意后续是否有更好用的商用化版本或集成工具出现。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 xAI上线Grokipedia:AI全自动生成的百科全书

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策