OvisOCR2文档解析OCR模型源码

OvisOCR2文档解析OCR模型源码

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁
资源下载
免费资源
立即下载

OvisOCR2 仓库封面

源码系统概览

文章正文

这套源码对应的是 ATH-MaaS 团队发布的 OvisOCR2,一个走“端到端”路线的轻量文档解析模型。
它只有 0.8B 参数,基于 Qwen3.5-0.8B 做后训练,输入一张文档页面图,直接吐出按自然阅读顺序排列的 Markdown。
和传统的“检测+识别+排版”多阶段流水线不同,OvisOCR2 把文字、公式、表格和图像区域都塞进一个模型里一次生成。

源码简介

OvisOCR2 以 HuggingFace 模型仓库形式发布,协议为 Apache-2.0,仓库内包含模型配置、分词器配置、对话模板与官方推理示例。
模型架构为 Qwen3_5ForConditionalGeneration,图像通过视觉 token 接入,文本部分沿用 Qwen3.5-0.8B 结构。
推理侧官方推荐用 vLLM 部署,README 给出了一个 OvisOCR2Parser 类,几行代码就能把文档图转成结构化 Markdown。

适用场景

  1. 论文与书籍数字化:把扫描页、PDF 页转成可编辑 Markdown,保留公式与表格结构。
  2. 企业文档中台:批量解析合同、报表、票据等版面复杂文档,输出统一 Markdown 供下游检索。
  3. 轻量本地部署:0.8B 体积适合单卡甚至边缘设备跑文档解析,成本低于大模型方案。

功能亮点

  1. 端到端页面级解析:单模型直接输出整页 Markdown,免去检测、识别、版面分析多模块拼接。
  2. 自然阅读顺序:生成结果按人类阅读顺序排列文字、公式、表格与图像区域,不乱序。
  3. 轻量 0.8B 参数:在保持精度的同时显著降低部署成本,适合本地与边缘场景。
  4. SOTA 文档解析成绩:OmniDocBench v1.6 总分 96.58,成为首个登顶该榜单的端到端模型;PureDocBench Avg3 达 75.06。
  5. vLLM 推理示例开箱即用:README 提供 OvisOCR2Parser 封装,含截断重复清理逻辑,方便直接接入业务。

技术架构与部署指南

维度 本套源码 同类通用方案
技术栈 模型底座:Qwen3.5-0.8B 后训练,架构 Qwen3_5ForConditionalGeneration,bfl 依具体方案选型,需自行搭建与维护
部署方式 安装依赖:pip install “vllm==0.22.1” pillow。 多托管于第三方平台或订阅云服务
功能侧重 端到端页面级解析:单模型直接输出整页 Markdown,免去检测、识别、版面分析多模块拼接。 功能通用,定制深度有限
数据归属 数据自持,部署在自有服务器,不出站 数据通常留存于服务商侧
成本模式 获取后自主部署,无持续授权费用 通常按订阅或调用量计费

技术栈与运行环境

  • 模型底座:Qwen3.5-0.8B 后训练,架构 Qwen3_5ForConditionalGeneration,bfloat16 精度。
  • 推理框架:官方示例基于 vLLM 0.22.1(LLM + SamplingParams),支持 tensor_parallel_size 与 gpu_memory_utilization 配置。
  • 图像预处理:transformers 图像处理器,min_pixels / max_pixels 控制输入分辨率(示例 448×448 至 2880×2880)。
  • 输出格式:Markdown,公式转 LaTeX,表格转 HTML table,图像区域用带坐标的 img 标签表示。
  • 依赖:pillow、vllm,模型通过 HuggingFace 加载。

安装与部署提示

  • 安装依赖:pip install “vllm==0.22.1” pillow。
  • 加载模型:用 vLLM 的 LLM(model=”ATH-MaaS/OvisOCR2″) 初始化,apply_chat_template 构造提示词,enable_thinking=False。
  • 图像输入:PIL 读取后通过 multi_modal_data={“image”: image} 传入,可在 mm_processor_kwargs 控制分辨率上下限。
  • 采样参数:max_tokens=16384、temperature=0.0,长文档建议保留较大 token 上限。
  • 仓库下载说明:本包含模型配置与推理示例(权重请从 HuggingFace 拉取,未打包进 zip)。

截图与演示说明

  • README.md:含模型介绍、性能对比图引用与完整 vLLM 推理代码。
  • performance.png、performance_omnidocbench_v16.png、performance_puredocbench.png:三张官方性能对比图,展示 OmniDocBench 与 PureDocBench 成绩。
  • config.json:Qwen3_5ForConditionalGeneration 架构与层类型配置(linear / full attention 交替)。
  • chat_template.jinja:多模态对话模板,定义图像占位符与 vision token 拼接逻辑。
  • tokenizer_config.json、preprocessor_config.json、video_preprocessor_config.json:分词与图像预处理配置。

部署后可补充实际解析效果截图。

常见问题

  1. 这是应用源码还是模型权重?OvisOCR2 以模型仓库形式发布,本包包含配置、对话模板与官方 vLLM 推理示例,模型权重需从 HuggingFace 下载。
  2. 和 Ovis 系列什么关系?模型基于 Qwen3.5-0.8B 后训练,走端到端文档解析路线,推理复用 transformers / vLLM 生态,无独立大型代码仓库。

安全风险提示

特别提示:本源码未检测安全风险文件,下载后请务必进行安全审计,删除恶意代码后再部署使用!

下载说明

源码已打包为 zip,包含模型配置、对话模板、分词配置与官方推理示例(权重未包含,请从 HuggingFace 获取)。
HuggingFace模型地址:https://huggingface.co/ATH-MaaS/OvisOCR2

资源下载
下载价格免费
本文章资源https://www.aosen.cc/mianfei3224.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码