
源码系统概览
文章正文
这套源码对应的是 ATH-MaaS 团队发布的 OvisOCR2,一个走“端到端”路线的轻量文档解析模型。
它只有 0.8B 参数,基于 Qwen3.5-0.8B 做后训练,输入一张文档页面图,直接吐出按自然阅读顺序排列的 Markdown。
和传统的“检测+识别+排版”多阶段流水线不同,OvisOCR2 把文字、公式、表格和图像区域都塞进一个模型里一次生成。
源码简介
OvisOCR2 以 HuggingFace 模型仓库形式发布,协议为 Apache-2.0,仓库内包含模型配置、分词器配置、对话模板与官方推理示例。
模型架构为 Qwen3_5ForConditionalGeneration,图像通过视觉 token 接入,文本部分沿用 Qwen3.5-0.8B 结构。
推理侧官方推荐用 vLLM 部署,README 给出了一个 OvisOCR2Parser 类,几行代码就能把文档图转成结构化 Markdown。
适用场景
- 论文与书籍数字化:把扫描页、PDF 页转成可编辑 Markdown,保留公式与表格结构。
- 企业文档中台:批量解析合同、报表、票据等版面复杂文档,输出统一 Markdown 供下游检索。
- 轻量本地部署:0.8B 体积适合单卡甚至边缘设备跑文档解析,成本低于大模型方案。
功能亮点
- 端到端页面级解析:单模型直接输出整页 Markdown,免去检测、识别、版面分析多模块拼接。
- 自然阅读顺序:生成结果按人类阅读顺序排列文字、公式、表格与图像区域,不乱序。
- 轻量 0.8B 参数:在保持精度的同时显著降低部署成本,适合本地与边缘场景。
- SOTA 文档解析成绩:OmniDocBench v1.6 总分 96.58,成为首个登顶该榜单的端到端模型;PureDocBench Avg3 达 75.06。
- vLLM 推理示例开箱即用:README 提供 OvisOCR2Parser 封装,含截断重复清理逻辑,方便直接接入业务。
技术架构与部署指南
| 维度 | 本套源码 | 同类通用方案 |
|---|---|---|
| 技术栈 | 模型底座:Qwen3.5-0.8B 后训练,架构 Qwen3_5ForConditionalGeneration,bfl | 依具体方案选型,需自行搭建与维护 |
| 部署方式 | 安装依赖:pip install “vllm==0.22.1” pillow。 | 多托管于第三方平台或订阅云服务 |
| 功能侧重 | 端到端页面级解析:单模型直接输出整页 Markdown,免去检测、识别、版面分析多模块拼接。 | 功能通用,定制深度有限 |
| 数据归属 | 数据自持,部署在自有服务器,不出站 | 数据通常留存于服务商侧 |
| 成本模式 | 获取后自主部署,无持续授权费用 | 通常按订阅或调用量计费 |
技术栈与运行环境
- 模型底座:Qwen3.5-0.8B 后训练,架构 Qwen3_5ForConditionalGeneration,bfloat16 精度。
- 推理框架:官方示例基于 vLLM 0.22.1(LLM + SamplingParams),支持 tensor_parallel_size 与 gpu_memory_utilization 配置。
- 图像预处理:transformers 图像处理器,min_pixels / max_pixels 控制输入分辨率(示例 448×448 至 2880×2880)。
- 输出格式:Markdown,公式转 LaTeX,表格转 HTML table,图像区域用带坐标的 img 标签表示。
- 依赖:pillow、vllm,模型通过 HuggingFace 加载。
安装与部署提示
- 安装依赖:pip install “vllm==0.22.1” pillow。
- 加载模型:用 vLLM 的 LLM(model=”ATH-MaaS/OvisOCR2″) 初始化,apply_chat_template 构造提示词,enable_thinking=False。
- 图像输入:PIL 读取后通过 multi_modal_data={“image”: image} 传入,可在 mm_processor_kwargs 控制分辨率上下限。
- 采样参数:max_tokens=16384、temperature=0.0,长文档建议保留较大 token 上限。
- 仓库下载说明:本包含模型配置与推理示例(权重请从 HuggingFace 拉取,未打包进 zip)。
截图与演示说明
- README.md:含模型介绍、性能对比图引用与完整 vLLM 推理代码。
- performance.png、performance_omnidocbench_v16.png、performance_puredocbench.png:三张官方性能对比图,展示 OmniDocBench 与 PureDocBench 成绩。
- config.json:Qwen3_5ForConditionalGeneration 架构与层类型配置(linear / full attention 交替)。
- chat_template.jinja:多模态对话模板,定义图像占位符与 vision token 拼接逻辑。
- tokenizer_config.json、preprocessor_config.json、video_preprocessor_config.json:分词与图像预处理配置。
部署后可补充实际解析效果截图。
常见问题
- 这是应用源码还是模型权重?OvisOCR2 以模型仓库形式发布,本包包含配置、对话模板与官方 vLLM 推理示例,模型权重需从 HuggingFace 下载。
- 和 Ovis 系列什么关系?模型基于 Qwen3.5-0.8B 后训练,走端到端文档解析路线,推理复用 transformers / vLLM 生态,无独立大型代码仓库。
安全风险提示
特别提示:本源码未检测安全风险文件,下载后请务必进行安全审计,删除恶意代码后再部署使用!
下载说明
源码已打包为 zip,包含模型配置、对话模板、分词配置与官方推理示例(权重未包含,请从 HuggingFace 获取)。
HuggingFace模型地址:https://huggingface.co/ATH-MaaS/OvisOCR2
资源下载
下载价格免费
本文章资源https://www.aosen.cc/mianfei3224.html来源于互联网,如存在侵权,请联系我们立马删除!