PaddleOCR-VL-1.5 算法解析:0.9B 紧凑 VLM 在文档解析与真实场景畸变鲁棒性上的 SOTA 方案
【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR
PaddleOCR-VL-1.5 是 PaddleOCR 项目在初代 PaddleOCR-VL 基础上的重大升级,以 0.9B 超紧凑 VLM 参数量在 OmniDocBench v1.5 文档解析基准上取得 94.5% 的新 SOTA 结果,并引入不规则形状定位(异形框)能力,在扫描、弯曲、倾斜、屏摄、光照变化五个真实场景中均取得领先表现。本文以官方算法文档为主体,结合仓库中的使用教程与源码实现,系统讲解该模型的五大核心特性、两阶段技术架构、基准评测体系(OmniDocBench v1.5 与 Real5-OmniDocBench)、推理部署性能,并给出在当前仓库中的实际接入方式,帮助开发者快速理解并落地这一文档解析方案。
一、模型简介与关键指标
PaddleOCR-VL-1.5在 1.0 版本基础上进行了能力的进一步扩展和升级优化,在文档解析基准 OmniDocBench v1.5 上取得了 94.5% 的更高 SOTA(最佳)结果。为了严格评估其对现实世界物理畸变的鲁棒性——包括扫描伪影、倾斜、弯曲、屏摄和光照变化——官方提出了 Real5-OmniDocBench 基准测试。实验结果表明,该增强模型在这一新构建的基准测试中各个场景均达到 SOTA 性能。此外,模型通过加入印章识别和文字检测识别任务扩展了能力边界,同时保持了 0.9B 的超紧凑 VLM 规模和高效率。
关键指标(以官方算法文档声明的数据为准):
- 参数量:0.9B,属于超紧凑 VLM 规模;
- OmniDocBench v1.5:94.5% 准确率,超越此前的 SOTA 模型 PaddleOCR-VL(v1);
- Real5-OmniDocBench:在扫描、弯曲、倾斜、屏摄、光照五个真实扰动场景中均达到 SOTA;
- 新增能力:文本行定位与识别(spotting)、印章识别(seal recognition),相关指标均在各自任务中创下新 SOTA。
需要特别说明的是,该模型属于 PaddleOCR-VL 系列。仓库中与之一脉相承的还有 PaddleOCR-VL 初代算法文档(支持 109 种语言)以及 PaddleOCR-VL-1.6 算法文档(在 OmniDocBench v1.6 上达到 96.33%),本篇文章聚焦 1.5 版本的算法能力与部署细节。
二、五大核心特性
1. 文档解析的 SOTA 性能
凭借 0.9B 的参数量,PaddleOCR-VL-1.5 在 OmniDocBench v1.5 上达到了 94.5% 的准确率,超越了之前的 SOTA 模型 PaddleOCR-VL(v1)。在表格、公式和文本识别方面观察到了显著提升。
2. 现实 5 大场景文档解析的 SOTA 性能
引入了一种创新的文档解析方法,支持不规则形状定位,能够在文档倾斜和弯曲条件下实现精确的多边形检测。在扫描、弯曲、倾斜、屏摄和光照变化这五个现实场景的评估中,表现优于主流的开源和闭源模型。这意味着模型不再局限于轴对齐矩形框,而是可以输出贴合文字行真实走向的多边形轮廓,从而在物理畸变严重的文档图像上依然保持稳定解析。
3. 0.9B 紧凑架构扩充能力
模型在保持 0.9B 紧凑架构的前提下,新增了文本行定位与识别(spotting)以及印章识别两个任务,所有相关指标均在各自任务中创下了新的 SOTA 结果。紧凑的参数量意味着更低的显存占用与推理成本,为边缘部署和批量处理提供了可能。
4. 强化多元素识别能力
PaddleOCR-VL-1.5 进一步增强了在特定场景和多语言识别方面的能力。针对特殊符号、古籍、多语言表格、下划线和复选框的识别性能得到提升,语言覆盖范围扩展至包括中国藏文和孟加拉语。
5. 长文档跨页解析
模型支持跨页表格自动合并和跨页段落标题识别,有效缓解了长文档解析中的内容碎片化问题。该能力与使用侧提供的页面重建接口(见下文第七节)相配合,可将多页 PDF 解析结果整合为结构连贯的完整文档。
三、技术架构:版面分析 + VLM 识别的两阶段流程
PaddleOCR-VL-1.5 的整体流程与 PaddleOCR-VL 系列一致,由版面分析与VLM 识别两个核心阶段组成,这在 PaddleOCR-VL 使用教程中有明确描述:
- 第一阶段:版面分析。模型以整图作为输入,检测并定位图像中的各类版面元素(例如表格、公式等),同时确定其阅读顺序,并根据检测结果裁剪出对应的元素子图;
- 第二阶段:VLM 识别。将每个子图独立输入 VLM,生成对应的识别结果(例如 Markdown 文本),随后再按照版面分析阶段给出的顺序对各元素结果进行合并,得到整幅图像的完整解析结果。
因此,若需使用 PaddleOCR-VL 的完整能力,必须采用版面分析与 VLM 识别协同的完整流程,而不能仅单独使用 VLM。PaddleOCR-VL-1.5 针对真实场景引入的不规则形状(多边形)定位能力,正是作用于第一阶段版面分析,使其在文档倾斜和弯曲条件下依然能够精确裁剪元素子图,供第二阶段 VLM 识别。
注意:PaddleOCR-VL-0.9B 是完整流程中的VLM 组件,并非 PaddleOCR-VL 的一个模型变种。官方文档特别提醒:如果出现无法复现论文或官方精度、模型输出大量幻觉文本等问题,首先应确认使用的是完整的 PaddleOCR-VL 流程,而不是仅通过 Transformers 本地执行或直接请求 vLLM / SGLang / FastDeploy 服务等方式单独使用 VLM 组件。
从仓库源码也可以印证版本与产线的对应关系。在 paddleocr/_pipelines/paddleocr_vl.py 中:
_AVAILABLE_PIPELINE_VERSIONS = ["v1", "v1.5", "v1.6"] _DEFAULT_PIPELINE_VERSION = "v1.6"而PaddleOCRVL类的_paddlex_pipeline_name属性(paddleocr/_pipelines/paddleocr_vl.py)将pipeline_version="v1.5"映射到名为PaddleOCR-VL-1.5的 PaddleX 产线,开发者可以通过pipeline_version参数显式选择 1.5 版本产线。
四、模型性能评测
1. OmniDocBench v1.5 基准
PaddleOCR-VL-1.5 在 OmniDocBench v1.5 上的整体、文本、公式、表格和阅读顺序中均达到最先进的性能。官方算法文档注明,性能指标引自 OmniDocBench 官方排行榜(Gemini-3 Pro、Qwen3-VL-235B-A22B-Instruct 和本模型除外)。
2. Real5-OmniDocBench 基准
在扫描(Scanning)、扭曲(Warping)、屏摄(Screen-photography)、光照(Illumination)和倾斜(Skew)这五个多样化且具挑战性的场景中,PaddleOCR-VL-1.5 均创下了新的 SOTA 记录。
Real5-OmniDocBench 是 PaddleOCR 团队基于 OmniDocBench v1.5 数据集构建的、面向真实场景的全新基准测试。与常规干净扫描文档评测不同,该基准刻意引入真实世界中的物理畸变,用于检验模型在"开箱即用"条件下的鲁棒性——这正是 1.5 版本引入不规则形状定位能力所要解决的问题。
五、推理部署性能
官方在 OmniDocBench v1.5 上对 PaddleOCR-VL-1.5 进行了端到端推理性能对比:PDF 文档在单张 NVIDIA A100 GPU 上以 512 的 batch size 进行处理,报告的端到端运行时间包含 PDF 渲染和 Markdown 生成,所有方法均依赖其内置的 PDF 解析模块和默认 DPI 设置,以反映开箱即用的性能。
值得说明的是,PaddleOCR-VL 系列的推理工作流程引入了多线程异步执行机制(详见 PaddleOCR-VL 初代算法文档):整个流程分为三个主要阶段——数据加载(例如将 PDF 页面渲染为图像)、布局模型处理和 VLM 推理,每个阶段在单独的线程中运行,数据通过队列在相邻阶段之间传输,从而实现并发执行以提高效率。这一设计在使用侧对应use_queues参数(默认开启),对于页数较多的 PDF 文档或包含大量文件的目录尤其高效。
六、可视化效果
官方算法文档展示了多组可视化案例,直观呈现模型在真实场景下的解析效果:
- 现实场景文档:分别展示光照(light)、倾斜(skew)、屏摄(screen)、扫描(scanning)、弯曲/扭曲(curving)五种扰动条件下的文档解析结果,体现不规则形状定位带来的鲁棒性;
- 文本定位与识别(spotting):展示模型在文本行级定位与识别上的表现;
- 印章识别(seal):展示新增的印章识别任务效果。
七、实际接入方式(结合仓库使用教程与源码)
PaddleOCR 为 PaddleOCR-VL 系列模型提供了统一接口。以下要点均来自 PaddleOCR-VL 使用教程 与源码 paddleocr/_pipelines/paddleocr_vl.py,帮助开发者把 1.5 版本落地到自己的项目中。
1. 环境准备与安装
教程支持 x64 CPU 和除 Blackwell 之外的 NVIDIA GPU,推荐使用官方 Docker 镜像(要求 Docker >= 19.03,NVIDIA 驱动支持 CUDA 12.6+):
docker run \ -it \ --gpus all \ --network host \ --user root \ ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddleocr-vl:latest-nvidia-gpu \ /bin/bash也可以手动安装(Python 3.9–3.13 已验证):先安装 3.2.1 及以上版本 PaddlePaddle(CPU/GPU 版本不允许同时安装),再执行:
python -m pip install -U "paddleocr[doc-parser]"2. 命令行快速体验
doc_parser是 PaddleOCR-VL 产线的 CLI 子命令(见源码 paddleocr/_pipelines/paddleocr_vl.py)。要使用 1.5 版本产线,可通过--pipeline_version v1.5显式指定:
paddleocr doc_parser -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/paddleocr_vl_demo.png --pipeline_version v1.5 --save_path ./output常用开关参数包括:
--use_doc_orientation_classify True:启用文档方向分类(默认 False);--use_doc_unwarping True:启用文本图像矫正(默认 False);--use_layout_detection False:关闭版面分析、仅使用 VLM 组件(默认 True);--engine transformers:切换到 transformers 引擎。
3. Python API 集成
from paddleocr import PaddleOCRVL pipeline = PaddleOCRVL(pipeline_version="v1.5") output = pipeline.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/paddleocr_vl_demo.png") for res in output: res.print() # 打印结构化输出 res.save_to_json(save_path="./output") res.save_to_markdown(save_path="./output") res.save_to_word(save_path="./output")4. 长文档跨页重建
1.5 版本支持的跨页表格合并、跨页标题识别,对应 Python 侧的restructure_pages()方法:
pipeline = PaddleOCRVL(pipeline_version="v1.5") output = pipeline.predict(input="./your_pdf_file.pdf") pages_res = list(output) output = pipeline.restructure_pages(pages_res, merge_tables=True, relevel_titles=True)其中merge_tables控制跨页表格合并(默认 True)、relevel_titles控制多级标题重建(默认 True)、concatenate_pages控制是否合并多页结果为一页(默认 False)。
5. VLM 推理服务接入
如需提升生产环境推理性能,可将 VLM 推理交给专用服务(vLLM / SGLang / FastDeploy 等),客户端继续负责版面分析等环节。通过--vl_rec_backend vllm-server --vl_rec_server_url http://localhost:8118/v1指定后端与地址,支持vllm-server、sglang-server、fastdeploy-server、mlx-vlm-server、llama-cpp-server五种后端(源码_SUPPORTED_VL_BACKENDS常量可见,paddleocr/_pipelines/paddleocr_vl.py)。
八、常见问题(FAQ)
结合 PaddleOCR-VL 初代算法文档 中的 FAQ 与使用教程,以下问题对 1.5 版本同样适用:
- 如何使用 PaddleOCR-VL 做文档解析?参考 PaddleOCR-VL 使用教程,通过 CLI 或 Python API 调用完整流程;
- 如何开启图表识别?默认关闭,设置
use_chart_recognition=True(CLI 参数--use_chart_recognition True)即可开启; - 版面检测结果不理想怎么办?若测试数据是非标准文档(如车牌、火车票、身份证),可设置
use_layout_detection=False直接使用 VLM 组件单独识别;1.5 版本对应的单独识别任务可通过prompt_label指定,可选值为ocr、formula、table、seal、chart、spotting(仅当use_layout_detection=False时生效); - 长文档解析内容碎片化如何缓解?使用
restructure_pages()开启跨页表格合并与标题重建(默认开启),并结合use_queues=True的多线程流水线提升长文档处理效率。
总结
PaddleOCR-VL-1.5 以 0.9B 紧凑参数量实现了文档解析(OmniDocBench v1.5,94.5%)、真实场景鲁棒性(Real5-OmniDocBench 五场景 SOTA)与新增能力(文本定位识别、印章识别、长文档跨页解析)的全面升级。其在仓库中的落地路径清晰:通过 算法文档 理解模型能力,通过 使用教程 完成部署接入,通过 源码实现 掌握版本映射与参数体系,即可在真实业务中快速构建鲁棒的文档解析能力。
【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考