PDF转Markdown怎么转得准?Dolphin把表格与公式都解析成可编辑文本
2026/9/19 6:06:28 网站建设 项目流程

PDF转Markdown怎么转得准?Dolphin把表格与公式都解析成可编辑文本

【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin

从 PDF 里复制文字常常错位,表格和公式只能对着屏幕重打。Dolphin 是一个开源的 PDF转Markdown 工具:它把文档里的正文、表格、公式、代码分开解析,直接输出可编辑的 Markdown 文件。📄

谁会用 Dolphin 做 PDF转Markdown

读论文要复用公式和表格、整理技术文档、把扫描报告变成可编辑文字,Dolphin 都适用。它支持 PDF 和常见图片格式,多页 PDF 可以逐页处理。

快速上手:安装并完成第一次转换

先克隆仓库并装好依赖:

git clone https://gitcode.com/GitHub_Trending/dolphin33/Dolphin cd Dolphin && pip install -r requirements.txt

再从 Hugging Face 下载 Dolphin-v2 预训练模型,放到本地./hf_model目录,然后直接转换仓库自带的示例 PDF:

python demo_page.py --model_path ./hf_model --save_dir ./results \ --input_path ./demo/page_imgs/page_6.pdf

结果保存在./results/markdown/下,包含 Markdown 文件、带元素坐标的 JSON 和裁出的图片,可以对照 demo/page_imgs/ 里的原页检查。

核心能力:表格、公式、代码各自怎么被识别

Dolphin 分两步工作:先判断整页的版面和阅读顺序,再把每个元素切出来并行解析。具体表现是:🧩

  • 表格输出为 Markdown 表格,保留行列结构
  • 公式输出为 LaTeX,块级和行内公式都能识别
  • 代码区域转成代码块,保留换行
  • 段落、标题按原页面的阅读顺序排列,整体结构与原文一致

含公式、含代码的 PDF 怎么转:可选参数怎么调

默认demo_page.py解析整页。某类内容效果不好时,可改用元素级解析:运行demo_element.py,用--element_type指定 table、formula、text 或 code,单独解析该类型的裁剪区域。

想先确认版面划分与阅读顺序,可单独运行demo_layout.py,只输出版面结构。批量解析多个文件时,还能用--max_batch_size调节并行数量与速度。

转换效果不理想时怎么办

  • 公式缺符号:先确认原页是否模糊,换成高分辨率图片再试
  • 表格行列错位:用demo_element.py--element_type table单独重跑该表格
  • 元素顺序混乱(常见于多栏排版):先用demo_layout.py检查版面阶段是否切分正确,也可把问题页面提交到仓库 issue

Dolphin 是较轻量的 PDF转Markdown 开源方案,适合批量整理论文与技术文档。可以先转换仓库里的样例页,确认效果符合预期后再接手自己的文档。

【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询