PDF转Markdown怎么转得准?Dolphin把表格与公式都解析成可编辑文本
【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin
从 PDF 里复制文字常常错位,表格和公式只能对着屏幕重打。Dolphin 是一个开源的 PDF转Markdown 工具:它把文档里的正文、表格、公式、代码分开解析,直接输出可编辑的 Markdown 文件。📄
谁会用 Dolphin 做 PDF转Markdown
读论文要复用公式和表格、整理技术文档、把扫描报告变成可编辑文字,Dolphin 都适用。它支持 PDF 和常见图片格式,多页 PDF 可以逐页处理。
快速上手:安装并完成第一次转换
先克隆仓库并装好依赖:
git clone https://gitcode.com/GitHub_Trending/dolphin33/Dolphin cd Dolphin && pip install -r requirements.txt再从 Hugging Face 下载 Dolphin-v2 预训练模型,放到本地./hf_model目录,然后直接转换仓库自带的示例 PDF:
python demo_page.py --model_path ./hf_model --save_dir ./results \ --input_path ./demo/page_imgs/page_6.pdf结果保存在./results/markdown/下,包含 Markdown 文件、带元素坐标的 JSON 和裁出的图片,可以对照 demo/page_imgs/ 里的原页检查。
核心能力:表格、公式、代码各自怎么被识别
Dolphin 分两步工作:先判断整页的版面和阅读顺序,再把每个元素切出来并行解析。具体表现是:🧩
- 表格输出为 Markdown 表格,保留行列结构
- 公式输出为 LaTeX,块级和行内公式都能识别
- 代码区域转成代码块,保留换行
- 段落、标题按原页面的阅读顺序排列,整体结构与原文一致
含公式、含代码的 PDF 怎么转:可选参数怎么调
默认demo_page.py解析整页。某类内容效果不好时,可改用元素级解析:运行demo_element.py,用--element_type指定 table、formula、text 或 code,单独解析该类型的裁剪区域。
想先确认版面划分与阅读顺序,可单独运行demo_layout.py,只输出版面结构。批量解析多个文件时,还能用--max_batch_size调节并行数量与速度。
转换效果不理想时怎么办
- 公式缺符号:先确认原页是否模糊,换成高分辨率图片再试
- 表格行列错位:用
demo_element.py加--element_type table单独重跑该表格 - 元素顺序混乱(常见于多栏排版):先用
demo_layout.py检查版面阶段是否切分正确,也可把问题页面提交到仓库 issue
Dolphin 是较轻量的 PDF转Markdown 开源方案,适合批量整理论文与技术文档。可以先转换仓库里的样例页,确认效果符合预期后再接手自己的文档。
【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考