本地 PDF、图片字段提取到 Excel:用文档工作台的完整流程
标签:OCR、PDF、Excel、文档处理、本地部署
碰到一摞 PDF 和图片要整理,目标是提取指定的信息输出 Excel——这时候直接跑全文 OCR 往往不管用。
举个例子:交付表要"姓名、编号、日期、金额"四列。全文识别给你一大段文字,你还是得自己从每一页里挨个找这四个字段,再手动填表。
下面是我用的方法:文档工作台,全程本地处理,把 PDF 和图片里的字段抽出来,导出 Excel。
截图里的 LocalDoc Studio 是当前客户端界面名字。
什么情况下适用
先看你的任务符不符合这四条:
- 输入是 PDF、图片,或者混装两者的文件夹。
- 每页要取的信息比较固定。
- 最后要的是 Excel。
- 文件不能往外传,得在本地处理。
如果你的需求是直接写进业务系统、处理没定义字段的复杂表、或者要求不管什么版面都零误差——那这个流程不一定合适,得先把交付标准定清楚。
1. 导入 PDF、图片或文件夹
上传页面里,单个文件也行,整个文件夹也行。
PDF 按页拆,图片进队列。动手前确认一件事:一页是不是 Excel 的一行?如果一页里有多条记录,或者一条记录跨页,先定义拆分规则。
图 1:左边导文件,右边配字段。
2. 配字段
两种方式:
- 自己新建字段名,顺带加描述。
- 导入现成的 Excel 模板,列名自动变成字段。
比如目标表是:
| 客户名称 | 单据编号 | 日期 | 金额 |
|---|
就在文档工作台里配这四个同名字段。导出时它们就是 Excel 列名。
到这一步,真正要紧的不是"能不能做全文识别"——当然能做——而是"字段定义了没有"。没定义字段,全文结果有,但没法按字段导出 Excel。
3. 本机识别和提取
字段配好,OCR 和字段提取都在你电脑上跑:
PDF、图片或文件夹 → 配好字段 → 文档工作台本地识别与提取 → Excel图 2:任务结果可以对照原图和全文识别内容。
省掉的是反复读页、定位字段、整理成表的体力活。复杂材料的业务判断,该你判断还是你判断。
4. 对照原图复核
导出之前,在文档工作台里把原图、全文、字段结果放一起看。重点盯这几类:
- 模糊、倾斜、扫描质量差的页面。
- 编号、日期、金额——不能错。
- 同一字段在每页位置不一样的。
- 字段含义可能有歧义的。
图 3:原始文档和字段结果左右对照,方便人工复核。
工具跑完一轮不等于就能直接交。模糊的、格式怪的、业务上拿不准的,还是得人来确认。
5. 按字段导出 Excel
确认完,字段变成列名,页面结果填成行。多页可以一次导出。
图 4:导出后字段就是列名。
这张 Excel 可以拿去录入系统、做分析、继续整理——接上你已有的流程就行。
适用边界
- 只跑本地,不处理云端文档。
- 当前输入的正式支持是 PDF、图片、文件夹,其他格式没验证过。
- 不保所有文档、所有字段都零误差:版面复杂、图片模糊、对准确率有硬要求的,人工复核省不了。
说到底,好用的流程不是"先转 PDF 再说",而是先把那张 Excel 要什么列想清楚,再让工具去认、去提、去导出。
下载
文档工作台下载链接https://pan.quark.cn/s/9a25a85ba730#/list/share