Umi-OCR 实战教程:三个场景跑通截图取字、批量识别与 PDF 搜索,全程离线
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
截图里想抠出文字、一文件夹扫描件没法一张张处理、PDF 全文搜索一片空白——这些事 Umi-OCR 都能一次办到。它是一款免费开源的离线 OCR 软件,解压即用,不上传图片、不依赖网络,识别全部在你自己的电脑里完成。
解压后三步跑通第一次识别
发布包是.7z压缩包(也有.7z.exe自解压版),支持 Windows 7 x64 与 Linux x64,没有安装器。
- 解压后双击
Umi-OCR.exe(Linux 下运行umi-ocr.sh),首次打开界面语言会跟随系统自动切换。 - 进「全局设置」页:语言、主题、字体、开机自启、OCR 引擎插件都在这里,顺手把自启加上。
- 切到「截图 OCR」页,按快捷键唤起截图(快捷键在该页设置里改),鼠标框选区域,按
Esc可随时取消。
识别完成后文字出现在右侧「记录」栏,点一下即复制,最短路径就此跑通:截图 → 识别 → 复制。
📸 把教程截图里的代码直接贴进 IDE
想把教程、视频截图里的代码拷进编辑器,手敲一遍既慢又容易漏空格,普通识别还会把缩进吞掉,这一节就解决这件事。
- 在「截图 OCR」页框选代码区域。
- 打开右侧设置面板,把「排版解析」选为单栏-保留缩进——它专为代码设计,行首缩进和行中空格原样保留。
- 识别完成后,在记录栏选中结果直接复制。
验证很简单:粘进 IDE 或 Markdown 预览,缩进层级和原图一致、没有多余空格,就过关了。
坑预警:默认的「多栏-按自然段换行」是为报纸式排版设计的(自动识别栏序、按段换行),拿它处理代码会丢掉缩进;反过来,多栏报纸、公文这类文档保持默认的多栏方案即可,阅读顺序会自动排对。
批量识别整个扫描图文件夹,输出 txt 或 Excel
几十上百张扫描文档、票据或拍照图,一张一张过不现实,批量页一次处理完。
- 打开「批量 OCR」页,点「选择图片」或直接拖入文件夹。输入支持
jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff,无数量上限。 - 选定输出格式:
txt / jsonl / md / csv(Excel)。 - 点「开始任务」,列表逐张显示识别耗时与置信度。
验证:随机抽 3 张,对照左侧预览和右侧记录;置信度(0~1)低于 0.8 的几张重点人工核对。
常见坑有两个:每张图都有固定位置的水印或 LOGO 时,进右侧设置的忽略区域编辑器,按住右键画矩形把水印罩住——只有整个文本块完整落在框内才会被丢弃,所以框画大一点更稳;图片像素超大的长图,先把「设置 → 文字识别 →限制图像边长」从默认 960 调到 2880 或 4320,否则图片会先被压缩、小字发糊。
把扫描版 PDF 变成可搜索的文件
PDF 是纯图片扫描件,全文搜索一片空白,想引用一句话却找不到在哪页,文档识别页(v2.1.0 及以上版本)就是干这个的。
- 打开「文档识别」标签页,拖入文件,支持
pdf / xps / epub / mobi / fb2 / cbz。 - 只想要正文的话,设定忽略区域把页眉页脚排除掉。
- 任务完成后得到双层可搜索 PDF:原图还在底层,识别出的文字藏在顶层。
验证:打开生成的 PDF,用 Ctrl+F 搜一个只出现在正文里的词,能直接跳到对应页,说明文字层写对了。
坑预警:页眉、页脚、页码的文字会被原样识别进结果,记得提前画好忽略区域省得返工;想挂机批量跑大批文档,可在设置里勾「任务完成后自动关机」。
记牢这 5 个设置项:缩进、大图、多栏
日常基本只用得着这几项,其余保持默认:
| 设置项 | 何时用 | 建议值 | 为什么 |
|---|---|---|---|
| 排版解析 | 代码截图 | 单栏-保留缩进 | 保留行首缩进与行中空格,粘了就能用 |
| 排版解析 | 多栏报纸、长文档 | 多栏-按自然段换行 | 默认方案,自动处理多栏阅读顺序 |
| 限制图像边长 | 高分辨率大图、小字多 | 2880 或 4320 | 默认 960 会先压缩大图,小字易糊 |
| 语言/模型库 | 纯英文文档、纯代码 | models/config_en.txt | 有专门的英文模型库,英文场景更准 |
| OCR 引擎插件 | 初次使用 | Rapid-OCR(自带) | 兼容性好、速度够用,也可在全局设置切换 Paddle-OCR |
界面改动会自动存到UmiOCR-data/.settings(ini 格式),可以手改,改完执行umi-ocr --reload重载即可(v2.1.5 以上支持)。
🚀 用命令行与 HTTP 接入 OCR 自动化
跨进程调用依赖本地 HTTP 服务(默认开启,主机保持「仅本地」即可),默认端口1224。两条路任选:
命令行(umi-ocr即Umi-OCR.exe的简写):
umi-ocr --screenshot --clip # 截图取字,结果进剪贴板 umi-ocr --path "D:/docs" --output "结果.txt" # 整个文件夹批量识别 umi-ocr --qrcode_read "D:/code.png" # 识别二维码HTTP 接口(任何语言都能接):
GET http://127.0.0.1:1224/api/ocr/get_options # 查询全部参数与默认值 POST http://127.0.0.1:1224/api/ocr # 传 base64 图片 + options,返回识别文本请求体是一个 JSON:base64放图片编码,options放「语言/模型库」「排版解析」等选项。完整参数表见 图片识别接口文档,文档识别也有上传/查询/下载接口,细节看 api_doc.md。
四个常见识别问题速查
| 症状 | 原因 | 解决 |
|---|---|---|
| 识别顺序错乱、读不通 | 排版解析方案与图片排版不匹配 | 代码选「单栏-保留缩进」;多栏文档用默认多栏方案 |
| 大图里小字认错 | 默认边长 960 先把图片压缩了 | 「限制图像边长」调到 2880 或 4320 |
| 水印、LOGO、页眉混进结果 | 该区域的文本块被一起识别 | 批量/文档识别中画忽略区域,整个文本块罩住 |
| 命令行或 HTTP 调用无反应 | HTTP 服务没开 | 全局设置勾选允许 HTTP 服务,主机选「仅本地」 |
把 Umi-OCR 当成你电脑里随叫随到的文字提取组件:截图取字、批量导出、PDF 补文字层,入口都固定,离线完成、图片不出机器。建议先在截图页练熟,再上批量与文档页;各命令的完整参数在 命令行手册,接口用法汇总在 HTTP 接口手册。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考