☰
Umi-OCR 完全指南:5 分钟上手的免费离线 OCR 工具
2026/10/2 1:42:16 网站建设 项目流程

Umi-OCR 完全指南:5 分钟上手的免费离线 OCR 工具

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款开源免费的离线 OCR 软件,解压即用、无需联网,把截图、图片、PDF 里的文字提取成可复制文本。自带识别引擎和多语言识别库,图片全程不出本机,敏感内容也能放心处理。

最快上手:3 分钟跑通第一次识别

  1. 从项目发布页下载.7z压缩包(或.7z.exe自解压包),解压到任意目录。
  2. 双击Umi-OCR.exe启动(Linux 下运行umi-ocr.sh)。无需安装、不产生注册表垃圾,首次打开会自动跟随系统语言切换界面。
  3. 打开"截图OCR"标签页,按下截图快捷键,框选屏幕上任意一段文字,松开鼠标,识别结果立刻出现在右侧记录栏。

左侧是图片预览,可以鼠标划选文字直接复制;右侧记录栏支持编辑、多选记录、整条复制。懒得截图的话,在别处复制一张图片后直接粘贴进 Umi-OCR 也能识别。从框选到拿到文字,通常不到 3 秒。

按场景拆功能

场景一:随手截图,拿到干净有序的文字

多栏排版的页面直接按引擎原始输出,文字顺序容易乱。Umi-OCR 提供排版解析:选"多栏-按自然段换行"还原正常阅读顺序;选"单栏-保留缩进"则专门对付代码截图,行首缩进和行内空格原样保留。横排、竖排(从右到左)文字都能自动处理,识别日文竖排内容尤其顺手。

场景二:整文件夹批量转文字

几百张扫描件、照片要逐个点?"批量OCR"标签页一次接住:拖入图片后点击开始任务即可。支持 jpg、png、webp、bmp、tif 等常见格式,没有数量上限;结果可导出为 txt、jsonl、md、csv(Excel)等格式。两个实用细节:水印、页眉页脚位置可以用"忽略区域"框选排除,避免混进结果;任务完成后可设置自动关机或待机,睡前挂任务、起床收结果。

场景三:整本 PDF 变可搜索文档

"文档识别"标签页支持 pdf、xps、epub、mobi、fb2、cbz 等格式。扫描件走 OCR,已有文本的文档直接提取,最终可输出双层可搜索 PDF——文字层叠在图片层之上,之后在 PDF 里直接搜索、复制都行。忽略区域同样适用,把每页页眉页脚排除干净。

场景四:顺手扫码、生成二维码

"二维码"标签页支持截图、粘贴或拖入图片识别二维码与条形码,支持一图多码和 19 种编码协议;反过来输入文本也能直接生成二维码图片,可指定纠错等级等参数。日常收付款码、文档里的链接码,识别生成都在同一个工具里闭环。

底气在哪:离线引擎与兼容性

识别引擎直接内置在软件里:自带 PaddleOCR-json 与 RapidOCR-json 两套离线引擎,内置简中、繁中、英文、日文等多语言识别库。识别过程不经过任何云端接口,Windows 7 x64 和 Linux x64 都能运行,老电脑也带得动。

界面本身也可调:全局设置里支持十余种界面语言切换、多个亮/暗主题、字体与字号调整。若截图时出现闪烁或界面错位,多半是渲染兼容问题,切换渲染方案或关闭硬件加速即可。

进阶集成:命令行与 HTTP 接口

界面点按之外,还有两条自动化通道。命令行入口就是主程序,例如把整个文件夹的图片识别结果写入文件:

umi-ocr --path "扫描件目录" --output "输出.txt"

--path支持传入多个文件或文件夹路径;--output覆盖写入,--output_append追加写入,--clip直接进剪贴板。需要程序化调用时,HTTP 接口提供图片 OCR、文档识别、二维码识别/生成等端点,默认监听127.0.0.1:1224,全局设置中勾选"高级"可见服务开关。完整参数与示例见 docs/README_CLI.md 和 docs/http/README.md,文档识别调用还附带了 Python 与 Web 示例代码(docs/http/api_doc_demo.py)。

下一步

下载一个发布包,先用快捷键跑通一次截图识别,再挑几张带水印的图试一遍忽略区域。项目通过 Weblate 平台协作界面翻译(dev-tools/翻译步骤(简易).md 有操作指引),欢迎补充翻译或在仓库提交 Issue 反馈问题。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询