Umi-OCR 完整指南:5分钟上手免费离线的文字识别神器
Umi-OCR 完整指南:5分钟上手免费离线的文字识别神器
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
你是不是也遇到过这种时刻:屏幕上明明有字,却怎么都复制不下来——网页里那张图、聊天记录里的代码片段、PDF 扫描件里的一句话,只能瞪着它一个字一个字手打。打开在线识别网站?图片要上传、次数有限制,敏感内容也不敢往外传。今天要介绍的 Umi-OCR,就是一款开源、免费、完全离线的 OCR 软件,解压即用,把图片、截图、PDF 里的文字干净利落地提取出来,全程不需要联网。
它凭什么敢"离线"?先聊聊识别引擎
很多 OCR 工具靠云端接口工作,识别一次就要把图片传上去一次。Umi-OCR 反其道而行——它把识别引擎直接内置到软件里,自带 PaddleOCR-json 和 RapidOCR-json 两套离线引擎,并支持简体中文、繁体中文、英文、日文等多语言识别库。这意味着你的图片从头到尾不出本机,合同、证件、私人笔记这类内容可以放心处理。同时它兼容 Windows 7 和 Linux,老电脑也能跑得动。
第一步:解压、双击,3分钟跑通第一次识别
这款软件无需安装。下载.7z压缩包解压后,直接双击Umi-OCR.exe就能启动,Linux 下运行umi-ocr.sh即可。第一次打开,它会按你的系统语言自动切换界面。
最常用的场景是截图识别:按下默认快捷键 Ctrl+Shift+S,用鼠标框选屏幕上的文字区域,松开后结果立刻出现在右侧记录栏里,可以直接划选复制,也能右键调出"复制全部"之类的快捷操作。如果你在别处复制了一张图片,甚至不用截图,粘贴进来就能识别。从按下快捷键到拿到文字,整个过程用不了几秒钟。
识别结果乱糟糟?排版解析帮你理干净
截下来的页面往往是多栏排版,如果直接按识别引擎的原始输出读,文字顺序可能跳来跳去。Umi-OCR 内置了排版解析功能:选择"多栏-按自然段换行",就能还原正常的阅读顺序;选择"单栏-保留缩进",则是专门对付代码截图的——缩进和空格都会被原样保留,程序员看到一段代码截图再也不用逐字重敲了。横排、竖排文字都能自动处理,识别日文竖排内容时尤其好用。
几百张图片要转文字?把任务挂上就去忙别的
如果你的素材不是一张两张,而是整个文件夹的扫描件或照片,就该轮到批量 OCR 上场了。把图片拖进"批量 OCR"标签页,点击开始,剩下的交给软件:
- 支持 jpg、png、webp、bmp、tif 等常见格式,没有数量上限,一次塞几百张也没问题;
- 结果可以导出为 txt、jsonl、md、csv(Excel)等格式,方便后续加工;
- 识别完成后还能选择自动关机或待机,睡前挂上任务,第二天直接收结果。
批量页面里还藏着一个贴心功能——忽略区域。如果图片角落带着水印、页眉页脚,你可以在编辑器里用鼠标框出这些区域,识别时自动跳过,防止水印文字混进结果里。
纸质书、扫描件、电子书:一键变成可搜索的 PDF
批量 OCR 只处理图片,那整本 PDF 呢?"文档识别"标签页接住了这个需求:支持 pdf、epub、mobi、fb2 等格式,既能对扫描件做 OCR,也能直接提取原有文本,最终输出为双层可搜索 PDF——也就是说,你可以在 PDF 里直接搜索、复制文字,纸质资料瞬间变成电子档案。配合忽略区域,还能把每页的页眉页脚排除干净。
进阶玩法:命令行和 HTTP 接口,把识别能力装进自己的工作流
界面点来点去终究有上限,Umi-OCR 还留了两条自动化通道。命令行模式支持--path、--output等参数,例如:
umi-ocr --path "扫描件目录" --output "输出.txt"一行命令就能批量识别整个文件夹,配合脚本和定时任务,可以做到无人值守。如果你需要更灵活的集成,它还提供了 HTTP 接口,让其他程序远程调用识别、二维码生成等功能,甚至能部署到服务器上使用。详细的参数说明都整理在docs/README_CLI.md和docs/http/README.md两份文档里,想深入折腾时直接查阅即可。
界面也能随你心意:语言、主题、字体都能调
日常使用中,把界面调顺眼也很重要。全局设置里可以一键切换中、英、日、俄等十多种界面语言,内置多个亮色和暗色主题,字体大小也能自由调整。如果某些机器上截图出现闪烁或界面错位,多半是渲染器兼容问题,在设置里换一个渲染方案通常就能解决。
现在就可以开始的下一步
到这里,Umi-OCR 从截图识别到批量处理、从 PDF 转换到自动化调用的能力已经全部串起来了。接下来建议你直接下载一个发布包,先用快捷键跑通一次截图识别,感受离线识别的速度;再找几张带水印的图片试试忽略区域,体会批量任务的省心。如果遇到问题,项目的更新日志CHANGE_LOG.md和文档都整理得很清楚。作为开源项目,它也欢迎你参与界面翻译或反馈建议。让 Umi-OCR 成为你桌面上一个随取随用的文字提取工具,就从今天的第一张截图开始吧。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
