ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Umi-OCR离线OCR完整攻略:截图、批量、PDF文档识别一网打尽

Umi-OCR离线OCR完整攻略:截图、批量、PDF文档识别一网打尽 Umi-OCR离线OCR完整攻略截图、批量、PDF文档识别一网打尽【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR是一款免费、开源、完全离线的OCR文字识别软件核心功能包括截图识别、批量图片识别与PDF文档识别还内置二维码扫描/生成与多国语言支持。你不需要注册账号不需要联网解压双击就能把屏幕上、图片里、PDF扫描件中的文字抠出来。这篇文章不讲晦涩原理只按真实使用路径带你从下载安装、逐个体验核心功能一直到避开那些新手最容易踩的坑。从一次抓狂的复制说起离线OCR到底解决了什么先讲个场景同事发来一份扫描版PDF合同你想引用其中一段条款结果全选、复制——屏幕上只有一行提示无法从此PDF复制文字。你只好打开在线识别网站结果发现文件超过大小限制、一天只送几次免费额度更糟的是这些敏感合同要先上传到别人的服务器。这个痛点正是Umi-OCR存在的理由。它把OCR引擎整个搬到了你的电脑里本地运行、本地计算图片和文档都不离开你的硬盘。识别多少张、多大多小、什么时候用都由你说了算。一句话总结它的定位给Windows和Linux用户的一把本地文字剪刀剪哪里、剪多少全凭你自己。整篇文章会带你走完四条路先花三分钟跑起来再把截图、批量、PDF三大主力功能逐个摸清然后学会用语言、排版、性能三个旋钮微调体验最后翻一遍新手最容易踩的坑。我们开始。三分钟跑起来解压即用的上手路径Umi-OCR是绿色软件不需要安装这也是它最让人舒服的一点。上手只需要三步下载从项目发布页获取.7z压缩包或.7z.exe自解压包。如果电脑没装压缩软件选自解压包双击即可解开。解压把压缩包解压到任意目录比如D:/Tools/Umi-OCR注意路径里不要带中文和空格可以减少莫名奇妙的兼容问题。启动双击Umi-OCR.exeWindows或运行umi-ocr.shLinux。第一次启动时软件会自动读取你的系统语言把界面切成对应的语言想手动切换随时去全局设置里改。程序主体由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置等就像浏览器的标签栏一样你想用哪个点哪个还可以锁住常用标签防止误关。这里有个容易忽略的小提醒启动前把杀毒软件的白名单里加一下软件目录。因为Umi-OCR内置了本地OCR引擎和运行库部分杀软会误报加白名单能省去后续很多为什么闪退的烦恼。核心功能逐个演示从截屏到PDF一条龙截图OCR屏幕上看到的文字随抓随用日常最高频的场景就是看到一段文字想立刻复制。打开截图OCR标签页按下快捷键唤起截图框划出目标区域识别结果会立刻出现在右侧记录栏里。几个很实用的小习惯不用截图也能识别在别处复制一张图片比如聊天窗口里回到Umi-OCR直接粘贴它照样帮你识别。结果可以二次编辑右侧记录栏里的文字能直接改错、划选多条记录一起复制识别完顺手就能整理成你想要的格式。竖排文字也不怕排版解析会自动处理横排和竖排从右到左的文本只要OCR引擎本身支持竖排即可。截图识别只是开胃菜真正体现效率的还在后面。批量OCR几百张图片一口气处理遇到几十上百张截图、扫描件、相册照片一张张截屏识别就太亏了。切到批量OCR标签页把图片拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式一次拖几百张也没有数量上限。点下开始任务右侧会逐张显示文件耗时、置信度和识别结果。任务跑完可以按需输出成txt、jsonl、md、csvExcel可直接打开四种格式。对于深夜挂机场景它还支持任务完成后自动关机或待机——睡前扔进去几百张图醒来直接拿结果。忽略区域让水印、页眉页脚自动隐身批量识别有个高频痛点图片角落的水印、LOGO、页眉页脚每次都会混进识别结果里还要人工删。Umi-OCR的忽略区域功能就是为这个设计的。在批量识别页的右侧设置里进入忽略区域编辑器按住右键在图片上绘制多个矩形框把水印可能出现的位置全部框住识别时这些区域内的文字就会被自动排除。做学术论文批量转换时用这个功能把统一的页眉页脚一次框掉输出会干净很多。这里有一个必须记住的机制只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。所以画框时宁可大一点把水印所有可能出现的位置都包住否则漏框一次结果里就混进一行杂音。文档识别扫描版PDF也能变成可搜索文本如果说前面是热身文档识别就是Umi-OCR的压轴功能。它支持pdf、xps、epub、mobi、fb2、cbz六种格式其中PDF扫描件是最典型的应用场景。底层逻辑可以概括为三步解析 → 识别 → 重组。PDF先被解析引擎底层依赖PyMuPDF拆开区分出本来就有的文本层和需要OCR的扫描图片层扫描图片交给本地OCR引擎逐页识别最后按阅读顺序重新拼装输出成你指定的格式。具体到操作有两个亮点值得展开双层可搜索PDF这是很多人的刚需。对扫描版PDF做OCR后输出为底层是原图、上层是透明文字的双层PDF。外观上跟原扫描件一模一样但里面的文字可以搜索、复制、划线。给公司做历史合同归档、给学校做论文数字化这个功能都能直接顶上去。灵活的提取模式Umi-OCR会优先尝试提取PDF自带的文本层速度快、零识别误差只有当遇到纯扫描页时才自动切换到OCR。你还可以主动选择整页强制OCR或反过来只提取原文本。v2.1.2版本起还支持输出单层纯文本PDF想要体积小、好编辑的文件时可以选它。文档识别同样支持忽略区域可按页码范围设置用来排除扫描件的页眉页脚也能设置任务完成后的自动关机。如果家里有一堆扫描版书要转成可搜索存档这个标签页能帮你省下大量人工。三个关键配置语言、排版与性能多语言界面一套软件多国面孔Umi-OCR的界面语言支持中文、繁体中文、英文、日文、俄语、葡萄牙语等多种语言由社区译者协作维护版本更新还会持续新增。切换路径是全局设置 → 语言/Language。顺带一提界面语言和识别语言库是两回事界面语言管按钮菜单长什么样识别语言库管OCR引擎认哪种文字。识别语言可以在各标签页的文字识别设置里单独选择或下载。比如你的界面用中文、但日常识别日文书籍二者完全可以搭配使用。排版方案怎么选给OCR结果排座位OCR引擎吐出的文字往往是散装的谁先谁后要看排版解析怎么安排。Umi-OCR内置了多套预设方案选对方案输出的文本才符合阅读习惯方案适用场景多栏-按自然段换行两栏/三栏排版的论文、书籍自动按段落断行最常用多栏-总是换行每句独立成行适合后续按行处理多栏-无换行强制整段合并成一行单栏-按自然段换行单栏文档段落自然换行单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理OCR引擎原始输出不做任何整理其中单栏-保留缩进值得单独表扬把代码截图扔进去输出能基本保持缩进结构配合截图OCR简直是小程序员的福音。如果你不确定选哪个直接选多栏-按自然段换行就对了它能覆盖大多数场景遇到特殊排版再回来逐个切换对比。性能微调大图、内存与渲染器三个常见性能问题的应对方法识别长图/大图不完整去文字识别设置里调高限制图像边长。默认边长限制是为了平衡速度与内存遇到像素特别大的长截图适当调高数值即可。内存占用偏高如果用的是PaddleOCR插件v2.1.4版本起默认内存占用被限制在系统总内存的一半以内想进一步压内存可以在插件配置里调低线程数。截屏闪烁或界面错位这是显卡渲染兼容问题去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速通常能解决。新手避坑清单8个高频问题的标准答案把最常见的报错和误区集中成一份清单遇到问题直接对号入座忽略区域画了却没效果检查矩形框是否够大只有整个文本块完全在框内才会被忽略再确认是否保存了忽略区域配置。长图识别结果缺胳膊少腿调高限制图像边长而不是盲目放大原图——过度放大会增加噪声反而降低准确率。截图时界面闪烁、错位切渲染器或关硬件加速见上文。命令行指令没反应Umi-OCR依赖本地HTTP服务进行进程间通信请确认全局设置里HTTP服务已开启默认开启且仅监听本地环回不经过物理网卡数据不会外泄。批量任务想中途休息v2.1.2起支持暂停任务只要软件不退出待机/休眠后可以继续跑。代码截图排版全乱了切到单栏-保留缩进。多栏论文输出顺序串行切到多栏-按自然段换行。文件夹里有几万个文件加载很卡v2.1.5优化了异步加载机制遇到超大文件夹可以稍等加载完成再操作预览界面会显示加载进度。延伸探索命令行、HTTP接口与更多玩法对普通用户来说图形界面已经够用但如果你想把它嵌入自己的工作流Umi-OCR还提供两条程序化通道。命令行模式入口就是主程序本身。几个常用姿势# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录 umi-ocr --path D:/scans -- all_result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256配合快捷键工具如HotkeysCMD还能实现按一个键自动截指定屏幕区域并识别的骚操作。指令的具体参数和简写规则见项目内docs/README_CLI.md命令行手册。HTTP接口Umi-OCR启动后本地HTTP服务提供OCR、文档识别、二维码等接口接口文档在docs/http/api_doc.md。开发者可以用几十行代码把它封装成局域网内的小工具或者接入自己的自动化流程实现上传图片→返回JSON识别结果。引擎与插件生态软件默认内置Rapid-OCR引擎兼容性好与PaddleOCR引擎速度快一些在全局设置里可以随时切换。如果你想折腾项目还有独立的插件库支持扩展更多OCR引擎。另外公式识别等功能也已在开发路线图上属于远期计划可以保持关注。版本更新别错过项目的CHANGE_LOG.md记录了每个版本的演进——v2.1.0加入文档识别、v2.1.2支持单层纯文本PDF与任务暂停、v2.1.3登陆Linux并支持Docker部署、v2.1.5修复了PDF页面旋转导致的文本错位问题。如果你手头有旋转过方向的扫描件一定要用最新版。小结把整篇文章压缩成三句话Umi-OCR是一款免费、开源、离线运行的OCR工具装好就能用截图、批量、文档识别三大功能覆盖了从日常摘抄到批量归档的绝大多数场景遇到问题别慌忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。下次再收到扫描版PDF或者一堆带水印的图片时打开Umi-OCR你会发现自己已经不再需要在线工具和手动抄录了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表