多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

Umi-OCR 离线 OCR 实践指南:从下载到首次识别,4 步处理批量图片与 PDF

Umi-OCR 离线 OCR 实践指南:从下载到首次识别,4 步处理批量图片与 PDF Umi-OCR 离线 OCR 实践指南从下载到首次识别4 步处理批量图片与 PDF【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 文字识别工具截图识别、批量图片识别、扫描版 PDF 转文本、二维码扫描与生成全部在本机完成。不联网、不注册、不上传图片识别次数不设上限。如果你经常截图取字或者有一批图片、一整本扫描 PDF 要处理这篇文章的完整流程大约 10 分钟可以走通。第一次出结果从下载到首次截图识别主界面由截图OCR、批量OCR、文档识别、二维码、全局设置几个标签页组成右上角可锁定标签页防止误关。按下面 4 步走拿发布包。到项目的 Release 页下载.7z压缩包没有解压软件就选.7z.exe自解压包双击即可解开。需要源码时执行git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。解压到纯英文路径。软件无需安装解压即用。建议放D:\Tools\Umi-OCR这类目录路径里避开中文和空格。提示软件内置 OCR 引擎和运行库部分杀软会误报先把目录加入白名单再启动。启动。Windows 双击Umi-OCR.exeLinux 自 v2.1.3 起支持运行umi-ocr.sh。首次启动按系统语言自动切换界面要改界面语言进全局设置→语言/Language支持简中、繁中、英文、日文、俄语、葡萄牙语等。跑第一个任务。打开截图OCR标签页按快捷键唤起截图框划出屏幕上的文字区域识别结果立刻出现在右侧记录栏。按Esc可随时取消截图。把量提起来从一张截图到一整本 PDF识别的量从单张扩到整批、整本标签页和设置各自对应下面是按规模递进的三种用法。当你要处理单张截图或一张复制来的图片。截图只是取图的方式之一在别处复制一张图片比如聊天窗口里的图切回 Umi-OCR 直接粘贴效果相同。记录栏里的文字支持直接编辑划选多条记录可一次复制。另外两个顺手的功能二维码标签页支持截图、粘贴、拖入图片三种方式扫码一张图里多个码一次读出覆盖 QRCode、EAN13、Code128 等 19 种码制生成方向可选码制和纠错等级把文本直接输出成二维码图片。当你要处理几百张图片。切到批量OCR标签页把图片直接拖进窗口没有数量上限。项目支持范围输入格式jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff输出格式txt、jsonl、md、csv可直接用 Excel 打开长任务任务完成后自动关机/待机v2.1.2 起支持暂停任务不退出软件时待机/休眠后可恢复右侧面板逐张显示耗时、置信度和识别结果跑完按上表选输出格式。图片角落的水印、LOGO 会混进结果处理方式批量页右侧设置里打开忽略区域编辑器按住右键在图片上绘制多个矩形框。机制记死一条——只有整个文本块完全落在框内才忽略按单个字符不算所以框要画得足够大把水印所有可能落位包住。当你要处理一整本文档。v2.1.0 起文档识别标签页支持pdf、xps、epub、mobi、fb2、cbz扫描版 PDF 是典型场景。处理逻辑是先挑现成的再补缺的解析器区分 PDF 自带的文本层和扫描图片层自带文本的页面直接提取只有纯扫描页才交给本地 OCR 引擎也可以反向操作整页强制 OCR或只提取原文本。两种成品输出双层可搜索 PDF底层保留原图上层叠加透明文字层外观与扫描件一致但可搜索、可复制适合合同归档、论文数字化。单层纯文本 PDFv2.1.2 起文件更小、方便后续编辑只要文字的话选它。文档识别同样支持忽略区域v2.1.1 起可指定页码范围把统一位置的页眉页脚一次性排除也支持任务完成后自动关机/待机。一整柜扫描旧书转可搜索存档这个标签页是主力。识别不理想按顺序排查质量不满意时别乱调参数按下面 3 个问题依次过一遍大部分问题定位到第三步就能解决。引擎选对了吗判断依据内置两套引擎切换入口在全局设置的 OCR 插件选项里。识别不准、或干脆报错先切到Rapid-OCR它是兼容性好的一套。追求速度用PaddleOCRv2.1.4 起默认把内存占用限制在系统总内存的一半以内想再压低就在插件配置里调低线程数。顺带分清两个概念界面语言管菜单按钮显示什么文字识别语言库管引擎认哪种文字在各标签页的文字识别设置里单独选择或下载。界面用中文、日常识别日文书籍这种组合完全成立。排版方案对了吗判断依据字都认对了但行序混乱、段落粘连问题出在排版解析不在引擎。OCR 引擎吐出的是散装文本块排版解析器负责决定谁先谁后。内置预设按这个决策路径选两栏/三栏的论文、书籍 →多栏-按自然段换行默认后续要按行处理 →多栏-总是换行代码截图 →单栏-保留缩进保留行首缩进和行中空格拿不准 → 保持默认所有方案都自动处理横排和竖排从右到左的排版。参数卡在哪对照现象定位参数现象调整位置做法长截图/大图识别不完整页面设置 → 文字识别 →限制图像边长默认 960调高到 2880、4320 或无限制不要靠放大原图解决过度放大引入噪声内存占用偏高PaddleOCR 插件配置调低线程数截图时屏幕闪烁、界面错位全局设置→界面和外观→渲染器切换渲染方案或关闭硬件加速接进你的自动化流程两条程序化通道命令行和本地 HTTP 接口。命令行入口就是主程序Umi-OCR.exeLinux 为umi-ocr所有指令支持前缀简写--screenshot可写成--sc。指令通过本地 HTTP 环回服务传给后台进程该服务默认开启、仅监听本地环回、不经过物理网卡软件没开或入口用错RUN_GUI.bat这类备用启动器不支持命令行指令就石沉大海。3 个最小可用示例umi-ocr --screenshot --clip截图识别结果直接进剪贴板。umi-ocr --path D:\scans -- all.txt递归识别整个文件夹含子目录结果追加到all.txt--等价于--output_append--是覆盖写入。umi-ocr --qrcode_create https://example.com D:\qr.png 256生成 256×256 像素的二维码图片末尾数字也可分开指定宽、高。需要程序化收结果时走 HTTP 接口更稳软件运行期间本地 HTTP 服务暴露 OCR、文档识别、二维码等接口默认端口1224命令行受环境限制系统的管道重定向符、|可能失效。接口清单见 docs/http/README.md完整命令参数见 docs/README_CLI.md。常见问题命令行指令没有任何反应原因指令靠本地 HTTP 服务传递服务被关了或入口不是主程序RUN_GUI.bat备用启动器不支持命令行。 解决确认全局设置里 HTTP 服务处于开启状态默认开启用Umi-OCR.exe作为入口重新执行。忽略区域画了水印文字还在结果里原因矩形框只包住了文本块的一部分或配置没保存。机制是整块忽略包住一半等于没包。 解决把框画到完全包含整个文本块确认配置已保存后再跑任务。代码截图的缩进全乱了原因默认排版方案会合并空格。 解决排版解析方案切到单栏-保留缩进缩进和行中空格原样保留。长图识别结果缺头少尾原因限制图像边长默认 960边长超限的图片被压缩后才送进引擎。 解决页面设置 → 文字识别里调高该数值2880、4320 或无限制不要直接放大原图。旋转了方向的扫描件提取出的文字位置错位原因文档识别提取 PDF 自带文本层时早期版本没有处理页面旋转。 解决v2.1.5 已修复升级到最新版再跑。拖入几万个文件的文件夹界面卡死原因超大文件夹同步加载占满界面线程。 解决v2.1.5 起改为异步加载并显示进度等进度跑完再操作加载期间不要连续提交任务。截图时屏幕闪烁、界面错位原因显卡加速渲染在你的机器上不兼容。 解决全局设置→界面和外观→渲染器切换渲染方案或直接关闭硬件加速。下一步拿到最新版 v2.1.5完成一次截图识别让第一条结果落在记录栏里。在批量OCR页把常用水印位置的忽略区域画好并保存之后整批图片直接拖入。要自动化的话先跑通umi-ocr --screenshot --clip这条命令确认命令行通道可用再接 HTTP 接口封装成自己的小服务。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表