Umi-OCR截图取字、批量图片识别、PDF 扫描件3 个本地 OCR 任务一网打尽不联网不花钱【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的离线 OCR 软件。截图取字、整文件夹图片批量识别、扫描版 PDF 变可搜索文档全在本地处理无需联网图片不离开你的机器。读完全文你可以独立做完四件事走通一次截图 → 识别 → 复制把一文件夹图片导出成 txt/Excel把文档变成双层可搜索 PDF以及把识别能力接进自己的脚本和 Web 服务。主界面左侧是截图预览可直接划选文字右侧按时间排列每次识别的记录先跑通一次完成第一张截图 OCR解压发布包。发布版是.7z压缩包或自解压的.7z.exeWindows 7 x64 与 Linux x64 均可运行没有安装器。你会看到一个完整的目录里面就是全部文件。启动程序。Windows 上双击Umi-OCR.exeLinux 上执行umi-ocr.sh。你会看到主窗口弹出界面语言跟随系统设置走。唤起截图。打开截图 OCR标签页按下快捷键可在该页设置里改用鼠标框选一块文字区域。你会看到屏幕变暗、出现选框随时能按Esc取消。复制文字。识别跑完后右侧记录栏多出一条文本点一下记录即可复制左侧预览图上也能直接划选字符。最短闭环到此就通了。顺手可以进全局设置标签页切换语言、主题、开自启全局设置页切换界面语言与主题或添加桌面快捷方式、开机自启任务A截图 OCR 取字排版怎么配才不乱要什么文档截图、视频帧里的代码你想原样贴进 IDE。手敲太慢普通 OCR 又容易吞掉缩进和行内空格。怎么做在截图 OCR标签页框选代码区域。右侧设置面板中把排版解析切到单栏-保留缩进。识别结束后在右侧记录中点这条结果复制。怎么算成了把结果贴进 IDE 或 Markdown 预览缩进层级和原图一致、没有多余空格就算过关。别栽在这默认排版解析是多栏-按自然段换行面向普通文档。套在代码截图上缩进会被拍平。OCR 引擎只管认字把字块按阅读顺序拼回去靠的是排版解析方案选错结果就不对味。截图 OCR 页面左侧预览栏可划选文字右侧记录栏按时间保存每次识别结果记录面板还能划选多条记录批量复制也可以编辑文字后再复制识别记录面板右键菜单可复制、删除单条记录或清空全部任务B批量导出 txt 和 Excel一文件夹图片或一整个 PDF 一次出结果要什么手里有一堆扫描文档、票据或拍照图片一张一张点不现实。怎么做切到批量 OCR标签页点选择图片或直接拖入文件夹几百张也能一次导入。核对输入格式jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff输出勾选txt / jsonl / md / csv (Excel)。点开始任务。你会看到左侧列表逐张显示耗时和置信度任务结束得到每个文件对应的输出。怎么算成了随机抽 3 张图对比左侧预览和右侧记录置信度0~1低于0.8的那几张重点人工核对。别栽在这⚠️每张图固定位置都有水印或 LOGO 时在右侧设置进入忽略区域编辑器按住右键画矩形框住它。只有完整落在框内的文本块会被丢弃框画得稍大一点更安全。像素超大的长图、小字多的大图到设置 → 文字识别 → 限制图像边长把数值调高默认960可选2880或4320否则大图先被压缩小字容易糊。批量 OCR 页面左侧是待识别文件列表含耗时、置信度右侧是识别记录PDF 扫描件走同一套思路切到文档识别标签页v2.1.4及以上版本支持拖入文档支持pdf / xps / epub / mobi / fb2 / cbz同样可以设忽略区域排除页眉页脚。产物是双层可搜索 PDF原图垫底识别出的文字藏在上层能搜能选版面不损失。打开生成的 PDF用CtrlF搜一个只在正文里出现的词能直接跳到对应页就说明文字层写对了。任务C把 OCR 挂进自动化命令行和 HTTP 两条路要什么你想把 OCR 塞进定时任务、打包脚本或自己的 Web 服务。怎么做在全局设置里确认 HTTP 服务已开启主机保持仅本地即可默认端口1224。命令行走法umi-ocr是Umi-OCR.exe的简写完整用法看 命令行手册umi-ocr --screenshot --clip umi-ocr --path D:/docs --output 结果.txt umi-ocr --qrcode_read D:/code.pngHTTP 走法先GET http://127.0.0.1:1224/api/ocr/get_options查参数定义再POST http://127.0.0.1:1224/api/ocr提交 base64 图片。请求体是 JSON图片编码放base64字段语言模型、排版解析等选项放options字段完整参数表见 图片识别接口文档以官方文档为准。文档识别也有对应的上传、查询、下载接口详见 HTTP 接口手册。怎么算成了命令行跑完文本出现在剪贴板或你指定的文件里浏览器访问get_options能看到 JSON 参数定义。没反应的话九成是 HTTP 服务没开回全局设置查一下。别栽在这命令行任务沿用截图 OCR标签页的参数设定。不希望任务时弹出主窗口就在该标签页里关掉对应选项。参数速查真正要动的就这几个参数默认建议为什么排版解析多栏-按自然段换行代码选单栏-保留缩进文档保持默认引擎只管认字缩进和阅读顺序全靠它限制图像边长9602880或4320默认960会先压缩大图小字容易糊语言/模型库简体中文纯英文、纯代码换models/config_en.txt中文模型认纯英文容易出怪字符OCR 引擎插件Rapid-OCR自带保持默认不够用再在全局设置切换自带的兼容性好、够快省去折腾界面改动会自动存进UmiOCR-data/.settingsini 格式也允许手动修改改完执行umi-ocr --reload重新加载即可。识别结果不对时怎么办现象原因处理识别顺序错乱、读不通默认排版解析不适合该图片的排版换排版解析方案代码选单栏-保留缩进大图里的小字认错默认边长限制960先压缩了图片限制图像边长调到2880以上水印、LOGO 文字混进结果水印里的文本块被一起识别批量页画忽略区域把水印整块框住命令行 / HTTP 没反应HTTP 服务没开全局设置里允许 HTTP 服务主机选仅本地文档与源码入口Umi-OCR 像个放在本地的 OCR 工具箱截图、批量、PDF 一次做完还留了命令行和 HTTP 两个口子接自动化。想深入的话docs/README_CLI.md 和 docs/http/README.md 是完整参考Python 源码在UmiOCR-data/py_src/目录里欢迎直接翻。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考