扫描件 OCR 转可编辑文字教程
拍照或扫描得到的 PDF 是整页图片,改不了字也搜不到。本篇讲怎么用 PDFelement 的文字识别(OCR)把扫描件变成可搜索、可复制、可编辑的文件,以及识别质量不行时从哪里排查。相关文档:手机上怎么编辑PDF文字与图片 · PDF合并拆分与页面整理方法
一、什么文件需要 OCR
先确认手里的是不是扫描件,别白跑一遍识别:
- 来源判断:相机拍的、扫描仪扫的、聊天工具里收到的「图片转 PDF」,基本都是整页图片;
- 操作判断:进编辑模式点一下文字选不中;放大后文字边缘发虚、带扫描噪点,就是图片型页面;
- 反例:从 Word、网页导出的 PDF 自带文字层,不需要 OCR,直接编辑就行。
二、识别步骤
以 PDFelement 安卓版为例(OCR 属于会员能力,未开通时进入会提示升级):
- 打开这份扫描件;
- 在工具区找到「OCR」或「文字识别」入口;
- 选识别语言——语言要与文件正文一致,选错语言是识别出乱码最常见的原因;
- 等识别完成,应用会生成一层可搜索的文字层;
- 之后这份文件就能全文搜索、复制文字、直接改字,编辑操作见 手机上怎么编辑PDF文字与图片。
三、识别质量怎么保证
识别效果七分在原件、三分在操作:
| 环节 | 做法 |
|---|---|
| 拍摄 | 光线均匀、对焦清晰、页面拍正、整页入镜,四角不要缺 |
| 原件 | 打印体识别好于手写体;字号太小的先放大复印再扫 |
| 语言 | 与正文一致;混排文件选主语言 |
| 识别后 | 通读一遍再交付,重点核对数字、人名、金额这类易错内容 |
四、识别不出来怎么排查
- 手写内容:识别效果普遍不好,重要手写件建议人工誊录;
- 模糊、歪斜:重拍比反复识别有用,先解决原件质量;
- 语言不在列表里:识别语言以应用内可选列表为准,列表里没有的语言结果不可靠;
- 识别后仍是图片:确认选的是「识别」而不是「扫描成 PDF」——后者只是把照片变成 PDF,不做文字识别。
顺带一提,PDFelement 除扫描与 OCR 外也支持把 PDF 转成 Word 继续处理,页面整理(合并、拆分、提取)的做法见 PDF合并拆分与页面整理方法;功能总览与安装文件资源入口在 PDFelement 安卓版介绍站。