投标截止前2小时,我才发现扫描件里的文字根本没法复制——怎么提取图片中的文字,这步差点让我翻车
投标截止前2小时,我才发现扫描件里的文字根本没法复制——怎么提取图片中的文字,这步差点让我翻车
说起来真是教训。那天下午五点投标截止,我负责汇总几家分包商的资质材料,一切都准备得七七八八,直到材料组长丢过来一沓用手机拍的营业执照和检测报告。图片看起来还算清楚,可我需要把上面的统一社会信用代码、检测编号和结论一字不差地填进标书汇总表。我习惯性地长按图片,点了“提取文字”,结果因为照片有点反光,末尾几位数字全错了。当时脑子里就一个念头:除了重打,还有没有别的路子能快速把图片里的字提出来,而且比较合适能在电脑上直接编辑?后来就是靠着几种工具轮番上阵,硬是在截止前十分钟把材料交了上去。事后复盘,觉得这些方法对平时看稿、整理纸质笔记也太有用了,干脆把我实战过的、身边朋友验证过的路子整理下来。

系统自带的文字捕获,很多时候够用而且最快
现在手边设备其实已经悄悄把OCR做进了系统底层,完全不用额外装任何东西。我用得最多的是手机相册里的那个不起眼的功能。
在iPhone上,打开一张有明显文字的图片,不用等什么菜单弹出来,直接长按文字区域,系统就会自动框选。我第一次发现这个“实况文本”功能的时候还有点惊讶——连手写体不太潦草的情况都能识别出来。选中之后可以拷贝、翻译,甚至直接拨打电话号码。整个过程不需要联网,图片留在本地,这对处理合同、标书这种文件来说,心理上踏实不少。
安卓这边情况类似,不同品牌叫法不一样,但入口基本都藏在相册的“更多”里。比如Google相册打开图片后,底下会出现一个类似镜头的图标,点进去就是智能镜头,提取出来的文字可以直接复制或者发送到电脑。很多国产定制系统也把“提取图中文字”放在了编辑菜单里,同样是离线就能跑。拍课件、拍会议白板的时候随手一用,省掉了很多手动敲字的功夫。
这些内置功能的最大好处是零门槛,缺点也很明显:它们对复杂排版的还原很弱,遇到竖排文字、或者表格混排的图片,出来的顺序常常是乱的。而且,它们基本只给纯文本,不会保留任何格式、表格结构。所以当文件需要拿去再编辑排版的时候,就不太够用了。
WPS,办公软件里的图片转文字
WPS图片转文字
WPS的手机端和电脑端都内置了图片转文字功能。在WPS手机App里打开任意一张图片,右下角会出现「图片转文字」的入口,点进去就能自动识别并导出为可编辑的文档。电脑端的WPS同样可以在「特色应用」里找到这个功能。因为很多人电脑里本来就有WPS,不需要额外装东西,算是一个顺手的选择。不过它的OCR识别对中文手写体的支持一般,排版还原也不如专门的PDF工具精细,拿来处理印刷体文档比较稳。
微信里直接唤出的小程序,连软件都不用下
青蓝PDF转换

我就是那次投标临时抱佛脚的时候,才真正体会到“不用安装”这四个字的份量。当时时间太紧,根本不允许去电脑上下载软件再研究怎么用。同事提醒我可以试试在小程序入口里搜「青蓝PDF转换」这个小程序,上传图片就能直接把上面的字变成可编辑的Word或者TXT。
操作方法特别直白:进到小程序后,第一眼就能看到“图片转Word”或者“图片转TXT”的入口。我那次是把手机拍的一整页检测报告直接传上去,选定输出格式为Word,点一下转换,大概三四秒后就可以下载文件。下载下来的Word打开一看,表格的大体骨架还在,文字基本准确,只有报告底部那行因为拍摄角度太斜的小字,把“0”认成了“O”,手动改一下就行。整个过程三步走完:上传、选格式、一键下载。
比较舒服的是它导出不带水印,也不需要我填手机号或者实名,打开聊天软件就能用。一次最多可以传9个文件,每个文件不能超过100MB,日常用的手机照片或者扫描件完全够。转换是在服务器上跑的,处理完立即清除,这一点对于处理公司内部材料的人来说能稍微放下心。
当然它也有很明确的局限:OCR扫描件的准确率高度依赖图片清晰度,如果原图本身就是糊的或者有大面积阴影,识别结果会打折扣。还有就是一些特别复杂的版式,比如多重嵌套表格,转换成Word后可能需要自己稍微调一调行距和缩进。它不是魔法,只是个能帮上忙的工具,我一般把它当作手机和电脑之间搬运文字的桥梁。
在线工具,在公用电脑上临时救急的选项
Smallpdf

有时候不在自己电脑前,用的是图书馆、打印店的公用机,不允许安装任何程序,这时候网页端的在线OCR就会派上用场。我有几次在客户公司改资料,就是用这类网站把方案截图转成文字的。
Smallpdf的图片转文字功能就属于这一类。打开它的网页版,直接把JPG或者PNG拖进去,选择输出Word或TXT,等上几十秒就能下载。它处理英文和多语种文档的准确率一向不错,而且操作界面很干净,没有乱七八糟的弹窗。免费的额度日常偶尔用用还行,处理量大的话就得考虑付费方案了。
iLovePDF

iLovePDF同样提供了图片识别转换服务,逻辑和上面类似。我印象比较深的是它对PDF扫描件的处理,可以把一个纯图片的PDF变成可搜索、可复制的文档。因为这两家都有比较成熟的云端服务器,识别速度相对稳定,缺点就是必须把文件上传到第三方服务器,涉及敏感信息的时候我会主动避开,只处理那些公开的、不涉密的资料。
这类在线工具的通用步骤就是:打开网页、拖拽文件、选取输出格式、等待转换、回传下载。它们的优势很明显,跨平台、不用安装、浏览器就能跑。但一定要提前想清楚文件的敏感程度,别什么图都往上扔。
PC端的传统强手,精度和版式控的归宿
Adobe Acrobat Online

如果日常有大量扫描件需要转成可编辑文档,而且对排版要求特别严,那最终大概率还是会回到桌面软件上来。下面这两个是我工作电脑里一直留着的。
Adobe Acrobat 的在线版以及桌面客户端,在处理图片OCR时有个很顺手的设计:可以直接把图片合成一个PDF,然后运行“增强扫描件”功能,软件会自动分析图片里的文字和图表位置,生成一个近乎原样的Word文件。我在处理一份几十页的外文技术手册扫描版时,试过用它导出,页眉页脚和段间距还原得相当到位,后期排版的时间省下不少。Acrobat 的缺点是软件本身比较庞大,而且完整功能需要订阅,适合本来就在使用它管理文档的用户。
另一条路是开源的Tesseract引擎搭配图形化前端,比如gImageReader。这对普通用户来说有一点门槛,需要下载安装语言包,但是完全免费,而且所有处理都在本地完成,不存在隐私顾虑。我见过一些程序员朋友会在自己的脚本里调用Tesseract,对图片先做一遍灰度化和二值化预处理,再扔进去识别,准确率会明显提升。这个方案更适合愿意折腾、或者有批量处理需求的人,它不漂亮,但很能打。
顺便说一句,手机和电脑之间怎么传图最高效
这个话题虽然不在主线上,但实际用起来很影响效率。我现在的习惯是:如果图片在手机里,需要电脑编辑,就直接用聊天软件文件传输助手发原图,然后在电脑端用Adobe Acrobat或者青蓝PDF转换打开;如果是纸质文件,先用手机高像素模式垂直拍摄,注意别留太多阴影,然后裁剪掉多余的背景再送进工具。这么一个小动作,能把识别准确率往上提一截。
几条我自己试出来的提升识别效果的路子
不管用哪个工具,前期把图片稍微打理一下,比事后逐个校对错字要轻松得多。我常用的招数就这几个:
- 拍照时尽量让光线均匀,不要一半亮一半暗,那种阴阳脸图片最容易翻车。
- 无关的背景能裁就裁,让文字区域占画面的主体,减少引擎误判。
- 图片太灰的话,稍微拉一下对比度,让字更黑、底更白,很多工具马上就“认得清”了。
- 识别完之后别急着直接用,重点检查数字、专有名词和形近字,比如“拨”和“拔”这类。
那天投标截止前的慌乱,最后是靠手机实况文本先快速抓出大部分摘要信息,再结合在线工具和那个免安装的小程序把整份报告转成Word格式排版,才算平稳落地。现在回看,图片里锁着的那些字,其实远没有当时感觉的那么难搞。如果现在叫我选一条最常用的路,我会说:不敏感的文件随手用系统自带功能;要格式要编辑,就聊天软件里打开青蓝PDF转换直接导出Word;碰到超大文件或者对版面还原有执念,再打开电脑端Adobe Acrobat。三条路都在手边,就看当下图的是快、准、还是稳。
(正文已经结束)
推荐阅读:
免责声明及提醒:此文内容为本网所转载企业宣传资讯,该相关信息仅为宣传及传递更多信息之目的,不代表本网站观点,文章真实性请浏览者慎重核实!任何投资加盟均有风险,提醒广大民众投资需谨慎!
相关新闻
- 2020-05-05·新贵正当燃,8848钛金手机M
- 2020-05-11·摒弃无效社交,爻信APP引领价
- 2020-05-18·新全球最薄手机?ELIFE S
- 2020-05-24·手机批发价,一台手机能挣你六七
- 2020-05-31·真·小手机!Palm入网工信部


手机阅读分享话题
