从pdf图片中抓取文字.docVIP

  • 5
  • 0
  • 约2.23千字
  • 约 3页
  • 2017-06-14 发布于四川
  • 举报
从pdf图片中抓取文字 Home 今日一点, 技术分析 从pdf图片中抓取文字 Posted on April 23, 2008 by 白菜林 从pdf中抓取文字原理: 利用office的虚拟打印机Microsoft Office Document Image Writer把图片或者pdf打印到tiff或者mdi格式的文件,然后关联使用Microsoft Office Document Imaging打开tiff或者mdi文件,然后选择“工具”菜单下的“使用ocr识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”(或者直接选择“将文本发送到word”,会提示你先进行ocr识别,然后会自动开始),最后将把整个PDF文件识别输出到word文件中。 原理就是这样子啦,操作也很简单,Microsoft Office Document Imaging的安装我就不说啦,早些时候已经说过啦,可以参考:windows的的墨水服务『office2007的Microsoft Office Document Image安装』。 下边说说pdf文件中文字的识别 以文本形式保存的PDF文件:可以使用gmail发附件然后使用view html查看或者acrobat reader直接选中文字部分复制粘贴到记事本中或者word中即可。 以图片形式存在的pdf文件:这样gmail的附件就无

文档评论(0)

1亿VIP精品文档

相关文档