11.1.2识别PDF文档中的文字.pptxVIP

  • 1
  • 0
  • 约2.26千字
  • 约 9页
  • 2026-08-05 发布于陕西
  • 举报

问题描述图书在版编目(CIP)数据Prthon程序设计/岑远红。李娟芏编.-重庆:重庆大学出版社,……活动二猜数-50输出结果从PDF文档python.pdf中提取出所有的文字。

问题分析问题描述问题解答python怎么打开Python文档?怎么将PDF文档拆分为图片?调用fitz.open()函数可以打开指定PDF文档文档对象通过索引可以访问页面对象pymupdf.Page,调用页面对象的get_pixmap()方法可以得到页面的图像数据

程序代码打开PDF文档,将返回的pymupdf.Document对象保存到变量pdfdefget_text_from_pdf(fname):pdf=fitz.open(fname)①reader=easyocr.Reader([ch_sim,en],gpu=True,download_enabled=False,model_storage_directory=model)text=foriinrange(2):trans=fitz.Matrix(3,3)②pm=pdf[i].get_pixmap(matrix=trans,alpha=False)③res=reader.readtext(pm.tobytes(),detail=0

文档评论(0)

1亿VIP精品文档

相关文档