python读取pdf格式文档的实现代码

2024-04-02 19:04:59 324人浏览独家记忆

Python 官方文档：入门教程 => 点击学习

摘要

python读取pdf文档一、准备工作安装对应的库 pip install pdfminer3k pip install pdfminer.six 二、部分变量的

python读取pdf文档

一、准备工作


安装对应的库
	pip install pdfminer3k
	pip install pdfminer.six

二、部分变量的含义

PDFDocument（pdf文档对象）
PDFPageInterpreter（解释器）
PDFParser（pdf文档分析器）
PDFResourceManager（资源管理器）
PDFPageAggregator（聚合器）
LAParams（参数分析器）

三、PDFMiner类之间的关系

PDFMiner的相关文档(点击跳转)

四、代码实现


#!/usr/bin/env Python
# -*- coding:utf-8 -*-
# datetime:2021/3/17 12:12
# software: PyCharm
# version: python 3.9.2

def changePdfToText(filePath):
 """
 解析pdf 文本，保存到同名txt文件中

 param：
 filePath: 需要读取的pdf文档的目录
 introduced module:
 from pdfminer.pdfpage import PDFPage
 from pdfminer.pdfparser import PDFParser
 from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
 from pdfminer.converter import PDFPageAggregator
 from pdfminer.layout import LAParams
 from pdfminer.pdfdocument import PDFDocument, PDFTextExtractionNotAllowed
 import os.path
 """
 file = open(filePath, 'rb') # 以二进制读模式打开
 # 用文件对象来创建一个pdf文档分析器
 praser = PDFParser(file)
 # 创建一个PDF文档
 doc = PDFDocument(praser, '') # praser ：上面创建的pdf文档分析器 ，第二个参数是密码，设置为空就好了
 # 连接分析器 与文档对象
 praser.set_document(doc)
 # 检测文档是否提供txt转换，不提供就忽略
 if not doc.is_extractable:
 raise PDFTextExtractionNotAllowed
 # 创建PDf 资源管理器 来管理共享资源
 rsrcmgr = PDFResourceManager()
 # 创建一个PDF设备对象
 laparams = LAParams()
 device = PDFPageAggregator(rsrcmgr, laparams=laparams)
 # 创建一个PDF解释器对象
 interpreter = PDFPageInterpreter(rsrcmgr, device)
 result = [] # 内容列表
 # 循环遍历列表，每次处理一个page的内容
 for page in PDFPage.create_pages(doc):
 interpreter.process_page(page)
 # 接受该页面的LTPage对象
 layout = device.get_result()
 for x in layout:
  if hasattr(x, "get_text"):
  result.append(x.get_text())
  fileNames = os.path.splitext(filePath) # 分割
  # 以追加的方式打开文件
  with open(fileNames[0] + '.txt', 'a', encoding="utf-8") as f:
   results = x.get_text()
   # print(results) 这个句可以取消注释就可以在控制台将所有内容输出了
   f.write(results) # 写入文件

# 调用示例 ：

# path = u'E:\\1.pdf'
# changePdfToText(path)

利用PyPDF2实现了对pdf文字内容的提取


from PyPDF2 import PdfFileReader

# 定义获取pdf内容的方法
def getPdfContent(filename):
  # 获取PdfFileReader对象
  pdf = PdfFileReader(open(filename, "rb"))
  content = "" #content是输出文本
  for i in range(0,pdf.getNumPages()): #遍历每一页
    pageObj = pdf.getPage(i)
    try:
      extractedText = pageObj.extractText()#导出每一页的内容，如果当前页有图片的话就跳过
      content += extractedText + "\n"
    except BaseException:
      pass
  return content.encode("ascii", "ignore")


# 将获取的内容写入txt文件
with open("test.txt","w") as f:
  count=0 #count的作用是限制每一行的文字个数，本人设置的是十行
  #将获取的文本变成字符串并用空白隔开
  for item in str(getPdfContent("test.pdf")).split(" "):
    # 如果当前文字以句号结尾就换行
    if item[-1]==".":
      f.write(item+"\n")
      count=0
    else:
      f.write(item+" ")
      count +=1
    # 如果写了十个字就换行
    if count==10:
      f.write("\n")
      # 重置count
      count = 0

总结

到此这篇关于python读取pdf格式文档的文章就介绍到这了,更多相关python读取pdf文档内容请搜索编程网以前的文章或继续浏览下面的相关文章希望大家以后多多支持编程网！

您可能感兴趣的文档:

点击免费下载>>软考高级考试备考技巧/历年真题/备考精华资料

--结束END--

本文标题: python读取pdf格式文档的实现代码

本文链接: https://www.lsjlt.com/news/122762.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑，方便收藏和打印～

下载Word文档

去做题

猜你喜欢

python读取pdf格式文档的实现代码

python读取pdf文档一、准备工作安装对应的库 pip install pdfminer3k pip install pdfminer.six 二、部分变量的...

99+

2022-11-12
python如何读取pdf格式文档

这篇文章给大家分享的是有关python如何读取pdf格式文档的内容。小编觉得挺实用的，因此分享给大家做个参考，一起跟随小编过来看看吧。python读取pdf文档一、准备工作安装对应的库pip install pdfmi...

99+

2023-06-14
JAVA读取PDF、WORD文档实例代码

读取PDF文件jar引用<dependency> <groupid>org.apache.pdfbox</groupid> pdfbox</artifactid> <version...

99+

2023-05-31

java word文档 pdf文档
python读取pdf文档-实战

# -*- coding: utf-8 -*- #读取pdf文档 from pdfminer.converter import PDFPageAggregator from pdfminer.layout import LAPar...

99+

2023-01-31

实战文档 python
JAVA实现PDF转HTML文档的示例代码

本文是基于PDF文档转PNG图片,然后进行图片拼接，拼接后的图片转为base64字符串，然后拼接html文档写入html文件实现PDF文档转HTML文档。引入Maven依赖 &...

99+

2022-11-12
python读取word文档表格里的数据

首先需要安装相应的支持库：直接在命令行执行pip install python-docx 示例代码如下： import docx from docx import Document #导入库 path = "E:\\pyt...

99+

2023-01-31

表格文档数据
Java实现PDF转为Word文档的示例代码

目录代码编译环境将 PDF 转换为固定布局的 Doc/Docx 文档完整代码将 PDF 转换为流动形态的 Doc/Docx 文档完整代码效果图众所周知，PDF文档除了具有较强稳定性和...

99+

2023-01-28

Java实现PDF转Word Java PDF转Word Java PDF Word
ios 实现PDF,Word,Excel等文档类型的读取与预览

文章目录一、前言二、iCould相关配置三、功能实现 3.1 UIDocumentPickerViewController 选取...

99+

2023-10-26

UIDocument iCloud 文档上传文档预览文档下载
python读取excel格式的文件

使用 xlrd 能够很方便的读取 excel 文件内容，而且这是个跨平台的库，能够在windows，linux/unix，等平台上面使用。软件可以去这个地址http://www.lexicon.net/sjmachin/xlrd.htm下载...

99+

2023-01-31

格式文件 python
小程序中读取腾讯文档的表格数据的实现

目录1 创建连接器2 创建腾讯文档3 应用中访问腾讯文档3.1 获取sheet中的所有数据3.2 迭代行和列的数据4 总结日常生活中我们使用腾讯文档在线的收集各类数据，数据收集是比较...

99+

2022-11-13
python使用numpy按一定格式读取bin文件的实现

目录使用numpy按一定格式读取bin文件这里重点介绍fromfilepython读取bin文件并下发串口总结使用numpy按一定格式读取bin文件 python环境下，如何使用nu...

99+

2023-05-12

python使用numpy numpy读取bin文件 numpy按格式读取bin文件
利用Python实现读取Word文档里的Excel附件

目录解压缩Microsoft OLE2 文件分析与提取分析安装提取再次使用 file 分析完整代码如下使用正确的后缀保存附件安装获取后缀安装获取后缀正确的文件名群里有人提出这么一个需...

99+

2022-12-16

Python读取Word中Excel附件 Python读取Excel附件 Python Word Excel
python中csv格式文件如何实现写入与读取

这篇文章主要为大家展示了“python中csv格式文件如何实现写入与读取”，内容简而易懂，条理清晰，希望能够帮助大家解决疑惑，下面让小编带领大家一起研究并学习一下“python中csv格式文件如何实现写入与读取”这篇文章吧。csv的简单介绍...

99+

2023-06-29
JavaScript实现获取图片文件真实格式的示例代码

目录常见方式判断图片格式图像数据简单说明JS读取图片真实格式svg格式的判断总结前面博文有提到，当前主流浏览器能支持的图片格式，是七种：jpg、png、gif、bmp、ico、web...

99+

2023-02-21

JavaScript获取图片文件真实格式 JavaScript获取图片格式 JavaScript 图片格式
如何利用Python代码批量将PDF文件转为Word格式

本篇文章给大家分享的是有关如何利用Python代码批量将PDF文件转为Word格式，小编觉得挺实用的，因此分享给大家学习，希望大家阅读完这篇文章后可以有所收获，话不多说，跟着小编一起来看看吧。在日常工作或学习中，经常会遇到这样的无奈：“小任...

99+

2023-06-17
Python实现xml格式转txt格式的示例代码

目录1、前言2、分析xml、txt数据3、转换过程4、最后结果对比1、前言最近学习Yolo v5是遇见了个问题，找的数据集全是xml文件，VOC 的标注是 xml 格式的，而YOL...

99+

2022-11-13
Python+OCR实现文档解析的示例代码

目录介绍环境设置检测提取介绍文档解析涉及检查文档中的数据并提取有用的信息。它可以通过自动化减少了大量的手工工作。一种流行的解析策略是将文档转换为图像并使用计算机视觉进行识别。而文档...

99+

2022-11-11
基于pdf2docx模块Python实现批量将PDF转Word文档的完整代码教程

PDF文件是一种常见的文档格式，但是在编辑和修改时不太方便，因为PDF本质上是一种静态的文档格式。因此，有时候我们需要将PDF文件转换成Word格式，以便更好地编辑和修改文档。在本...

99+

2023-05-15

pdf2docx模块 Python PDF Python PDF转Word
Python读取文件夹下的所有文件实例代码

Python读取文件夹下的所有文件 os.listdir(path)是得到在path路径下所以文件的名称列表。 open...

99+

2022-11-12
Shell实现读取ini格式配置文件方法

ini文件格式一般都是由节、键、值三部分组成格式： [第一节 ] 第一个键 = 值第二个键 = 第二个值 [第二节 ] 第一个键 = val1,val2,val3 例子： [COM] KINGGOO...

99+

2022-06-04

配置文件格式方法