Python 3.6 中使用pdfminer解析pdf文件的实现-侯体宗的博客

Python 3.6 中使用pdfminer解析pdf文件的实现
Python / 管理员发布于 8年前 328

所使用python环境为最新的3.6版本

一、安装pdfminer模块

安装anaconda后，直接可以通过pip安装

pip install pdfminer3k

如上图所示安装成功。

二、在IDE中进行编码

#!/usr/bin/env python# encoding: utf-8"""@author: wugang@software: PyCharm@file: prase_pdf.py@time: 2017/3/3 0003 11:16"""import sysimport importlibimportlib.reload(sys)from pdfminer.pdfparser import PDFParser,PDFDocumentfrom pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreterfrom pdfminer.converter import PDFPageAggregatorfrom pdfminer.layout import LTTextBoxHorizontal,LAParamsfrom pdfminer.pdfinterp import PDFTextExtractionNotAllowed''' 解析pdf 文本，保存到txt文件中'''path = r'../../data/pdf/阿里巴巴Java开发规范手册.pdf'def parse():  fp = open(path, 'rb') # 以二进制读模式打开  #用文件对象来创建一个pdf文档分析器  praser = PDFParser(fp)  # 创建一个PDF文档  doc = PDFDocument()  # 连接分析器 与文档对象  praser.set_document(doc)  doc.set_parser(praser)  # 提供初始化密码  # 如果没有密码 就创建一个空的字符串  doc.initialize()  # 检测文档是否提供txt转换，不提供就忽略  if not doc.is_extractable:    raise PDFTextExtractionNotAllowed  else:    # 创建PDf 资源管理器 来管理共享资源    rsrcmgr = PDFResourceManager()    # 创建一个PDF设备对象    laparams = LAParams()    device = PDFPageAggregator(rsrcmgr, laparams=laparams)    # 创建一个PDF解释器对象    interpreter = PDFPageInterpreter(rsrcmgr, device)    # 循环遍历列表，每次处理一个page的内容    for page in doc.get_pages(): # doc.get_pages() 获取page列表      interpreter.process_page(page)      # 接受该页面的LTPage对象      layout = device.get_result()      # 这里layout是一个LTPage对象 里面存放着 这个page解析出的各种对象 一般包括LTTextBox, LTFigure, LTImage, LTTextBoxHorizontal 等等 想要获取文本就获得对象的text属性，      for x in layout:        if (isinstance(x, LTTextBoxHorizontal)):          with open(r'../../data/pdf/1.txt', 'a') as f:results = x.get_text()print(results)f.write(results + '\n')if __name__ == '__main__':  parse()

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

上一条：
利用python、tensorflow、opencv、pyqt5实现人脸实时签到系统
下一条：
Python实现串口通信（pyserial）过程解析

0条评论 (评论内容有缓存机制,请悉知!)

最新最热

近期评论
test1 在
opencode + Oh-my-openagent,我的第一个免费的ai编程智能体管家:Sisyphus中评论 test..
122 在
学历：一种延缓就业设计，生活需求下的权衡之选中评论工作几年后，报名考研了，到现在还没认真学习备考，迷茫中。作为一名北漂互联网打工人..
Zita 在
Google AI Studio升级全栈 vibe coding体验，可直接构建带登录和数据库的应用中评论 111222..
123 在
Clash for Windows作者删库跑路了，github已404中评论按理说只要你在国内，所有的流量进出都在监控范围内，不管你怎么隐藏也没用，想搞你分..
原梓番博客在
在Laravel框架中使用模型Model分表最简单的方法中评论好久好久都没看友情链接申请了，今天刚看，已经添加。..

Top