首頁手記盤點一個批量提取pdf文件目標信息的實用案例

盤點一個批量提取pdf文件目標信息的實用案例

標簽：

Python 機器學習人工智能

大家好，我是皮皮。

一、前言

前几天在帮助粉丝解决问题的时候，遇到一个简单的小需求，需要批量提取pdf文件目标信息，这里拿出来跟大家一起分享，后面再次遇到的时候，可以从这里得到灵感。

二、需求澄清

下面他下载的pdf文件，有几百个文件，这里拿出部分做示例，每个pdf文件里边有一个统一社会信用代码，后面的数字和字符是他的目标信息，需要提取出来。

三、实现过程

这里实现主要借用了pdf文件读取库和正则表达式来提取，先给出单个pdf文件提取的方法，代码如下所示：

from pdfminer import high_level
import re

text = high_level.extract_text('1.pdf')  # 提取pdf中的文本信息
# print(text)
regex = r'统一社会信用代码：(.*?)\n'
xinyongcode = re.findall(regex, text)
print(xinyongcode)

有了前面的代码打底之后，接下来就可以实现批量处理了，代码如下所示：

from pdfminer import high_level
from pdfminer.layout import LTTextContainer  # 文本容器
import re
import os

for root, dirs, files in os.walk('./'):
    # root 表示当前正在访问的文件夹路径; dirs 表示该文件夹下的子目录名list;files 表示该文件夹下的文件list
    # 遍历文件
    for f in files:
        file_name = os.path.join(root, f)
        if file_name.endswith('.pdf'):
            text = high_level.extract_text(file_name)  # 提取pdf中的文本信息
            regex = r'统一社会信用代码：(.*?)\n'
            xinyongcode = re.findall(regex, text)
            print(xinyongcode[0])

代码运行之后，可以依次得到所有文件携带的目标信息，如下图所示：

剩下的工作就不多赘述了，大家自行考虑即可。

三、总结

大家好，我是皮皮。这篇文章主要盘点一个批量提取pdf文件目标信息的实用案例，文中针对该问题，给出了具体的解析和代码实现，帮助粉丝顺利解决了问题。

點擊查看更多內容

為 TA 點贊

若覺得本文不錯，就分享一下吧！

評論

評論

共同學習，寫下你的評論

評論加載中...

展開查看更多評論

作者其他優質文章

正在加載中

慕先生0340613

手記
篇

粉絲

23

獲贊與收藏

124

關注作者，訂閱最新文章

閱讀免費教程

Python 辦公自動化教程

17個小節 27229 923

Python 算法入門教程

15個小節 29860 1149

Python 進階應用教程

38個小節 71803 1122

推薦

評論

收藏

共同學習，寫下你的評論



感謝您的支持，我會繼續努力的～

掃碼打賞，你說多少就多少

贊賞金額會直接到老師賬戶

支付方式

打開微信掃一掃，即可進行掃碼打賞哦

今天注冊有機會得

100積分直接送

付費專欄免費學

大額優惠券免費領

立即參與放棄機會

點擊
抽獎

慕課手記新用戶專享福利

恭喜你，你的運氣太好了，居然抽中了 100個積分！

恭喜你，抽中了價值元的專欄！

太棒了，直接落到你賬戶里！

積分商城里的羅技鼠標、機械鍵盤、
Kindle 閱讀器、小米平衡車
Apple iPad （10.2英寸）、大額優惠券
在等著你去兌換了噢

作者：

免費贈送

兌換碼：1111222211 復制

優惠券可用于購買實戰課、體系課
無門檻使用

先去看看，有什么好東西馬上兌換我愛學習，選課去


亚洲在线久爱草,狠狠天天香蕉网,天天搞日日干久草,伊人亚洲日本欧美

熱搜

最近搜索清空

盤點一個批量提取pdf文件目標信息的實用案例

一、前言

二、需求澄清

三、实现过程

三、总结

閱讀免費教程