展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > Python实现读取PDF并提取文本和图片

Python实现读取PDF并提取文本和图片

Spire.PDFforPython可仅用几行代码实现PDF文本与图片提取,支持文件或数据流加载。PyMuPDF(fitz)全能高效,同时提取文本图片并支持OCR;pdfplumber擅长表格提取;pypdf轻量适用于纯文本。根据需求选择合适库即可提升文档处理效率。

在日常工作和学习中,我们经常会遇到需要从 PDF 文件中批量提取文本或图片的情况。比如,整理一份扫描版合同中的条款,或者收集一份产品手册里所有的配图。

之前处理 PDF 可能会让人感到头疼,但有了合适的库,这一切都变得简单。今天,我们来聊聊如何用 Spire.PDF for Python 这个库,仅需几行代码,就能轻松搞定 PDF 中的文本和图片提取。

Python实现读取PDF并提取文本和图片

在开始之前,请确保你已经安装了 Spire.PDF 库:

pip install Spire.PDF

1. 加载 PDF 文档

在进行任何操作之前,首先需要将 PDF 文件加载到我们的代码中。Spire.PDF 非常灵活,支持 从文件路径加载 ,也支持 从数据流(Stream)加载 。具体用哪种,取决于你的数据来源。

方式一:从文件加载

这是最直接的方式,适用于本地磁盘上的固定文件。

from spire.pdf import PdfDocument

# 创建一个 PdfDocument 实例
pdf = PdfDocument()
# 加载本地的 PDF 文档
pdf.LoadFromFile("sample.pdf")

方式二:从数据流加载

如果你的 PDF 数据是从网络接口接收到的,或者是通过其他方式在内存中生成的字节数据,这种方式就非常实用。

from spire.pdf import PdfDocument, Stream

# 将文件读取为字节数组(这里演示从文件读,实际也可以来自网络)
with open("sample.pdf", "rb") as f:
    byte_data = f.read()

# 创建数据流对象
pdfStream = Stream(byte_data)
# 从流中加载 PDF
pdf = PdfDocument(pdfStream)

2. 提取文本

文本提取是处理文档最常用的功能之一。下面的代码演示了如何遍历 PDF 的所有页面,并将每一页的文本拼接起来。

主要用到 PdfTextExtractorPdfTextExtractOptions 这两个辅助类。设置 IsExtractAllText = True 可以确保提取出页面上的大部分可见文本。当然,你还可以根据需求调整其他选项,这里只展示最简洁的写法。

# 假设 pdf 对象已经通过上面的方式加载完成
all_text = ""

# 循环遍历每一页
for pageIndex in range(pdf.Pages.Count):
    # 根据索引获取当前页
    page = pdf.Pages.get_Item(pageIndex)

    # 创建文本提取器
    text_extractor = PdfTextExtractor(page)

    # 配置提取选项
    options = PdfTextExtractOptions()
    options.IsExtractAllText = True
    options.IsSimpleExtraction = True

    # 执行提取并累加
    all_text += text_extractor.ExtractText(options)

# 打印结果
print(all_text)

3. 提取图片

很多时候,PDF 里的关键信息其实藏在插图或图表里。Spire.PDF 同样为我们准备了非常便捷的图片提取方案。

通过 PdfImageHelper 帮助类,我们可以直接获取页面上的图片信息,然后一键保存为图片文件(如 .png 格式)。注意,这里我们只提取了第一页的图片作为演示,如果要提取所有页面,嵌套一层循环即可。

# 获取第一页(索引为0)
page = pdf.Pages.get_Item(0)

# 创建图片辅助对象
image_helper = PdfImageHelper()
# 获取该页面上的所有图片信息
images_info = image_helper.GetImagesInfo(page)

# 遍历并保存每一张图片
for i in range(len(images_info)):
    # 保存为 PNG 格式
    images_info[i].Image.Sa ve(f"output/Images/image_{i}.png")

print(f"成功提取 {len(images_info)} 张图片")

注意 :如果是扫描件(图片型 PDF),提取出来的其实是一整张扫描图;如果是电子文档生成的 PDF,则能精准提取出嵌入的独立图标或照片。这一点需要根据实际情况区分。

4. 进阶提示

虽然上述代码已经覆盖了基础需求,但在实际应用中还有几点值得留意:

  1. 分页处理 :示例中为了演示,提取了所有文本。如果你想按页处理,只需在循环中控制 pageIndex 即可。例如,只提取第3到第5页。
  2. 中文支持 :该库对中文支持良好,提取中文 PDF 时只要保持编码环境为 UTF-8 即可。如果遇到乱码,检查一下编码设置。
  3. 免费版限制 :如果你使用的是免费版的 Spire.PDF,请注意它通常对处理的页数有限制(例如仅支持前 10 页)。如果需要处理页数较多的文档,可能需要评估商业版。不过对于大多数日常小任务,免费版完全够用。

5. 方法补充

提取 PDF 中的文本和图片,关键在于根据文档类型和需求选择合适的库。如果追求通用与平衡PyMuPDF (fitz) 是首选:它速度极快,能同时完美提取文本和图片,且支持对扫描版 PDF 进行光学字符识别 (OCR)。下面列一个主流工具的对比,方便你快速决策。

主流 Python PDF 提取工具对比

库名核心特长处理速度推荐指数最佳适用场景
PyMuPDF (fitz)全能、高速、稳定极快★★★★★大多数通用场景,尤其是需要同时提取文本和图片时。
pdfplumber表格提取精准、API 友好较慢★★★★☆处理需要精确提取复杂表格的金融、数据类报告。
pdf-oxide极致性能最快★★★★☆性能瓶颈项目、大规模批量处理;纯文本提取极快。
pypdf轻量、功能基础一般★★★☆☆仅需快速提取纯文本或合并、拆分 PDF 等操作。
pdfminer.six布局分析准确一般★★☆☆☆需要深入了解页面布局坐标,且有能力二次开发的场景。

如果你的 PDF 是扫描件(由图片组成),PyMuPDF 仍是首选,因为它集成了 OCR 功能。对于纯文本提取速度有极致要求,可以尝试新的高性能库 pdf-oxide

下面用最小化代码来演示最核心的三个库,方便你直接复制使用。

1. PyMuPDF (fitz) - 全能首选

PyMuPDF 是处理 PDF 的瑞士军刀,以其卓越的性能和对文本、图片的完美支持而闻名。安装后直接用:

pip install PyMuPDF

提取文本和图片的完整示例

下面的代码展示了如何打开一个 PDF 文件,遍历每一页,提取其中的所有文本,并将页面上的所有图片保存下来。注意,fitz 是 PyMuPDF 的导入名。

import fitz  # PyMuPDF 的导入名

def extract_text_and_images(pdf_path):
    """从PDF中提取文本并保存所有图片"""
    doc = fitz.open(pdf_path)
    full_text = ""
    for page_num in range(len(doc)):
        page = doc[page_num]
        # 1. 提取当前页的文本
        page_text = page.get_text()
        full_text += page_text
        # 2. 提取当前页的图片
        image_list = page.get_images(full=True)
        for img_index, img in enumerate(image_list):
            xref = img[0]  # 图片的引用ID
            base_image = doc.extract_image(xref)
            image_bytes = base_image["image"]
            image_ext = base_image["ext"]  # 图片扩展名,如 'png', 'jpeg'
            with open(f"image_page{page_num+1}_{img_index}.{image_ext}", "wb") as img_file:
                img_file.write(image_bytes)
    doc.close()
    return full_text

# 使用示例
text_content = extract_text_and_images("your_document.pdf")
print(text_content[:500]) # 打印前500个字符

2. pdfplumber - 表格提取的利器

当你的 PDF 包含表格时,pdfplumber 的 extract_table() 方法非常强大,可以智能解析并提取表格结构。安装后操作也很简单:

pip install pdfplumber

提取表格并打印

import pdfplumber

with pdfplumber.open("table_file.pdf") as pdf:
    first_page = pdf.pages[0]
    # 尝试自动识别并提取页面上的第一个表格
    table = first_page.extract_table()
    if table:
        for row in table:
            print(row)   # 打印表格的每一行

3. pypdf - 简单文本提取

如果你只需要提取纯文本,不关心图片和格式,pypdf 是一个轻量级的选择。核心代码就几行:

pip install pypdf

基础文本提取

from pypdf import PdfReader

reader = PdfReader("example.pdf")
text = ""
for page in reader.pages:
    text += page.extract_text()
print(text)

进阶技巧:处理扫描版 PDF(OCR)

如果 PDF 是扫描件或图片型 PDF(无法直接选中文字),PyMuPDF 内部集成了对 Tesseract 的支持。只需要调用 get_textpage_ocr() 即可生成可提取的文字层:

import pymupdf  # 注意,这里导入名是 pymupdf,与上文的 fitz 等价

doc = pymupdf.open("scanned.pdf")
for page in doc:
    # 获取 OCR 文本页,如果已有文本层,常规方法也能拿到
    tp = page.get_textpage_ocr()
    text = page.get_text(textpage=tp)
    print(text)

6. 总结

通过 Spire.PDF for Python,你会发现处理 PDF 文件变得如此简单。无论是读取文件、逐页分析文字,还是把珍贵的插图保存下来,只需要短短的十几行代码就能搞定。这大大提升了文档处理的效率,让你能专注于下一步的数据分析或业务逻辑。

当然,如果遇到更复杂的场景(比如扫描件、复杂表格),PyMuPDF 和 pdfplumber 也是值得投入研究的备选方案。现在就去试试吧,用代码解放你的双手!

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发 Python
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。