展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > 使用Python轻松获取Word文本框中的文字和图片

使用Python轻松获取Word文本框中的文字和图片

使用Python的Spire.Doc库可通过遍历文本框对象模型,提取其中的段落文字、表格数据及图片。通过判断子对象类型,读取文字或表格单元格内容,利用ImageBytes属性导出图片。该方法支持嵌套文本框和编码处理,适用于文档自动化迁移与归档。

Word文档里的文本框,是个挺实用的设计——它能把独立的文字段落、表格甚至图片都“打包”起来,放在文档的任意位置。但在实际工作中,比如做文档迁移、数据归档或者批量处理时,经常会遇到一个需求:怎么把这些藏在文本框里的文字和图片“捞”出来?和正文不一样,文本框里的内容并不在文档主段落流里,得通过专门的文档对象模型去遍历和访问。下面就来聊聊,怎么用Python把Word文本框里的文字、表格数据和嵌入的图片,系统性地提取出来。

环境准备

这次我们用到的工具是Spire.Doc for Python。这个库提供了完整的文档对象模型,能很方便地遍历文本框里的子对象,然后按类型分别处理。安装命令很简单:

pip install Spire.Doc

装好之后,在脚本里导入需要的模块就能开工了。

from spire.doc import *
from spire.doc.common import *

遍历文本框并提取文字

在Spire.Doc的对象模型里,文本框对应的是TextBox类型。它的内部内容通过Body属性暴露出来,结构和文档主体很像。文本框里可能既包含段落,也可能嵌套表格,所以需要遍历ChildObjects集合,然后根据每个子对象的DocumentObjectType来判断该走哪条路。这种逐层遍历的方法,能确保不遗漏任何嵌套结构里的文字。

from spire.doc import *
from spire.doc.common import *

inputFile = "/文本框.docx"
outputFile = "ExtractedText.txt"

# 加载文档
document = Document()
document.LoadFromFile(inputFile)

# 检查文档中是否包含文本框
if document.TextBoxes.Count > 0:
    with open(outputFile, 'w', encoding='utf-8') as sw:
        for i in range(document.TextBoxes.Count):
            textbox = document.TextBoxes.get_Item(i)
            # 遍历文本框内的子对象
            for j in range(textbox.Body.ChildObjects.Count):
                obj = textbox.Body.ChildObjects.get_Item(j)
                # 提取段落文字
                if obj.DocumentObjectType == DocumentObjectType.Paragraph:
                    para = obj if isinstance(obj, Paragraph) else None
                    sw.write(para.Text + "n")
                # 提取表格中的文字
                if obj.DocumentObjectType == DocumentObjectType.Table:
                    table = obj if isinstance(obj, Table) else None
                    for row_idx in range(table.Rows.Count):
                        row = table.Rows[row_idx]
                        for cell_idx in range(row.Cells.Count):
                            cell = row.Cells[cell_idx]
                            for para_idx in range(cell.Paragraphs.Count):
                                para = cell.Paragraphs.get_Item(para_idx)
                                sw.write(para.Text + "t")
                        sw.write("n")

document.Close()

使用Python轻松获取Word文本框中的文字和图片

这段代码的逻辑很清晰:先通过document.TextBoxes拿到文档里所有的文本框,然后对每个文本框,用Body.ChildObjects遍历它内部的子对象。碰到Paragraph类型的,直接读Text属性就行;碰到Table类型的,就再往下走一层——遍历表格的行、单元格、单元格里的段落,一个个提取文字。为了让表格结构保留下来,同一行里不同单元格的内容用t制表符隔开,不同行之间用n换行。这样提取出来的文本,后续处理起来就很方便了。

从文本框中读取表格数据

有时候,我们明确知道文本框里装的就是一个表格,而且希望用更结构化的方式去读它。这时候,可以直接通过Body.Tables集合来访问,不用再绕路去遍历ChildObjects。这种方法更直接,适合对文本框内部结构比较熟悉的场景。

from spire.doc import *
from spire.doc.common import *

inputFile = "./Data/TextBoxTable.docx"
outputFile = "TableFromTextBox.txt"

# 加载文档
doc = Document()
doc.LoadFromFile(inputFile)

# 获取第一个文本框
textbox = doc.TextBoxes[0]

# 获取文本框中的第一个表格
table = textbox.Body.Tables[0] if isinstance(textbox.Body.Tables[0], Table) else None

result = ""
for i in range(table.Rows.Count):
    row = table.Rows.get_Item(i)
    for j in range(row.Cells.Count):
        cell = row.Cells.get_Item(j)
        for k in range(cell.Paragraphs.Count):
            paragraph = cell.Paragraphs.get_Item(k)
            result += paragraph.Text + "t"
    result += "n"

with open(outputFile, 'w', encoding='utf-8') as fp:
    fp.write(result)

doc.Close()

这段代码更简短:直接通过doc.TextBoxes[0]拿到第一个文本框,然后通过textbox.Body.Tables[0]拿到它里面的第一个表格。之后按行→单元格→段落的层次结构遍历,把每个单元格的文字拼出来。如果你的表格位置是固定的,这种写法能省下不少遍历开销。

提取文本框中的图片

文本框里的图片,在Spire.Doc里是以DocPicture对象来表示的,它的ImageBytes属性里存着图片的二进制数据。提取图片的思路和提取文字差不多:遍历文本框的子对象,一旦发现类型是Picture的,就读取它的ImageBytes,然后写入文件。不过有个细节要注意——图片通常嵌套在段落里面,所以需要递归遍历所有层级的子对象。

from spire.doc import *
from spire.doc.common import *
import os

inputFile = "./Data/TextBoxWithImages.docx"
outputDir = "ExtractedImages/"

if not os.path.exists(outputDir):
    os.makedirs(outputDir)

# 加载文档
document = Document()
document.LoadFromFile(inputFile)

image_index = 0

# 遍历所有文本框
for i in range(document.TextBoxes.Count):
    textbox = document.TextBoxes.get_Item(i)
    # 遍历文本框中的子对象
    for j in range(textbox.Body.ChildObjects.Count):
        obj = textbox.Body.ChildObjects.get_Item(j)
        # 检查是否为段落,图片通常嵌套在段落中
        if obj.DocumentObjectType == DocumentObjectType.Paragraph:
            para = obj if isinstance(obj, Paragraph) else None
            for k in range(para.ChildObjects.Count):
                child = para.ChildObjects.get_Item(k)
                if child.DocumentObjectType == DocumentObjectType.Picture:
                    picture = child if isinstance(child, DocPicture) else None
                    # 获取图片二进制数据并保存
                    image_bytes = picture.ImageBytes
                    image_path = os.path.join(outputDir, f"Image-{image_index}.png")
                    with open(image_path, 'wb') as img_file:
                        img_file.write(image_bytes)
                    image_index += 1
                    print(f"已保存图片: {image_path}")

document.Close()

使用Python轻松获取Word文本框中的文字和图片

这段代码遍历了文档里所有的文本框。对每个文本框里的每个段落,再进一步遍历段落的ChildObjects集合。一旦发现子对象类型是Picture,就把它转成DocPicture对象,通过ImageBytes拿到原始图片字节流,然后以PNG格式写入文件。ImageBytes返回的是原始图片的字节数据,默认以PNG格式保存;如果原始图片是JPEG或其他格式,你可以根据实际需求修改文件扩展名。每个图片文件用序号命名,避免重名冲突。

实用技巧

同时提取文字和图片

实际应用中,文本框里经常是文字和图片混在一起的。可以把文字和图片的提取逻辑整合到一个遍历流程里:外层遍历到段落时,既提取段落文字,又检查段落里有没有图片子对象。这样一次遍历就能搞定所有内容,效率更高。

处理嵌套文本框

Word文档支持文本框嵌套,就是一个文本框里可能还藏着另一个文本框。如果在提取过程中遇到了DocumentObjectType.TextBox类型的子对象,就需要对它的Body做递归遍历,保证所有层级的内容都能被提取到。写一个递归函数来处理这个逻辑,是个不错的选择。

编码与换行处理

提取的文字写入文件时,强烈建议统一使用UTF-8编码(encoding='utf-8'),避免中文等非ASCII字符出现乱码。另外,不同操作系统对换行符的处理方式不一样——Windows用\r\n,Linux/macOS用\n。如果需要在特定平台上正确显示,可以针对性地调整换行符格式。

总结

这篇文章介绍了如何用Python结合Spire.Doc库,从Word文档的文本框中提取文字和图片。通过遍历文本框对象,结合文档结构,可以识别并读取其中的段落、表格等文本内容;同时,利用图片对象的ImageBytes属性,可以实现文本框内图片的导出。此外,还顺带聊了嵌套文本框、编码处理、换行符解析等常见场景的处理方法。虽然文本框里的内容不属于文档正文流,但借助Spire.Doc提供的对象模型,仍然可以灵活地访问和提取它们。掌握这些方法后,就能进一步应用到Word文档归档、数据迁移、内容分析以及批量文档处理等自动化场景中。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发 Python
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。