展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > Python正则表达式的用法实用技巧总结

Python正则表达式的用法实用技巧总结

正则表达式是Python文本处理的核心工具,借助re模块实现匹配、查找、替换。掌握元字符、字符类、分组捕获、贪婪与非贪婪匹配等基础,以及预查、命名分组、编译优化等高级技巧,可高效完成数据清洗、验证邮箱、提取URL等任务。

要说Python里哪个工具最实用,正则表达式绝对排得上号。它就像文本世界里的瑞士军刀——匹配、查找、替换字符串中的特定模式,干起活来效率极高。而Python通过内置的re模块,把这把刀递到了每位开发者手里。

import re

常用元字符

元字符是什么?就是正则表达式里那些拥有“特异功能”的符号。掌握它们,就等于拿到了入门钥匙。下面这张表是基本功,值得收藏:

  • .:匹配任意单个字符(换行符除外)。
  • ^:锚定字符串的开头。
  • $:锚定字符串的结尾。
  • *:匹配前面的字符零次或多次。
  • +:匹配前面的字符一次或多次。
  • ?:匹配前面的字符零次或一次。
  • {n}:匹配前面的字符恰好 n 次。
  • {n,}:匹配前面的字符至少 n 次。
  • {n,m}:匹配前面的字符至少 n 次,至多 m 次。
  • []:匹配括号内的任意一个字符。
  • |:表示“或”关系。

举个例子,用a.b这个模式去匹配字符串"aab abb acb",看看会发生什么?

import re
pattern = r"a.b"
text = "aab abb acb"
matches = re.findall(pattern, text)
print(matches)  # 输出: ['aab', 'abb', 'acb']

Python正则表达式的用法实用技巧总结

字符类

字符类是一个字符集合,专门用来匹配“这一类”中的任意一个。无论是数字、字母还是空白,全都能搞定:

  • \d:匹配任意数字,等价于[0-9]
  • \D:匹配任意非数字。
  • \w:匹配任意字母、数字或下划线。
  • \W:匹配任意非字母、数字或下划线。
  • \s:匹配任意空白字符(空格、制表符、换行符等)。
  • \S:匹配任意非空白字符。

比如,你想从一大段文本里找出美国社保号(格式是123-45-6789),一句正则就能搞定:

pattern = r"\d{3}-\d{2}-\d{4}"
text = "My SSN is 123-45-6789."
match = re.search(pattern, text)
if match:
    print("Found SSN:", match.group())  # 输出: Found SSN: 123-45-6789

Python正则表达式的用法实用技巧总结

分组与捕获

圆括号()不光能分组,还能“捕获”匹配到的内容。捕获到的内容通过group()方法按编号提取,非常灵活:

pattern = r"(\d{3})-(\d{2})-(\d{4})"
text = "My SSN is 123-45-6789."
match = re.search(pattern, text)
if match:
    print("Full match:", match.group(0))  # 输出: Full match: 123-45-6789
    print("Group 1:", match.group(1))  # 输出: Group 1: 123
    print("Group 2:", match.group(2))  # 输出: Group 2: 45
    print("Group 3:", match.group(3))  # 输出: Group 3: 6789

Python正则表达式的用法实用技巧总结

非捕获分组

有些场景下,我们只是想分组,并不需要捕获内容。这时候就用(?:...)语法,既保持了逻辑分组,又省去了不必要的内存开销:

pattern = r"(?:\d{3})-(\d{2})-(\d{4})"
text = "My SSN is 123-45-6789."
match = re.search(pattern, text)
if match:
    print("Full match:", match.group(0))  # 输出: Full match: 123-45-6789
    print("Group 1:", match.group(1))  # 输出: Group 1: 45
    print("Group 2:", match.group(2))  # 输出: Group 2: 6789

Python正则表达式的用法实用技巧总结

贪婪与非贪婪匹配

默认情况下,正则表达式是“贪婪”的——它会尽可能多地匹配字符。但你只要在量词后面加个?,它立刻变得“非贪婪”,点到为止:

pattern_greedy = r"<.*>"
pattern_non_greedy = r"<.*?>"
text = "Page Title"
match_greedy = re.search(pattern_greedy, text)
match_non_greedy = re.search(pattern_non_greedy, text)
print("Greedy match:", match_greedy.group())  # 全吃掉了
print("Non-greedy match:", match_non_greedy.group())  # 只吃第一个标签

Python正则表达式的用法实用技巧总结

查找与替换

re.sub()是处理文本替换的得力干将。比如想把字符串里所有数字都换成"X"

pattern = r"\d+"
text = "There are 3 apples and 5 oranges."
result = re.sub(pattern, "X", text)
print(result)  # 输出: There are X apples and X oranges.

Python正则表达式的用法实用技巧总结

编译正则表达式

如果一个正则表达式要反复使用,别每次都重新解析。用re.compile()把它编译成re.Pattern对象,性能会有明显提升:

pattern = re.compile(r"\d{3}-\d{2}-\d{4}")
text = "My SSN is 123-45-6789."
match = pattern.search(text)
if match:
    print("Found SSN:", match.group())  # 输出: Found SSN: 123-45-6789

Python正则表达式的用法实用技巧总结

多行匹配

默认情况下,^$只匹配整个字符串的开头和结尾。但如果加上re.MULTILINE标志,它们就能分别匹配每一行的开头和结尾了:

pattern = r"^\d+"
text = "1 apple\n2 oranges\n3 bananas"
matches = re.findall(pattern, text, re.MULTILINE)
print(matches)  # 输出: ['1', '2', '3']

Python正则表达式的用法实用技巧总结

忽略大小写

配合re.IGNORECASE标志,正则匹配时不再区分大小写——这在处理用户输入时尤其有用:

pattern = r"apple"
text = "Apple is a fruit."
match = re.search(pattern, text, re.IGNORECASE)
if match:
    print("Found:", match.group())  # 输出: Found: Apple

Python正则表达式的用法实用技巧总结

正则表达式的高级技巧

正向预查

(?=...)——匹配一个后面跟着特定模式的位置,但不消耗那个模式本身。例如,要匹配“后面跟着‘dollars’的数字”:

pattern = r"\d+(?= dollars)"
text = "I ha ve 100 dollars."
match = re.search(pattern, text)
if match:
    print("Found:", match.group())  # 输出: Found: 100

Python正则表达式的用法实用技巧总结

负向预查

(?!...)——与正向预查相反,它匹配后面不跟着特定模式的位置:

pattern = r"\d+(?! dollars)"
text = "I ha ve 100 euros."
match = re.search(pattern, text)
if match:
    print("Found:", match.group())  # 输出: Found: 100

Python正则表达式的用法实用技巧总结

命名分组

(?P...)可以给捕获的分组起个名字。后续用名字引用,代码的可读性瞬间拉满:

pattern = r"(?P\d{3})-(?P\d{2})-(?P\d{4})"
text = "My SSN is 123-45-6789."
match = re.search(pattern, text)
if match:
    print("Area:", match.group("area"))  # 输出: Area: 123
    print("Group:", match.group("group"))  # 输出: Group: 45
    print("Serial:", match.group("serial"))  # 输出: Serial: 6789

Python正则表达式的用法实用技巧总结

调试与性能优化

正则表达式写起来爽,但调起来也可能让人头疼。不妨试试re.DEBUG标志,它能把正则表达式引擎的解析过程打印出来,帮你理清思路:

pattern = re.compile(r"\d{3}-\d{2}-\d{4}", re.DEBUG)

至于性能,有几个小诀窍:尽量用非贪婪匹配;避免嵌套量词;预编译正则表达式;需要遍历大量匹配时,用re.finditer()代替re.findall(),前者是惰性求值,能省不少内存:

pattern = re.compile(r"\d{3}-\d{2}-\d{4}")
text = "My SSN is 123-45-6789."
for match in pattern.finditer(text):
    print("Found SSN:", match.group())

正则表达式的常见应用场景

验证电子邮件地址

虽然电子邮件的完整验证很复杂,但一个简单的正则就能过滤掉大部分无效输入:

pattern = r"^[a-zA-Z0-9_.+-]+@[a-zA-Z0-9-]+\.[a-zA-Z0-9-.]+$"
email = "example@example.com"
if re.match(pattern, email):
    print("Valid email address")
else:
    print("Invalid email address")

提取 URL

从文本中抓取网址?一行代码的事儿:

pattern = r"https?://(?:www\.)?\S+"
text = "Visit https://example.com for more info."
matches = re.findall(pattern, text)
print(matches)  # 输出: ['https://example.com']

Python正则表达式的用法实用技巧总结

提取 HTML 标签

处理简单的HTML时,正则也能发挥余热——比如抓取所有标签名和其中的内容:

pattern = r"<(\w+)[^>]*>(.*?)"
html = "

Title

Paragraph

" matches = re.findall(pattern, html) print(matches) # 输出: [('h1', 'Title'), ('p', 'Paragraph')]

Python正则表达式的用法实用技巧总结

总结

正则表达式是文本处理领域的核心技能,基础语法加上高级技巧,足以应对绝大多数模式匹配和替换任务。从简单的数据清洗到复杂的文本解析,只要用得巧妙,它总能给你带来惊喜。说到底,它是任何一位Python开发者工具箱里不可或缺的利器。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发 Python
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。