正则表达式中的量词,本质上就是用来控制匹配次数的一类特殊符号。它们就像语文中的“量词”一样,决定了某个字符或模式“出现多少次”才算匹配成功。理解这些量词,可以说是掌握正则表达式核心匹配逻辑的第一步。下面就来逐一拆解这些看似简单、实则暗藏机锋的符号。

1. *

import re

text = "aaaa"
pattern = re.compile(r'a*')
result = pattern.search(text)
print(result.group())  # 输出: aaaa

2. +

import re

text = "aaaa"
pattern = re.compile(r'a+')
result = pattern.search(text)
print(result.group())  # 输出: aaaa

3. ?

import re

text1 = "color"
text2 = "colour"
pattern = re.compile(r'colou?r')
result1 = pattern.search(text1)
result2 = pattern.search(text2)
print(result1.group())  # 输出: color
print(result2.group())  # 输出: colour

4. {n,}

import re

text = "aaaa"
pattern = re.compile(r'a{2,}')
result = pattern.search(text)
print(result.group())  # 输出: aaaa

5. {n,m}

import re

text = "aaaa"
pattern = re.compile(r'a{2,3}')
result = pattern.search(text)
print(result.group())  # 输出: aaa

值得注意的是,上面这些量词在默认情况下都是“贪婪”的。什么叫贪婪?就是它们会尽可能多地匹配符合条件的字符,直到无法再匹配为止。这种贪婪行为在某些场景下会导致回溯问题,影响匹配效率,甚至引发意想不到的结果。

那么,怎么让贪婪变成“非贪婪”呢?方法很简单,只需在量词后面加上一个问号 ? 即可,比如 *?+???{n,}?{n,m}?。非贪婪模式会尽可能少地匹配字符,只要满足条件就立刻停止。不过,非贪婪模式虽然能解决一些回溯问题,但也可能无法达到你的预期结果,具体用哪一种,还得根据实际需求来权衡。

总结

本文转载于:https://www.jb51.net/program/344648jp4.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。