正则表达式中的量词,本质上就是用来控制匹配次数的一类特殊符号。它们就像语文中的“量词”一样,决定了某个字符或模式“出现多少次”才算匹配成功。理解这些量词,可以说是掌握正则表达式核心匹配逻辑的第一步。下面就来逐一拆解这些看似简单、实则暗藏机锋的符号。
1. *
- 含义:匹配前面的元素零次或者多次。简单来说,就是“有也行,没有也行,多了更好”。
- 示例:正则表达式
a*在字符串"aaaa"中,匹配的是整个"aaaa"。因为它会尽可能多地匹配字符,直到无法继续为止。 - 代码示例(Python):
import re text = "aaaa" pattern = re.compile(r'a*') result = pattern.search(text) print(result.group()) # 输出: aaaa
2. +
- 含义:匹配前面的元素一次或者多次。和 * 的区别在于,它至少要求出现一次,不能“没有”。
- 示例:正则表达式
a+在字符串"aaaa"中,同样会匹配整个"aaaa"。但如果字符串是空字符串,它会匹配失败。 - 代码示例(Python):
import re text = "aaaa" pattern = re.compile(r'a+') result = pattern.search(text) print(result.group()) # 输出: aaaa
3. ?
- 含义:匹配前面的元素零次或者一次。最多只能出现一次,相当于“最多一个”。
- 示例:正则表达式
colou?r可以同时匹配"color"和"colour"。这里的u?表示字母u要么出现一次,要么不出现。 - 代码示例(Python):
import re text1 = "color" text2 = "colour" pattern = re.compile(r'colou?r') result1 = pattern.search(text1) result2 = pattern.search(text2) print(result1.group()) # 输出: color print(result2.group()) # 输出: colour
4. {n,}
- 含义:匹配前面的元素至少
n次。这是一个“下限”条件,上不封顶。 - 示例:正则表达式
a{2,}在字符串"aaaa"中,匹配整个"aaaa"。因为它要求a至少出现 2 次,而字符串中有 4 次,满足条件。 - 代码示例(Python):
import re
text = "aaaa"
pattern = re.compile(r'a{2,}')
result = pattern.search(text)
print(result.group()) # 输出: aaaa
5. {n,m}
- 含义:匹配前面的元素至少
n次,但不超过m次。这是一个“区间”条件,既设了下限也设了上限。 - 示例:正则表达式
a{2,3}在字符串"aaaa"中,匹配的是前三个a,即"aaa"。因为它会尽量在 2 到 3 次的范围内进行最大匹配,但不会超过 3 次。 - 代码示例(Python):
import re
text = "aaaa"
pattern = re.compile(r'a{2,3}')
result = pattern.search(text)
print(result.group()) # 输出: aaa
值得注意的是,上面这些量词在默认情况下都是“贪婪”的。什么叫贪婪?就是它们会尽可能多地匹配符合条件的字符,直到无法再匹配为止。这种贪婪行为在某些场景下会导致回溯问题,影响匹配效率,甚至引发意想不到的结果。
那么,怎么让贪婪变成“非贪婪”呢?方法很简单,只需在量词后面加上一个问号 ? 即可,比如 *?、+?、??、{n,}?、{n,m}?。非贪婪模式会尽可能少地匹配字符,只要满足条件就立刻停止。不过,非贪婪模式虽然能解决一些回溯问题,但也可能无法达到你的预期结果,具体用哪一种,还得根据实际需求来权衡。