发布于2026-07-23 阅读(0)
扫一扫,手机访问
正则表达式中的量词,本质上就是用来控制匹配次数的一类特殊符号。它们就像语文中的“量词”一样,决定了某个字符或模式“出现多少次”才算匹配成功。理解这些量词,可以说是掌握正则表达式核心匹配逻辑的第一步。下面就来逐一拆解这些看似简单、实则暗藏机锋的符号。
a* 在字符串 "aaaa" 中,匹配的是整个 "aaaa"。因为它会尽可能多地匹配字符,直到无法继续为止。import re text = "aaaa" pattern = re.compile(r'a*') result = pattern.search(text) print(result.group()) # 输出: aaaa
a+ 在字符串 "aaaa" 中,同样会匹配整个 "aaaa"。但如果字符串是空字符串,它会匹配失败。import re text = "aaaa" pattern = re.compile(r'a+') result = pattern.search(text) print(result.group()) # 输出: aaaa
colou?r 可以同时匹配 "color" 和 "colour"。这里的 u? 表示字母 u 要么出现一次,要么不出现。import re text1 = "color" text2 = "colour" pattern = re.compile(r'colou?r') result1 = pattern.search(text1) result2 = pattern.search(text2) print(result1.group()) # 输出: color print(result2.group()) # 输出: colour
n 次。这是一个“下限”条件,上不封顶。a{2,} 在字符串 "aaaa" 中,匹配整个 "aaaa"。因为它要求 a 至少出现 2 次,而字符串中有 4 次,满足条件。
import re
text = "aaaa"
pattern = re.compile(r'a{2,}')
result = pattern.search(text)
print(result.group()) # 输出: aaaa
n 次,但不超过 m 次。这是一个“区间”条件,既设了下限也设了上限。a{2,3} 在字符串 "aaaa" 中,匹配的是前三个 a,即 "aaa"。因为它会尽量在 2 到 3 次的范围内进行最大匹配,但不会超过 3 次。
import re
text = "aaaa"
pattern = re.compile(r'a{2,3}')
result = pattern.search(text)
print(result.group()) # 输出: aaa
值得注意的是,上面这些量词在默认情况下都是“贪婪”的。什么叫贪婪?就是它们会尽可能多地匹配符合条件的字符,直到无法再匹配为止。这种贪婪行为在某些场景下会导致回溯问题,影响匹配效率,甚至引发意想不到的结果。
那么,怎么让贪婪变成“非贪婪”呢?方法很简单,只需在量词后面加上一个问号 ? 即可,比如 *?、+?、??、{n,}?、{n,m}?。非贪婪模式会尽可能少地匹配字符,只要满足条件就立刻停止。不过,非贪婪模式虽然能解决一些回溯问题,但也可能无法达到你的预期结果,具体用哪一种,还得根据实际需求来权衡。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8