发布于2026-07-05 阅读(0)
扫一扫,手机访问
正则表达式,说到底,就是用来对付字符串的一把瑞士军刀。无论是做开发、搞数据分析,还是日常处理各种文档,只要跟文本打交道,这玩意儿就能让你效率翻倍。它的核心价值在于:用一套精巧的规则,去描述、匹配和操作你想要的文本模式,而不是靠肉眼一个一个去找。

下面,我们把正则表达式的核心知识点系统地过一遍。这是一份能让你随时翻查的实用速查表。
说到应用场景,几乎无处不在:你用的编程语言(Ja vaScript/Python/Ja va/PHP 等)里,你常用的文本编辑器(VS Code、Sublime)里,甚至数据库查询(SQL)里,都能看到它的身影。
这部分是正则表达式的“字母表”。要玩转正则,这些元字符是绕不开的基本功。
这里先列个最常用的对照表,方便随时回来翻看。
| 元字符 | 含义 | 示例 |
| . | 匹配任意单个字符(除了换行符\n、回车符\r) | a.b 可匹配 aab、acb,不匹配 ab |
| [] | 匹配括号内任意一个字符 | [abc] 匹配 a、b 或 c 中的任意一个 |
| [^] | 匹配不在括号内的任意字符 | [^abc] 匹配 d、e 等任何不是 a、b、c 的字符 |
| \d | 匹配数字(等价于 [0-9]) | \d{3} 匹配 123、456 等 3 位数字 |
| \D | 匹配非数字(等价于 [^0-9]) | \D 匹配 a、b 等非数字字符 |
| \w | 匹配数字、字母、下划线(等价于 [0-9a-zA-Z_]) | \w 匹配 1、a、b2、c5_ 等 |
| \W | 匹配非数字、字母、下划线(等价于 [^0-9a-zA-Z_]) | \W 匹配 @、#、¥ 等 |
| \s | 匹配空白字符(含空格“ ”、换行\n、回车\r、制表符\t 等) | a\sb 匹配 "a b"、"a\nb"、"a\rb" 等 |
| \S | 匹配非空白字符 | a\Sb 匹配 "ab",不匹配 "a b" |
当然,如果你真想匹配这些元字符本身(比如匹配小数点`.`、星号`*`),就得用到反斜杠`\`进行转义。比如`\.`匹配小数点,`\*`匹配星号。
量词是用来指定字符或分组出现次数的,没有它们,正则就只能匹配固定的字符。
| 量词 | 含义 | 示例 |
| * | 匹配 0 次或多次(尽可能多,即贪婪模式) | ab* 匹配 a、ab、abb 等 |
| + | 匹配 1 次或多次 | ab+ 匹配 ab、abb 等,不匹配 a |
| ? | 匹配 0 次或 1 次 | ab? 匹配 a、ab |
| {n} | 精确匹配 n 次 | ab{2} 匹配 abb |
| {n,} | 匹配至少 n 次 | ab{2,} 匹配 abb、abbb 等 |
| {n,m} | 匹配 n 到 m 次(包含 n 和 m) | ab{2,4} 匹配 abb、abbb、abbbb |
一个必须弄懂的细节是贪婪和非贪婪。默认情况下,量词是贪婪的,会尽可能多地匹配字符。如果你希望它“见好就收”,在量词后面加个问号`?`就行。比如,对字符串 "axxbxxb",正则`a.*b`会匹配整个 "axxbxxb",而`a.*?b`则只会匹配 "axxb"。
这类元字符不匹配具体字符,而是匹配字符之间的位置,用来定位字符串的边界。
| 元字符 | 含义 | 示例 |
| ^ | 匹配字符串开头(多行模式下匹配每行开头) | ^abc 匹配 "abcd",不匹配 "1abcd" |
| $ | 匹配字符串结尾(多行模式下匹配每行结尾) | abc$ 匹配 "1abc",不匹配 "abcd" |
| \b | 匹配单词边界(字母数字与非字母数字的交界处) | \bcat\b 匹配 "cat"、"cat!",不匹配 "category" |
| \B | 匹配非单词边界 | \Bcat\B 匹配 "category" 中的 "cat",不匹配单独的 "cat" |
这才是正则真正发力、变得灵活的地方。通过括号`()`,我们可以把多个字符“打包”成一个整体来处理。
| 名称 | 含义 | 示例 |
| 分组 | 用括号 () 将多个字符视为一个整体,可结合量词使用 | (ab)+ 匹配 "ab"、"abab",不匹配 "abb" |
| 捕获分组 | 分组会默认分配编号(从 1 开始),编号后的内容可在正则中用 \1 引用,在替换时用 $1 引用 | (\d{4})-(\d{2})-(\d{2}) 匹配日期,替换为 $3/$2/$1 可转为“日/月/年”格式 |
| 非捕获分组 | 用 (?:) 定义,仅分组不捕获(不分配编号,节省资源) | (?:\d{4})-(\d{2})-(\d{2}) 匹配日期,替换为 $2/$1 可转为“日/月”格式,年份未被捕获,所以 $1 代表月份 |
| 分支条件 | 用符号 | 表示“或”关系,匹配多个模式中的一个 | abc|adc 匹配 "abc" 或 "adc";a(b|d)c 匹配 "abc" 或 "adc" |
这些标志写在正则的末尾(比如 `/pattern/gi`),用来调整整个匹配的规则,影响全局行为。
| 标志 | 含义 | 示例 |
| i | 忽略大小写 | /abc/i 匹配 "abc"、"AbC" |
| g | 全局匹配(找到所有匹配,而非第一个) | /a/g 匹配 "aaab" 中的所有 "a" |
| m | 多行模式(^ 和 $ 匹配每行的开头和结尾) | /^a/m 匹配 "\na\nbc" 中的 2 个 "a" |
| s | 单行模式(. 就可以匹配换行符) | /a.b/s 可以匹配 "a\nb",但 /a.b/ 不可以 |
断言是正则里比较进阶的概念。通俗地说,它就是“条件检查”——它要求目标字符串在某个位置必须满足某种条件,但检查完之后,它不消耗任何字符,只判定位置。这正是正则表达式最灵活、也最容易被忽视的部分。
| 类型 | 含义 | 示例 |
| 正向先行断言 | (?=pattern) 匹配后面跟着 pattern 的位置 | /[a-z](?=\d)/ 匹配 "a1" 中的 "a" |
| 负向先行断言 | (?!pattern) 匹配后面不跟着 pattern 的位置 | /[a-z](?!\d)/ 匹配 "ab" 中的 "a" |
| 正向后行断言 | (?<=pattern) 匹配前面跟着 pattern 的位置 | /(?<=\d)[a-z]/ 匹配 "1a" 中的 "a" |
| 负向后行断言 | (? | /(? |
最后,光说不练假把式。这里整理了几个高频的实战案例,可以直接拿来用或者稍作修改套进你的项目里。
| 案例 | 规则 | 正则 |
| 手机号 | 11 位数字,以 1 开头,第二位为 3/4/5/7/8 | ^1[34578]\d{9}$ |
| 邮箱 | 用户名 @ 域名(域名含 . 和字母 / 数字) | ^\w+([+-.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*$ |
| 提取URL中的域名 | 从 "https://www.example.com/path" 提取 "www.example.com" | https?://([^/]+)(通过分组捕获域名) |
| 匹配日期 | YYYY-MM-DD 格式 | ^\d{4}-(0[1-9]|1[0-2])-(0[1-9]|[12]\d|3[0-1])$ |
正则表达式,上手不难,精通则需要不断练习。上面这张“速查表”,覆盖了从基础字符匹配到高阶断言的绝大部分核心点。需要反复强调的是,理解贪婪与非贪婪、捕获分组与非捕获分组的差异,以及断言“只占位不消费”的特性,是写出优雅且高效正则的关键。希望这份梳理能成为你随时查阅的实用工具。
下一篇:Git如何忽略已加入的文件
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8