商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 正则表达式核心知识点语法速查表

正则表达式核心知识点语法速查表

  发布于2026-07-05 阅读(0)

扫一扫,手机访问

前言

正则表达式,说到底,就是用来对付字符串的一把瑞士军刀。无论是做开发、搞数据分析,还是日常处理各种文档,只要跟文本打交道,这玩意儿就能让你效率翻倍。它的核心价值在于:用一套精巧的规则,去描述、匹配和操作你想要的文本模式,而不是靠肉眼一个一个去找。

正则表达式核心知识点语法速查表

下面,我们把正则表达式的核心知识点系统地过一遍。这是一份能让你随时翻查的实用速查表。

一、基础概念与作用

  • 定义:简单说,正则表达式就是一个由普通字符(比如字母、数字)和特殊字符(也就是“元字符”)组合起来的“模式”。这个模式,就是你要匹配的那些字符串应该遵循的规则。
  • 核心作用
    • 验证字符串格式(比如检查手机号、邮箱、身份证号是否合规)。
    • 从文本中提取特定信息(比如扒拉出所有的URL、日期、或者你关心的关键词)。
    • 批量替换或清理文本(比如一键去除多余空格、统一日期格式)。

说到应用场景,几乎无处不在:你用的编程语言(Ja vaScript/Python/Ja va/PHP 等)里,你常用的文本编辑器(VS Code、Sublime)里,甚至数据库查询(SQL)里,都能看到它的身影。

二、基础语法:元字符与规则

这部分是正则表达式的“字母表”。要玩转正则,这些元字符是绕不开的基本功。

1. 匹配单个字符

这里先列个最常用的对照表,方便随时回来翻看。

元字符含义示例
.匹配任意单个字符(除了换行符\n、回车符\r)a.b 可匹配 aab、acb,不匹配 ab
[]匹配括号内任意一个字符[abc] 匹配 a、b 或 c 中的任意一个
[^]匹配不在括号内的任意字符[^abc] 匹配 d、e 等任何不是 a、b、c 的字符
\d匹配数字(等价于 [0-9])\d{3} 匹配 123、456 等 3 位数字
\D匹配非数字(等价于 [^0-9])\D 匹配 a、b 等非数字字符
\w匹配数字、字母、下划线(等价于 [0-9a-zA-Z_])\w 匹配 1、a、b2、c5_ 等
\W匹配非数字、字母、下划线(等价于 [^0-9a-zA-Z_])\W 匹配 @、#、¥ 等
\s匹配空白字符(含空格“ ”、换行\n、回车\r、制表符\t 等)a\sb 匹配 "a b"、"a\nb"、"a\rb" 等
\S匹配非空白字符a\Sb 匹配 "ab",不匹配 "a b"

当然,如果你真想匹配这些元字符本身(比如匹配小数点`.`、星号`*`),就得用到反斜杠`\`进行转义。比如`\.`匹配小数点,`\*`匹配星号。

2. 匹配数量:量词

量词是用来指定字符或分组出现次数的,没有它们,正则就只能匹配固定的字符。

量词含义示例
*匹配 0 次或多次(尽可能多,即贪婪模式)ab* 匹配 a、ab、abb 等
+匹配 1 次或多次ab+ 匹配 ab、abb 等,不匹配 a
?匹配 0 次或 1 次ab? 匹配 a、ab
{n}精确匹配 n 次ab{2} 匹配 abb
{n,}匹配至少 n 次ab{2,} 匹配 abb、abbb 等
{n,m}匹配 n 到 m 次(包含 n 和 m)ab{2,4} 匹配 abb、abbb、abbbb

一个必须弄懂的细节是贪婪和非贪婪。默认情况下,量词是贪婪的,会尽可能多地匹配字符。如果你希望它“见好就收”,在量词后面加个问号`?`就行。比如,对字符串 "axxbxxb",正则`a.*b`会匹配整个 "axxbxxb",而`a.*?b`则只会匹配 "axxb"。

3. 位置匹配:边界与锚点

这类元字符不匹配具体字符,而是匹配字符之间的位置,用来定位字符串的边界。

元字符含义示例
^匹配字符串开头(多行模式下匹配每行开头)^abc 匹配 "abcd",不匹配 "1abcd"
$匹配字符串结尾(多行模式下匹配每行结尾)abc$ 匹配 "1abc",不匹配 "abcd"
\b匹配单词边界(字母数字与非字母数字的交界处)\bcat\b 匹配 "cat"、"cat!",不匹配 "category"
\B匹配非单词边界\Bcat\B 匹配 "category" 中的 "cat",不匹配单独的 "cat"

4. 分组与引用

这才是正则真正发力、变得灵活的地方。通过括号`()`,我们可以把多个字符“打包”成一个整体来处理。

名称含义示例
分组用括号 () 将多个字符视为一个整体,可结合量词使用(ab)+ 匹配 "ab"、"abab",不匹配 "abb"
捕获分组分组会默认分配编号(从 1 开始),编号后的内容可在正则中用 \1 引用,在替换时用 $1 引用(\d{4})-(\d{2})-(\d{2}) 匹配日期,替换为 $3/$2/$1 可转为“日/月/年”格式
非捕获分组用 (?:) 定义,仅分组不捕获(不分配编号,节省资源)(?:\d{4})-(\d{2})-(\d{2}) 匹配日期,替换为 $2/$1 可转为“日/月”格式,年份未被捕获,所以 $1 代表月份
分支条件用符号 | 表示“或”关系,匹配多个模式中的一个abc|adc 匹配 "abc" 或 "adc";a(b|d)c 匹配 "abc" 或 "adc"

5. 特殊模式:标志(修饰符)

这些标志写在正则的末尾(比如 `/pattern/gi`),用来调整整个匹配的规则,影响全局行为。

标志含义示例
i忽略大小写/abc/i 匹配 "abc"、"AbC"
g全局匹配(找到所有匹配,而非第一个)/a/g 匹配 "aaab" 中的所有 "a"
m多行模式(^ 和 $ 匹配每行的开头和结尾)/^a/m 匹配 "\na\nbc" 中的 2 个 "a"
s单行模式(. 就可以匹配换行符)/a.b/s 可以匹配 "a\nb",但 /a.b/ 不可以

6. 断言的类型

断言是正则里比较进阶的概念。通俗地说,它就是“条件检查”——它要求目标字符串在某个位置必须满足某种条件,但检查完之后,它不消耗任何字符,只判定位置。这正是正则表达式最灵活、也最容易被忽视的部分。

类型含义示例
正向先行断言(?=pattern) 匹配后面跟着 pattern 的位置/[a-z](?=\d)/ 匹配 "a1" 中的 "a"
负向先行断言(?!pattern) 匹配后面不跟着 pattern 的位置/[a-z](?!\d)/ 匹配 "ab" 中的 "a"
正向后行断言(?<=pattern) 匹配前面跟着 pattern 的位置/(?<=\d)[a-z]/ 匹配 "1a" 中的 "a"
负向后行断言(?/(?

7. 常用的场景案例

最后,光说不练假把式。这里整理了几个高频的实战案例,可以直接拿来用或者稍作修改套进你的项目里。

案例规则正则
手机号11 位数字,以 1 开头,第二位为 3/4/5/7/8^1[34578]\d{9}$
邮箱用户名 @ 域名(域名含 . 和字母 / 数字)^\w+([+-.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*$
提取URL中的域名从 "https://www.example.com/path" 提取 "www.example.com"https?://([^/]+)(通过分组捕获域名)
匹配日期YYYY-MM-DD 格式^\d{4}-(0[1-9]|1[0-2])-(0[1-9]|[12]\d|3[0-1])$

总结

正则表达式,上手不难,精通则需要不断练习。上面这张“速查表”,覆盖了从基础字符匹配到高阶断言的绝大部分核心点。需要反复强调的是,理解贪婪与非贪婪捕获分组非捕获分组的差异,以及断言“只占位不消费”的特性,是写出优雅且高效正则的关键。希望这份梳理能成为你随时查阅的实用工具。

本文转载于:https://www.jb51.net/program/366268v5f.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注