正则表达式的整理与归纳(附例子)
正则表达式由普通字符和元字符构成,元字符包括点号、中括号、竖线、锚点(^和$)及反斜线转义。常用量词有*、+、?、{n}等,预定义字符如\d、\s,自定义字符用方括号。一个Java示例演示了利用正则从日志中提取姓名并去重。
正则表达式,说白了就是由普通字符(比如 a 到 z)和特殊字符(也就是元字符)拼出来的一种文本模式。举个例子,[a-z]* 这个表达式描述的就是所有只包含小写字母的字符串——这里面 a、z 是普通字符,而连字符、左右中括号以及星号,都属于元字符的范畴。
正则表达式中的元字符的类别
1. 点号
点号能匹配除换行符(\n)之外的任意单个字符。简单说就是“一个位置,除了回车啥都行”。
2. 中括号
中括号 [] 允许你指定一组字符,匹配时只认你写进去的那几个。比如 [abc] 就只匹配 a、b 或 c 中的一个。
3. 竖线
竖线 | 好比逻辑“或”,匹配它左边或右边的任意一个模式。
4. ^ 符号
^ 匹配一行的开头位置。在正则里它经常作为“起始锚点”使用。
5. 美元符号
$ 匹配一行的结尾,和 ^ 正好相反,一个管头一个管尾。
6. 反斜线
反斜线 \ 的作用是“转义”——把它后面的元字符变成普通字符。比如你要匹配一个真实的点号,就得写成 \.。
常用的匹配次数元符号
| 元字符 | 含义 |
|---|---|
| X* | 匹配 X 出现零次或多次,比如 Y、YXXXY |
| X+ | 匹配 X 出现一次或多次,比如 YXY、YXX |
| X? | 匹配 X 出现零次或一次,比如 Y、YXY |
| X{n} | 匹配 X 恰好出现 n 次 |
| X{n,} | 匹配 X 出现至少 n 次 |
| X{n,m} | n ≤ m,匹配 X 出现至少 n 次,最多 m 次 |
预定义字符(只匹配一个字符)
| 元字符 | 含义 |
|---|---|
| \d | 数字,相当于 [0-9] |
| \D | 非数字,相当于 [^0-9] |
| \s | 空白字符,相当于 [\t\n\x0B\f\r] |
| \S | 非空白字符,相当于 [^\s] |
| \w | 单词字符,相当于 [a-zA-Z_0-9] |
| \W | 非单词字符,相当于 [^\w] |
| \b | 单词边界 |
| \B | 非单词边界 |
| \A | 输入的开头 |
| \G | 上一个匹配的结尾 |
自定义字符(只匹配一个字符)
| 元字符 | 含义 |
|---|---|
| [abc] | 只能是 a,b 或 c |
| [^abc] | 除了 a,b,c 之外的任何字符 |
| [a-zA-Z] | a 到 z 或 A 到 Z(范围) |
| [a-d[m-p]] | a 到 d 或 m 到 p(并集) |
| [a-z&&[bcd]] | a-z 和 bcd 的交集,即 b,c,d |
| [a-z&&[^bcd]] | a-z 和非 bcd 的交集,等同于 [ae-z] |
| [a-z&&[^m-p]] | a-z 和除了 m 到 p 的交集,等同于 [a-lq-z] |
举例如下
下面这个 Ja va 示例演示了如何通过正则表达式从日志中提取人物姓名并去重。代码不算复杂,但很实用:
import ja va.util.ArrayList;
import ja va.util.List;
public class MyMain {
public static void main(String[] args) {
String log = "张三10:23:0:802023-10-09 09:21:22"
+ "李四115:203:10:1802023-05-09 19:21:22"
+ "王五115:203:10:1802023-05-09 19:21:22"
+ "张三11:22:0:802024-11-09 07:21:25";
// 以日期时间格式为分隔符拆分日志,得到 [姓名+数字] 的数组
String[] nameIPs = log.split("\\d{4}-\\d{2}-\\d{2} \\d{2}:\\d{2}:\\d{2}");
List names = new ArrayList();
for (String nameIP : nameIPs) {
int index = -1;
// 找到第一个数字的位置
for (int i = 0; i < nameIP.length(); i++) {
if (nameIP.charAt(i) >= '0' && nameIP.charAt(i) <= '9') {
index = i;
break;
}
}
// 从开头到第一个数字之前的部分就是姓名
String name = nameIP.substring(0, index);
names.add(name);
}
// 对 List 中的姓名去重
List nameUniques = new ArrayList();
for (String name : names) {
if (!nameUniques.contains(name)) {
nameUniques.add(name);
}
}
for (String name : nameUniques) {
System.out.println(name);
}
}
}
运行结果

其它方面的细节及注意事项
- 反斜线是转义字符,用于改变后面字符的原本含义。在程序里写正则时,
\\d才表示一个数字字符,这一点很容易踩坑。 - 正则表达式是从左到右逐个字符去匹配,一个表达式通常只对应一个字符(除非用了量词)。
matches()方法可以用来判断整个字符串是否满足正则,返回 true 或 false,非常适合做格式校验。- 需要求两个字符范围的交集时,记得写成
&&,如果只写一个&,那它就是个普通字符,不是交集运算。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















