发布于2026-06-29 阅读(0)
扫一扫,手机访问

正则表达式这东西,不同语言有自己的实现,但核心元字符基本相通——无非就是靠组合这些元字符来完成匹配。因为Nmap内置的服务与版本探测用的是Perl正则规范,所以这里专门梳理一下Perl正则的相关要点,方便日常翻阅。
下面的例子有些来自网络,没有逐一验证,但基本覆盖了常见场景。
1. 匹配IP地址:\d+\.\d+\.\d+\.\d+
\d匹配一位数字,\d+匹配一次或多次;\.转义匹配点号。
2. 匹配邮箱(如123456@qq.com):/^[a-zA-Z0-9_\-\.]+@[a-zA-Z0-9_\-]+\.[a-zA-Z]+$/
^匹配开头,$匹配结尾——这两个锚点保证匹配的是完整的一串字符,不会出现部分匹配。
3. 匹配数字:m/^[0-9]+$/
同样用^和$限制了整串内容只能是数字。如果只写$,那abc12这种也会被匹配到。这个模式在输入校验里很实用。
4. 用户输入温度(华氏/摄氏)并转换:
m/^([-+]?[0-9]+)([CF])$/ — 匹配正负整数温度。
[CF]匹配C或F;?表示可选;+表示一次或多次。Perl通过临时变量$1、$2保存子表达式匹配的文本,这里$1是数字,$2是符号。
如果需要支持小数:m/^([-+]?[0-9]+(?:\.[0-9]*)?)\s*([CF])$/i)
注意临时变量保存顺序跟左括号出现的顺序有关,所以用?:可以让该括号不保存匹配结果。/i忽略大小写。
5. 匹配空白行:
^$ — 开头即结尾,表示没有任何字符的空白行。
\n\s*\r — \n换行符,\s空白字符(空格、制表、换页),\r回车符。
6. 匹配首尾空白字符:^\s*|\s*$
7. 匹配版本号(如1.3.0):[\d.]+
8. 匹配某个字符以外的所有字符:
[^a]* 匹配除a以外的字符;[^abc]* 匹配除a、b、c以外的字符。
((?!win).)* 匹配除了单词“win”之外的所有字符。
Windows (?!95|98|NT|2000)' 能匹配“Windows 3.1”中的“Windows”,但不会匹配“Windows 2000”中的“Windows”。
9. 匹配数字(通用):^\d+(\.\d+)?
^定义开头;\d+匹配数字;?表示小数部分可选。
下面是几个实际匹配的例子:
1){"service":"nutcracker", "source":"ubuntu", "version":"0.3.0",
m|^{"service":"nutcracker", "source":"([^"]+)", "version":"([\d.]+)",|
2)220 yzwb.net ESMTP MDaemon 10.1.2;
m|^220[ -]([-.\w]+) ESMTP MDaemon ([\d.\-]+);
3)AMQP\x01\x01\x00\n
m|^AMQP\x01\x01\x00\x0a$| — 注意换行符\n对应十六进制\x0a,回车对应\x0d。
元字符是正则表达式的积木块,掌握了它们就能搭出任何想要的结构。
| 字符 | 描述 |
| \ | 将下一个字符标记为特殊字符、原义字符、后向引用或八进制转义符。例如'n'匹配字符"n",而'\n'匹配换行符;'\\'匹配'\','\('匹配'('。 |
| ^ | 匹配输入字符串的开始位置。若设置了Multiline属性,也匹配'\n'或'\r'之后的位置。 |
| $ | 匹配输入字符串的结束位置。若设置了Multiline属性,也匹配'\n'或'\r'之前的位置。 |
| * | 匹配前面的子表达式零次或多次。'zo*'能匹配"z"和"zoo",等价于{0,}。 |
| + | 匹配前面的子表达式一次或多次。'zo+'能匹配"zo"和"zoo",但不能匹配"z",等价于{1,}。 |
| ? | 匹配前面的子表达式零次或一次。'do(es)?'能匹配"do"或"does"中的"do",等价于{0,1}。 |
| {n} | n为非负整数,匹配确定的n次。'o{2}'能匹配"food"中的两个o,但不能匹配"Bob"中的o。 |
| {n,} | 至少匹配n次。'o{2,}'能匹配"foooood"中的所有o;'o{1,}'等价于'o+';'o{0,}'等价于'o*'。 |
| {n,m} | 最少n次,最多m次。'o{1,3}'匹配"fooooood"中的前三个o;'o{0,1}'等价于'o?'。注意逗号和数字之间不能有空格。 |
| ? | 当跟在任何限制符(*,+,?,{n},{n,},{n,m})后面时,匹配模式变为非贪婪。'o+?'会尽可能少匹配,对"oooo"只匹配一个o;而'o+'会尽可能多匹配。 |
| . | 匹配除'\n'外的任意单个字符。若要匹配包括'\n'在内的任何字符,可用'[.\n]'。 |
| (pattern) | 匹配pattern并获取匹配。捕获的内容可通过$0…$9(或SubMatches集合)获取。若要匹配圆括号本身,使用'\('或'\)'。 |
| (?:pattern) | 匹配pattern但不获取匹配(非获取匹配)。常用于组合"|"模式,如'industr(?:y|ies)'比'industry|industries'更简洁。 |
| (?=pattern) | 正向预查,匹配pattern开始的位置。例如'Windows (?=95|98|NT|2000)'能匹配"Windows 2000"中的"Windows",但不匹配"Windows 3.1"中的"Windows"。预查不消耗字符。 |
| (?!pattern) | 负向预查,匹配不匹配pattern的位置。例如'Windows (?!95|98|NT|2000)'能匹配"Windows 3.1"中的"Windows",但不匹配"Windows 2000"中的"Windows"。 |
| x|y | 匹配x或y。'z|food'匹配"z"或"food";'(z|f)ood'匹配"zood"或"food"。 |
| [xyz] | 字符集合,匹配其中任意一个字符。'[abc]'能匹配"plain"中的'a'。 |
| [^xyz] | 负值字符集合,匹配未包含的任意字符。'[^abc]'能匹配"plain"中的'p'。 |
| [a-z] | 字符范围,匹配指定范围内的任意字符。'[a-z]'匹配小写字母。 |
| [^a-z] | 负值字符范围,匹配不在指定范围内的任意字符。 |
| \b | 匹配单词边界。'er\b'匹配"never"中的"er",但不匹配"verb"中的"er"。 |
| \B | 匹配非单词边界。'er\B'匹配"verb"中的"er",但不匹配"never"中的"er"。 |
| \cx | 匹配由x指定的控制字符。\cM匹配Control-M或回车符,x必须为A-Z或a-z。 |
| \d | 匹配一个数字字符,等价于[0-9]。 |
| \D | 匹配一个非数字字符,等价于[^0-9]。 |
| \f | 匹配换页符,等价于\x0c和\cL。 |
| \n | 匹配换行符,等价于\x0a和\cJ。 |
| \r | 匹配回车符,等价于\x0d和\cM。 |
| \s | 匹配任何空白字符(空格、制表符、换页符等),等价于[ \f\n\r\t\v]。 |
| \S | 匹配任何非空白字符,等价于[^ \f\n\r\t\v]。 |
| \t | 匹配制表符,等价于\x09和\cI。 |
| \v | 匹配垂直制表符,等价于\x0b和\cK。 |
| \w | 匹配包括下划线的任何单词字符,等价于[A-Za-z0-9_]。 |
| \W | 匹配任何非单词字符,等价于[^A-Za-z0-9_]。 |
| \xnn | 匹配十六进制转义值nn,必须为两个数字长。例如\x41匹配"A"。 |
| \num | 匹配后向引用,num是正整数。'(.)\1'匹配两个连续相同字符。 |
| \n | 八进制转义或后向引用。如果n之前至少有n个获取的子表达式,则为后向引用;否则若n为八进制数字(0-7),则为八进制转义值。 |
| \nm | 如果\nm之前至少有nm个获取的子表达式,则为后向引用;否则若n为八进制且m为数字,可能为后向引用后跟文字m;都不满足则匹配八进制转义值nm。 |
| \nm | 若n为八进制数字(0-3)且m、l均为八进制数字(0-7),匹配八进制转义值nml。 |
| \unnnn | 匹配以四个十六进制数字表示的Unicode字符,例如\u00A9匹配版权符号©。 |
掌握了上面这些元字符,就可以组合出几乎所有想要的匹配模式。下面整理几个常用表达式,实际工作中随时可能用到。
[\u4e00-\u9fa5][^\x00-\xff] — 可用于计算字符串长度(双字节计2,ASCII计1)\n\s*\r<(\S*?)[^>]*>.*?\1>|<.*? /> — 注:复杂嵌套仍难以完美处理^\s*|\s*$\w+([-+.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*[a-zA-z]+://[^\s]*^[a-zA-Z][a-zA-Z0-9_]{4,15}$\d{3}-\d{8}|\d{4}-\d{7}[1-9][0-9]{4,}[1-9]\d{5}(?!\d)\d{15}|\d{18}\d+\.\d+\.\d+\.\d+匹配特定数字:
^[1-9]\d*$ //匹配正整数
^-[1-9]\d*$ //匹配负整数
^-?[1-9]\d*$ //匹配整数
^[1-9]\d*|0$ //匹配非负整数(正整数+0)
^-[1-9]\d*|0$ //匹配非正整数(负整数+0)
^[1-9]\d*\.\d*|0\.\d*[1-9]\d*$ //匹配正浮点数
^-([1-9]\d*\.\d*|0\.\d*[1-9]\d*)$ //匹配负浮点数
^-?([1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0)$ //匹配浮点数
^[1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0$ //匹配非负浮点数(正浮点数+0)
^(-([1-9]\d*\.\d*|0\.\d*[1-9]\d*))|0?\.0+|0$ //匹配非正浮点数(负浮点数+0)
匹配特定字符串:
^[A-Za-z]+$ //匹配26个英文字母组成的字符串
^[A-Z]+$ //匹配大写字母
^[a-z]+$ //匹配小写字母
^[A-Za-z0-9]+$ //匹配数字和字母
^\w+$ //匹配数字、字母、下划线
上一篇:Perl学习教程之单行命令详解
下一篇:Perl6中的垃圾收集
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8