商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 强大的Perl正则表达式实例详解

强大的Perl正则表达式实例详解

  发布于2026-06-29 阅读(0)

扫一扫,手机访问

一、介绍

强大的Perl正则表达式实例详解

正则表达式这东西,不同语言有自己的实现,但核心元字符基本相通——无非就是靠组合这些元字符来完成匹配。因为Nmap内置的服务与版本探测用的是Perl正则规范,所以这里专门梳理一下Perl正则的相关要点,方便日常翻阅。

二、Perl正则例子

下面的例子有些来自网络,没有逐一验证,但基本覆盖了常见场景。

1. 匹配IP地址:\d+\.\d+\.\d+\.\d+
  \d匹配一位数字,\d+匹配一次或多次;\.转义匹配点号。

2. 匹配邮箱(如123456@qq.com):/^[a-zA-Z0-9_\-\.]+@[a-zA-Z0-9_\-]+\.[a-zA-Z]+$/
  ^匹配开头,$匹配结尾——这两个锚点保证匹配的是完整的一串字符,不会出现部分匹配。

3. 匹配数字:m/^[0-9]+$/
  同样用^$限制了整串内容只能是数字。如果只写$,那abc12这种也会被匹配到。这个模式在输入校验里很实用。

4. 用户输入温度(华氏/摄氏)并转换:
  m/^([-+]?[0-9]+)([CF])$/ — 匹配正负整数温度。
  [CF]匹配C或F;?表示可选;+表示一次或多次。Perl通过临时变量$1$2保存子表达式匹配的文本,这里$1是数字,$2是符号。
  如果需要支持小数:m/^([-+]?[0-9]+(?:\.[0-9]*)?)\s*([CF])$/i)
  注意临时变量保存顺序跟左括号出现的顺序有关,所以用?:可以让该括号不保存匹配结果。/i忽略大小写。

5. 匹配空白行:
  ^$ — 开头即结尾,表示没有任何字符的空白行。
  \n\s*\r\n换行符,\s空白字符(空格、制表、换页),\r回车符。

6. 匹配首尾空白字符:^\s*|\s*$

7. 匹配版本号(如1.3.0):[\d.]+

8. 匹配某个字符以外的所有字符:
  [^a]* 匹配除a以外的字符;[^abc]* 匹配除a、b、c以外的字符。
  ((?!win).)* 匹配除了单词“win”之外的所有字符。
  Windows (?!95|98|NT|2000)' 能匹配“Windows 3.1”中的“Windows”,但不会匹配“Windows 2000”中的“Windows”。

9. 匹配数字(通用):^\d+(\.\d+)?
  ^定义开头;\d+匹配数字;?表示小数部分可选。

下面是几个实际匹配的例子:
  1){"service":"nutcracker", "source":"ubuntu", "version":"0.3.0",
    m|^{"service":"nutcracker", "source":"([^"]+)", "version":"([\d.]+)",|
  2)220 yzwb.net ESMTP MDaemon 10.1.2;
    m|^220[ -]([-.\w]+) ESMTP MDaemon ([\d.\-]+);
  3)AMQP\x01\x01\x00\n
    m|^AMQP\x01\x01\x00\x0a$| — 注意换行符\n对应十六进制\x0a,回车对应\x0d

三、正则元字符

元字符是正则表达式的积木块,掌握了它们就能搭出任何想要的结构。

字符描述
\将下一个字符标记为特殊字符、原义字符、后向引用或八进制转义符。例如'n'匹配字符"n",而'\n'匹配换行符;'\\'匹配'\','\('匹配'('。
^匹配输入字符串的开始位置。若设置了Multiline属性,也匹配'\n'或'\r'之后的位置。
$匹配输入字符串的结束位置。若设置了Multiline属性,也匹配'\n'或'\r'之前的位置。
*匹配前面的子表达式零次或多次。'zo*'能匹配"z"和"zoo",等价于{0,}。
+匹配前面的子表达式一次或多次。'zo+'能匹配"zo"和"zoo",但不能匹配"z",等价于{1,}。
?匹配前面的子表达式零次或一次。'do(es)?'能匹配"do"或"does"中的"do",等价于{0,1}。
{n}n为非负整数,匹配确定的n次。'o{2}'能匹配"food"中的两个o,但不能匹配"Bob"中的o。
{n,}至少匹配n次。'o{2,}'能匹配"foooood"中的所有o;'o{1,}'等价于'o+';'o{0,}'等价于'o*'。
{n,m}最少n次,最多m次。'o{1,3}'匹配"fooooood"中的前三个o;'o{0,1}'等价于'o?'。注意逗号和数字之间不能有空格。
?当跟在任何限制符(*,+,?,{n},{n,},{n,m})后面时,匹配模式变为非贪婪。'o+?'会尽可能少匹配,对"oooo"只匹配一个o;而'o+'会尽可能多匹配。
.匹配除'\n'外的任意单个字符。若要匹配包括'\n'在内的任何字符,可用'[.\n]'。
(pattern)匹配pattern并获取匹配。捕获的内容可通过$0…$9(或SubMatches集合)获取。若要匹配圆括号本身,使用'\('或'\)'。
(?:pattern)匹配pattern但不获取匹配(非获取匹配)。常用于组合"|"模式,如'industr(?:y|ies)'比'industry|industries'更简洁。
(?=pattern)正向预查,匹配pattern开始的位置。例如'Windows (?=95|98|NT|2000)'能匹配"Windows 2000"中的"Windows",但不匹配"Windows 3.1"中的"Windows"。预查不消耗字符。
(?!pattern)负向预查,匹配不匹配pattern的位置。例如'Windows (?!95|98|NT|2000)'能匹配"Windows 3.1"中的"Windows",但不匹配"Windows 2000"中的"Windows"。
x|y匹配x或y。'z|food'匹配"z"或"food";'(z|f)ood'匹配"zood"或"food"。
[xyz]字符集合,匹配其中任意一个字符。'[abc]'能匹配"plain"中的'a'。
[^xyz]负值字符集合,匹配未包含的任意字符。'[^abc]'能匹配"plain"中的'p'。
[a-z]字符范围,匹配指定范围内的任意字符。'[a-z]'匹配小写字母。
[^a-z]负值字符范围,匹配不在指定范围内的任意字符。
\b匹配单词边界。'er\b'匹配"never"中的"er",但不匹配"verb"中的"er"。
\B匹配非单词边界。'er\B'匹配"verb"中的"er",但不匹配"never"中的"er"。
\cx匹配由x指定的控制字符。\cM匹配Control-M或回车符,x必须为A-Z或a-z。
\d匹配一个数字字符,等价于[0-9]。
\D匹配一个非数字字符,等价于[^0-9]。
\f匹配换页符,等价于\x0c和\cL。
\n匹配换行符,等价于\x0a和\cJ。
\r匹配回车符,等价于\x0d和\cM。
\s匹配任何空白字符(空格、制表符、换页符等),等价于[ \f\n\r\t\v]。
\S匹配任何非空白字符,等价于[^ \f\n\r\t\v]。
\t匹配制表符,等价于\x09和\cI。
\v匹配垂直制表符,等价于\x0b和\cK。
\w匹配包括下划线的任何单词字符,等价于[A-Za-z0-9_]。
\W匹配任何非单词字符,等价于[^A-Za-z0-9_]。
\xnn匹配十六进制转义值nn,必须为两个数字长。例如\x41匹配"A"。
\num匹配后向引用,num是正整数。'(.)\1'匹配两个连续相同字符。
\n八进制转义或后向引用。如果n之前至少有n个获取的子表达式,则为后向引用;否则若n为八进制数字(0-7),则为八进制转义值。
\nm如果\nm之前至少有nm个获取的子表达式,则为后向引用;否则若n为八进制且m为数字,可能为后向引用后跟文字m;都不满足则匹配八进制转义值nm。
\nm若n为八进制数字(0-3)且m、l均为八进制数字(0-7),匹配八进制转义值nml。
\unnnn匹配以四个十六进制数字表示的Unicode字符,例如\u00A9匹配版权符号©。

掌握了上面这些元字符,就可以组合出几乎所有想要的匹配模式。下面整理几个常用表达式,实际工作中随时可能用到。

  • 匹配中文字符:[\u4e00-\u9fa5]
  • 匹配双字节字符(含汉字):[^\x00-\xff] — 可用于计算字符串长度(双字节计2,ASCII计1)
  • 匹配空白行:\n\s*\r
  • 匹配HTML标记:<(\S*?)[^>]*>.*?|<.*? /> — 注:复杂嵌套仍难以完美处理
  • 匹配首尾空白字符:^\s*|\s*$
  • 匹配Email地址:\w+([-+.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*
  • 匹配网址URL:[a-zA-z]+://[^\s]*
  • 匹配合法账号(字母开头,5-16字节,允许字母数字下划线):^[a-zA-Z][a-zA-Z0-9_]{4,15}$
  • 匹配国内电话号码(如0511-4405222或021-87888822):\d{3}-\d{8}|\d{4}-\d{7}
  • 匹配腾讯QQ号(从10000开始):[1-9][0-9]{4,}
  • 匹配中国邮政编码(6位数字):[1-9]\d{5}(?!\d)
  • 匹配身份证(15或18位):\d{15}|\d{18}
  • 匹配IP地址:\d+\.\d+\.\d+\.\d+

匹配特定数字:

^[1-9]\d*$    //匹配正整数
^-[1-9]\d*$    //匹配负整数
^-?[1-9]\d*$   //匹配整数
^[1-9]\d*|0$   //匹配非负整数(正整数+0)
^-[1-9]\d*|0$   //匹配非正整数(负整数+0)
^[1-9]\d*\.\d*|0\.\d*[1-9]\d*$   //匹配正浮点数
^-([1-9]\d*\.\d*|0\.\d*[1-9]\d*)$  //匹配负浮点数
^-?([1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0)$  //匹配浮点数
^[1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0$   //匹配非负浮点数(正浮点数+0)
^(-([1-9]\d*\.\d*|0\.\d*[1-9]\d*))|0?\.0+|0$  //匹配非正浮点数(负浮点数+0)

匹配特定字符串:

^[A-Za-z]+$   //匹配26个英文字母组成的字符串
^[A-Z]+$   //匹配大写字母
^[a-z]+$   //匹配小写字母
^[A-Za-z0-9]+$  //匹配数字和字母
^\w+$   //匹配数字、字母、下划线

四、总结

  1. 不同场景、不同语言,正则会有些细微差别。只要掌握基本元字符和对应语言的特性,真正用时花上十几分钟熟悉一两个例子就能上手。
  2. Perl正则目前仍是功能最完善的,建议投入时间学一学——处理数据时优势很明显。
  3. 如果目标只是抽取数据,正则匹配的原理没有必要深究,会套用就行。
本文转载于:https://www.jb51.net/article/127536.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注