Python正则表达式从匹配手机号到提取文本内容的基础用法详解
Pythonre模块提供search、findall、sub、split、match等方法处理文本。search查找首个匹配,findall提取所有结果,sub替换内容,split按多分隔符拆分,match从头验证。常用正则符号如\d、\w、+、[]等,结合原始字符串r"..."可快速完成手机号、邮箱匹配、数字替换及简单HTML提取。
日常开发中,这类需求几乎天天遇到:

- 从一段文字里找出手机号;
- 从用户输入中提取邮箱;
- 把字符串里的数字统一替换掉;
- 按多种分隔符拆分文本;
- 从简单 HTML 片段中提取标签内容。
这些场景,正则表达式是天然的好工具。Python 内置的 re 模块提供了一套完整的正则工具,从几个最常用的方法切入,配合示例代码,可以快速上手。
1. 引入 re 模块
使用正则之前,先导入模块:
import re
re 是 regular expression 的缩写。它帮我们按照规则去匹配、查找、替换或分割字符串。
2. 使用 re.search 查找第一个匹配项
比如这段文本:
text = "我的手机号是 13812345678,邮箱是 test@example.com"
要从中提取手机号,用 re.search():
phone = re.search(r"1[3-9]d{9}", text)
if phone:
print(f"找到手机号:{phone.group()}")
输出:
找到手机号:13812345678
这个正则表达式 r"1[3-9]d{9}" 的含义很直白:
1:以数字 1 开头;[3-9]:第二位是 3 到 9 之间的数字;d{9}:后面再跟 9 个数字。
所以它能匹配 13812345678 这类手机号。需要注意的是,re.search() 只返回第一个匹配结果,找不到时返回 None。实际使用时通常先判断:
if phone:
print(phone.group())
其中 group() 取出真正匹配到的字符串。
3. 使用 re.search 查找邮箱
同一段文本中继续找邮箱:
email = re.search(r"w+@w+.w+", text)
if email:
print(f"找到邮箱:{email.group()}")
输出:
找到邮箱:test@example.com
这个正则表达式 r"w+@w+.w+" 拆解一下:
w+:匹配一个或多个字母、数字或下划线;@:匹配 @ 符号;w+:域名主体;.:匹配真正的点号,需要转义;w+:后缀。
为什么点号要写成 .?因为正则里 . 代表“任意字符”,要匹配普通点号就必须用反斜杠转义,这个细节容易踩坑。
4. 使用 re.findall 查找所有匹配项
re.search() 只找第一个,如果想把所有匹配内容都找出来,用 re.findall()。比如文本中有多个价格:
text = "价格:100元、200元、350元" prices = re.findall(r"d+", text) print(prices)
输出:
['100', '200', '350']
正则 r"d+" 匹配一个或多个数字。 findall() 把所有匹配结果放进一个列表返回。当你需要批量提取时,这个函数是首选。
5. 使用 re.sub 替换字符串
正则不仅能查找,还能替换。比如把日期中的数字全部替换成 X:
text = "今天是2026年02月19日" result = re.sub(r"d+", "X", text) print(result)
输出:
今天是X年X月X日
re.sub() 的基本格式是 re.sub(pattern, replacement, string),分别对应匹配规则、替换成什么、在哪个字符串里替换。这个例子中 d+ 匹配连续数字,2026、02、19 都被替换成了 X。替换功能在数据脱敏、格式化输出时非常实用。
6. 使用 re.split 按多个分隔符拆分字符串
普通字符串的 split() 一次只能按一种分隔符拆分,但实际数据往往不规整。比如:
text = "张三;李四,王五 赵六"
名字之间混杂了分号、逗号和空格。用 re.split() 轻松解决:
names = re.split(r"[;,s]+", text) print(names)
输出:
['张三', '李四', '王五', '赵六']
正则 r"[;,s]+" 含义:字符集合 [] 中的分号、逗号、空白字符,出现一次或多次,都作为分隔符。这在处理 CSV 或混合分隔符的日志时特别有用。
7. 常用正则符号速查
下面这些符号是写正则时最基础、最常用的语法。
| 符号 | 含义 |
|---|---|
. |
匹配任意字符,换行符除外 |
d |
匹配数字,相当于 [0-9] |
D |
匹配非数字 |
w |
匹配字母、数字、下划线 |
W |
匹配非字母、数字、下划线 |
s |
匹配空白字符 |
S |
匹配非空白字符 |
^ |
匹配字符串开头 |
$ |
匹配字符串结尾 |
* |
匹配 0 次或多次 |
+ |
匹配 1 次或多次 |
? |
匹配 0 次或 1 次 |
{n} |
匹配恰好 n 次 |
{n,m} |
匹配 n 到 m 次 |
[] |
字符集合 |
| ` | ` |
() |
分组 |
刚开始不用一次性记太多,先掌握 d、w、s、+、*、[]、^、$ 这些基础符号,就能解决很多实际问题。
8. 实战一:验证手机号
前面用 search() 从文本中找手机号,如果现在要判断一个字符串是不是完整的手机号,可以用 re.match():
phone_pattern = r"^1[3-9]d{9}$"
print(re.match(phone_pattern, "13812345678"))
这里的规则比前面更严格:r"^1[3-9]d{9}$" 中 ^ 表示字符串开头,$ 表示字符串结尾。加上它们之后,整个字符串必须完整符合手机号格式,否则即使中间部分匹配也会被拒绝。这一点在表单验证时尤其重要。
9. 实战二:验证邮箱
邮箱验证可以写成这样:
email_pattern = r"^[w.+-]+@[w-]+.[w.]+$" print(re.match(email_pattern, "test@example.com"))
这个表达式覆盖了常见的邮箱格式:用户名部分允许字母、数字、下划线、点号、加号和短横线;中间必须有 @;域名部分允许字母、数字、下划线和短横线;后缀部分允许字母、数字、下划线和点号。不过真实世界的邮箱规则极其复杂,如果只是做基础格式校验,这个正则通常够用;如果是严肃的注册场景,还需要结合邮件发送验证来兜底。
10. 实战三:提取 HTML 标签内容
还有一个经典场景:从简单 HTML 片段中提取标签内的文本。
html = "标题
段落
" contents = re.findall(r"(.*?) ", html) print(contents)
输出:
['标题', '段落']
这个正则 r" 中, 匹配开始标签,(.*?) 提取中间内容, 匹配结束标签。其中 (.*?) 里的 ? 表示非贪婪匹配,如果没有它,正则可能会尽可能多地匹配,导致结果偏差。需要提醒的是,正则可以处理简单 HTML 片段,但不适合解析复杂文档,正式爬虫场景建议用 BeautifulSoup 或 lxml。
11. search、match、findall、sub、split 怎么选
用下面这张表可以快速判断:
| 方法 | 用途 |
|---|---|
re.search() |
查找第一个匹配项 |
re.match() |
从字符串开头开始匹配 |
re.findall() |
找出所有匹配内容 |
re.sub() |
替换匹配内容 |
re.split() |
按正则规则分割字符串 |
简单总结:找第一个用 search(),从头验证用 match(),全部提取用 findall(),替换用 sub(),复杂分隔符切分用 split()。记住这五个,日常够用。
12. 为什么正则字符串前面常加 r
示例中的正则表达式大多写成 r"d+" 这种形式。前面的 r 表示原始字符串,它让反斜杠保持原样,避免写一堆转义符。比如正则中的 d 表示数字,如果没有原始字符串,在更复杂的表达式中很容易遇到双重转义问题。所以写 Python 正则时,一个好习惯是:
正则表达式尽量使用
r"..."这种原始字符串形式。
小结
本文从几个常见例子出发,介绍了 Python re 模块的基础用法。核心内容包括:
- 用
re.search()查找手机号和邮箱; - 用
re.findall()提取所有数字; - 用
re.sub()替换匹配内容; - 用
re.split()按多个分隔符拆分文本; - 理解常见正则符号;
- 使用
re.match()验证手机号和邮箱格式; - 用分组和非贪婪匹配提取简单标签内容。
正则表达式刚开始看起来有点像“符号密码”,但它的核心思想其实很简单:用一套规则去描述你想匹配的字符串。当你掌握了常用符号和几个基础方法之后,就可以用正则快速完成很多文本处理任务。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















