Python中正则表达式是通过内置的re模块实现的,它提供了一系列函数来处理字符串的匹配、查找、替换等操作,能够高效解决复杂的字符串处理需求。

正则表达式基础语法
正则表达式是由普通字符和特殊字符组成的字符串模式,用来描述字符串的匹配规则。常见的特殊字符含义如下:
- .:匹配除换行符以外的任意单个字符
- d:匹配任意数字,等价于[0-9]
- w:匹配字母、数字、下划线,等价于[a-zA-Z0-9_]
- s:匹配任意空白字符,包括空格、制表符、换行符等
- *:匹配前面的字符零次或多次
- +:匹配前面的字符一次或多次
- ?:匹配前面的字符零次或一次
- {n}:匹配前面的字符恰好n次
- {n,m}:匹配前面的字符n到m次
- []:字符集,匹配其中任意一个字符
- ^:匹配字符串的开头
- $:匹配字符串的结尾
re模块核心函数
re.match()
该函数从字符串的开头开始匹配,如果开头不符合模式则返回None,否则返回匹配对象。
import re # 匹配开头的数字 pattern = r"d+" string1 = "123abc" string2 = "abc123" result1 = re.match(pattern, string1) result2 = re.match(pattern, string2) print(result1.group() if result1 else "未匹配") # 输出:123 print(result2.group() if result2 else "未匹配") # 输出:未匹配
re.search()
该函数扫描整个字符串,返回第一个匹配到的结果,不管匹配内容在字符串的什么位置。
import re # 查找字符串中的邮箱 pattern = r"w+@w+.w+" string = "我的邮箱是test@ipipp.com,备用邮箱是demo@ipipp.com" result = re.search(pattern, string) print(result.group() if result else "未匹配") # 输出:test@ipipp.com
re.findall()
该函数扫描整个字符串,返回所有匹配到的结果组成的列表,没有匹配则返回空列表。
import re # 查找字符串中的所有数字 pattern = r"d+" string = "订单号123,金额456,数量789" result = re.findall(pattern, string) print(result) # 输出:['123', '456', '789']
re.sub()
该函数用于替换字符串中匹配到的内容,返回替换后的新字符串。
import re
# 将字符串中的手机号中间四位替换为*
pattern = r"(d{3})d{4}(d{4})"
string = "我的手机号是13812345678"
result = re.sub(pattern, r"1****2", string)
print(result) # 输出:我的手机号是138****5678
常见使用场景示例
校验手机号格式
国内手机号通常是11位,以1开头,第二位是3-9的数字,后面9位是任意数字。
import re
def check_phone(phone):
pattern = r"^1[3-9]d{9}$"
return re.match(pattern, phone) is not None
print(check_phone("13812345678")) # 输出:True
print(check_phone("12812345678")) # 输出:False
提取网页中的链接
可以通过正则表达式匹配<a>标签中的href属性值,提取网页中的链接地址。
import re
html_content = "<a href="https://ipipp.com/page1">页面1</a><a href="https://ipipp.com/page2">页面2</a>"
pattern = r"href="(.*?)""
links = re.findall(pattern, html_content)
for link in links:
print(link)
# 输出:
# https://ipipp.com/page1
# https://ipipp.com/page2
注意事项
在使用正则表达式时,如果模式中包含大量反斜杠,建议使用原始字符串(在字符串前加r),避免反斜杠被Python解释器转义。另外,复杂的正则表达式可读性较差,如果匹配规则过于复杂,可以考虑拆分规则或者使用其他方式处理,避免过度依赖正则表达式。