正则表达式是一种用于描述字符串匹配规则的特殊字符序列,通过定义特定的模式,可以快速对目标字符串进行匹配、查找、替换和提取等操作,是文本处理领域非常实用的工具。

正则表达式的核心作用
正则表达式的作用主要体现在以下几个常见场景中:
- 字符串校验:可以快速判断输入的字符串是否符合指定格式,比如手机号、邮箱、身份证号等格式的校验。
- 内容提取:从一段长文本中提取出符合特定规则的内容,比如从网页源码中提取所有链接地址,从日志中提取特定格式的报错信息。
- 批量替换:对文本中符合特定规则的内容进行统一替换,比如把文本中所有的手机号中间四位替换为星号,批量修改代码中的变量名。
- 文本分割:按照自定义的规则对字符串进行分割,比如按照多个空格或者特定符号分割字符串,比普通的分割方法更灵活。
正则表达式基本语法
普通字符
普通字符包括大小写字母、数字、下划线等,这些字符在正则表达式中表示匹配自身。比如正则表达式abc就表示匹配字符串中出现的abc三个连续字符。
元字符
元字符是正则表达式中具有特殊含义的字符,常用的元字符如下:
| 元字符 | 含义 | 示例 |
|---|---|---|
| . | 匹配除换行符以外的任意单个字符 | a.c可以匹配abc、aac、a1c等 |
| d | 匹配任意数字,等价于[0-9] | dd匹配两个连续数字 |
| w | 匹配字母、数字、下划线,等价于[a-zA-Z0-9_] | w+匹配一个或多个字母数字下划线 |
| s | 匹配任意空白字符,包括空格、制表符、换行符等 | asb匹配a和b之间有空白字符的情况 |
| ^ | 匹配字符串的开头 | ^hello匹配以hello开头的字符串 |
| $ | 匹配字符串的结尾 | world$匹配以world结尾的字符串 |
量词
量词用来指定前面的字符或表达式出现的次数,常用量词如下:
*:匹配前面的内容0次或多次+:匹配前面的内容1次或多次?:匹配前面的内容0次或1次{n}:匹配前面的内容恰好n次{n,}:匹配前面的内容至少n次{n,m}:匹配前面的内容n到m次
字符类
用方括号[]包裹的字符集合表示匹配其中任意一个字符,比如[aeiou]匹配任意一个元音字母,[0-9]匹配任意一个数字,[^0-9]匹配任意一个非数字字符。
常见使用示例
校验手机号
国内手机号通常是11位数字,开头是1,第二位是3-9的数字,后续9位是任意数字,对应的正则表达式如下:
// 校验手机号的正则表达式
const phoneReg = /^1[3-9]d{9}$/;
console.log(phoneReg.test("13800138000")); // true
console.log(phoneReg.test("12800138000")); // false,第二位不是3-9
console.log(phoneReg.test("1380013800")); // false,只有10位
提取文本中的邮箱
邮箱的格式通常是用户名@域名,用户名可以包含字母、数字、下划线、点,域名部分是字母数字加点的组合,提取邮箱的正则示例如下:
import re text = "我的邮箱是test_example@ipipp.com,他的邮箱是user123@mail.ipipp.com" # 匹配邮箱的正则表达式 email_reg = r"[a-zA-Z0-9_.]+@[a-zA-Z0-9_.]+.[a-zA-Z]+" emails = re.findall(email_reg, text) print(emails) # 输出 ['test_example@ipipp.com', 'user123@mail.ipipp.com']
替换字符串中的敏感信息
比如把文本中的手机号中间四位替换为星号,示例如下:
public class RegexDemo {
public static void main(String[] args) {
String text = "我的手机号是13800138000,她的手机号是15912345678";
// 匹配手机号的正则,捕获前三位和后四位
String phoneReg = "(\d{3})\d{4}(\d{4})";
// 替换为前三位+****+后四位
String result = text.replaceAll(phoneReg, "$1****$2");
System.out.println(result);
// 输出:我的手机号是138****8000,她的手机号是159****5678
}
}
使用注意事项
正则表达式虽然功能强大,但在使用时也需要注意一些问题。首先,复杂的正则表达式可读性较差,维护成本高,如果规则过于复杂,建议适当拆分或者添加注释。其次,部分正则引擎在处理长字符串和复杂规则时可能存在性能问题,尽量避免写回溯过多的正则表达式。另外,不同编程语言的正则表达式语法可能存在细微差异,使用时需要参考对应语言的文档。