mysql中的regexp_substr函数是用于基于正则表达式从字符串中提取子串的内置函数,它比普通的substring函数更灵活,能够适配复杂的字符串匹配规则,适合处理格式不固定的文本提取场景。

regexp_substr函数基本语法
regexp_substr函数的完整语法格式如下:
REGEXP_SUBSTR(str, pattern[, position[, occurrence[, match_type]]])
各个参数的具体含义如下:
- str:待提取的原始字符串,可以是字段名,也可以是固定的字符串常量。
- pattern:正则表达式匹配规则,用来指定要提取的子串特征。
- position:可选参数,指定从字符串的第几个字符开始匹配,默认值是1,也就是从字符串开头开始。
- occurrence:可选参数,指定匹配到第几个符合条件的子串,默认值是1,也就是第一个匹配的子串。
- match_type:可选参数,指定正则匹配的修饰符,常见的取值有c(区分大小写)、i(不区分大小写)、m(多行模式)等。
基础使用示例
我们先从最简单的场景开始,比如从一段文本中提取第一个数字串:
-- 从字符串中提取第一个连续的数字串
SELECT REGEXP_SUBSTR('订单号是12345,金额是678', '[0-9]+') AS result;
-- 返回结果:12345
如果要提取第二个匹配的数字串,可以调整occurrence参数:
-- 提取第二个连续的数字串
SELECT REGEXP_SUBSTR('订单号是12345,金额是678', '[0-9]+', 1, 2) AS result;
-- 返回结果:678
结合字段的实际使用场景
在实际业务中,我们经常需要从表中存储的字段里提取内容,比如用户表中存储的用户标签是逗号分隔的格式,我们要提取第二个标签:
-- 创建测试表
CREATE TABLE user_tags (
id INT PRIMARY KEY,
tags VARCHAR(255)
);
-- 插入测试数据
INSERT INTO user_tags VALUES (1, '篮球,足球,羽毛球');
INSERT INTO user_tags VALUES (2, '编程,阅读,跑步');
-- 提取每个用户的第二个标签
SELECT id, REGEXP_SUBSTR(tags, '[^,]+', 1, 2) AS second_tag FROM user_tags;
上述查询中,正则表达式[^,]+表示匹配一个或多个非逗号的字符,occurrence设为2就表示取第二个符合这个规则的子串,也就是第二个标签。
匹配类型的使用
如果需要不区分大小写匹配,可以设置match_type参数为i,比如从字符串中提取第一个英文字母串,不区分大小写:
-- 不区分大小写提取第一个英文字母串
SELECT REGEXP_SUBSTR('Abc123def', '[a-z]+', 1, 1, 'i') AS result;
-- 返回结果:Abc
注意事项
- 如果正则匹配不到符合条件的子串,函数会返回NULL,使用前可以根据需要处理空值情况。
- mysql版本需要是8.0及以上才支持regexp_substr函数,低版本mysql无法使用这个函数。
- 正则表达式的语法需要符合mysql的正则规则,和常见编程语言的正则语法略有差异,比如不支持d表示数字,需要用[0-9]代替。
使用regexp_substr函数时,建议先通过简单的查询测试正则规则是否符合预期,再应用到实际的业务查询中,避免出现提取结果不符合预期的问题。
mysqlregexp_substr正则表达式字符串提取修改时间:2026-07-22 01:36:21