SQL排序规则决定了数据库中字符数据的比较规则、排序方式以及大小写敏感属性,是数据库字符处理的核心配置之一,不同的排序规则会导致相同的字符查询、排序操作产生完全不同的结果。
SQL排序规则的核心原理
排序规则(Collation)本质上是字符集的配套规则,它定义了字符的排序顺序、比较时的等价规则以及大小写、重音的敏感属性。常见的排序规则属性包含以下几类:
- 大小写敏感(Case Sensitive):区分大小写字符,比如'a'和'A'会被判定为不同的字符
- 大小写不敏感(Case Insensitive):不区分大小写字符,'a'和'A'会被判定为等价
- 重音敏感(Accent Sensitive):区分带重音和不带重音的字符,比如'e'和'é'被视为不同字符
- 重音不敏感(Accent Insensitive):不区分重音差异,'e'和'é'被视为等价
排序规则的命名通常遵循固定格式,以MySQL常用的utf8mb4_general_ci为例,utf8mb4是字符集,general是排序算法,ci代表大小写不敏感(Case Insensitive)。
不同场景下的SQL排序规则设置方法
1. 创建数据库时设置排序规则
创建数据库时可以直接指定默认的排序规则,后续该数据库下创建的表默认会继承这个排序规则,以MySQL为例:
-- 创建数据库时指定字符集和排序规则 CREATE DATABASE test_db CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci;
如果需要修改已有数据库的排序规则,可以使用ALTER语句:
-- 修改已有数据库的排序规则 ALTER DATABASE test_db CHARACTER SET utf8mb4 COLLATE utf8mb4_bin;
2. 创建表时设置排序规则
创建表时可以单独为表指定排序规则,覆盖数据库的默认配置,也可以为单个字段指定独立的排序规则:
-- 创建表时指定表的排序规则,同时给name字段单独设置大小写敏感的排序规则
CREATE TABLE user_info (
id INT PRIMARY KEY AUTO_INCREMENT,
name VARCHAR(50) COLLATE utf8mb4_bin,
age INT
) ENGINE=InnoDB DEFAULT CHARSET=utf8mb4 COLLATE=utf8mb4_general_ci;
3. 查询语句中临时设置排序规则
如果查询时需要临时改变排序规则,不需要修改表结构,可以在查询语句中直接指定字段的排序规则:
-- 查询时临时使用大小写敏感的排序规则,区分name的大小写 SELECT * FROM user_info WHERE name COLLATE utf8mb4_bin = 'Admin';
排序规则的选择技巧
实际开发中可以根据场景选择合适的排序规则:
- 如果业务需要区分用户名、密码等字段的大小写,优先选择带
_bin后缀的二进制排序规则,或者带_cs后缀的大小写敏感排序规则 - 如果是普通的中文内容存储、排序,选择
utf8mb4_general_ci或者utf8mb4_unicode_ci即可,后者对多语言字符的排序支持更完善 - 如果涉及跨数据库的查询,尽量保证关联字段的排序规则一致,避免出现隐式转换导致的查询性能下降或者结果错误
常见问题说明
如果查询时出现排序规则不匹配的错误,比如提示Illegal mix of collations,通常是因为参与比较的两个字段排序规则不一致,可以通过统一字段排序规则,或者在查询时显式指定其中一个字段的排序规则来解决。
另外需要注意,修改已有表的排序规则不会影响已经存储的数据,只会影响后续的写入和查询比较逻辑,如果需要让已有数据也按照新的排序规则生效,需要对表进行重建或者数据迁移操作。