在SQL查询里,GROUP BY是最常用的聚合手段之一,但当数据量变大时,分组操作很容易拖慢整体性能。数据库执行GROUP BY主要有两种方式:松散索引扫描(Loose Index Scan)和紧凑索引扫描(Tight Index Scan)。两者的本质区别在于是否利用索引跳过了不必要的记录读取。

什么是紧凑索引扫描
紧凑索引扫描是指数据库按照索引顺序依次读取每一条索引记录,并在内存中持续维护分组状态。它避免了全表扫描,但依然要遍历索引中的全部条目。对于如下查询:
SELECT user_id, COUNT(*) FROM orders GROUP BY user_id;
如果我们在 user_id 上有索引,MySQL可能使用紧凑索引扫描,按顺序读出每个 user_id 并计数。这种方式比无索引的全表扫描快,但读取行数并没有减少。
什么是松散索引扫描
松散索引扫描只读取索引中每个分组的第一条记录,跳过同组其他记录。它通常只能用于特定聚合函数,例如 MIN()、MAX(),且分组列必须是索引前缀。示例如下:
SELECT user_id, MIN(amount), MAX(amount) FROM orders GROUP BY user_id;
当 orders 表有联合索引 (user_id, amount) 时,优化器可以走松散索引扫描,对每个 user_id 只取首尾 amount 值,性能提升非常明显。
如何判断使用了哪种扫描
通过 EXPLAIN 查看执行计划,Extra 列出现 Using index for group-by 表示松散索引扫描,出现 Using index 通常表示紧凑索引扫描。我们可以用下表快速对照:
| 扫描方式 | Extra信息 | 适用场景 |
|---|---|---|
| 松散索引扫描 | Using index for group-by | MIN/MAX等,索引前缀分组 |
| 紧凑索引扫描 | Using index | 通用聚合,索引顺序分组 |
优化建议
- 为 GROUP BY 列建立合适的联合索引,把分组列放在索引最左前缀。
- 尽量用 MIN()、MAX() 等可触发松散索引扫描的函数替代 COUNT()、SUM()。
- 避免 SELECT 非索引列,减少回表操作。
- 使用 EXPLAIN 验证执行路径,确认是否命中索引扫描。
建立联合索引示例
-- 创建支持松散索引扫描的联合索引 CREATE INDEX idx_user_amount ON orders(user_id, amount);
验证执行计划
EXPLAIN SELECT user_id, MIN(amount) FROM orders GROUP BY user_id;
合理利用松散与紧凑索引扫描,能够把原本缓慢的分组统计变成毫秒级响应。核心思路就是让索引顺序与分组顺序一致,并优先满足松散扫描的苛刻条件。