做数据统计时,最常见的需求莫过于“按部门统计人数”“按类别统计销售额”“按月份统计订单量”。这类需求在SQL里都离不开一个核心操作——分组统计。GROUP BY负责把数据按规则分堆,聚合函数负责对每一堆做计算,而HAVING则用来筛选不满足条件的分组。这三个概念配合起来,几乎是日常数据分析查询的骨架。下面我们从执行原理讲起,逐步展开各种实际用法。

一、GROUP BY的执行原理与基本语法
很多初学者写分组查询时会报错,比如“选择列表中的列无效,该列没有包含在聚合函数或GROUP BY子句中”。要理解这个报错,得先明白GROUP BY到底做了什么。
GROUP BY的工作方式可以想象成“分堆”。假设有一张订单表orders,包含字段order_id、customer_id、category(商品类别)、amount(金额)。执行GROUP BY category时,数据库会把category值相同的行归到同一组,比如“电子产品”一堆、“服装”一堆。分组之后,每个组在结果集中只输出一行,所以SELECT后面只能出现两类东西:分组字段本身,或者聚合函数(如COUNT、SUM、AVG、MAX、MIN)。
-- 按商品类别统计订单数和总金额
SELECT category,
COUNT(*) AS order_count,
SUM(amount) AS total_amount
FROM orders
GROUP BY category;
这条语句会为每个类别输出一行,包含该类别的订单数量和金额合计。如果把没有分组的字段比如customer_id直接放进SELECT,数据库就不知道该输出组内哪个客户的ID,因此直接报错。这是初学者最容易踩的第一个坑。
还需要了解SQL语句的实际执行顺序。虽然书写顺序是SELECT、FROM、WHERE、GROUP BY、HAVING、ORDER BY,但实际执行时数据库先FROM确定数据来源,再WHERE逐行过滤,然后GROUP BY分组,接着HAVING过滤分组,再执行SELECT中的聚合计算,最后才是ORDER BY排序。理解这个顺序,很多语法限制就顺理成章了。
二、常见聚合统计场景实例
掌握了基本语法后,来看几个典型场景。以下例子基于一张学生成绩表scores,包含字段student_name、subject、score、class_name。
第一个场景是单字段分组统计平均值:统计每个班级的平均分。
SELECT class_name,
AVG(score) AS avg_score,
COUNT(*) AS student_count
FROM scores
GROUP BY class_name;
第二个场景是多字段分组,相当于更细粒度的分堆。比如统计每个班级每个科目的平均分,GROUP BY后面依次写上两个分组字段即可,组的数量等于班级和科目的组合数。
SELECT class_name,
subject,
AVG(score) AS avg_score,
MAX(score) AS max_score,
MIN(score) AS min_score
FROM scores
GROUP BY class_name, subject;
第三个场景是条件统计,在聚合函数内部使用CASE表达式。比如统计每个班级及格人数和不及格人数,不必写两条查询,一条就够了。
SELECT class_name,
COUNT(CASE WHEN score >= 60 THEN 1 END) AS pass_count,
COUNT(CASE WHEN score < 60 THEN 1 END) AS fail_count
FROM scores
GROUP BY class_name;
这里利用了COUNT只统计非空值的特性,CASE不匹配时返回NULL就不会被计入。这种写法在报表开发中非常实用,能显著减少查询次数。
第四个场景是分组后排序。比如找出销售额最高的前五个类别,只需在分组统计的基础上加ORDER BY降序和LIMIT(MySQL写法,SQL Server用TOP,Oracle用ROWNUM)。
SELECT category, SUM(amount) AS total_amount FROM orders GROUP BY category ORDER BY total_amount DESC LIMIT 5;
三、HAVING与WHERE的区别及进阶用法
HAVING是分组统计中另一个关键子句,它和WHERE都可以做过滤,但作用对象完全不同。WHERE在分组之前逐行过滤原始数据,HAVING在分组之后对整个组做过滤。因此WHERE后面不能跟聚合函数,而HAVING可以。
举个典型例子:查询总销售额超过10000的商品类别。因为“总销售额”是对分组求和的结果,在分组前根本不存在,所以必须用HAVING。
SELECT category, SUM(amount) AS total_amount FROM orders WHERE amount > 0 -- 先剔除无效订单(逐行过滤) GROUP BY category HAVING SUM(amount) > 10000 -- 再筛选高销售额的组(分组后过滤) ORDER BY total_amount DESC;
这条语句同时演示了WHERE和HAVING的配合:先用WHERE把金额小于等于0的脏数据剔除,减少参与分组的行数,再用HAVING留下销售额达标的组。从性能角度看,应尽量把能下推的过滤条件放到WHERE里,HAVING只处理必须依赖聚合结果的筛选,这样分组计算的数据量更小,查询更快。
HAVING中还可以使用别名。在MySQL中,下面这种写法是允许的,因为MySQL允许在HAVING里引用SELECT中定义的别名;但SQL Server、Oracle等数据库不支持,跨库开发时要注意兼容性,稳妥做法是直接写完整的聚合表达式。
-- MySQL支持,其他数据库可能报错 SELECT category, SUM(amount) AS total_amount FROM orders GROUP BY category HAVING total_amount > 10000;
最后提醒几个易错点:第一,GROUP BY后面的字段必须与SELECT中的非聚合字段一致,不能多也不能少;第二,COUNT(*)统计所有行,COUNT(字段)会跳过该字段为NULL的行,两者在含空值的数据里结果可能不同;第三,分组查询不要依赖默认排序,需要确定顺序就显式写ORDER BY。把这些细节记牢,分组统计的查询基本不会再出问题。