在业务查询里,我们经常会碰到一对多的数据关系,比如一个订单对应多件商品,或者一个用户拥有多个标签。如果按常规方式查询,应用层拿到的是多行重复主键的记录,只能自己写循环去归并。PostgreSQL提供的ARRAY_AGG函数可以直接在数据库侧把分组内的某一列聚合成数组,一次性返回清晰的结构。

ARRAY_AGG 基本语法与行为
ARRAY_AGG是一个聚合函数,它把分组中表达式的值收集到一个数组里。最简单的用法是在GROUP BY查询中配合普通列使用。默认情况下,数组元素的顺序是不保证的,如果业务对顺序敏感,应当显式加上ORDER BY子句。
下面的示例演示如何把一个部门下的员工姓名聚合成数组。我们会按照部门编号分组,并在聚合时对姓名排序,这样返回的结果既紧凑又有序。
SELECT
dept_id,
ARRAY_AGG(emp_name ORDER BY emp_name) AS emp_names
FROM employee
GROUP BY dept_id;
从执行结果看,每个部门只有一行,emp_names字段是文本数组。应用层不需要再按dept_id做二次分组,直接映射成列表对象即可。需要注意,当分组内没有行时,ARRAY_AGG默认返回NULL而不是空数组,如果希望空分组得到空数组,可以用COALESCE包裹。
结合其他聚合简化一对多查询
实际场景中,我们往往不仅要聚合一个字段,还要保留分组的主信息。此时可以把ARRAY_AGG和普通聚合混用,或者用子查询先聚合再关联。这样能显著减少应用层与数据库的交互次数。
以订单系统为例,传统做法先查订单列表,再循环查每个订单的商品;使用ARRAY_AGG后,可以用一条SQL把订单及其商品名数组一并查出。如下代码展示了这种写法:
SELECT
o.order_id,
o.created_at,
ARRAY_AGG(oi.product_name ORDER BY oi.item_id) AS products
FROM orders o
JOIN order_item oi ON oi.order_id = o.order_id
GROUP BY o.order_id, o.created_at
ORDER BY o.created_at DESC;
这条语句把同一个订单的商品名聚合成数组,订单本身只出现一行。对于后端接口来说,序列化时直接把products映射成字符串数组,省去了嵌套查询与内存归并。如果商品还需要数量,可以再增加一个ARRAY_AGG(oi.quantity)。
在关联聚合时,要留意JOIN可能放大行数,但GROUP BY后数组会收敛,因此对性能影响可控。对大表建议在分组列上建立索引,并利用EXPLAIN观察是否走了哈希聚合或排序聚合。
处理空值与多维数组场景
ARRAY_AGG默认会把NULL值也放进数组。如果某行待聚合字段为NULL,数组里就会出现NULL元素。若想剔除空值,可以在聚合前用FILTER子句过滤,或者用WHERE条件提前排除。
PostgreSQL还支持多维数组聚合,例如先把每行转成数组再用ARRAY_AGG嵌套,不过大多数业务用一维数组就够了。下面示例用FILTER去掉空标签,并演示如何把数组转回多行做反向展开。
SELECT
u.user_id,
ARRAY_AGG(t.tag_name ORDER BY t.tag_name) FILTER (WHERE t.tag_name IS NOT NULL) AS tags
FROM app_user u
LEFT JOIN user_tag t ON t.user_id = u.user_id
GROUP BY u.user_id;
-- 反向展开数组为多行
SELECT user_id, UNNEST(tags) AS tag_name
FROM user_profile
WHERE tags IS NOT NULL;
FILTER子句让聚合逻辑更声明式,避免了先子查询后聚合的繁琐。UNNEST则是对偶操作,方便把数组重新铺开做关联分析。两者配合,能在仓库层灵活调整数据结构形态。
需要提醒的是,数组字段在JDBC或ORM里通常映射为数组类型或JSON。如果应用层使用MyBatis等框架,可以借Array类型接收,或者把ARRAY_AGG换成JSON_AGG返回JSON数组,视客户端解析习惯而定。
与应用层处理的对比优势
把聚合下推到数据库,最大的好处是减少传输行数和代码分支。假设一个用户有五十个标签,常规查询会返回五十行,而数组方案只有一行。网络包更小,ORM映射更快。
从维护角度看,分组逻辑写在SQL里比散落在服务循环中更易测试与优化。数据库优化器可以对聚合做并行与内存控制,而应用层手写归并往往忽略大数据量下的扩容问题。下面的对照表总结了两者差异:
| 维度 | 应用层循环归并 | ARRAY_AGG下推 |
|---|---|---|
| 返回行数 | 一对多放大 | 每组一行 |
| 代码复杂度 | 需Map暂存 | 单条SQL |
| 排序控制 | 代码内排序 | ORDER BY子句 |
| 空分组表现 | 无记录 | NULL或空数组 |
当然,数组方案并非万能。若数组预期非常大,可能触及数据库单字段大小限制,此时应评估是否仍需要完整聚合,或采用游标分页。但在绝大多数中低频一对多展示场景,ARRAY_AGG是简化架构的实用选择。
总结与实践建议
ARRAY_AGG是PostgreSQL中处理分组多值字段的高效工具。通过在GROUP BY查询中嵌入带排序的ARRAY_AGG,可以把原本需要在应用层循环归并的数据直接结构化为数组,降低代码量与数据传输量。
建议在写报表接口、标签系统、订单明细汇总时优先尝试该函数,配合FILTER处理空值,用COALESCE保证空数组。若客户端更习惯JSON,可平行使用JSON_AGG。把聚合逻辑留在数据库,往往能让服务层更瘦、更清晰。
PostgreSQLARRAY_AGG分组聚合修改时间:2026-08-08 07:27:30