在数据库的日常运维和开发中,大表的数据修改操作十分常见,比如批量插入、更新、删除大量数据后,数据库的统计信息往往无法及时同步数据变化,此时查询优化器可能会基于过期的统计信息生成低效的执行计划,导致查询性能大幅下降。执行Analyze命令是更新统计信息的重要手段,能够快速让数据库重新收集表和索引的数据分布信息。

统计信息过期的影响
统计信息记录了表的数据量、列的数据分布、索引的选择性等信息,查询优化器会依据这些信息选择最优的查询路径。当大表数据被大量修改后,统计信息过期的常见问题包括:
- 优化器误判表的行数,选择全表扫描而非索引扫描
- 多表关联时选择错误的关联顺序,增加关联成本
- 对数据分布判断错误,导致内存分配不合理,查询耗时增加
Analyze命令的作用
Analyze命令的核心作用是触发数据库重新收集指定表或者整个数据库的统计信息,更新数据字典中存储的相关元数据。执行完成后,查询优化器可以基于最新的统计信息生成更合理的执行计划,提升查询效率。不同数据库对Analyze命令的支持略有不同,以下是常见数据库的实现方式。
PostgreSQL中执行Analyze
PostgreSQL的Analyze命令可以针对单表、单表的指定列或者整个数据库执行,语法如下:
-- 更新单个表的统计信息 ANALYZE 表名; -- 更新单个表指定列的统计信息 ANALYZE 表名 (列名1, 列名2); -- 更新整个数据库所有表的统计信息 ANALYZE;
如果只需要更新大表中部分列的统计信息,可以指定列名,减少统计信息收集的开销。例如对订单表的大客户ID列和订单金额列更新统计信息:
ANALYZE 订单表 (客户ID, 订单金额);
MySQL中执行Analyze
MySQL中对应的命令是ANALYZE TABLE,用于更新表和索引的统计信息,语法如下:
-- 更新单个表的统计信息 ANALYZE TABLE 表名; -- 同时更新多个表的统计信息 ANALYZE TABLE 表1, 表2;
执行后MySQL会重新计算表的索引基数等信息,更新到information_schema相关的统计表中。需要注意MySQL的ANALYZE TABLE会对表加读锁,大表执行时需要避开业务高峰期。
Oracle中执行Analyze
Oracle中除了传统的Analyze命令,更推荐使用DBMS_STATS包来收集统计信息,传统Analyze命令的语法如下:
-- 更新表的统计信息 ANALYZE TABLE 表名 COMPUTE STATISTICS; -- 仅更新索引的统计信息 ANALYZE INDEX 索引名 COMPUTE STATISTICS;
如果表数据量极大,使用ESTIMATE STATISTICS可以采样收集统计信息,减少执行时间:
ANALYZE TABLE 大表名 ESTIMATE STATISTICS SAMPLE 10 PERCENT;
大表执行Analyze的注意事项
大表的数据量通常达到千万甚至亿级,执行Analyze命令时需要考虑以下要点:
- 选择业务低峰期执行,避免影响正常业务查询,尤其是会对表加锁的数据库实现
- 优先使用采样收集的方式,不需要全量扫描所有数据,在保证统计信息准确度的前提下降低资源消耗
- 对于分区表,可以仅对修改过的分区执行Analyze,不需要全表扫描所有分区
- 执行完成后可以查询数据库的统计信息相关系统表,确认统计信息已经更新到最新时间
验证统计信息是否更新
执行Analyze命令后,可以通过查询系统表确认统计信息的更新时间,以PostgreSQL为例:
SELECT schemaname, tablename, last_analyze FROM pg_stat_user_tables WHERE tablename = '大表名';
如果last_analyze字段显示的时间为最近执行Analyze的时间,说明统计信息已经成功更新。