在数据库运维和开发工作中,MySQL的数据导入导出以及批量操作是决定任务耗时的关键环节。面对百万甚至千万量级的数据迁移、备份和恢复,如果只依赖图形化工具或简单的循环插入,往往会出现超时、锁表、内存溢出等问题。理解MySQL内部执行机制并选用合适的命令与参数,才能把操作时间从几小时压缩到几分钟。

一、LOAD DATA实现高速导入
LOAD DATA INFILE是MySQL提供的最快的文本数据导入方式。它跳过SQL解析器,直接由存储引擎读取客户端或服务器端的文本文件,将行拆分成字段后写入表。相比应用层拼装INSERT语句,性能通常提升十倍到几十倍。该语句默认在服务器端读取文件,若文件在客户端需使用LOAD DATA LOCAL INFILE。
使用时应先关闭目标表的非唯一索引,导入完成后再重建,这样引擎只需最后一次排序建索引,而不是每行维护一次B+树。同时把unique_checks和foreign_key_checks设为0,可以避免逐行唯一性和外键校验带来的磁盘随机IO。下面示例展示了一个典型用法:
-- 服务器端文件导入,跳过索引与约束检查以加速 SET unique_checks=0; SET foreign_key_checks=0; ALTER TABLE user DISABLE KEYS; LOAD DATA INFILE '/data/user.csv' INTO TABLE user FIELDS TERMINATED BY ',' ENCLOSED BY '"' LINES TERMINATED BY 'n' IGNORE 1 LINES; ALTER TABLE user ENABLE KEYS; SET unique_checks=1; SET foreign_key_checks=1;
该方式的局限在于文件必须能被MySQL进程读取,涉及权限与路径限制。在云数据库或容器环境中,往往需要先通过管理后台把文件传到指定目录。此外,LOAD DATA对字符集敏感,若文件编码与表定义不一致会产生乱码,应在语句中显式指定CHARACTER SET。
二、SELECT INTO OUTFILE导出大表
导出数据时,很多人习惯在程序里查全表再写文件,这种做法容易把客户端内存撑爆。SELECT INTO OUTFILE让MySQL服务器直接把结果集写成文本,不经过网络传输给客户端,效率和安全性都更好。生成的文件属于服务器,权限归运行MySQL的系统用户。
通过FIELDS和LINES子句可精确控制分隔符与换行,方便后续被Hive、Spark或其他库消费。注意该语句不能覆盖已存在文件,且输出路径必须在secure_file_priv允许的范围内。示例如下:
-- 将订单表导出为管道分隔的CSV,仅含2023年前数据 SELECT order_id, user_id, amount INTO OUTFILE '/var/lib/mysql-files/order_old.csv' FIELDS TERMINATED BY '|' LINES TERMINATED BY 'n' FROM orders WHERE create_time < '2023-01-01';
如果必须经由客户端导出,可使用mysqldump配合--tab参数,它会在服务端生成txt并用mysql命令导出结构。对于超大数据集,建议按主键区间分片导出,避免单语句持锁过久影响线上读写。
三、批量INSERT的写法优化
应用代码中常见的误区是循环执行单条INSERT,每次都产生一次网络往返和事务提交。改成单条INSERT多值语法,或者把多条语句放进一个事务,能显著减少日志刷盘和锁获取次数。下面展示多值写法:
-- 一次插入多行,减少解析与提交开销 INSERT INTO log_record (uid, action, ts) VALUES (1001, 'login', NOW()), (1002, 'pay', NOW()), (1003, 'logout', NOW());
当批量量极大时,还应控制每批次行数,例如每五千行提交一次,防止undo日志膨胀。结合rewriteBatchedStatements参数(JDBC连接串)可让驱动把多条PreparedStatement合并发送。与此同时,将innodb_flush_log_at_trx_commit临时调为0或2,能在非核心场景进一步加快写入,但需承担故障丢数据风险。
四、利用分区与并行提升吞吐
对于按时间或哈希分区的表,导入时可针对各个分区目录并行写文件,再由不同会话分别LOAD。这样能把单盘IO分散到多块磁盘。导出时也可利用分区裁剪,只抽取所需分区,缩短查询时间。
在批量删除或更新时,用LIMIT分批处理比一次性大事务更温和。如下代码每批删一千行,避免长时间持有锁导致主从延迟:
-- 分批删除历史数据,降低锁争用 DELETE FROM events WHERE create_time < '2022-01-01' LIMIT 1000; -- 循环执行直至受影响行数为0
此外,使用pt-archiver等在线归档工具,可以在保证业务连续性的前提下完成大量数据迁移。它自动处理分块、限速和从库延迟监控,比手写脚本稳健得多。
五、常见避坑与参数清单
不少团队在导入前忘记调整max_allowed_packet,导致长SQL被拒绝;也有人漏掉character set设置,使中文变成问号。下表列出关键参数与建议值:
| 参数/命令 | 作用 | 建议 |
|---|---|---|
| unique_checks | 关闭唯一性校验 | 导入前设0 |
| foreign_key_checks | 跳过外键检查 | 导入前设0 |
| DISABLE KEYS | 暂停非唯一索引更新 | MyISAM有效,InnoDB用排序建索引 |
| secure_file_priv | 限制文件读写目录 | 提前配置路径 |
| innodb_buffer_pool_size | 缓存池大小 | 导入机调大至物理内存70% |
掌握上述技巧后,你会发现原本需要通宵的迁移任务,白天就能轻松完成。实际落地时请结合业务容忍度,权衡速度与数据安全,切勿在金融主库上盲目关闭校验。