本文介绍如何利用 MySQL 原生 LOAD DATA INFILE 与 staging table 策略,将 10 万+ 行 CSV 数据高效拆分写入 5 张关联表,全程控制在 5 秒内,远超 ORM 单条插入或小批量 save 的性能极限。
本文介绍如何利用 mysql 原生 `load data infile` 与 staging table 策略,将 10 万+ 行 csv 数据高效拆分写入 5 张关联表,全程控制在 5 秒内,远超 orm 单条插入或小批量 save 的性能极限。
在 Express + TypeORM 技术栈中直接通过 ORM 插入 10 万+ 行结构化数据(如用户、评论、员工、职位、公司等多实体关联数据),极易遭遇性能瓶颈——即使采用 save() 批量提交(如每 100 条一批),仍受限于事务开销、N+1 查询、外键约束校验及网络往返延迟,实际耗时往往达数分钟。
真正高效的解决方案是绕过 ORM,直击 MySQL 底层批量能力:将原始 CSV 作为“暂存原料”,用原生 SQL 在数据库内完成解析、映射与分发。核心流程分为四步:
✅ 第一步:创建宽表暂存区(Staging Table)
先建一张与 CSV 结构完全一致的宽表 raw_import,允许所有字段为 TEXT 或 VARCHAR(255),暂不设外键或复杂约束:
CREATE TABLE raw_import ( id INT AUTO_INCREMENT PRIMARY KEY, reviewer VARCHAR(255), review LONGTEXT, email VARCHAR(255), rating TINYINT, employee VARCHAR(255), employee_position VARCHAR(255), employee_unique_id VARCHAR(255), company VARCHAR(255), company_description LONGTEXT );
✅ 第二步:极速加载 CSV 到暂存表
启用 LOCAL INFILE(需 MySQL 配置 local_infile=ON 并授予 FILE 权限),单条命令秒级导入:
LOAD DATA LOCAL INFILE '/path/to/data.csv' INTO TABLE raw_import FIELDS TERMINATED BY ',' ENCLOSED BY '"' LINES TERMINATED BY '\n' IGNORE 1 ROWS; -- 注意:确保 CSV 字段顺序与表定义严格一致
⚠️ 安全提示:生产环境慎用 LOCAL INFILE;若不可用,可先上传至 MySQL 服务器本地路径,改用 LOAD DATA INFILE(无需 LOCAL)。
✅ 第三步:原子化拆分写入目标表(关键优化点)
利用 INSERT ... SELECT 一次性生成各实体表,避免逐行计算 ID。针对主键自增/UUID 场景,推荐以下模式:
-
User 表(去重 + 自增 ID):
INSERT INTO user (name, email) SELECT DISTINCT reviewer, email FROM raw_import WHERE email IS NOT NULL AND email != '';
-
Employee 表(基于唯一 ID 关联):
INSERT INTO employee (id, name, company_id, position_id) SELECT DISTINCT employee_unique_id, employee, (SELECT id FROM company WHERE name = raw_import.company LIMIT 1), (SELECT id FROM employee_position WHERE name = raw_import.employee_position LIMIT 1) FROM raw_import WHERE employee_unique_id IS NOT NULL;
-
Review 表(关联已生成的 User/Employee ID):
INSERT INTO review (text, rating, from_user_id, for_employee_id) SELECT r.review, r.rating, u.id, e.id FROM raw_import r JOIN user u ON u.email = r.email JOIN employee e ON e.id = r.employee_unique_id;
? 提示:company 和 employee_position 表需提前预置基础数据(如 CSV 中出现的所有职位名、公司名),或通过 INSERT IGNORE ... SELECT DISTINCT 快速初始化。
✅ 第四步:零停机切换(可选,适用于全量替换场景)
若需完全替换旧数据,按如下三步实现亚秒级上线:
- 创建带 _new 后缀的新表(如 user_new, review_new);
- 上述 INSERT ... SELECT 写入 _new 表;
- 原子重命名切换:
RENAME TABLE user TO user_old, user_new TO user, review TO review_old, review_new TO review, employee TO employee_old, employee_new TO employee, employee_position TO employee_position_old, employee_position_new TO employee_position, company TO company_old, company_new TO company; DROP TABLE user_old, review_old, employee_old, employee_position_old, company_old;
? 注意事项与最佳实践
- 禁用索引与外键:导入前 ALTER TABLE raw_import DISABLE KEYS,导入后 ENABLE KEYS;目标表可在数据写入完成后再创建索引。
- 事务粒度:整个流程无需显式事务——每个 INSERT ... SELECT 本身已是原子操作,且 RENAME TABLE 为元数据操作,毫秒级完成。
- TypeORM 协同:导入完成后,可通过 queryRunner.query() 在 TypeORM 中执行上述 SQL,保持事务上下文统一;但切勿在循环中调用 repository.save()。
- 内存与配置:增大 innodb_buffer_pool_size、bulk_insert_buffer_size 及 max_allowed_packet,避免导入中断。
通过该方案,10 万行 CSV 的全链路处理(含清洗、关联、写入、切换)可稳定控制在 3–5 秒内,性能提升 50 倍以上。记住:当数据规模突破万级,数据库原生批量能力永远优于应用层抽象——让 SQL 做它最擅长的事。


















