LOAD DATA INFILE是MySQL最快最稳的CSV导入方式,但需满足secure_file_priv路径限制、正确设置字段分隔符与引号、跳过标题行、处理日期格式及授权FILE权限;PostgreSQL用COPY(服务器端)或\copy(客户端);SQLite用.import需注意模式、编码和换行;跨平台推荐pandas+SQLAlchemy并优化chunksize和method参数。

MySQL用LOAD DATA INFILE直接导入CSV
只要CSV文件在数据库服务器本地,LOAD DATA INFILE 是最快最稳的方式。它绕过客户端解析,由MySQL服务端直接读取文件,百万行数据通常几秒完成。
常见错误是报错 ERROR 1290 (HY000): The MySQL server is running with the --secure-file-priv option —— 这说明MySQL只允许从特定目录读文件。先查允许路径:
SHOW VARIABLES LIKE 'secure_file_priv';返回结果为空或
/var/lib/mysql-files/这类路径,你就得把CSV拷到那个目录下,再用绝对路径引用。
- 字段分隔符默认是制表符,CSV要用
FIELDS TERMINATED BY ',',带引号的字段还得加OPTIONALLY ENCLOSED BY '"' - 首行是标题?加
IGNORE 1 ROWS跳过 - 日期字段格式不匹配(比如CSV里是
2024-03-15但表定义为DATETIME)会静默转成0000-00-00 00:00:00,建议先用SELECT验证格式 - 权限必须有
FILE权限,普通应用账户通常没有,得让DBA授权:GRANT FILE ON *.* TO 'user'@'host';
PostgreSQL用COPY命令导入CSV
COPY是PostgreSQL原生命令,性能和LOAD DATA INFILE相当,但要求文件在数据库服务器上,且连接用户需有pg_read_server_files角色(或超级用户)。
容易卡在路径问题:用COPY table_name FROM '/path/to/file.csv'时,路径是服务器视角,不是你本地机器。如果没权限访问文件,会报ERROR: could not open file "/xxx.csv" for reading: Permission denied。
- 客户端导入可用
\copy(psql元命令),文件路径是你本地的,但速度稍慢,适合万级以下数据 - 字段含逗号或换行?确保CSV用双引号包裹字段,并声明
CSV HEADER QUOTE '"' DELIMITER ',' - 目标列顺序必须和CSV列顺序一致,除非显式指定列名:
COPY t(a,b,c) FROM '/x.csv' ... - 遇到类型转换失败(如字符串往
INT插空值),默认整行失败;加ON ERROR CONTINUE(v15+)或提前用NULL AS ''定义空值映射
SQLite用.import命令处理小批量CSV
.import是SQLite CLI内置命令,不走SQL解析,纯文本逐行导入,适合本地开发、测试或单机工具场景。注意它不校验约束、不触发触发器,也不支持事务回滚——出错就得删表重来。
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
典型翻车点是编码和分隔符:默认按制表符切分,CSV得先设.mode csv,否则所有字段挤进第一列。另外Windows写的CSV常用CRLF换行,Linux下可能多出^M字符,导致最后一列异常。
- 执行前务必
.headers on确认头行是否被当数据读了;若CSV有标题,加--skip 1(3.37+版本)或手动删头行 - 字段含双引号?CLI默认用
"做引号,但不会自动转义内部",得确保CSV符合RFC 4180规范(即内部引号写成"") - 数值型字段插入字符串会静默转成0,无法像PostgreSQL那样
ON CONFLICT兜底,得靠预处理清洗
跨平台通用方案:用Python pandas + SQLAlchemy
当CSV在你本地、数据库远程,或者需要清洗/转换逻辑时,pandas.read_csv() + df.to_sql() 是最灵活的选择。但它本质是循环INSERT,大数据量(>10万行)会明显变慢,且默认不启用execute_many模式。
性能坑主要在默认参数:不设chunksize直接读GB级CSV会爆内存;不用method='multi'或method='batch'(SQLAlchemy 2.0+)就只能单条提交,速度差10倍以上。
- MySQL推荐:
to_sql(..., method='multi', chunksize=10000),配合engine = create_engine('mysql+pymysql://...', echo=False) - PostgreSQL更稳:
method='multi'或直接用psycopg2.extras.execute_batch手写批量插入 - 注意
if_exists='replace'会先DROP TABLE,别误删生产表;'append'才安全 - 中文乱码?读CSV时显式指定
encoding='utf-8-sig'(防BOM),写入前检查df.dtypes避免object列被当成TEXT塞进数字字段
真正麻烦的从来不是“怎么导”,而是CSV字段语义模糊、缺失值标记不一、时间格式混杂——这些得在pandas里用fillna()、pd.to_datetime()、astype()一个个对齐,没法靠一条SQL命令解决。

















