最稳妥的导出方式是显式指定字段而非使用SELECT *。需注意权限、字段顺序、NULL处理、特殊字符转义,并通过视图或配置化管理字段清单,确保可维护性与安全性。
用 SELECT 指定字段导出,别用 *
直接写死要导出的列名,是最稳妥、最可控的方式。用 * 看似省事,但表结构一变(比如新增敏感字段或大文本列),导出文件就可能暴增、失败,甚至泄露数据。
常见错误是导出脚本里还留着 SELECT *,尤其在定时备份或交接给他人维护时容易被忽略。
-
mysqldump -u user -p db_name table_name --where="1=1" --fields-enclosed-by='"' --tab=/tmp/这类命令不支持只选列,得靠SELECT ... INTO OUTFILE或客户端工具 - PostgreSQL 用
psql -c "COPY (SELECT col1, col2 FROM t) TO '/path/out.csv' WITH CSV HEADER;" - MySQL 命令行:先连上,再执行
SELECT col_a, col_b, created_at FROM orders WHERE status = 'paid' INTO OUTFILE '/tmp/orders_light.csv' FIELDS TERMINATED BY ',' ENCLOSED BY '"' LINES TERMINATED BY ' '; - 注意权限:
INTO OUTFILE要求 MySQL 有写入目标目录的权限,且路径必须是服务端本地路径,不是你本地机器
用 pg_dump 或 mysqldump 配合视图导出
当需要长期复用某几列的导出逻辑(比如每月财务报表固定字段),建个视图比每次拼 SQL 更可靠。
视图把字段选择、过滤、类型转换都固化下来,导出命令就能保持稳定,也不怕手误漏列。
- MySQL 创建视图:
CREATE VIEW export_orders AS SELECT id, amount, currency, DATE(created_at) as date FROM orders WHERE deleted = 0; - 然后用
mysqldump -u u -p db_name export_orders > export_orders.csv(需配合--tab或用SELECT ... INTO OUTFILE导出为 CSV) - PostgreSQL 直接
pg_dump -t export_orders -F csv -f export.csv db_name不行,pg_dump不支持按视图导出 CSV;得用psql -c "COPY export_orders TO STDOUT WITH CSV HEADER" - 视图不会提升导出性能,但能避免重复写错字段名或条件,特别适合多人协作或自动化脚本
导出 CSV 时字段顺序和 NULL 处理容易翻车
字段顺序不是“看着顺眼就行”,它直接影响下游系统解析——尤其是用 Excel 打开或 Python pandas.read_csv() 加载时,列对不上就全乱了。
NULL 值默认导出为空字符串,但有些系统要求显示为 N 或 NULL 字符串,不统一就会报错或数据错位。
- MySQL
INTO OUTFILE中用FIELDS TERMINATED BY ',' ENCLOSED BY '"' LINES TERMINATED BY ' '是基础配置,但若字段含换行符或双引号,必须加ESCAPED BY '\',否则 CSV 格式会崩 - PostgreSQL 的
COPY ... WITH CSV默认把 NULL 输出为空,加NULL 'NULL'可改成字符串NULL,如:COPY t TO STDOUT WITH (FORMAT CSV, HEADER, NULL 'NULL') - 如果字段里有逗号、换行、引号,又不想加转义,更稳妥的是导出为 TSV(制表符分隔):
FIELDS TERMINATED BY ' ',Excel 和多数分析工具都支持
Python 脚本导出时别硬编码字段列表
写脚本导出时,把字段名写死在代码里(比如 ['name', 'email', 'updated_at'])看似简单,但表结构一改,脚本就静默少导字段,问题很难发现。
真正省心的做法是让字段定义和业务逻辑绑定,而不是和 SQL 字符串耦合。
- 用 SQLAlchemy 的
inspect(table).c.keys()获取列名,再按白名单过滤:[c for c in cols if c not in ['password_hash', 'raw_log']] - 或者把字段清单单独提成配置项,比如 YAML 文件:
export_fields: [user_id, order_total, shipped_at],代码只读配置、不碰字段名 - 如果用
pd.read_sql(),务必加columns=...参数限定返回列,避免 DataFrame 里混进不需要的大字段(如 JSON blob),拖慢内存和导出速度 - 别依赖
df.to_csv()默认行为——它默认不处理 NaN,也不强制字符串字段加引号,导出后 Excel 可能自动转数字或科学计数,要用quoting=csv.QUOTE_NONNUMERIC和na_rep=''

















