要让DeepSeek生成真正可用的数据清洗规则,需四步:一、粘贴真实字段与脏数据样本;二、用业务语言明确定义“干净”标准及异常处理动作;三、指定交付形式(Excel公式/Pandas代码/SQL语句);四、设定专业角色、硬性约束与纯输出要求。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让DeepSeek生成的数据清洗规则真正能用在你手头的销售报表、客户名单或爬虫导出的原始数据里,而不是泛泛而谈的“删除空行”“统一大小写”——这要求提示词必须锚定你的字段名、异常样例、业务逻辑和输出目标。
第一步:把真实字段和问题样本塞进提示词
打开你的Excel或CSV文件,挑出3~5行典型脏数据(比如手机号带空格/括号、日期格式混杂为“2024-01-01”和“01/01/2024”、姓名列出现“张三//李四”这种双人名)。把这些原始文本连同行头字段名一起粘贴到提示词开头,前面加一句:“以下是我的原始数据片段:”。
这一步不能跳过。DeepSeek若没见过你真实的“客户电话”列里是写成“138****1234”还是“+86 138 0013 8000”,它生成的正则就只能靠猜。
第二步:用业务语言定义“干净”标准
不要说“清洗数据”,要说清楚什么状态算合格。例如:“手机号必须为11位纯数字,且以13/15/17/18/19开头;日期统一转为YYYY-MM-DD格式;客户等级字段只允许出现‘VIP’‘普通’‘流失’三个值,其余全部标为‘待核实’。”
【必须写明校验失败后的处理动作】,比如是删掉整行、留空、还是填入默认值。不写清楚,DeepSeek可能默认返回“建议人工复核”,而这对你批量处理毫无帮助。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
第三步:指定交付物形式
方法一:要可直接粘贴的Excel条件格式公式
输入:“请生成适用于Excel 365的条件格式公式,用于标红所有不符合上述手机号规则的单元格,作用范围是B2:B1000。”
方法二:要Python pandas代码
输入:“用pandas写清洗脚本,读取data.csv,按前述规则清洗后保存为cleaned_data.csv,保留原始索引不变。”
方法三:要SQL清洗语句(适用于数据库表)
输入:“生成MySQL语句,对customer_info表的phone字段执行UPDATE,将非11位数字的值设为NULL,日期字段用STR_TO_DATE转换。”
第四步:加入角色与约束,封住AI的自由发挥
第一步:设定角色 → 你是一名有3年电商数据治理经验的数据工程师
第二步:加硬性约束 → 不得虚构字段名;所有正则表达式必须经Python re.fullmatch()验证通过;若遇到模糊场景(如中英文混排地址),优先保留原始值并打上‘_flag_unclean’后缀
第三步:限定输出 → 只输出可执行代码或公式,不解释原理,不加注释,不举例
这三步叠在一起,就把DeepSeek从“通用回答机器”锁进了你的数据上下文里。它不再回答“什么是数据清洗”,而是直接给你一行能跑通的pandas.drop_duplicates(subset=['user_id'], keep='first')。


















