高质量微调数据集需明确场景目标、合法获取脱敏数据、严格清洗格式、规范标注JSONL字段、均衡构建验证集并校验分布——这是让天工AI真正理解垂直领域业务的关键前提。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用天工AI大模型做垂直领域任务,比如金融报告生成或医疗问诊辅助,但模型直接调用效果生硬、术语不准、逻辑不连贯——问题不在模型本身,而在于它没见过你业务里真实的数据表达方式。准备一份高质量训练数据集,是让天工模型真正“听懂你说话”的第一步,不是凑够几百条文本就行,而是要让每一条数据都成为模型理解你业务的锚点。
明确微调目标并锁定数据范围
先别急着收集文本,打开笔记本写下三个问题:你要让模型在什么具体场景下输出?用户会怎么提问?回答必须包含哪些关键要素(比如财报中的同比/环比、诊断结论里的置信等级)?
例如做法律文书助手,就不能泛泛收集“合同范本”,而要聚焦“小微企业房屋租赁纠纷调解书终稿”,且必须含双方诉求→证据链→法条引用→调解建议四段结构。
【目标模糊会导致后续所有数据清洗和标注失去方向】
把答案整理成一句话需求描述,贴在项目根目录README.md第一行——这是你后续所有操作的唯一校验标尺。
数据来源与合法性筛查
方法一:自有业务数据(首选)
从客服对话日志、内部知识库、已结案文档中提取原始素材。注意脱敏:用正则批量替换身份证号、手机号、企业全称(保留行业属性如“某三甲医院”而非“北京协和医院”)。
方法二:公开数据集补充
仅限Hugging Face上带CC-BY-SA 4.0或MIT协议的数据集,下载前逐条核对许可证条款——天工官方文档明确要求训练数据不得含GPL类传染性协议内容。
方法三:合成数据(慎用)
用天工API自身生成初稿,再由领域专家人工重写校验。禁止直接用合成数据当训练集主体,否则模型会学出“自说自话”的幻觉逻辑。
提醒:爬虫获取的网页数据一律弃用,天工平台审核时会检测User-Agent和Referer头字段,触发风控即终止微调任务。
清洗与格式化实操步骤
第一步:去重 → 用simhash算法计算文本指纹,阈值设为0.95(默认0.9太松,会漏掉语义相同但措辞差异大的样本)
第二步:噪声过滤 → 删除含“【系统提示】”“#ERROR#”等非人类表达的整行;保留中文标点,但移除连续3个以上感叹号/问号(如“!!!”,这属于情绪噪音)
天工AI (iOS) 5.2.1版本新增 PPT 生成页数配置、十余种专业视频模板,并且支持设置视频比例与时长;定时任务可指定模型并推送到 IM 渠道。修复了下载失败等问题,提升了稳定性与内容创作体验,让创作更自由、更高效。
第三步:长度截断 → 指令微调数据单条总长≤2048 token,超长则从末尾反向裁剪,确保答案部分完整保留(模型更关注结尾输出)
第四步:强制UTF-8 BOM清除 → 用VS Code打开文件→右下角编码显示“UTF-8 with BOM”时,点击切换为“UTF-8”,否则天工训练器读取会报错“invalid start byte”
标注规范与JSONL转换
天工只接受JSONL格式(每行一个JSON对象),字段必须含instruction、input、output三项:
• instruction:任务指令,用自然语言描述(例:“请根据患者主诉和检查结果,生成门诊诊断意见,需包含疾病名称、ICD编码、处置建议三部分”)
• input:实际输入文本(例:“女,62岁,主诉:反复上腹痛3月,加重1周。胃镜示胃窦溃疡,活检病理:低分化腺癌。”)
• output:标准答案(例:“诊断:胃窦低分化腺癌(ICD-10:C16.3)。处置:立即转肿瘤科会诊,完善腹部增强CT及PET-CT评估分期。”)
标注时用Excel管理原始数据,确认无误后运行以下Python脚本转换:
import json
with open('data.xlsx', 'rb') as f:
df = pd.read_excel(f)
with open('train.jsonl', 'w', encoding='utf-8') as f:
for _, row in df.iterrows():
f.write(json.dumps({
'instruction': str(row['instruction']),
'input': str(row['input']),
'output': str(row['output'])
}, ensure_ascii=False) + '\n')
【output字段内禁止出现markdown符号(如**加粗**、```代码块),天工会将其解析为无效token】
验证集构建与分布检查
① 按7:2:1切分训练集/验证集/测试集,切分前先按instruction字段聚类,确保同类指令均匀分布到三组中(避免验证集全是“写邮件”而训练集全是“写报告”)
② 验证集必须含3种典型错误样本:a)输入含歧义表述(如“这个方案行不行?”未指明方案编号) b)输出缺失必填字段(如诊断意见缺ICD编码) c)专业术语错误(如把“心肌梗死”写成“心肌梗塞”)——这些样本要人工标注为“bad_case”,上传时勾选“启用bad_case增强”选项
③ 运行天工平台内置校验工具:
登录控制台→进入“数据集管理”→选择刚上传的JSONL文件→点击“结构校验”→等待10秒后查看report.json,重点检查“output_token_count_stddev”值,若>85说明答案长度波动过大,需重新平衡样本复杂度

















