讲师中心 微信公众号
AI工具推荐 视频效率加速

ShareGPT数据集在SFT监督微调中的标准用法:有监督微调的数据加载和训练设置

轻伟大大_5983

轻伟大大_5983

发布时间:2026-05-29 13:56:35

|

807人浏览过

|

来源于php中文网

原创

ShareGPT数据集需满足conversations中human/gpt交替且至少两轮,首为human、末为gpt;system字段须为非空字符串;加载时须匹配对应模板(如--template sharegpt)或转为instruction-output格式,否则因解析错误导致KeyError或loss不降。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

sharegpt数据集在sft监督微调中的标准用法:有监督微调的数据加载和训练设置

你需要把ShareGPT数据集直接用于SFT监督微调,但训练脚本报错“KeyError: 'instruction'”或loss不下降,说明原始conversations结构未被正确解析——这不是数据质量问题,而是加载路径与模型期望格式不匹配导致的解析中断。

确认ShareGPT原始结构是否满足SFT基本要求

打开你的sharegpt_zh.json文件,用文本编辑器搜索任意一条样本的"conversations"字段。该数组必须至少包含两个对象,且from值严格交替为"human"→"gpt"→"human"→"gpt"……首项必须是"human",末项推荐为"gpt"。若出现连续两个"human"或某条缺失from键,该样本将被主流框架静默丢弃。

执行命令jq '.[0].conversations | length'检查首条样本轮次长度。结果小于2的样本必须过滤——【SFT阶段严禁使用单轮human无响应的数据】,否则训练时会因output为空导致loss爆梯度。

检查是否存在system字段。若有,需确认其value是否为字符串类型而非null或空对象;非字符串system内容会导致LLaMA-Factory tokenizer在拼接时抛出TypeError。

方法一:用LLaMA-Factory零代码加载(推荐新手)

这一步操作起来很简单,直接把原始ShareGPT JSON文件扔进data目录就行。

在LLaMA-Factory项目根目录下执行:cp sharegpt_zh.json data/,重命名为sharegpt_zh_custom.json。

运行训练命令时必须显式指定--template sharegpt参数,否则框架默认按alpaca模板解析,会把conversations整个数组当instruction字符串切分,造成语义断裂。

确保dataset_info.json中已注册该数据集:添加条目{"sharegpt_zh_custom": {"file_name": "sharegpt_zh_custom.json", "formatting": "sharegpt"}},否则--dataset参数无法命中配置。

方法二:手动转换为ChatGLM兼容的instruction-output三元组

ChatGLM官方train_bash.py不识别conversations字段,必须重构为{"instruction": "...", "input": "", "output": "..."}结构。

  1. 提取每条conversations中第一个from: "human"的对象,其value作为instruction字段值;
  2. 跳过中间所有轮次,定位最后一个from: "gpt"的对象,其value作为output字段值;
  3. 若该gpt对象value为空字符串或仅含换行符,整条样本丢弃——【空回复会导致ChatGLM tokenizer生成全-100 labels,loss恒为nan】;
  4. 用json.dumps()逐行写入新文件,保存为UTF-8无BOM编码,扩展名必须为.jsonl。

注意:input字段强制设为空字符串"",不可省略或填null,否则ChatGLM-Efficient-Tuning会因字段缺失触发default_factory异常。

方法三:适配Hugging Face Transformers原生Trainer

如果你用Trainer + SFTTrainer类训练,需自定义Dataset类来处理嵌套结构。

继承torch.utils.data.Dataset,__getitem__中对conversations做如下处理:取前N-1轮拼成prompt(human+gpt交替),最后一轮gpt作为response,再用tokenizer.encode(prompt+response, truncation=True, max_length=2048)。

关键点在于labels构造:对prompt部分token全部赋值-100,仅response对应token保留真实id。若用AutoTokenizer.from_pretrained("xxx")加载,必须确认其add_eos_token=True,否则response末尾缺少eos token会导致loss计算漏掉最后一个词。

这一步不能跳过——没有正确mask的labels会让模型学习预测用户提问,而非生成回答。

热门AI工具

更多
WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

PixPix
PixPix Hot

PixPix是一款面向电商视觉生产的AI商品图生成工具。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

相关专题

更多
数据分析的方法
数据分析的方法

数据分析的方法有:对比分析法,分组分析法,预测分析法,漏斗分析法,AB测试分析法,象限分析法,公式拆解法,可行域分析法,二八分析法,假设性分析法。php中文网为大家带来了数据分析的相关知识、以及相关文章等内容。

1682

2023.07.04

数据分析方法有哪几种
数据分析方法有哪几种

数据分析方法有:1、描述性统计分析;2、探索性数据分析;3、假设检验;4、回归分析;5、聚类分析。本专题为大家提供数据分析方法的相关的文章、下载、课程内容,供大家免费下载体验。

2270

2023.08.07

网站建设功能有哪些
网站建设功能有哪些

网站建设功能包括信息发布、内容管理、用户管理、搜索引擎优化、网站安全、数据分析、网站推广、响应式设计、社交媒体整合和电子商务等功能。这些功能可以帮助网站管理员创建一个具有吸引力、可用性和商业价值的网站,实现网站的目标。

6350

2023.10.16

数据分析网站推荐
数据分析网站推荐

数据分析网站推荐:1、商业数据分析论坛;2、人大经济论坛-计量经济学与统计区;3、中国统计论坛;4、数据挖掘学习交流论坛;5、数据分析论坛;6、网站数据分析;7、数据分析;8、数据挖掘研究院;9、S-PLUS、R统计论坛。想了解更多数据分析的相关内容,可以阅读本专题下面的文章。

2924

2024.03.13

Python 数据分析处理
Python 数据分析处理

本专题聚焦 Python 在数据分析领域的应用,系统讲解 Pandas、NumPy 的数据清洗、处理、分析与统计方法,并结合数据可视化、销售分析、科研数据处理等实战案例,帮助学员掌握使用 Python 高效进行数据分析与决策支持的核心技能。

4105

2025.09.08

Python 数据分析与可视化
Python 数据分析与可视化

本专题聚焦 Python 在数据分析与可视化领域的核心应用,系统讲解数据清洗、数据统计、Pandas 数据操作、NumPy 数组处理、Matplotlib 与 Seaborn 可视化技巧等内容。通过实战案例(如销售数据分析、用户行为可视化、趋势图与热力图绘制),帮助学习者掌握 从原始数据到可视化报告的完整分析能力。

6112

2025.10.14

Python 数据分析与可视化合集
Python 数据分析与可视化合集

聚焦 Python 在数据分析领域的核心应用,讲解 NumPy 数组运算、Pandas 数据清洗与聚合统计、缺失值与异常值处理、数据透视表生成,以及使用 Matplotlib、Seaborn、Pyecharts 制作折线图、柱状图、热力图、地图等多种可视化图表,适合数据分析师和运营人员快速掌握用 Python 从原始数据中挖掘洞察的能力。

276

2026.04.08

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

431

2026.04.13

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

100

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn