可将ShareGPT对话通过三种方式归档:一、手动Markdown+YAML元数据结构化保存;二、Python脚本自动化抓取存入SQLite数据库;三、用sentence-transformers嵌入+ChromaDB实现本地向量检索。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在使用ShareGPT平台浏览他人分享的高质量AI对话时,发现其中包含可复用的技术方案、提示词范例或领域知识,但这些内容散落于网页、缺乏本地存储与检索能力,则无法将其真正转化为个人知识资产。以下是将ShareGPT中获取的对话有效归档并融入个人知识库的具体方法:
一、手动结构化保存:以Markdown+标签体系实现轻量归档
该方法适用于单次发现少量高价值对话,无需技术部署,强调语义提取与人工标注,确保每条归档记录具备可读性与可检索性。其核心在于将原始JSON或HTML格式的ShareGPT对话,转化为带元数据的结构化文本。
1、打开ShareGPT页面,定位目标对话,点击右上角“Copy as Markdown”按钮,复制完整对话文本。
2、新建本地Markdown文件,文件名采用“日期_主题_来源简写”格式,例如“20260518_Python异步错误处理_sgpt”。
3、在文件开头添加YAML元数据区块,填写topic(主题)、source_url(原始链接)、use_case(适用场景)、key_insight(关键洞见)四项必填字段。
4、将粘贴的Markdown对话置于元数据下方,并在每轮用户提问前插入二级标题“## 问题:[精炼关键词]”,在AI回复后添加“> ? 提示:[可复用的技巧或注意事项]”。
二、自动化抓取+SQLite入库:构建可搜索的本地对话数据库
该方法面向高频使用者,通过脚本批量拉取ShareGPT公开对话数据,清洗后存入本地SQLite数据库,支持按关键词、标签、时间范围进行SQL查询,避免依赖第三方平台稳定性。
1、使用Python requests库向ShareGPT公开API端点(如https://shareg.pt/api/conversations?limit=100)发起GET请求,携带User-Agent头模拟浏览器访问。
2、解析返回JSON,提取id、title、messages数组、created_at字段;对messages中每条content做基础清洗——移除Markdown代码块外的多余换行、过滤含“[deleted]”或“error”字样的无效消息。
3、建立SQLite数据库,包含conversations(id, title, url, created_at, tags)和messages(id, conversation_id, role, content, position)两张表,使用sqlite3模块执行建表与INSERT操作。
4、编写简易CLI工具,支持命令如“search --topic ‘LLM微调’ --after 2026-04-01”,自动执行SELECT语句并高亮匹配关键词。
三、语义嵌入+本地向量检索:实现基于意图的模糊查找
该方法突破关键词匹配局限,将ShareGPT对话转化为向量表示,使“想找一段关于用LangChain做RAG优化的对话”这类自然语言查询成为可能,适用于已积累200+条归档记录的进阶用户。
1、为每条归档对话生成摘要:调用本地运行的sentence-transformers/all-MiniLM-L6-v2模型,对conversation title与首条user message拼接后的文本进行编码,得到384维向量。
2、使用ChromaDB创建持久化向量集合,设置collection name为sharegpt_archive,插入每条记录的id、document(摘要文本)、embedding及metadata(含原始url与tags)。
3、当需检索时,将自然语言查询(如“如何让大模型只输出JSON格式不加解释”)同样编码为向量,在ChromaDB中执行query,返回相似度最高的top-3对话ID及对应source_url。
4、配置本地Web界面(如Flask简易服务),输入查询词即可返回高亮匹配段落与原始链接,所有数据全程离线运行,不上传任何内容至公网。

















