可利用ShareGPT数据集构建幻觉率评估路径:一、提取高风险问答对并定义事实错误等三类幻觉边界;二、构建800条分层抽样人工校验子集并双盲标注;三、引入强基座模型辅助核查以提升类型识别精度;四、按轮次、上下文长度等分层统计幻觉率;五、注入对抗前缀触发隐性幻觉并单独计量。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望量化大语言模型在真实多轮对话中生成虚假信息的倾向,则可利用ShareGPT数据集中天然存在的用户意图、上下文连贯性与回复合理性等隐含标注信号,构建面向幻觉率统计的评估路径。以下是基于该数据集开展幻觉率测量的具体操作方法:
一、提取高风险问答对并定义幻觉判定边界
ShareGPT原始会话中包含大量用户提出具体事实性问题(如“Python中如何用pandas读取Excel文件?”)后由assistant给出技术性答复的片段,此类样本构成幻觉检测的理想基础。需先识别出具备明确可验证性前提的问答对,并为每条assistant回复设定三类幻觉判定维度:事实错误、虚构引用、逻辑矛盾。
1、遍历每条会话,定位所有user消息中含疑问词(如“如何”“是什么”“为什么”“是否”)且长度≥15字符的句子。
2、将紧随其后的assistant消息作为待检回复,剔除含“我不确定”“可能”“据我所知”等模糊表述的样本。
3、对剩余回复逐句进行结构化解析,标记其中涉及的实体(人名、工具名、函数名、版本号)、操作步骤、因果关系链。
4、使用权威文档源(如Python官方文档、Stack Overflow高赞答案、RFC标准文本)对每个标记项进行交叉验证,确认是否存在不一致。
二、构建人工校验子集并实施双盲标注
为避免单点判断偏差,需从筛选出的高风险问答对中抽样构建人工校验集,并采用双盲机制确保标注一致性。该子集应覆盖不同领域(编程、学术、生活、医疗咨询等),且每条样本由两名独立标注员分别判别是否存在幻觉及类型归属。
1、从清洗后的ShareGPT样本中按领域比例分层抽样,共选取800条问答对,确保编程类≥300条、学术类≥200条、其余类别合计≥300条。
2、向每位标注员提供统一判定手册,明确定义“虚构函数名”“错误参数顺序”“不存在的API路径”等12类典型幻觉模式。
3、标注员仅可见user提问与assistant回复原文,不可查阅上下文历史或外部搜索,强制依赖文本内证完成判断。
4、当两名标注员判定结果不一致时,交由第三位资深标注员仲裁,最终以仲裁结果为准计入统计。
三、引入LLM辅助核查增强判别粒度
人工标注虽可靠但成本高昂,可借助另一组经验证低幻觉率的强基座模型(如GPT-5.5 Instant或Claude-3.7 Sonnet)作为辅助核查引擎,对人工标注结果进行反向验证与细粒度归因,从而提升幻觉类型分类精度。
1、将每条待检assistant回复与对应user提问拼接为输入,提示辅助模型:“请指出该回答中所有与公认事实不符的内容,并说明错误类型(虚构实体/步骤缺失/因果倒置/数值失真)。”
使用 @youdotcom-oss/teams-anthropic 将 Anthropic Claude 模型(Opus、Sonnet、Haiku)添加到 Microsoft Teams.ai 应用程序中。可选集成 You.com MCP 服务器以进行网页搜索和内容提取。
2、解析辅助模型输出,提取其识别出的错误位置(如第2句第3个名词)、错误类型标签及支持依据(如“pandas.read_excel()无header_row参数,正确参数为header”)。
3、比对人工标注与辅助模型输出,在二者一致处强化置信度;在分歧处启动人工复核流程,重点审查辅助模型是否出现过度质疑或漏判。
4、将辅助模型识别出但人工未标注的错误项纳入“潜在幻觉”池,后续用于模型迭代训练的数据增强。
四、计算分层幻觉率指标并映射至对话轮次
幻觉并非均匀分布于对话各阶段,ShareGPT中长会话提供了观察轮次衰减效应的机会。需将幻觉发生频次与所在轮次、上下文长度、前序交互密度等变量关联,形成可解释的统计矩阵。
1、为每条含幻觉的样本记录其在会话中的绝对轮次编号(如第5轮)、相对轮次(如warm-up后第2轮)、上下文token数、前序user消息数量。
2、按轮次区间分组:1–2轮、3–4轮、5–6轮、7轮及以上,分别统计各组幻觉发生次数与该组总样本量,得出区间幻觉率。
3、对上下文长度做分箱处理(0–512、512–1024、1024–2048、2048+ tokens),计算各箱内幻觉率并观察趋势变化。
4、将所有幻觉样本按错误类型聚合,统计“虚构代码示例”占比、“错误命令语法”占比、“捏造论文引用”占比等,形成类型分布热图。
五、实施对抗性上下文注入以触发隐性幻觉
常规问答对难以暴露模型在干扰语境下的稳定性缺陷,需主动构造对抗性前缀插入ShareGPT原始会话开头,模拟用户无意带入偏见信息的情形,从而激发出更隐蔽的对话幻觉行为。
1、选取500条原无幻觉的高质量ShareGPT会话,为其添加三类对抗前缀:“我刚看到一篇论文说……”“朋友告诉我这个功能已被弃用”“最新版文档里写明必须先……”。
2、将注入前缀后的完整会话重新送入待测模型,捕获其对原始user提问的新一轮回复。
3、对比注入前后两版assistant回复,使用字符串编辑距离与语义相似度(BERTScore)双重指标识别实质性偏离。
4、对发生偏离且内容可验证为错误的样本,标记为“上下文诱导型幻觉”,单独计入幻觉率统计维度。

















