必须启用Q&A分段模式并配置好Embedding与LLM模型,上传可读文档后显式选择该模式,调整参数(如每段生成1~2个问题、保留原始段落),才能自动提炼高质量问答对。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在Dify中让知识库自动从原始文档提炼出高质量问答对,而不是手动一条条写Q&A,必须启用并精细配置Q&A分段模式——它调用大模型为每个文本块生成语义匹配的问题与答案,是提升检索命中率和回答精准度的关键环节。
确认前提条件:Embedding与LLM模型已就绪
进入Dify后台 → 【设置】→【模型配置】→ 检查TEXT EMBEDDING和LLM两类模型是否均已启用且状态为“已连接”。【若LLM未配置,Q&A分段将完全无法触发,上传后只会走普通分段流程】
TEXT EMBEDDING用于向量化,LLM用于生成问题。二者缺一不可,且LLM需支持较长上下文(建议≥8K),否则长文档切片后无法完整送入生成流程。
上传文档并选择Q&A分段模式
进入【知识库】→【新建知识库】→ 上传PDF/DOCX/MD等可读格式文件(单个≤15MB)→ 上传完成后,在“文本分段与清洗”页面右侧预览区下方,点击【分段模式】下拉菜单 → 选择【Q&A分段】。
这一步不能跳过:Q&A分段不会在通用分段或自动分段中出现,必须显式选择。选错模式会导致后续所有生成动作失效。
⚠️ 扫描版PDF、图片型PPT、加密文档会直接失败——系统无法提取文字,更无法喂给LLM生成问题。务必先用OCR工具转为可选文字PDF再上传。
调整Q&A生成参数:控制问题数量与覆盖粒度
选择Q&A分段后,页面会展开高级参数区:
① 设置每段生成问题数:默认为3,建议设为1~2。问题越多,Token消耗越剧烈,且易产生语义重复或边缘化问题;1个精准问题+对应答案,比3个模糊问题更利于检索匹配。
② 开启“保留原始段落”:勾选此项,系统会在生成Q&A的同时,仍保留原始文本块作为独立向量索引源。这样即使用户提问方式超出生成问题范围,也能通过向量检索兜底命中。
③ 关闭“强制生成FAQ格式”:该选项会把所有输出强行套进Q: / A:模板,破坏语义完整性。真实业务中,答案常含表格、代码、步骤编号等结构化内容,保留原格式更利于LLM后续引用。
启动处理并验证生成效果
点击【保存并处理】→ 等待状态变为“已完成”(耗时取决于文档长度与LLM响应速度,通常1页PDF约需8~15秒)→ 返回知识库详情页 → 点击【数据集】标签 → 找到刚处理的文档 → 点击右侧【查看分段】。
此时可见每个原始段落下方,已列出1~2组由模型生成的Q&A对,格式为:Q: 用户可能怎么问? → A: 基于本段内容的直接回答。
若发现某段未生成Q,或生成的问题明显偏离原文主旨(如把操作步骤生成成背景介绍),说明该段文本存在歧义、术语堆砌或缺乏主谓宾结构——需返回原始文档,对该段进行重写或拆分后再重新上传处理。















