必须统一索引多格式语义结构才能避免检索异常;需准备合规PDF(含可复制文字)、DOCX、XLSX(首行为列名、无合并单元格及空行)和静态HTML网页URL,创建时选“文本”类型知识库,分批次上传并启用“自动分段与清洗”,最后验证各格式解析效果。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在扣子平台构建一个能同时理解PDF说明书、Word话术文档、Excel产品参数表和网页FAQ的混合知识库,必须让系统识别不同格式的语义结构并统一索引,否则检索时会出现PDF段落被切碎、表格字段无法匹配、网页内容漏采等问题。
准备多源文件并校验格式合规性
收集待入库的全部文件:至少1份PDF(如《智能音箱用户手册》)、1份DOCX(如《客服标准应答话术》)、1份XLSX(如《2026Q2产品参数总表》)、1个有效URL(如公司官网FAQ页面)。【PDF文件必须含可复制文字,扫描图转PDF不支持OCR,上传后将无法分段】
检查XLSX文件:首行为列名(如“型号”“续航时间”“接口类型”),无合并单元格,数据行连续无空行。若存在空行或标题错位,上传后系统会跳过整块区域。
打开目标网页URL,确认页面加载完成且FAQ内容为静态HTML文本——若依赖JavaScript动态渲染(如点击展开才显示答案),需改用Notion或飞书文档中转。
创建知识库并选择混合数据源类型
登录扣子平台→进入团队工作区→点击左侧导航栏「知识库」→右上角「创建知识库」。
填写名称(如“全渠道产品知识库”)与描述(限200字),注意【同一团队内知识库名称不可重复,重名将导致创建失败】。
在「知识类型」中选择「文本」——这是唯一支持PDF/DOCX/URL混合上传的类型;表格类知识库仅支持CSV/XLSX,无法接入网页或文档。
分批次上传四类内容并配置分段逻辑
方法一:本地文档批量导入
点击「新增单元」→选择「文本」→「本地文档」→将PDF、DOCX、XLSX三类文件一次性拖入上传区(支持10个文件/次,单文件≤20MB)→上传完成后点击「下一步」。
方法二:网页内容自动采集
在同一知识库下再次点击「新增单元」→选择「文本」→「在线数据」→开启「自动采集」→点击「新增 URL」→粘贴已校验的FAQ网址→设置同步周期为「手动触发」(避免频繁抓取被封)→点击「确认」→「下一步」。
分段方式统一选「自动分段与清洗」:系统将按标题层级切分PDF/DOCX,对XLSX按行转为问答对(如“型号:A100 → 该型号支持蓝牙5.3吗?”),对网页则提取正文段落。无需自定义规则,除非原始DOCX中存在大量无标题的长段落需要人工干预。
验证混合内容是否成功解析
等待处理完成(通常1–3分钟),页面跳转至知识库详情页。
点击「内容管理」标签,查看分段列表:PDF应显示为带章节编号的条目(如“3.2 配网步骤”),XLSX应生成以字段名为前缀的条目(如“接口类型:USB-C”),网页URL条目末尾带?图标。
随机点击任一分段,右侧预览窗中必须完整显示原文本——若PDF预览为空白、XLSX只显示“第1行数据”,说明文件格式异常,需重新检查并替换文件。
至此,混合格式知识库训练完成。


















