必须将企业Wiki导出为Markdown/纯文本并清洗结构后上传至阶跃AI知识库,启用step-embed-v3-zh向量索引,才能让模型准确理解语义并精准回答内部问题。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要让阶跃AI知识库真正理解并回答企业内部Wiki里的内容,必须把原始Wiki页面转化为结构清晰、语义可识别的文本数据,不能直接上传HTML文件或截图——否则模型根本无法读取其中的标题层级、段落逻辑和关键术语。
导出Wiki页面为纯文本或Markdown格式
第一步:登录企业Wiki后台,进入需导入的知识空间 → 点击右上角「更多」→ 选择「导出全部页面」或「批量导出」(部分Wiki系统如Confluence需安装「Content Exporter」插件才支持此功能)。
第二步:导出时【务必选择Markdown或纯文本格式】,避免选PDF或HTML——PDF会混入页眉页脚和换行符,HTML则包裹大量标签,后续清洗成本极高。
第三步:检查导出包中每个.md文件是否保留了原始标题层级(# 一级标题、## 二级标题)、列表缩进和代码块标记。若发现所有标题都变成普通段落,说明导出插件未启用“结构化输出”选项,需重新配置后导出。
清洗与标准化文档结构
方法一:用Python脚本自动清理冗余符号
下载并运行clean_wiki.py脚本(GitHub开源工具),将导出的整个文件夹拖入脚本同目录 → 执行命令python clean_wiki.py --input ./wiki_export --output ./cleaned;它会自动删除Wiki编辑痕迹(如{toc}、{scroll-ignore}等宏标记)、统一空行数量、修复断裂的列表缩进。
方法二:人工抽检关键页面做语义校验
打开3~5个高频问答页面(如「OA系统登录失败处理」「报销流程时效说明」),逐段比对清洗前后内容:确认技术术语未被误删(例如“LDAP认证”不能变成“LDAP证”)、表格数据未错位、带编号的步骤顺序未打乱——【一旦编号错乱,问答时模型可能给出颠倒的操作顺序】。
上传至阶跃AI知识库并启用向量化索引
登录阶跃AI控制台 → 进入「知识库管理」→ 点击「新建知识库」→ 命名后选择「文档型知识库」→ 在上传区域直接拖入./cleaned文件夹中的所有.md文件 → 等待解析进度条走完(通常每千字耗时1.2~1.8秒)。
上传完成后,点击该知识库右侧「设置」→ 打开「启用向量索引」开关 → 下拉选择「embedding模型版本:step-embed-v3-zh」→ 点击「重建索引」。这一步不可跳过,否则上传的文档仅作关键词匹配,无法理解“单点登录失败”和“SSO登录报错”是同一类问题。
最后,在「测试问答」框输入:“员工忘记OA密码怎么办?”,观察返回结果是否精准定位到《账号管理规范.md》中第4.2节内容,并正确提取了重置链接和审批人字段。


















