需在RAG系统中集成多模态能力,包括部署Qwen2.5-VL等多模态LLM、启用多模态推理通道、接入OSS托管图片、构建视觉解析预处理流水线、引入Qwen3-VL-Reranker进行图文重排序。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望千问支持图文混合的知识库问答,需在RAG系统中集成多模态能力,使模型不仅能理解文本,还能解析图像语义并实现跨模态检索。以下是具体实施路径:
一、部署兼容的多模态大语言模型服务
必须使用具备视觉理解能力的多模态LLM作为生成层核心,确保其能联合处理文本查询与图像内容。该模型需支持OpenAI协议或提供标准HTTP接口,便于与RAG服务对接。
1、选择Qwen2.5-VL系列模型,例如Qwen2.5-VL-72B-Instruct-AWQ,该模型已在EAS平台完成量化适配,支持高吞吐推理。
2、登录阿里云模型在线服务(EAS)控制台,创建新服务实例,上传已准备好的多模态模型文件包。
立即进入“豆包AI人工智官网入口”;
立即学习“豆包AI人工智能在线问答入口”;
3、服务部署完成后,在基本信息页单击“查看调用信息”,获取服务访问URL与Token密钥。
4、若采用DashScope服务,则直接使用固定地址https://dashscope.aliyuncs.com/compatible-mode/v1,并配置对应API Key为密钥。
二、配置RAG服务启用多模态推理通道
需在RAG系统的WebUI中显式开启多模态支持,并将前述多模态LLM服务接入为默认生成模型,否则系统仍将按纯文本流程运行。
1、进入目标RAG服务详情页,点击右上角“查看Web应用”进入管理界面。
2、切换至“系统设置”页签,打开“模型及存储配置”TAB页。
3、在LLM配置区域填写:URL字段填入EAS服务地址或DashScope地址;密钥字段填入对应Token;模型名称字段输入如qwen2.5-vl-72b-instruct等实际模型标识符。
4、勾选“是否支持多模态”复选框,保存配置后触发服务重启。
三、接入阿里云OSS用于图片资源托管与引用
OSS作为统一图片存储中枢,使RAG系统可在生成阶段动态插入原始图像链接,实现图文并茂输出,同时保障图片可被公网或VPC内稳定访问。
使用豆包(火山引擎 Ark)生成图片或视频并保存本地。用户提及“豆包生图/图片/生视频/视频”、“Doubao”、“Seedance”、“火山引擎图片/视频”时触发。
1、前往阿里云对象存储OSS控制台,新建Bucket,地域需与RAG服务所在可用区一致。
2、在Bucket基础设置中开启“静态网站托管”,并记录Endpoint地址。
3、返回RAG服务WebUI的同一“模型及存储配置”TAB页,勾选“使用图片OSS存储”。
4、填写OSS存储空间名称(即Bucket名)、Endpoint、AccessKey ID与Secret,保存后系统自动校验连通性。
四、构建多模态文档预处理流水线
传统文本切片方式无法保留PPT、PDF中图表与文字的空间关系,必须引入视觉大模型进行页面级语义解析,生成带结构化描述的文本表示。
1、对原始PPT或扫描版PDF执行逐页截图,每页生成独立图像文件(PNG格式,分辨率不低于1280×720)。
2、调用豆包Vision模型或LlamaParse(开启Vision模式),以“请准确提取本页全部文字、图表标题、坐标轴标签及图例说明,并按阅读顺序组织为连贯段落”为提示词进行解析。
3、将解析所得文本与对应图像URL一同构造成数据条目,写入向量数据库,嵌入模型选用Embedding-V3以保障中文语义对齐质量。
4、确保每个条目元数据中包含image_url字段,供后续生成阶段调用渲染。
五、启用多模态重排序提升图文召回精度
初始向量检索结果可能混杂图文无关片段,需引入专用多模态重排序器(如Qwen3-VL-Reranker-8B),依据查询与图文对的联合相关性进行二次打分筛选。
1、在EAS平台单独部署Qwen3-VL-Reranker-8B服务,获取其独立调用地址与Token。
2、进入RAG服务WebUI的“高级配置”区域,定位“重排序模型”设置项。
3、填入重排序服务URL与密钥,启用“多模态重排序”开关,并设定top-k值为10~20之间。
4、保存后,系统将在每次检索后自动将初筛结果与用户查询共同送入重排序器,输出最终图文匹配度最高的前5个片段。

















