必须绕过Dify默认OpenAI兼容层校验,直接对接vLLM的/v1/chat/completions端点,且模型名须与vLLM启动参数--model严格一致(含大小写和连字符),否则返回404或“model not found”。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在Dify中稳定调用vLLM提供的高并发本地模型服务,必须绕过Dify默认的OpenAI兼容层校验逻辑,直接对接vLLM的/v1/chat/completions端点,并确保模型名称与vLLM启动时声明的--model参数完全一致,否则Dify会返回404或“model not found”错误。
部署并验证vLLM服务
在GPU服务器上执行:vllm serve --model Qwen2.5-7B-Instruct --tensor-parallel-size 2 --port 8000 --gpu-memory-utilization 0.85。该命令启用双卡张量并行,显存利用率设为85%,避免OOM导致服务崩溃。
打开新终端,用curl测试基础连通性:curl http://localhost:8000/health。返回{"healthy":true}表示服务已就绪;若超时,请检查nvidia-smi是否识别到GPU、端口是否被占用。
运行一次真实推理验证模型加载:curl -X POST "http://localhost:8000/v1/chat/completions" -H "Content-Type: application/json" -d '{"model":"Qwen2.5-7B-Instruct","messages":[{"role":"user","content":"你好"}]}'。注意:此处"model"字段值必须与启动命令中的--model参数严格一致,【大小写和连字符都不能错】。
配置Dify模型供应商为vLLM
登录Dify管理后台 → 左侧菜单底部点击“设置” → 进入“模型供应商”页面 → 点击右上角“安装供应商” → 在搜索框输入“vllm” → 找到“自定义OpenAI兼容API”并点击“安装”。
安装完成后,在供应商列表中找到刚添加的条目,点击右侧“配置”按钮:
① 填写“API基础URL”为http://localhost:8000/v1(结尾必须带/v1,否则Dify会拼接错误路径);
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
② “模型名称”填Qwen2.5-7B-Instruct(必须与vLLM启动时--model参数完全一致);
③ “API密钥”留空或填任意非空字符串(vLLM默认不鉴权,但Dify字段不可为空);
④ 点击“测试连接”,成功后保存配置。
在应用中启用并调试vLLM模型
新建或编辑一个Dify应用 → 进入“模型配置”标签页 → 在“推理模型”下拉菜单中选择你刚配置的vLLM供应商条目。
切换到“调试”面板 → 输入测试问题 → 点击“发送”。若返回正常响应,说明接入成功;若提示“Request failed with status code 500”,大概率是vLLM服务端报错,需立即查看vLLM终端日志中最后一行的Traceback。
关键调试技巧:在Dify调试窗口点击右上角“查看请求详情”,复制cURL命令,粘贴到终端手动执行——这样能绕过Dify中间层,直接暴露vLLM原始错误信息,比如"Context length exceeded"就说明max_model_len配置不足,需重启vLLM并加--max-model-len 8192参数。

















