必须在Dify中配置Groq为OpenAI兼容供应商,填写其API密钥与base URL,再添加llama3-70b-8192等模型并启用流式响应,最后在Chatflow应用中绑定该模型且设置System Prompt,方可实现120ms~350ms毫秒级响应。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在Dify中接入Groq加速的大语言模型,获得毫秒级响应能力,必须绕过传统HTTP长连接瓶颈,直接利用Groq的LLaMA-3-70b或Mixtral-8x7B等模型通过groq.com提供的超低延迟API端点。Dify本身不预置Groq支持,需手动配置模型供应商并严格匹配其认证与请求格式。
注册Groq API密钥并验证可用性
访问 Groq控制台 → 登录或注册账户 → 在“API Keys”页点击“Create API Key” → 复制生成的密钥(以gsk_开头)→ 立即在终端执行测试命令验证连通性:curl -X POST https://api.groq.com/openai/v1/chat/completions -H "Authorization: Bearer YOUR_API_KEY" -H "Content-Type: application/json" -d '{"model":"llama3-70b-8192","messages":[{"role":"user","content":"Hello"}]}'。若返回含"finish_reason":"stop"的JSON响应,说明密钥有效且网络可达。
【密钥必须在Dify部署所在服务器可访问groq.com,国内服务器需配置出口代理或使用合规云服务中转】
在Dify管理后台添加Groq为模型供应商
登录Dify管理后台 → 进入「Settings」→「Model Providers」→ 点击「+ Add Model Provider」→ 选择「OpenAI Compatible」类型 → 填写以下字段:
- Provider Name:Groq
- Base URL:
https://api.groq.com/openai/v1 - API Key:粘贴上一步复制的
gsk_...密钥 - Default Model:留空(后续在应用中指定)
点击「Save」。此时Groq会出现在模型供应商列表中,状态显示为「Connected」才表示基础对接成功。
配置Groq专属模型并启用流式响应
回到「Model Providers」→ 找到刚添加的Groq条目 → 点击右侧「Configure Models」→ 点击「+ Add Model」→ 按如下填写:
Model Name:llama3-70b-8192(或mixtral-8x7b-32768)
Model Type:LLM
Provider:Groq
Context Window:8192(对应llama3-70b)或32768(对应mixtral)
Supports Streaming:✅ 勾选
Supports Vision:❌ 不勾选(Groq当前不支持多模态)
保存后,该模型将出现在Dify所有应用的模型下拉菜单中。注意:Groq模型不支持system prompt以外的高级参数(如temperature、top_p),这些需在Prompt编排阶段通过变量传入,而非模型配置页设置。
创建Chatflow应用并绑定Groq模型
第一步:新建应用 → 选择「Chatflow」类型 → 命名后进入工作流编辑页。
第二步:拖入「Start」节点 → 连接至「LLM」节点。
第三步:双击LLM节点 → 在「Model」下拉框中选择你刚配置的llama3-70b-8192 → 展开「Advanced Settings」→ 将「Stream Response」设为「Enabled」→ 在「System Prompt」区域输入明确指令,例如:“你是一个响应极快的助手,用最简短句子回答,禁止解释、禁止换行。”
第四步:添加「Reply」节点并连接 → 发布应用。
发布后,在前端测试输入“你好”,观察响应时间——正常应稳定在120ms~350ms区间。若超过500ms,检查Dify服务器与groq.com之间的DNS解析是否走IPv4、TCP连接是否复用、是否有防火墙拦截HTTPS流量。
验证毫秒级交互的实际效果
方法一:在Dify内置聊天界面发送单字“嗯”,记录从回车到首字符出现的时间(浏览器开发者工具Network标签页查看stream请求的time to first byte)。
方法二:调用该Chatflow的API接口(POST /chat-messages),在请求体中加入"stream": true,用curl或Postman监听SSE流,观察每chunk间隔是否≤100ms。
方法三:部署一个轻量前端页面,用fetch()发起流式请求,用performance.now()打点计算端到端延迟。
只要任意一种方式测得首字节延迟≤400ms,即确认Groq加速生效。无需等待完整响应结束,流式输出本身就是毫秒级交互的核心体现。


















