需完成模型对接、Discord通信配置及提示词结构化输出:一、部署本地大模型并注册至OpenClaw;二、安装Midjourney Helper技能包并配置Discord凭证;三、定义六要素JSON模板约束提示词格式;四、监听Discord消息并自动下载图片;五、端到端验证全链路。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望将OpenClaw与Midjourney集成,实现从自然语言描述到图像生成的端到端自动化,需完成模型对接、Discord通信配置及提示词结构化输出等关键环节。以下是具体配置步骤:
一、配置本地模型服务作为提示词生成器
该步骤旨在为OpenClaw提供可调用的本地大模型能力,用于将用户输入的模糊创意转化为符合Midjourney语法规范的结构化提示词。模型需部署在本地并暴露标准API接口,确保OpenClaw Gateway能稳定发起请求。
1、通过Ollama拉取并运行QwQ-32B或GLM-4.7-Flash模型:
ollama pull QwQ-32B
ollama run QwQ-32B --port 11434
2、编辑~/.openclaw/openclaw.json文件,在models.providers下新增对应条目,确保baseUrl指向http://localhost:11434,api设为openai-completions,id与模型实际名称一致。
3、执行openclaw models list验证模型注册状态,确认返回列表中包含已配置的本地模型标识。
二、安装并启用Midjourney Helper技能包
此技能包封装了Discord Bot通信逻辑、消息解析、图片提取及失败重试机制,是OpenClaw与Midjourney之间唯一受信的协议桥接组件。它不依赖第三方API密钥,仅需合法Discord账户凭证即可建立会话通道。
1、在终端中执行clawhub install midjourney-helper命令,自动下载并注册技能至当前工作空间。
2、创建skills/midjourney-helper/config.yaml,填入有效的Discord用户Token、目标服务器ID(Guild ID)与频道ID(Channel ID)。
3、重启OpenClaw网关:openclaw gateway restart,使新技能加载生效。
三、构建结构化提示词模板
Midjourney对提示词格式高度敏感,直接输出自由文本易导致解析失败或风格偏移。本方法通过预定义JSON Schema模板约束模型输出,强制生成含主题、风格、构图、色彩、光照及负面词六要素的标准化字符串。
1、在skills/midjourney-helper/templates/目录下新建prompt_v2.json,内容包含字段theme、style、composition、color_scheme、lighting、negative_prompt。
2、在OpenClaw Web控制台中,为Midjourney Helper技能指定该模板路径,并启用structured_output: true开关。
3、向OpenClaw发送测试指令:“生成蒸汽朋克风格的图书馆 interior,黄铜机械结构与悬浮书架,暖金色主色调,柔和定向光,--no modern furniture, --no text”。
四、设置Discord Bot消息监听与结果捕获
Midjourney响应以Discord消息形式返回,含原始提示词、进度条、最终图像链接及按钮交互。OpenClaw需实时监听指定频道的新消息事件,并识别含https://cdn.discordapp.com/attachments/前缀的图片URL,将其提取并存入本地归档目录。
1、在skills/midjourney-helper/config.yaml中启用auto_download_images: true与download_path: ./outputs/mj/。
2、配置message_filter规则,仅捕获来自Midjourney Bot(ID:936850221299814461)且含附件的消息。
3、启动监听服务:claw skill start midjourney-helper,观察日志中是否出现[MJ-Helper] Image downloaded: ./outputs/mj/20260421_183244.png记录。
五、验证端到端工作流
该步骤用于确认全部组件协同运作无阻断点,涵盖用户输入→模型解析→提示词构造→Discord提交→图像生成→本地落盘全链路。任何环节超时或格式错误均会导致流程中断,需依据日志定位具体故障模块。
1、在OpenClaw Web界面的Chat区域输入完整自然语言描述,例如:“一只穿宇航服的橘猫站在火星环形山边缘,远处有两颗卫星,写实风格,电影级景深,冷蓝与锈红配色,--no humans, --no cartoon”。
2、等待约90秒后检查./outputs/mj/目录,确认生成PNG文件且尺寸大于500KB。
3、打开该PNG文件,核对图像内容是否与原始描述核心要素一致,特别是主体(橘猫)、场景(火星环形山)、风格(写实)、配色(冷蓝与锈红)四项关键维度。


















