要在扣子平台快速搭建多模态智能体,必须调用专用插件与模型:图像需启用DALL·E 3和CLIP并加约束提示;音频需启用Whisper/TTS或OpenClaw TTS Pro(须绑定API密钥);视频需启用VideoLLaMA(≥2.1.3)并配置工作流分支逻辑。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在扣子平台快速搭建能处理图像、音频、视频的多模态智能体,必须绕过纯文本思维定式,直接调用对应模态的专用插件与模型,否则生成结果将严重偏离预期。
创建支持图像理解与生成的智能体
第一步:进入扣子工作台→点击左上角⊕→选择「创建智能体」→在「AI 创建」输入框中明确写入“能看图识物并根据描述生成高清图片的助手”,系统会自动匹配多模态模型与图像插件。
第二步:进入编排页面后,检查中间「工具」面板是否已启用「文生图(DALL·E 3)」和「图生文(CLIP)」两个插件——【若未自动启用,必须手动勾选,否则后续所有图像交互均会返回错误】。
第三步:在左侧「人设与回复逻辑」中加入约束性提示词:“你必须先用图生文插件分析用户上传的图片内容,再决定是否调用文生图插件;禁止对未上传图片的请求直接生成图像”。这一步防止模型擅自虚构图像输入源。
接入音频类能力实现语音转文字与合成
方法一:使用内置语音插件
在「工具」面板中启用「语音识别(Whisper)」和「语音合成(TTS)」插件,然后在「人设与回复逻辑」中添加指令:“当用户发送语音消息时,优先调用Whisper转为文字再处理;当需要输出语音时,必须调用TTS插件生成MP3并以卡片形式返回”。
方法二:通过OpenClaw扩展高保真音色
前往「插件市场」搜索OpenClaw→安装「OpenClaw TTS Pro」→在技能配置中绑定自定义音色ID→注意:该插件需单独授权API密钥,【未完成密钥绑定前,所有语音合成请求将静默失败】。
构建视频理解与生成工作流
① 在「工具」面板中启用「视频理解(VideoLLaMA)」插件,并确认其版本号≥2.1.3(旧版本不支持短视频帧提取)。
② 新建一个「工作流模式」智能体,拖入「视频上传节点」→连接「视频理解节点」→再连接「文生视频(Runway Gen-3)」节点。
③ 设置分支逻辑:当视频时长<60秒且含人脸时,触发「人脸情绪分析」子流程;否则跳过。此判断必须放在视频理解节点之后,否则无法获取元数据。
④ 测试时上传MP4文件,观察右侧调试面板是否显示“video_duration: 47s, face_count: 2, emotion: neutral”——只有出现这类结构化输出,才代表视频理解链路打通。


















