必须开启【多模态输入支持】开关,否则语音和图片将被过滤或转文本;需用【多模态输入(语音+图片)】节点或手动组合双触发器,并配置大模型节点映射audio_text与image_caption变量,启用多轮模态上下文以实现跨模态理解。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让AI助手既能听懂你说话,又能看懂你随手拍的图片,并把两者结合起来理解你的真实意图——比如对着一张模糊的电路板照片说“这个焊点是不是虚焊”,而不是分别处理语音和图片。
准备多模态输入环境
登录扣子官网(https://www.coze.cn),进入工作空间后,点击左侧导航栏【Bot】→【新建 Bot】→选择【空白模板】。
在Bot基础设置页,必须开启【多模态输入支持】开关,否则后续上传的图片和语音将被自动过滤或转为纯文本描述,失去原始模态特征。
这一步不可跳过,关闭状态下所有音频文件会被静默丢弃,连错误提示都不会出现。
立即进入“豆包AI人工智官网入口”;
立即学习“豆包AI人工智能在线问答入口”;
配置语音与图片双通道接收节点
进入Bot的【工作流】编辑页,删除默认的单一“开始”节点,拖入两个并行的触发节点:
方法一:使用系统预置双模态入口
点击【+ 添加节点】→【触发器】→选择【多模态输入(语音+图片)】。该节点会自动生成一个统一输入槽,用户可同时上传1张图+1段音频,或单独上传其中任一类型。
方法二:手动组合双触发器
添加【语音输入】触发器 + 【图片输入】触发器,二者并列放置。注意:此时需在后续节点中用【条件分支】判断哪类输入存在,否则当只传图片时,语音路径会卡死等待超时。
【关键区别】:预置节点将语音ASR结果与图像OCR/CLIP特征向量在底层对齐融合;手动组合方式下,两路数据默认不关联,需额外写Python插件做语义对齐。
构建跨模态理解流程
第一步:连接多模态理解节点
从上一步的【多模态输入(语音+图片)】节点 → 拖线至【大模型节点】,模型选择【豆包·1.5·Pro·32k】或【Qwen-VL-7B】(后者原生支持图文联合推理)。
第二步:设置输入变量映射
在大模型节点配置中,将“语音转文字结果”映射到变量audio_text,将“图片语义描述”映射到变量image_caption,再手动拼接提示词:“用户语音说:
第三步:启用上下文感知增强
勾选【启用多轮模态上下文】选项。若用户第二次上传新图并说“和刚才那个对比”,模型能自动调取前序图片的视觉特征向量参与本次推理,而非仅依赖文字描述。
这一步决定AI能否真正“看图说话”,不开启则所有图片输入仅被压缩成一句固定格式的AI生成描述,丢失细节纹理、空间关系等关键信息。
调试与验证双模态响应效果
点击右上角【测试】按钮,在弹出面板中点击麦克风图标录制3秒语音,再点击图片图标上传一张含文字的截图(如微信聊天记录),发送。
观察返回内容是否同时引用了语音中的关键词(如“虚焊”)和图片中的可视线索(如“右下角银色焊点发暗”)。若只复述语音或只描述图片,说明大模型节点未正确绑定双变量,需返回第二步检查映射字段名是否拼写一致。
这一步必须用真实音画组合测试,纯文字模拟无法触发多模态对齐机制。


















