讲师中心 微信公众号
AI工具推荐 视频效率加速

如何在Dify中设计一个支持多图片对比与逻辑分析的视觉Agent

风雪小哥_3567

风雪小哥_3567

发布时间:2026-08-02 14:01:26

|

697人浏览过

|

来源于php中文网

原创

Dify多图视觉分析流需构建Workflow应用,集成万物识别与JSON校验插件,通过图意解析器定性任务,Branch节点按图像数量分流:双图走差分分析(定位坐标/状态/数量变化),多图走聚类或API归因,最终LLM生成带字段引用的逻辑结论。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如何在dify中设计一个支持多图片对比与逻辑分析的视觉agent

你需要让Dify智能体能同时接收多张图片,自动识别各自内容,再进行跨图比对(如物品增减、位置变化、状态差异),最后输出带逻辑链条的分析结论——这不是单图OCR或描述任务,而是要求视觉理解+关系建模+推理生成三者协同。

准备多模态运行环境

登录 Dify 控制台(https://cloud.dify.ai 或你的私有部署地址)→ 创建新应用 → 选择 “Workflow” 类型 → 命名为“多图视觉分析流”。【必须选Workflow而非Chatbot,否则无法接入图像节点与分支逻辑】

在左侧“工具库”中搜索并启用两个关键插件:「万物识别(Qwen-VL 或 LLaVA-1.6)」和「JSON Schema 校验器」。前者负责图文联合解析,后者用于强制后续节点接收结构化输出,避免自由文本导致流程断裂。

构建主控意图识别节点

添加第一个节点:类型选“LLM”,命名为“图意解析器”。

在提示词中明确约束输入格式:“你是一个多图视觉分析Agent的首层控制器。用户将上传2–4张图片,每张附带简短标签(如‘入库前’‘入库后’)。请仅输出JSON,字段为:{‘image_count’: int, ‘analysis_type’: ‘对比类’|‘变化类’|‘一致性类’, ‘key_objects’: [string], ‘required_relations’: [string]}”。

勾选“强制JSON输出”,并填写Schema示例:{"image_count":2,"analysis_type":"变化类","key_objects":["纸箱","托盘"],"required_relations":["位置偏移","堆叠层数变化"]}。这一步不处理图像本身,只做任务定性,为后续分支提供路由依据。

按图像数量动态分发处理路径

添加“Branch”节点,类型选“If/Else”,判断条件设为:{{ previous_node.output.image_count }} == 2。

分支A(True)→ 进入“双图差分分析流”;分支B(False)→ 进入“多图聚类归因流”。

注意:Dify 的 Branch 节点不支持大于/小于比较,必须用精确等值判断,否则会跳过整个分支。若需支持3张以上,需额外叠加 Branch 节点嵌套,不可写成 >2。

双图差分分析流:定位差异项并标注依据

第一步:添加两个并行“Image Recognition”节点,分别标记为“图A解析”和“图B解析”。配置相同:模型选 Qwen-VL,提示词统一为:“请逐项识别图中所有可定位物体,返回JSON数组,每项含字段:{‘name’: string, ‘bbox’: [x1,y1,x2,y2], ‘state’: string(如‘完好’‘破损’‘开启’), ‘count’: number}”。

One API key for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more
One API key for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more

统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。

下载

第二步:添加“Code”节点,命名为“差异比对引擎”。Python代码逻辑如下:

输入变量:output_a(来自图A解析)、output_b(来自图B解析);输出变量:delta_report(dict)。

核心逻辑:遍历 output_a 和 output_b 中的 name 字段,对同名物体比对 bbox 偏移量(>15像素记为“位移”)、state 变化(如‘关闭’→‘开启’)、count 差值(±1以上记为“增减”);对未匹配 name 单独归入“新增项”或“消失项”。最终输出结构化差异字典,含“变化项列表”和“置信度评分”。

第三步:添加“LLM”节点,输入 delta_report + 用户原始问题,提示词强调:“用自然语言重述差异,每条结论必须引用具体坐标或状态字段,例如‘托盘右下角纸箱较图A右移23像素(原bbox[412,201,488,275]→现[435,201,511,275])’。”

多图聚类归因流:识别共性模式与异常点

方法一:使用“Embedding + 聚类”子流

添加“Image Recognition”节点,但提示词改为:“提取本图最稳定、最具区分度的3个视觉特征描述,用逗号分隔短语,如‘金属反光表面,规则网格纹理,顶部红色标签’”。此步规避坐标依赖,适配不同拍摄角度。

添加“Code”节点,调用 sklearn.cluster.KMeans 对全部图像的特征向量做聚类,输出:主流簇ID、各图所属簇、离群图索引。

方法二:调用外部多模态API(如阿里云Vision AI)

在“Code”节点中编写 requests.post 调用其 /multi-image-compare 接口,传入全部 base64 图片数组和参数 {"mode": "consistency_check"},直接获取官方返回的“一致元素占比”和“异常图报告”。

两种方法输出统一送入终局“LLM”节点,提示词限定:“先总结共性(例:4图中均有蓝色安全帽、固定角度俯拍),再指出异常(例:图3缺失右侧货架,图4安全帽颜色为黄色),最后推断可能原因(如‘图3拍摄时货架被遮挡,图4为不同作业班组’)。”

热门AI工具

更多
豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

相关专题

更多
Figma AI图像处理全指南:抠图、扩图与矢量化实操
Figma AI图像处理全指南:抠图、扩图与矢量化实操

无需PS插件,掌握 Figma AI 原生图像工具,支持一键移除背景、智能填充丢失区域以及将位图快速转为高精度矢量路径。

252

2026.05.13

Dify 本地部署与企业配置
Dify 本地部署与企业配置

本专题系统讲解 Dify 从零开始的本地部署方法与企业环境配置实践,涵盖 Docker 安装、依赖准备、数据库初始化、反向代理、参数调优、安全加固与多用户开通,帮助开发者与企业团队快速搭建稳定可用的 Dify 平台。

577

2026.06.05

Dify Agent智能体开发实战教程
Dify Agent智能体开发实战教程

本专题聚焦 Dify Agent 智能体的设计与开发,涵盖 Agent 模式选择、工具集成、提示词设计、多步推理、上下文记忆与多 Agent 协作,帮助开发者构建可执行复杂业务任务的智能体应用。

245

2026.06.05

Dify RAG知识库构建实战教程
Dify RAG知识库构建实战教程

本专题围绕 Dify RAG 知识库的全流程实践展开,从文档导入、分段切片、向量化到混合检索、重排优化与召回评估,帮助你打造高准确率、低幻觉的企业知识问答应用。

216

2026.06.05

FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

0

2026.10.08

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

120

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

100

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

80

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Dify零基础教程
Dify零基础教程

共0课时 | 147人学习

学习Agent,从Dify开始
学习Agent,从Dify开始

共0课时 | 142人学习

Dify 部署与运维指南
Dify 部署与运维指南

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn