hypereyes 是小红书与剑桥大学联合研发的并行多模态搜索智能体,首次提出 ugs(unified grounded search)范式,将视觉定位与信息检索深度融合为单一原子操作,支持单轮内对图像中多个目标实体并发完成定位与检索,彻底替代传统串行裁剪—搜索流程。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

HyperEyes 的核心能力
- 并行多实体搜索:在一次推理中同步识别并检索图中多个对象,无需逐个裁剪、依次调用工具。
- 统一有依据检索:视觉定位框直接作为检索动作的参数嵌入函数调用,实现“所见即所搜”的端到端闭环。
- 渐进式拒绝采样机制:在动态扩展的轮次预算下持续优化搜索路径,构建高质量、零冗余的3万条并行种子数据集。
- 双粒度效率感知强化学习:TRACE模块动态校准轨迹级效率阈值;OPD模块在失败轨迹上引入教师模型指导的Token级纠错信号。
- IMEB 多实体评测基准:发布含300个复杂场景的视觉搜索评测集,并配套 CAS(Cost-Aware Scoring)指标,联合量化准确率、Token消耗与工具调用次数。
- 多模态工具协同执行:原生集成图像搜索引擎与文本检索API,支持视觉证据与文字信息同步获取与交叉验证。
HyperEyes 的技术实现逻辑
- UGS 动作空间重构:打破“先定位、再检索”的两阶段壁垒,将 bounding box 坐标直接编码为检索动作的结构化输入,物理层面打通单轮多目标并发通路。
- 并行数据合成流水线:通过多源图像拼接构造多实体查询样本,结合知识图谱随机游走生成强约束交集问题,并主动过滤易解捷径样本。
- TRACE 动态参考奖励机制:以当前最优搜索轨迹为实时标尺,仅当新策略更高效时才给予正向激励,每轮自动提升效率门槛。
- OPD 非对称策略蒸馏:当最终答案出错时,触发235B教师模型对整条失败轨迹进行细粒度Token级监督,保留模型固有的高并发本能。
- GRPO 联合优化目标:融合轨迹级效率奖励与Token级蒸馏损失,同步驱动策略网络在准确率与响应速度上的协同进化。
- CAS 成本感知评分公式:采用 Acc²×100/(N_tok + 2N_tool + 1) 统一度量标准,将精度、计算开销与交互成本压缩为单一可比数值。
如何接入 HyperEyes
- 开源资源获取:前往 GitHub 仓库 https://www.php.cn/link/9d40c1970d3d8f7224664a8a6523c0ea 下载完整代码与文档。
- 基础模型部署:选用 Qwen3-VL-30B 或 Qwen3-VL-235B 作为视觉语言主干模型,确保 GPU 显存满足推理要求。
- 外部工具配置:接入主流图像搜索(如 Bing Image Search)与文本检索服务(如 Google Custom Search),供 Agent 执行 UGS 并行动作。
- 多目标查询输入:上传含多个待识别实体的复杂图像,辅以自然语言描述问题,系统将自动启动统一有依据搜索流程。
- 结构化结果解析:输出包含每个实体的视觉定位框、对应检索结果、图文证据链及最终归纳答案。
- 效率量化评估:通过 CAS 分数直观对比不同模型在准确率、Token 使用量与工具调用轮次上的综合表现。
HyperEyes 的差异化优势
- 效率跃升显著:30B 版本平均仅需 2.2 轮工具调用,仅为同规模最强开源模型的 1/5,效率提升达 5.3 倍。
- 准确率全面领先:在 6 项权威基准测试中平均准确率高出最强开源竞品 9.9%;235B 版本与 Gemini-3.1-Pro 的差距缩小至 1.1%。
- 噪声鲁棒性强:并行机制天然规避串行过程中的误差累积,在真假混杂证据测试中准确率提升 3.7%–5.8%。
- 杜绝错误级联:UGS 原子动作设计使前置定位偏差无法传导至后续检索环节,保障结果可信度。
- 帕累托前沿占优:在准确率—效率联合优化曲线上全面超越现有方案,CAS 得分达次优开源模型的 7.6 倍。
- 全栈深度重构:从动作定义、数据生成、训练范式到底层 RL 算法均进行系统性革新,从根本上突破串行范式瓶颈。
HyperEyes 的官方资源入口
- GitHub 开源仓库:https://www.php.cn/link/9d40c1970d3d8f7224664a8a6523c0ea
- arXiv 技术论文:https://www.php.cn/link/4a66ba27e2e2a6b9420c1011579a5f24
HyperEyes 与主流竞品对比分析
| 对比维度 | HyperEyes-30B | DeepEyes-V2 | VDR |
|---|---|---|---|
| 开发团队 | 小红书/剑桥大学 | 小红书 | 未公开 |
| 搜索范式 | 并行并发(UGS) | 串行裁剪-搜索 | 串行深度搜索 |
| 平均工具轮次 | 2.2 | 3.6 | 11.6 |
| 6基准平均准确率 | 64.0% | 39.1% | 54.1% |
| IMEB准确率 | 46.7% | 18.0% | 21.2% |
| CAS效率评分 | 0.910 | 0.119 | 0.014 |
| 核心机制 | TRACE+OPD双粒度RL | 工具奖励激励 | 多轮深度推理 |
| 错误级联风险 | 免疫(原子动作) | 高风险 | 中等风险 |
HyperEyes 的典型应用方向
- 多人物身份联合推理:从合影中并发定位并检索多位人物的职业背景、历史关联与社会关系。
- 电商多商品横向比对:对货架图、直播间截图等含多个商品的图像,一次性获取品牌、价格、销量与用户评价。
- 跨模态复杂问答:解答涉及图像中多个物体、地标、艺术作品之间时空或语义关系的深层问题。
- 新闻事件真实性核查:针对含多主体、多场景的新闻配图,并发检索关键人物、地点、时间线索以交叉验证。
- 学术文献图表理解:对论文截图中并存的公式、图表、引用编号等元素进行定位与内容溯源。
- 社交平台内容风控:快速识别图片中多个潜在违规实体(如敏感标识、违禁物品、误导性文字),实现毫秒级初筛。



















