讲师中心 微信公众号
AI工具推荐 视频效率加速

Agent 下半场的隐秘战争发生在 Harness 调度层

星敏酱_9396

星敏酱_9396

发布时间:2026-07-11 09:56:44

|

962人浏览过

|

来源于php中文网

原创

文 | 王熠

在 DRACO 最近开展的一次评测中,一组数据引发了业内广泛关注。

这是一场公开基准测试,涵盖 100 道高难度的研究与分析类任务。开源 Agent 框架 OpenSquilla 0.5.0 将 DeepSeek、GLM、Kimi、Qwen 四款国产大模型构建为并行提案架构,并由第五个模型对输出进行聚合决策。

结果显示,这套纯国产组合取得了 60.85 的质量得分,小幅超越最新旗舰模型 Fable5 的 59.80。单任务平均成本仅为后者的约三分之一,分别为 0.39 美元与 1.21 美元。

在另一组横向对比中,该多模型协同方案相较单独运行的 Claude Opus 4.8 和 GPT-5.5,在质量分上更高,同时成本下降幅度达 86%~92%。

这组数据真正叩问的是:面对复杂任务,是否仍需无条件依赖单一“最强”模型?

过去两年,大模型赛道的竞争焦点集中于基础模型本身——参数规模、推理能力、上下文长度及各类榜单排名成为核心指标。而当技术迈入应用落地阶段,一项任务往往需经历多轮迭代:模型如何遴选、怎样协作、结果如何校验、失败后如何回滚……每一个环节都直接影响最终交付质量与资源消耗效率。

模型能力固然关键,但模型被组织与调度的方式,正日益成为决定性变量。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Agent 下半场的隐秘战争发生在 Harness 调度层

01. 被长期低估的 Harness

要理解这一趋势转变,需先厘清 Agent 的基本构成逻辑。业界普遍用这样一个公式来刻画 Agent 与 Harness 的关系——Agent = Base Models + Harness。

其中,基础模型负责语言理解、逻辑推理、代码生成、工具调用等底层能力;Harness 则承担将这些能力嵌入真实业务流程的职责,确保输出具备可执行性、可观测性与可验证性。

如果说模型提供“能做什么”,Harness 定义的则是“如何做”。它涵盖上下文动态管理、执行流程控制、外部工具集成、结果一致性校验、异常恢复机制,也包括多个模型之间的协同策略设计。单个模型被直接调用时,仅完成问答响应;一旦纳入 Harness 架构,它便成为完整工作流中的一个可控节点。

Harness 的价值远不止于工程封装。

基元律动团队早前在 Claw-SWE-Bench 测试中指出:同一款模型在不同 Harness 配置下,任务完成率最大差异可达 27.4 个百分点。这意味着,不更换模型本身,仅优化其外围执行框架,即可带来接近三成的结果波动。

这种影响在实际场景中会被进一步放大。

多数真实任务并非一次问答即可终结。系统通常需完成意图解析、步骤拆解、信息检索、工具调用、结果验证与迭代修正等多个环节。任一环节稳定性不足,都会传导至最终交付效果。

过去,“全量交给最贵模型”是一种低风险策略:复杂任务怕出错,默认启用旗舰模型;简单任务也被裹挟其中,持续消耗高价算力。账单节节攀升,但交付质量却未必同步提升。

随着可用模型数量增多,选型逻辑也在演进。各模型逐渐形成差异化能力图谱,问题不再只是“哪个最强”,而是“哪一步该用哪个”。

这正是 Harness 的核心使命——它不参与基础模型研发竞赛,却深度介入模型调度逻辑、互补机制与结果验证路径,最终保障端到端交付的稳定性与确定性。

02. OpenSquilla 0.5.0:让模型真正组成一支作战单元

OpenSquilla 0.5.0 Preview 及同期发布的《Agentic Routing》技术白皮书,将上述理念具象化为可落地的产品方案。

OpenSquilla 并非新训练的大模型,而是一个开源、支持本地部署的 Agent 运行框架。它不涉及基础模型训练,专注构建模型之上的智能调度与协同体系。

Agentic Routing 可理解为“步骤级模型路由机制”。传统路由通常仅在请求入口处做一次静态判断,依据用户原始输入选择单一模型。而 Agentic Routing 的决策发生在 Agent 执行过程中,每推进一步,系统都会基于当前状态重新评估并动态匹配最优模型。

例如,轻量级工具调用可交由小模型快速响应;涉及长文本归纳、多跳推理或复杂代码生成时,则自动切换至更强模型;某些关键步骤甚至会并发调用多个模型,分别产出方案后再由聚合模块统一整合。

0.5.0 版本的核心突破在于实现了多模型协同闭环。

Images & videos generation with Gemini 3 Pro Image + Qwen Wan 2.6 (video) via one API key
Images & videos generation with Gemini 3 Pro Image + Qwen Wan 2.6 (video) via one API key

使用AIsa生成图像与视频。仅需一个API密钥即可调用Gemini 3 Pro Image(图像)和Qwen Wan 2.6(视频)。

下载

在此架构中,四款国产模型处于并行提案层,各自独立完成信息搜索、逻辑推演与答案生成;第五个模型作为聚合中枢,对多个候选输出进行加权融合,输出最终结论。

该方法并无玄机,本质是应对单模型执行中固有的认知盲区。

单一模型检索资料时易遗漏关键信源;处理多重约束条件时也常顾此失彼。多模型并行探索,则相当于调动结构各异的能力体从不同视角协同补位,再通过聚合机制削弱个体偏差带来的不确定性。

OpenSquilla 团队在 DRACO 测试中展示了若干典型案例:

在跨文化电商结账流程任务中,单模型未能识别 Rakuten 平台特有的确认机制与 30 分钟自动取消窗口,多模型集成方案成功补全该细节;
在 AI 代码补全的用户体验分析中,单模型混淆了调试触发与功能开发的优先级逻辑,而多模型方案给出的交互节奏与时延预算更为精准;
在澳洲热泵烘干机横向对比任务中,单模型未覆盖全部机型的关键容量参数,多模型方案则提供了更完整的维度比对。

这些案例印证了一个事实:单模型在复杂任务中天然存在信息覆盖缺口。多模型并行提案+智能聚合,不仅能填补局部细节空白,更能显著提升整体结果鲁棒性。

值得注意的是,OpenSquilla 0.5.0 的多模型集成并非临时起意。回顾其演进路径可见清晰的技术脉络:
v0.1.0 实现智能路由,将简单任务导向低成本模型;
v0.3.0 引入 MetaSkill 自组织工作流,使 Agent 可按目标自主编排子任务;
v0.4.0 加入可验证编码与签名桌面版,将代码生成纳入可执行闭环验证;
直至 v0.5.0,多模型协同能力正式下沉至 Harness 层。

每一次迭代目标明确:让模型调用更可控、资源消耗更合理、交付结果更稳定。

03. 国产模型的价值重心,正从单点突破转向系统协同

OpenSquilla 0.5.0 在 DRACO 中的表现,本质上是一次阶段性快照。其深层意义在于揭示两个同步发生的结构性变化:国产模型能力日趋分化,模型组织范式亦加速成熟。

先看模型侧。

DRACO 单模型评测显示:DeepSeek V4 Pro 得分为 50.32,Qwen 3.7 为 49.34,GLM-5.2 为 48.28,虽与 Fable5 的 59.80 尚存差距,但已显现出差异化优势。单模型层面尚未全面赶超,但角色定位已然转变——它们不再是廉价替代品,而是在特定任务类型中逐步建立不可替代性。单点未必全能,但在合理组织框架下,组合效应可被充分释放。

再看组织侧。

以 Agentic Routing 为代表的新型路由机制,正从“按问题选模型”升级为“按执行态调度模型”。在 Agent 场景中,系统需实时感知任务所处阶段、风险等级变化、是否需要交叉验证或容错回滚,进而动态决策下一步模型调用策略。

OpenSquilla 的路由体系包含四层判断逻辑:从复杂度初筛、任务类型分类,到上下文状态识别,再到最终模型排序。其关键不在某项算法创新,而在于路由机制开始真正理解任务的“执行语境”。

同一任务在不同阶段所需模型可能截然不同:初期任务拆解可用轻量模型高效完成;进入证据链重建等高风险环节时,则无缝切换至更强模型;若验证失败,还可触发更强模型介入修正。路由决策的对象,已从原始用户提问,延伸至任务执行至此刻的完整状态快照。

每次路由动作均沉淀执行日志,含模型选择依据、实际输出、耗时与成本等字段。这些数据将持续反哺路由器优化,也可能用于训练更适配 Harness 场景的专用轻量模型。路由越精准,单位预算所能支撑的任务量越多,系统后续演进空间也越广阔。

OpenSquilla 0.5.0 的实践表明:当模型池足够丰富、调度逻辑足够精细,复杂任务完全不必默认绑定最昂贵模型。

04. Agent 的终极归宿,始终是可靠交付

AI 技术的价值落点,终究在于交付成效。

一个 Agent 是否真正融入生产环境,取决于三大刚性条件:任务能否完成、结果能否验证、成本能否承受。许多项目并非模型能力不足,而是规模化部署后 ROI 无法支撑。

OpenSquilla 0.5.0 所代表的方向,是将成本优化从粗放式“降配”,升维至精细化“能力匹配”。

所谓降配,仅是用低价模型替代高价模型,结果常伴随稳定性滑坡;而能力匹配追求的是:哪些环节必须启用强模型、哪些可交由轻量模型承接、哪些场景适合多模型协同攻坚。其目标是在质量与成本之间找到最优平衡点。

在此逻辑下,“降本”即剔除一切非必要高价调用。复杂任务无需全程依赖旗舰模型,只要模型组合科学、执行状态感知准确、验证机制健全,一组综合成本更低的模型,完全可能在部分任务中达成同等甚至更优表现。

当模型使用成本可通过系统工程手段有效压缩,那些曾因“ROI 不达标”被搁置的项目,便重新获得可行性评估机会。终端用户并不关心背后调用了几个模型,也不在意某款模型在榜单上的名次。他们真正关注的是:同样预算下,系统能稳定交付多少任务?出错后能否自动恢复?最终结果是否满足业务预期?

因此,AI 行业的效率红利,正从基础模型一侧,向模型组织与执行框架一侧持续延伸。

DRACO 的 100 道测试题只是一个切片样本,无法完全复现真实生产环境,亦不能替代长期运行验证。但它向行业传递了一个重要信号:解决复杂任务,未必只有等待更强模型这一条路。把现有模型组织得更细、更稳、更经济,本身就是一条极具潜力的技术路径。

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

180

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

80

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

80

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

60

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

60

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

60

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

60

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

80

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

100

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Kimi K2.6学习视频
Kimi K2.6学习视频

共1课时 | 143人学习

Gin框架官方中文文档
Gin框架官方中文文档

共0课时 | 0人学习

CodeIgniter框架入门视频教程
CodeIgniter框架入门视频教程

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn