文 | 王熠
在 DRACO 最近开展的一次评测中,一组数据引发了业内广泛关注。
这是一场公开基准测试,涵盖 100 道高难度的研究与分析类任务。开源 Agent 框架 OpenSquilla 0.5.0 将 DeepSeek、GLM、Kimi、Qwen 四款国产大模型构建为并行提案架构,并由第五个模型对输出进行聚合决策。
结果显示,这套纯国产组合取得了 60.85 的质量得分,小幅超越最新旗舰模型 Fable5 的 59.80。单任务平均成本仅为后者的约三分之一,分别为 0.39 美元与 1.21 美元。
在另一组横向对比中,该多模型协同方案相较单独运行的 Claude Opus 4.8 和 GPT-5.5,在质量分上更高,同时成本下降幅度达 86%~92%。
这组数据真正叩问的是:面对复杂任务,是否仍需无条件依赖单一“最强”模型?
过去两年,大模型赛道的竞争焦点集中于基础模型本身——参数规模、推理能力、上下文长度及各类榜单排名成为核心指标。而当技术迈入应用落地阶段,一项任务往往需经历多轮迭代:模型如何遴选、怎样协作、结果如何校验、失败后如何回滚……每一个环节都直接影响最终交付质量与资源消耗效率。
模型能力固然关键,但模型被组织与调度的方式,正日益成为决定性变量。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

01. 被长期低估的 Harness
要理解这一趋势转变,需先厘清 Agent 的基本构成逻辑。业界普遍用这样一个公式来刻画 Agent 与 Harness 的关系——Agent = Base Models + Harness。
其中,基础模型负责语言理解、逻辑推理、代码生成、工具调用等底层能力;Harness 则承担将这些能力嵌入真实业务流程的职责,确保输出具备可执行性、可观测性与可验证性。
如果说模型提供“能做什么”,Harness 定义的则是“如何做”。它涵盖上下文动态管理、执行流程控制、外部工具集成、结果一致性校验、异常恢复机制,也包括多个模型之间的协同策略设计。单个模型被直接调用时,仅完成问答响应;一旦纳入 Harness 架构,它便成为完整工作流中的一个可控节点。
Harness 的价值远不止于工程封装。
基元律动团队早前在 Claw-SWE-Bench 测试中指出:同一款模型在不同 Harness 配置下,任务完成率最大差异可达 27.4 个百分点。这意味着,不更换模型本身,仅优化其外围执行框架,即可带来接近三成的结果波动。
这种影响在实际场景中会被进一步放大。
多数真实任务并非一次问答即可终结。系统通常需完成意图解析、步骤拆解、信息检索、工具调用、结果验证与迭代修正等多个环节。任一环节稳定性不足,都会传导至最终交付效果。
过去,“全量交给最贵模型”是一种低风险策略:复杂任务怕出错,默认启用旗舰模型;简单任务也被裹挟其中,持续消耗高价算力。账单节节攀升,但交付质量却未必同步提升。
随着可用模型数量增多,选型逻辑也在演进。各模型逐渐形成差异化能力图谱,问题不再只是“哪个最强”,而是“哪一步该用哪个”。
这正是 Harness 的核心使命——它不参与基础模型研发竞赛,却深度介入模型调度逻辑、互补机制与结果验证路径,最终保障端到端交付的稳定性与确定性。
02. OpenSquilla 0.5.0:让模型真正组成一支作战单元
OpenSquilla 0.5.0 Preview 及同期发布的《Agentic Routing》技术白皮书,将上述理念具象化为可落地的产品方案。
OpenSquilla 并非新训练的大模型,而是一个开源、支持本地部署的 Agent 运行框架。它不涉及基础模型训练,专注构建模型之上的智能调度与协同体系。
Agentic Routing 可理解为“步骤级模型路由机制”。传统路由通常仅在请求入口处做一次静态判断,依据用户原始输入选择单一模型。而 Agentic Routing 的决策发生在 Agent 执行过程中,每推进一步,系统都会基于当前状态重新评估并动态匹配最优模型。
例如,轻量级工具调用可交由小模型快速响应;涉及长文本归纳、多跳推理或复杂代码生成时,则自动切换至更强模型;某些关键步骤甚至会并发调用多个模型,分别产出方案后再由聚合模块统一整合。
0.5.0 版本的核心突破在于实现了多模型协同闭环。
使用AIsa生成图像与视频。仅需一个API密钥即可调用Gemini 3 Pro Image(图像)和Qwen Wan 2.6(视频)。
在此架构中,四款国产模型处于并行提案层,各自独立完成信息搜索、逻辑推演与答案生成;第五个模型作为聚合中枢,对多个候选输出进行加权融合,输出最终结论。
该方法并无玄机,本质是应对单模型执行中固有的认知盲区。
单一模型检索资料时易遗漏关键信源;处理多重约束条件时也常顾此失彼。多模型并行探索,则相当于调动结构各异的能力体从不同视角协同补位,再通过聚合机制削弱个体偏差带来的不确定性。
OpenSquilla 团队在 DRACO 测试中展示了若干典型案例:
在跨文化电商结账流程任务中,单模型未能识别 Rakuten 平台特有的确认机制与 30 分钟自动取消窗口,多模型集成方案成功补全该细节;
在 AI 代码补全的用户体验分析中,单模型混淆了调试触发与功能开发的优先级逻辑,而多模型方案给出的交互节奏与时延预算更为精准;
在澳洲热泵烘干机横向对比任务中,单模型未覆盖全部机型的关键容量参数,多模型方案则提供了更完整的维度比对。
这些案例印证了一个事实:单模型在复杂任务中天然存在信息覆盖缺口。多模型并行提案+智能聚合,不仅能填补局部细节空白,更能显著提升整体结果鲁棒性。
值得注意的是,OpenSquilla 0.5.0 的多模型集成并非临时起意。回顾其演进路径可见清晰的技术脉络:
v0.1.0 实现智能路由,将简单任务导向低成本模型;
v0.3.0 引入 MetaSkill 自组织工作流,使 Agent 可按目标自主编排子任务;
v0.4.0 加入可验证编码与签名桌面版,将代码生成纳入可执行闭环验证;
直至 v0.5.0,多模型协同能力正式下沉至 Harness 层。
每一次迭代目标明确:让模型调用更可控、资源消耗更合理、交付结果更稳定。
03. 国产模型的价值重心,正从单点突破转向系统协同
OpenSquilla 0.5.0 在 DRACO 中的表现,本质上是一次阶段性快照。其深层意义在于揭示两个同步发生的结构性变化:国产模型能力日趋分化,模型组织范式亦加速成熟。
先看模型侧。
DRACO 单模型评测显示:DeepSeek V4 Pro 得分为 50.32,Qwen 3.7 为 49.34,GLM-5.2 为 48.28,虽与 Fable5 的 59.80 尚存差距,但已显现出差异化优势。单模型层面尚未全面赶超,但角色定位已然转变——它们不再是廉价替代品,而是在特定任务类型中逐步建立不可替代性。单点未必全能,但在合理组织框架下,组合效应可被充分释放。
再看组织侧。
以 Agentic Routing 为代表的新型路由机制,正从“按问题选模型”升级为“按执行态调度模型”。在 Agent 场景中,系统需实时感知任务所处阶段、风险等级变化、是否需要交叉验证或容错回滚,进而动态决策下一步模型调用策略。
OpenSquilla 的路由体系包含四层判断逻辑:从复杂度初筛、任务类型分类,到上下文状态识别,再到最终模型排序。其关键不在某项算法创新,而在于路由机制开始真正理解任务的“执行语境”。
同一任务在不同阶段所需模型可能截然不同:初期任务拆解可用轻量模型高效完成;进入证据链重建等高风险环节时,则无缝切换至更强模型;若验证失败,还可触发更强模型介入修正。路由决策的对象,已从原始用户提问,延伸至任务执行至此刻的完整状态快照。
每次路由动作均沉淀执行日志,含模型选择依据、实际输出、耗时与成本等字段。这些数据将持续反哺路由器优化,也可能用于训练更适配 Harness 场景的专用轻量模型。路由越精准,单位预算所能支撑的任务量越多,系统后续演进空间也越广阔。
OpenSquilla 0.5.0 的实践表明:当模型池足够丰富、调度逻辑足够精细,复杂任务完全不必默认绑定最昂贵模型。
04. Agent 的终极归宿,始终是可靠交付
AI 技术的价值落点,终究在于交付成效。
一个 Agent 是否真正融入生产环境,取决于三大刚性条件:任务能否完成、结果能否验证、成本能否承受。许多项目并非模型能力不足,而是规模化部署后 ROI 无法支撑。
OpenSquilla 0.5.0 所代表的方向,是将成本优化从粗放式“降配”,升维至精细化“能力匹配”。
所谓降配,仅是用低价模型替代高价模型,结果常伴随稳定性滑坡;而能力匹配追求的是:哪些环节必须启用强模型、哪些可交由轻量模型承接、哪些场景适合多模型协同攻坚。其目标是在质量与成本之间找到最优平衡点。
在此逻辑下,“降本”即剔除一切非必要高价调用。复杂任务无需全程依赖旗舰模型,只要模型组合科学、执行状态感知准确、验证机制健全,一组综合成本更低的模型,完全可能在部分任务中达成同等甚至更优表现。
当模型使用成本可通过系统工程手段有效压缩,那些曾因“ROI 不达标”被搁置的项目,便重新获得可行性评估机会。终端用户并不关心背后调用了几个模型,也不在意某款模型在榜单上的名次。他们真正关注的是:同样预算下,系统能稳定交付多少任务?出错后能否自动恢复?最终结果是否满足业务预期?
因此,AI 行业的效率红利,正从基础模型一侧,向模型组织与执行框架一侧持续延伸。
DRACO 的 100 道测试题只是一个切片样本,无法完全复现真实生产环境,亦不能替代长期运行验证。但它向行业传递了一个重要信号:解决复杂任务,未必只有等待更强模型这一条路。把现有模型组织得更细、更稳、更经济,本身就是一条极具潜力的技术路径。

















