启用辅助模型自动分流需五步:一、开启model_routing.enabled;二、在routing_rules.yaml定义高频任务正则与频次规则;三、在models.yaml声明辅助模型并设fallback_weight与latency_adaptive;四、启用validation_tool.py校验机制并设confidence_score阈值;五、用docker-compose部署独立gRPC辅助模型容器并验证连通性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在运行Hermes Agent时发现主模型负载过高、响应延迟增加或API调用费用持续攀升,则可能是由于高频、低复杂度任务未被合理分流,全部压入主模型处理所致。以下是实现辅助模型自动任务分流的具体配置步骤:
一、启用辅助模型路由开关
该步骤激活Hermes Agent的多模型协同调度能力,使系统具备识别任务类型并分发至对应模型的基础逻辑。只有开启此开关,后续的规则配置才能生效。
1、进入Hermes Agent配置目录,打开config/agent_config.yaml文件。
2、定位到model_routing:区块,将enabled:字段值由false修改为true。
3、保存文件后,执行hermes config reload命令使新配置即时加载,无需重启服务。
二、定义高频侧任务识别规则
通过正则匹配与语义标签组合,精准识别适合交由辅助模型处理的请求特征,避免误判导致关键任务降级。规则支持动态热更新,不影响在线服务。
1、在config/routing_rules.yaml中新增side_task_patterns:节。
2、添加以下三条核心规则:
— 匹配含“当前时间”“天气”“单位换算”“数学计算”的请求,使用regex: "时间|天气|换算|计算";
— 匹配长度≤30字符且不含专业术语的简短查询,启用length_threshold: 30;
— 匹配重复出现超3次的相同意图(基于intent_cache统计),标记为is_frequent: true。
3、执行hermes doctor --check routing验证规则语法与冲突情况,确保无重复或覆盖漏洞。
三、绑定辅助模型实例与权重策略
为分流任务指定专用轻量模型,并设置资源分配优先级,防止辅助模型过载反向拖累主模型调度效率。支持按模型响应延迟动态调整权重。
1、在config/models.yaml中声明辅助模型条目:
— 添加auxiliary_model:节点,指定provider: "qwen"、model_name: "qwen2-0.5b"、max_concurrent: 8;
2、于model_routing:下配置fallback_weight:参数:
— 将auxiliary_model的初始权重设为0.7,主模型保留0.3;
— 启用latency_adaptive: true,当辅助模型P95延迟>800ms时自动降权至0.4。
3、运行hermes model list确认辅助模型已注册并处于ready状态。
四、配置任务结果一致性校验机制
因辅助模型精度略低于主模型,需在返回前插入轻量级校验环节,拦截明显错误输出,避免下游业务逻辑受损。校验不阻塞主流程,仅对高风险任务触发。
1、编辑tools/validation_tool.py,启用enable_side_task_validation:为true。
2、设定校验触发条件:
— 对含数字结果的任务(如计算、换算),启动numeric_range_check;
— 对含时间/日期的响应,强制调用datetime_parser验证格式合法性;
— 对所有辅助模型输出,附加confidence_score阈值过滤,低于0.65者自动转交主模型重算。
3、在config/agent_config.yaml中将validation_timeout_ms:设为150,确保校验耗时可控。
五、部署辅助模型专用推理容器
为保障辅助模型独立资源边界与低延迟响应,需将其从主模型进程隔离,部署为独立gRPC服务容器。此举可避免内存争抢与CUDA上下文切换开销。
1、使用docker-compose.aux.yml模板启动辅助模型服务:
— 指定GPU显存限制为device_requests: [{capabilities: ['gpu'], count: 1}];
— 设置mem_limit: 4g与cpus: '1.5'硬性约束。
2、在主Agent配置中更新auxiliary_endpoint:为http://aux-model-svc:8080/v1/chat/completions。
3、执行hermes tools test --tool auxiliary_router --target aux-model-svc验证端到端连通性与吞吐达标(≥120 req/s)。


















