换用Taotoken平价模型或本地Qwen3.6可立省70%以上调用成本:优先配置Taotoken的gpt-4o-mini等低价模型,单价低至$0.0008/1K tokens;有GPU可本地运行Qwen3.6实现零成本;同步精简提示词、设max_tokens上限、启用流式响应截断。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用 Hermes Agent 又怕 API 账单突然暴增?不用等厂商降价、不靠薅羊毛活动,直接换掉默认模型就能立省 70% 以上调用成本——关键不是换“更强”的模型,而是换“更准”的模型。
确认当前模型开销来源
打开 Hermes Agent 配置界面 → 点击「LLM 设置」→ 查看当前激活的 provider 和 model 名称。如果显示的是 gpt-4o、claude-3.5-sonnet 或百炼 Qwen-Max 这类商用旗舰模型,它们单次推理 Token 成本普遍在 $0.01~$0.03 区间,连续对话 10 分钟就可能触发账单预警。
这一步必须做,否则你连自己正被哪个模型“吃钱”都不知道。
接入 Taotoken 平价模型(推荐首选)
Taotoken 是目前唯一提供稳定低价 + OpenAI 兼容接口 + 多模型自由切换的聚合平台,其 claude-sonnet-4-6、gpt-4o-mini、glm-5.1 等模型单价低至 $0.0008/1K tokens,且支持流式响应与 max_tokens 强制截断。
方法一:环境变量一键配置(最安全)
在 Hermes 项目根目录新建或编辑 .env 文件,写入以下三行:
OPENAI_API_KEY=你的_Taotoken_API_Key
OPENAI_BASE_URL=https://taotoken.net/api/v1
HERMES_DEFAULT_MODEL=gpt-4o-mini
【注意:OPENAI_BASE_URL 必须带 /v1 后缀,漏掉就会 404】
方法二:配置文件硬指定(适合多环境部署)
编辑 config.yaml,在 llm 节点下写入:
llm:
provider: custom
config:
base_url: "https://taotoken.net/api/v1"
api_key: "${OPENAI_API_KEY}"
model: "claude-sonnet-4-6"
保存后重启 Hermes Agent,终端会打印 “Connected to Taotoken — model: claude-sonnet-4-6”。
本地运行 Qwen3.6 作为零成本备选
如果你有 NVIDIA 显卡(RTX 3090 及以上)或 Apple Silicon M2 Ultra,Qwen3.6 在 llama.cpp 下仅需 6GB 显存即可跑满 8K 上下文,全程不走公网、不计费、不传数据。
基于阿里云百炼 Qwen3.5-Omni 的全模态技能,支持文本、图片、音频、视频理解与文本/语音输出。适用于图片分析、音频转写理解、视频理解、跨模态问答及语音回复生成。
第一步:安装 WSL2 + CUDA 12.8(Windows 用户)
以管理员身份运行 PowerShell → 执行 wsl --install -d Ubuntu-24.04 → 重启 → 运行 nvidia-smi 验证驱动识别成功。
第二步:编译支持 GPU 的 llama.cpp
git clone https://github.com/ggerganov/llama.cpp → cd llama.cpp → cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=89 → cmake --build build -j$(nproc)
第三步:下载 Qwen3.6-GGUF 量化模型
从 HuggingFace 官方镜像站下载 qwen3.6.Q5_K_M.gguf → 放入 llama.cpp/models/ 目录。
第四步:配置 Hermes 指向本地 Ollama(已预装)
执行 ollama serve → 新开终端 ollama create qwen36 -f Modelfile(内容为 FROM ./models/qwen3.6.Q5_K_M.gguf)→ ollama run qwen36 测试通路 → 回到 Hermes config.yaml,把 provider 改为 ollama,model 设为 qwen36。
这一步做完,Hermes 就彻底脱离云服务计费链路了。
启用低成本响应策略
即使换了平价模型,冗余输出仍会悄悄耗 Token。必须同步开启三项限制:
① 在系统提示词中删除所有“请用 Markdown 输出”“请分三点回答”等格式指令——这些文字本身就被计入输入 Token,且强迫模型生成结构化内容会额外增加 20%~40% 输出量。
② 为每类任务设 max_tokens 上限:
问答类 → 设为 128
摘要类 → 设为 64
关键词提取 → 设为 32
超过即截断,不等模型“发挥完毕”。
③ 开启流式响应并监听终止信号:
在 Hermes 的 LLM 配置中将 stream 设为 true → 在代码逻辑里监听 response 字段中是否出现 "```"、"}" 或 "END_OF_RESPONSE" 等闭合标记 → 检测到立即终止请求。
【max_tokens 不设上限 = 默认生成 2048 token,哪怕你只问“今天天气如何”】

















