要快速定位Agent Space中每个智能体的实际花费,必须直接查看每次chatModel.Generate()返回的ResponseMeta.Usage字段;需先开启「可观测性开关」,ANOLISA需启用AgentSight,Zentrix需开启「多维计量」;代码中提取Token用量后,可通过日志服务、Zentrix成本追踪器或手动Trace ID落盘三种方式聚合;识别异常需筛选>10000 Token调用,检查tool_result_parse等高耗步骤,并分析调用次数与总Token比值及模型混用情况。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要快速定位 Agent Space 中每个智能体的实际花费,必须跳过总账单数字,直接进入每次模型调用的用量元数据层——因为真正决定成本的,是每次 chatModel.Generate() 返回的 ResponseMeta.Usage 字段,而非后台汇总报表。
确认 Agent Space 是否已启用用量透出
登录 Agent Space 控制台 → 进入「部署管理」→ 找到目标 Agent 实例 → 点击「配置详情」→ 检查「可观测性开关」是否为开启状态。【未开启时,所有调用的 Token 数据将被丢弃,无法回溯】。该开关默认关闭,首次排查成本前务必手动打开。
若使用的是腾讯云 Agentic OS(ANOLISA)或 ZStack Zentrix 部署的 Agent Space,还需额外确认是否已挂载对应插件:ANOLISA 需启用 AgentSight 组件,Zentrix 需在网关侧开启「多维计量」策略。
从代码层提取单次调用的 Token 用量
在 Agent 执行链中,找到实际发起 LLM 请求的位置,通常是类似 chatModel.Generate(ctx, messages) 的调用点。
在其返回后立即读取用量:
usage := resp.ResponseMeta.Usage<br>fmt.Printf("Prompt: %d, Completion: %d, Total: %d\n",<br> usage.PromptTokens,<br> usage.CompletionTokens,<br> usage.TotalTokens)
注意:【OpenAI 兼容协议下,DeepSeek/Claude/GPT-4o 的 ResponseMeta 结构完全一致;但若直连原厂 SDK(如 Anthropic 官方 Go SDK),字段名可能为 Usage.InputTokens 和 Usage.OutputTokens,需按实际文档调整】。
聚合到 Agent 级别的三种方式
方法一:通过 AgentSpace 日志服务自动聚合
启用日志采集后,Agent Space 会将每次调用的 ResponseMeta 序列化为结构化日志,字段包含 agent_id、step_name、model_name、total_tokens。在日志分析页输入查询语句:fields @timestamp, agent_id, step_name, total_tokens | filter ispresent(total_tokens) | stats sum(total_tokens) as total by agent_id,即可得到各 Agent 总消耗。
方法二:用 Zentrix 成本追踪器绑定调用凭证
在统一网关入口处,为每个 Agent 分配唯一 app_key。Zentrix 会自动将该 key 关联至每次请求,并在「组织-应用-用户」三维视图中聚合用量。无需改代码,但要求所有流量必须经过 Zentrix 网关。
方法三:手动注入 Trace ID 并落盘
在 Agent 初始化时生成唯一 trace_id,将其写入每轮 LLM 调用的 messages[0].Content 或 metadata 字段;同时在 Generate() 返回后,将 trace_id + usage 写入独立数据库表。这种方式最灵活,适合已有成熟埋点体系的团队。
识别异常高消耗的典型路径
第一步:筛选单次调用 > 10000 Token 的记录
在日志或数据库中执行:WHERE total_tokens > 10000 ORDER BY total_tokens DESC LIMIT 5。
第二步:检查对应 step_name 是否为 tool_result_parse 或 reflection_loop
这两类步骤高 Token 往往意味着:工具返回内容未截断、反思逻辑陷入重试循环、或 system prompt 中嵌入了冗余知识库片段。
第三步:比对同一 agent_id 下「调用次数」与「总 Token」的比值
若比值持续低于 300(即平均每次调用不到 300 Token),说明存在大量空转调用——比如心跳检测、健康检查等非业务请求也被计入计费。
第四步:导出该 Agent 最近 100 次调用的 model_name 分布
发现混用 gpt-4o 与 deepseek-v3 且无路由策略时,需立即在调度层增加模型选择规则,避免简单任务误走高价模型。


















