直接查看用量面板实时监控Token消耗,重点关注输入(含历史消息)、输出、推理三类Token,工具调用和截图会产生额外视觉Token,易被忽略。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

直接看用量面板,别等账单出来才查。GPT-6 的官方控制台(或你用的 API 平台)里有实时 Token 消耗明细,每条请求都按输入、输出、推理、视觉、工具调用五类分开计数,不是笼统给个总数。
用量面板里重点盯这三块
输入 Token:包括系统提示词 + 全部历史消息 + 当前提问 + 所有图片/截图/文档内容。哪怕你只发“继续”,只要上下文还在,这部分就会越滚越大。
输出 Token:模型最终返回的文字长度。但注意——它不包含模型内部思考过程(比如 chain-of-thought 推理链),那部分算在“推理 Token”里。
推理 Token:GPT-6 Astra 独有项,是模型自己拆解任务、调用工具、验证结果时产生的中间计算量。同一问题,提示词写得模糊,它就得多想几步,这部分就多烧钱。
怎么确认某次请求到底花了多少
在 API 调用返回的 JSON 中,找 usage 字段,里面明确列出:
- prompt_tokens(输入)
- completion_tokens(输出)
- reasoning_tokens(推理)
- cache_hit_tokens(命中缓存的部分,价格只有 1/10)
网页端用户可在对话右上角点击「用量详情」,展开后能看到每轮交互对应的 Token 分解图,支持按日期、会话、模型类型筛选。
别被“长上下文”骗了,历史消息才是隐形账单
很多人以为“我只聊了 5 轮,肯定没花多少”,其实第 5 轮的 prompt_tokens = 系统提示词 + 第1轮用户+AI + 第2轮用户+AI + … + 第5轮用户。它不是累加轮数,而是把前面所有字全再送一遍。
建议做法:
- 每次新任务,新开一个会话,别硬续旧聊天
- 用完即删历史,尤其含截图、PDF 内容的会话
- 开启 Prompt Cache 后,检查 cache_hit_tokens 是否稳定增长——这是省钱最直观的信号
工具调用和截图最容易漏看
让 Astra 打开网页、截屏、读表格,这些动作本身不显示为文字,但后台已把图像转成视觉 Token 计费。一张 1080p 截图 ≈ 400–800 文本 Token,比你打两百字还贵。
自查方法:
- 在用量面板里切换“按功能分类”,单独查看 computer_use、web_search、code_interpreter 的消耗占比
- 如果某次任务中“推理 Token”远高于“completion_tokens”,大概率是它反复截图、重试操作导致的

















