MiniMax API Token消耗量=输入Token+输出Token,输入按messages全部字符计算,输出仅计content字段;TPS=输出Token数÷首末token时间差;上下文超限截断不计费;function call额外计入工具描述及调用内容;免费模型按日限额计费,超限返回403。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您调用MiniMax API接口,但对实际产生的Token消耗量缺乏清晰认知,则可能影响成本预估与资源调度。以下是精准解析MiniMax API计费粒度中Token计算逻辑的实操路径:
一、以API响应体usage字段为唯一计费依据
MiniMax所有文本类模型的计费粒度严格绑定HTTP响应JSON中的usage对象,该字段由服务端在推理完成后实时生成,反映真实分词结果,不受客户端本地估算干扰。任何脱离usage字段的字符数、字节数或经验公式推算均不可作为费用核算基准。
1、发起一次标准messages格式的POST请求,确保Content-Type为application/json。
2、在返回的完整JSON响应体中,定位顶层键"usage",确认其为非空对象。
3、从中精确提取"prompt_tokens"与"completion_tokens"两个整型字段值,二者均为非负整数。
4、将这两个数值分别代入对应模型的输入单价与输出单价进行费用核算,该usage字段值即为平台扣费的唯一凭证,不可争议、不可覆盖。
二、通过官方Tokenizer工具获取原始分词结果
MiniMax模型采用基于Unicode码点与特殊控制符联合映射的BPE分词策略,系统自动注入、、等保留token,且对空白符、BOM头、null padding等隐式切分标记敏感,必须依赖官方工具完成端到端分词验证。
1、访问Minimax开发者平台Token工具页面,使用与API密钥绑定的账号登录。
2、在输入框中完整粘贴待提交的messages数组内容,包括全部角色消息、换行符、制表符、空格及不可见控制字符。
3、点击“Calculate Tokens”按钮,查看返回的input_tokens与output_tokens数值,该结果已包含系统自动注入的指令token与格式token,与实际API usage字段完全一致。
4、将input_tokens乘以对应模型的输入单价,output_tokens乘以输出单价,二者相加即为本次调用精确费用。
三、手动模拟UTF-8字节映射并校验边界token
当网络受限或需离线调试时,可依据MiniMax公开文档中的UTF-8字节映射规则与reserved token前缀列表,对短文本执行本地化token推演,适用于识别异常长空格、BOM头或null padding引发的token激增问题。
1、将输入字符串通过Python执行text.encode("utf-8"),获取原始UTF-8字节序列。
2、逐字节比对Minimax reserved token字节前缀表,识别是否出现b'\xef\xbb\xbf'(BOM)、b'\x00'(null padding)等强制切分标记,每匹配一个即额外计入1个token,此部分常被忽略但真实计费。
3、对连续ASCII字符段执行最大匹配BPE查找,参考本地缓存的minimax-bpe-merges.txt前1000行规则,确认是否发生子词合并。
4、在prompt末尾与completion开头分别显式添加标记,并将其独立计入token总数,该标记不占用content字段,但强制计入input_tokens与output_tokens各1次。
四、按字符语义层级拆解Token构成
MiniMax对中文、英文、符号、控制符采用差异化映射策略,同一字符串在不同上下文位置可能触发不同分词路径,需结合语义层级理解token分布规律。
1、中文汉字绝大多数情况下1字=1token,但存在极少数复合字(如「?」「喆」)被拆分为多个Unicode码点,导致1字≥2tokens。
2、英文单词按BPE规则切分,常见词如"international"可能被分为"inter", "nation", "al"三段,而高频词"the"直接映射为单个token。
3、标点符号独立成token,全角与半角符号各自拥有专属token ID,混用将导致token数差异。
4、URL、邮箱、代码片段等含大量ASCII字符的结构,因BPE未覆盖长串数字/字母组合,易被逐字符切分,此类内容应前置压缩或编码处理,否则token膨胀率可达300%。
五、function call场景下的额外Token计入规则
当启用function calling能力时,除基础messages与content外,工具描述、参数schema、调用过程中的JSON结构本身均参与token计费,且计入维度与普通文本不同。
1、tools数组中每个tool的name、description、parameters JSON Schema全部计入input_tokens,无论是否被调用。
2、模型返回的tool_calls字段中,每个调用的name、arguments字符串内容均计入output_tokens。
3、若模型返回multiple tool_calls,则每个调用的arguments独立分词统计,arguments中嵌套JSON结构将被双重解析:一次作为字符串整体,一次按key-value键值对展开。
4、用户后续发送的tool_response内容,无论是否含有效数据,全部计入下一轮input_tokens,该机制导致function call链路token总量呈指数级增长特征。


















