若切换模型后出现Token溢出错误,需通过三种方式调整MaxTokens:一、会话中点击模型图标旁齿轮图标,调低「Max Output Tokens」至官方上限的70%;二、在「设置→AI模型管理→模型偏好设置」中修改目标模型的「Default Max Tokens」;三、手动编辑~/.workbuddy/models.json文件,为对应模型添加"max_tokens": 数值键值对。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在WorkBuddy中切换模型后触发Token溢出错误,通常表现为响应中断、提示“exceeded maximum context length”或生成内容被意外截断,则说明当前模型的输入+输出总长度已超出其允许的最大Token数。以下是调整MaxTokens限制参数的具体操作路径:
一、在单次会话中动态降低MaxTokens值
该方式适用于临时规避长上下文导致的溢出,不修改全局配置,仅影响当前对话链路的输出长度控制。
1、在WorkBuddy主界面任意对话窗口中,点击输入框右侧当前模型图标(如混元、GLM-4-Flash等)。
2、从下拉菜单中选择目标模型后,**不立即发送指令**,而是先点击模型名称右侧出现的齿轮图标(⚙️)进入会话级参数面板。
3、找到「Max Output Tokens」滑块或输入框,将其值设为不超过模型官方文档标注上限的70%(例如GLM-4-Flash上限为32768,则建议设为≤22937)。
4、确认修改后,再输入完整指令并发送,系统将严格按此限制生成响应,避免因贪婪解码导致溢出。
二、在AI模型管理页修改模型默认MaxTokens
该方式将持久化设定某模型的全局最大输出长度,适用于长期使用固定模型且明确其能力边界的用户。
1、点击WorkBuddy右上角个人头像,进入「设置」菜单。
2、在左侧导航栏中选择「AI模型管理」→「模型偏好设置」。
3、在模型列表中定位目标模型(如DeepSeek-V3),点击其右侧「编辑」按钮。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
4、在弹出配置面板中,展开「高级参数」区域,找到「Default Max Tokens」字段。
5、输入数值时需确保不超过该模型Base URL服务商声明的context window总容量(例如Kimi-Long官方声明支持200万Token上下文,但WorkBuddy默认仅开放131072上限,此时可手动提升至≤131072)。
6、点击「保存配置」,该模型后续所有新会话将自动应用此MaxTokens限制。
三、通过models.json文件手动注入max_tokens参数
该方式绕过图形界面限制,直接向底层配置写入模型级硬性约束,适用于需精确匹配第三方API规格的进阶用户。
1、关闭WorkBuddy客户端,确保无后台进程残留。
2、打开终端,执行命令:code ~/.workbuddy/models.json(或使用vim/nano等编辑器打开)。
3、在对应模型配置对象内(如"glm-4-flash"字段下),插入键值对:"max_tokens": 16384(注意逗号位置与JSON语法有效性)。
4、保存文件后,重新启动WorkBuddy,该参数将在模型初始化时被强制加载,优先级高于界面设置。
5、验证是否生效:新建会话并发送超长指令,观察响应是否稳定截断于设定值附近,而非报错退出。

















