WorkBuddy响应延迟时可通过三种方式调用轻量模型:一、URL参数强制指定(如?model_id=glm-4-flash);二、修改config.json添加default_model_id字段实现全局持久化;三、会话中输入/use-model指令动态切换。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在使用WorkBuddy时发现响应延迟明显,尤其在低配置设备或弱网络环境下,可能是当前模型推理负载过高所致。通过直接调整ModelID参数调用轻量化模型,可显著降低首字延迟与整体响应耗时。以下是具体操作路径:
一、通过URL参数强制指定轻量化ModelID
该方式绕过UI模型选择面板,适用于调试、嵌入网页版或需稳定复现低延迟场景的用户。系统将跳过模型偏好匹配逻辑,直连指定轻量模型服务端点。
1、在WorkBuddy桌面版中,右键任务栏图标选择「打开开发者工具」,或按Ctrl+Shift+I唤起控制台。
2、在控制台输入location.href += '?model_id=glm-4-flash'后回车(支持的轻量ModelID包括:glm-4-flash、deepseek-v3-turbo、kimi-long-lite)。
3、页面自动刷新后,地址栏末尾应显示完整参数如https://workbuddy.local/app?model_id=glm-4-flash。
4、新建对话窗口,发送任意测试指令,底部状态栏将显示正在使用GLM-4-Flash轻量模型字样。
二、修改本地配置文件注入ModelID默认值
该方法实现全局持久化设置,避免每次启动重复追加URL参数,适用于固定使用轻量模型的办公终端。
1、关闭WorkBuddy主程序,在文件资源管理器中定位其安装目录下的config.json文件(Windows路径通常为C:\Program Files\WorkBuddy\resources\app\config.json)。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
2、用记事本或VS Code以管理员权限打开该文件,在根对象内添加新字段:"default_model_id": "deepseek-v3-turbo"(注意逗号分隔)。
3、保存文件后,重新启动WorkBuddy,无需任何界面操作,所有新会话将自动加载指定轻量模型。
4、验证是否生效:进入任意聊天窗口,点击输入框右侧模型图标,确认当前选中项为DeepSeek-V3-Turbo且无“未配置”提示。
三、在单次会话中动态覆盖ModelID参数
该方式适用于临时切换至轻量模型处理突发性高并发请求,不影响其他长期运行的会话模型配置,且不修改任何本地文件。
1、在WorkBuddy主界面任意对话输入框中,先输入特殊指令前缀:/use-model glm-4-flash。
2、按下回车键,界面将立即刷新并弹出确认提示:“已切换至GLM-4-Flash轻量模型,本次会话后续响应均由此模型生成”。
3、继续输入实际业务指令(如“提取附件PDF第3页表格数据”),系统将跳过模型路由判断,直连轻量模型API。
4、若需恢复原模型,输入指令/use-model default后回车,即可即时回退至全局默认模型。

















