精准控制通义千问深度思考模式需按部署方式选择参数:百炼API须用extra_body传enable_thinking;本地Python调用可在generate()或apply_chat_template中设false;CLI工具支持--no-thinking开关,但开启思考模式会减少8192输入Token。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在通义千问中精准控制深度思考模式的启用与关闭,必须根据部署方式、调用接口和模型版本选择对应参数,否则可能触发默认思考链导致Token激增或响应延迟。
通过百炼平台API开启/关闭思考模式
第一步:确认你调用的是支持enable_thinking参数的模型,如qwen3.8-max或qwen3.7-max;【qwen3.8-flash、qwen3.8-omni等轻量级模型不支持该参数,强行传入会被忽略】。
第二步:在extra_body中显式设置"enable_thinking": true或false,不要放在messages或model字段里——放错位置会导致参数静默失效。
第三步:若需流式输出并统计Token消耗,务必同时启用stream_options={"include_usage": True},否则无法获知思考链实际占用多少Token。
本地部署时禁用深度思考(Python调用)
方法一:直接在generate()中传参
response = model.generate(inputs, enable_thinking=False)——这是最稳妥的方式,覆盖所有默认行为。
方法二:使用apply_chat_template时关闭模板级思考
使用AIsa生成图像与视频。仅需一个API密钥即可调用Gemini 3 Pro Image(图像)和Qwen Wan 2.6(视频)。
在构建输入前,加入thinking_mode=False参数:tokenizer.apply_chat_template(messages, thinking_mode=False, add_generation_prompt=True)。注意这个参数只在Qwen3系列新版Tokenizer中存在,旧版会报错。
方法三:修改配置文件(仅适用于Ollama等封装框架)
编辑Modelfile或parameters.yaml,添加enable_thinking: false字段。重启服务后全局生效,但后续想临时开启需重新加载配置。
命令行工具中快速切换思考模式
如果你用的是qwenv或qwen-cli这类官方CLI工具,执行时加--no-thinking即可跳过推理链:
qwenv chat --model qwen3.8-max --no-thinking "解释量子纠缠"
不加该参数时,默认启用思考模式;加了--no-thinking后,模型将直接输出结论,不展示中间推导步骤。这一步操作起来很简单,但要注意【开启思考模式时最大输入Token会减少8192个,超长上下文请求可能直接被截断】。

















