根本原因是temperature参数未显式设置导致行为不可控;需在/chat/completions请求体根层级设temperature为0.0~1.2,关闭auto_temperature_adjustment,并按任务类型选择对应值,搭配top_p=1.0或删除top_p字段实现确定性输出。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

调用千问AI API时,输出内容忽长忽短、逻辑跳跃或重复啰嗦,根本原因是temperature参数未显式设置,模型沿用默认值0.6导致行为不可控。
在API请求体中添加temperature字段
第一步:确认你使用的是标准/chat/completions端点(Qwen官方v2026.4文档明确支持该路径)。
第二步:在JSON请求体的根层级直接写入temperature键,值设为0.0~1.2之间的浮点数,例如{"model":"qwen3-14b","messages":[{"role":"user","content":"解释量子纠缠"}],"temperature":0.3}。
第三步:若用Python SDK调用,检查是否启用了auto_temperature_adjustment开关——该开关会覆盖你手动传入的temperature值,【必须关闭】才能生效。
按任务类型选对temperature值
方法一:代码生成任务 → temperature=0.3。这个值能压制非常规符号和虚构函数名,避免语法错误。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
方法二:法律/医疗类问答 → temperature=0.2。强制模型只采样高置信度术语,抑制模糊类比和主观推断。
方法三:诗歌或广告语创作 → temperature=1.2。扩大低频但语义新颖词的入选机会,激发风格化表达。
搭配top_p禁用实现确定性输出
① 将temperature设为0.0后,必须同步处理top_p:要么在请求体中显式写"top_p": 1.0,要么干脆删掉top_p字段——部分客户端默认注入top_p=1.0,但显式声明更可靠。
② 发送三次完全相同的请求,用SHA-256校验response.choices[0].message.content哈希值是否一致。若不一致,说明后端vLLM引擎仍被--top-p 0.9等参数覆盖,需优先从API层清除干扰。
这一步操作起来很简单,直接把文件拖进去就行。

















