DeepSeek API内容截断的根本原因是max_tokens参数设置不当,需结合模型规格(如Distill-Llama-8B限512、Qwen-1.5B建议≤512、原生R1可设2048)、输出长度及中文token补偿(1汉字≈1.8token)精准计算。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

DeepSeek API调用时生成内容被截断、句子中途断开或代码块不完整,根本原因是max_tokens参数没设对。这个值不是越大越好,也不是随便填个2048就能跑通,它必须和你实际要输出的内容长度、所选模型的承载能力、以及输入文本占用的token数一起算清楚。
先看模型规格,再定max_tokens上限
不同蒸馏版本的DeepSeek-R1对max_tokens的实际吞吐能力差异极大,硬套统一数值会直接触发OOM或流式中断。
使用DeepSeek-R1-Distill-Llama-8B时:默认n_predict=512,【max_tokens必须≤512】,否则请求会被服务端静默截断,且不报错;若需突破该限制,必须同步在Ollama配置中显式增大n_predict参数。
使用DeepSeek-R1-Distill-Qwen-1.5B时:该模型运行在消费级GPU上,显存极其敏感,【max_tokens超过800就可能触发内存溢出】,建议严格控制在512以内。
调用原生DeepSeek-R1(非蒸馏版)时:可安全启用max_tokens=2048,但须确保输入prompt的token数 + max_tokens ≤ 32768(总上下文窗口),否则超出部分将被自动丢弃。
按输出类型分档设置基础值
短文本类任务(如摘要、标题、关键词提取):设为128–512。这一步操作起来很简单,直接把数字填进参数就行。
基于阿里云百炼 Qwen3.5-Omni 的全模态技能,支持文本、图片、音频、视频理解与文本/语音输出。适用于图片分析、音频转写理解、视频理解、跨模态问答及语音回复生成。
中等长度任务(如技术说明、邮件正文、API文档段落):设为512–1024。注意这里不是“建议”,而是实测下语义连贯性的临界区间——低于512容易断句,高于1024则响应延迟陡增。
长结构化输出(如完整报告、多步骤推理链、带代码块的技术方案):设为1024–2048。中文需token换算补偿:1个汉字≈1.8个token,所以写500字的中文报告,至少预留900 token余量,max_tokens不能只设1024。
根据异常现象反推修正值
第一步:观察输出是否在句中突然终止(例如“根据上述分析,结论是——”后无后续)。这说明max_tokens已耗尽,应将当前值提升30%–50%。
第二步:检查响应时间是否显著长于平均值,但输出长度远未达设定值。此时模型正在低概率分支反复采样,不是max_tokens不够,而是temperature设得过高(>0.85),需下调至0.3–0.6区间再试。
第三步:确认finish_reason字段。若返回"length",就是max_tokens触顶;若返回"stop",说明命中了stop_sequences,和max_tokens无关。


















