千问AI生成图片卡在99%是本地显存不足或模型缓存未释放所致,并非服务器排队;需检查GPU内存使用率、清除模型缓存、降配CFG/步数/分辨率等参数来解决。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

千问AI生成图片卡在99%不是排队太久,而是本地显存或模型加载环节出问题,系统已开始绘图但中途被阻断,此时界面看似“快完成了”,实际已僵死。
先确认是不是真卡住
观察浏览器开发者工具(F12 → Network 标签页):如果「/generate」请求状态长期停留在 pending 或 200 但响应体为空,说明后端没返回图像数据,不是排队,是出错了。
刷新页面重试,若连续3次都卡99%,基本可排除服务器排队——千问办公和通义万相当前未启用队列限流机制,卡99%几乎全是本地侧异常。
检查显存是否溢出
方法一:Windows用户按 Ctrl+Shift+Esc 打开任务管理器 → 切换到“性能”页签 → 点击“GPU” → 查看“专用GPU内存”使用率。若已达95%以上,千问Turbo的BF16推理会因显存碎片无法分配新块而卡在最后一步。
方法二:Linux/macOS用户终端执行 nvidia-smi(NVIDIA)或 rocm-smi(AMD),重点看 【Memory-Usage】 是否接近显卡总显存上限。
注意:即使你用的是RTX 4090,若同时开着Stable Diffusion WebUI、OBS和Chrome十几个标签页,显存仍可能被吃光。关掉其他AI绘图工具再试。
强制释放模型缓存
第一步:在千问网页版右下角点击「高级设置」→ 找到「清除模型缓存」开关并开启 → 点击「立即释放」。
第二步:关闭当前浏览器所有千问相关标签页 → 重启浏览器(不是刷新,是彻底退出进程)。
第三步:重新打开 http://localhost:5000(本地部署)或通义万相官网 → 先不输提示词,等待左下角显示「模型已就绪」再操作。
这一步必须做。千问Turbo在BF16模式下会将部分权重常驻显存,异常中断后残留引用不释放,就会导致下次生成卡在99%——【不清缓存直接重试,100%复现卡死】。
降配参数绕过瓶颈
方法一:把CFG Scale从默认7.0降到5.0,推理步数从25步改为Turbo(9步),再生成同一张图。很多卡99%的情况在低负载下能顺利跑完。
方法二:临时禁用「风格强度」滑块(设为0),关闭「高清细节增强」选项,这两项会在最后阶段触发额外VAE解码,极易在显存临界时失败。
方法三:换尺寸。把1024×1024改成768×768,显存占用下降约38%,对测试构图足够,且能快速验证是否纯显存问题。


















