ComfyUI出图不稳定主因是中文提示词被CLIP错误分词,导致语义断裂;应将中文提示词预翻译为英文并按主体、场景、风格、质量四层结构组织,负面词需精准匹配且全英文,权重控制在1.0–1.5。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

ComfyUI出图不稳定,往往不是模型本身在“耍脾气”,而是提示词结构没搭稳——就像用歪斜的脚手架盖楼,风一吹就晃。中文提示词尤其容易踩坑:一个“古风少女”被CLIP分词器拆成“古”“风”“少”“女”四个孤立字块,语义链断裂,模型只能靠猜;加了权重的“(汉服:1.3)”可能根本没被正确识别,反而让“服”字单独放大,生成一堆奇怪的布料褶皱。
检查提示词是否被CLIP正确分词
第一步:打开ComfyUI,加载CLIP Text Encode节点,把你的中文提示词粘贴进去。
第二步:右键该节点→选择“View Node Info”,在弹出窗口中点击“Show Tokens”按钮。
第三步:观察Token列表——如果看到大量单字(如“汉”、“服”、“樱”、“花”)、乱码符号(如“▁”“Ġ”)或英文混杂(如“han”“fu”),说明分词已失败。【此时任何权重、逗号分隔、括号语法都无效】
第四步:对比英文提示词——输入“Chinese hanfu girl under cherry blossoms”,再点Show Tokens,你会看到“chinese”“hanfu”“girl”等完整语义单元。这才是模型能听懂的语言结构。
重构提示词:从“堆砌描述”到“分层引导”
方法一:预翻译+结构化填充(推荐首选)
先把中文原意用DeepL或Google Translate转成准确英文,再按四层结构组织:
主体(Who/What) + 场景(Where/When) + 风格(How) + 质量(Quality)
示例:“穿宋制褙子的20岁女子站在杭州西湖断桥边,水墨渲染,8K细节,柔光” →
“a 20-year-old East Asian woman wearing Song-dynasty beizi, standing on Broken Bridge at West Lake in Hangzhou, ink painting style, 8k resolution, soft lighting”
注意:文化专有名词(如“褙子”“断桥”)必须保留拼音或公认英文译法(beizi / Broken Bridge),不能直译成“back coat”或“broken bridge”——后者会让模型真造一座塌桥。
负面提示词不是越多越好,而是要精准卡位
第一步:先删掉所有“lowres,bad anatomy,extra fingers”这类通用词包——它们在中文提示词失效时会进一步干扰注意力分配。
第二步:只保留与当前提示词直接冲突的项。比如你写了“穿旗袍”,就在Negative Prompt里加“qipao, cheongsam”(防止模型误用其他中式服装);写了“白天”,就加“night, dark, sunset”(避免光影逻辑错乱)。
第三步:把负面词也翻译成英文,并确保和正向提示词在同一语义层级。不要混用中英文负面词,否则CLIP编码器会把“模糊”和“blurry”当成两个独立信号同时激活,反而强化模糊感。
验证权重是否真正生效
① 在英文提示词中测试基础权重语法:(masterpiece:1.3), (detailed face:1.5), (soft lighting:1.2)
② 每次只调整一个关键词的权重,运行3次对比图——如果变化不明显,说明该词未被CLIP识别为独立Token,需换更标准的英文表达(如把“detailed face”换成“sharp facial features”)。
③ 避免嵌套权重:((masterpiece:1.3):1.2)这种写法在ComfyUI中不被支持,会导致整个Token段被忽略。
④ 权重值超过1.6后边际效应急剧下降,且易引发画面过曝或结构扭曲,【核心词权重严格控制在1.0–1.5区间】

















