必须释放GPU显存并配置显存限制与量化模型:先通过任务管理器结束高GPU占用进程,再修改config.yaml中gpu_memory_utilization为0.7,并设置model_quantize为"q4_k_m",最后用最小提示测试验证。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在Windows上安装SunoAI本地版时反复报错“CUDA out of memory”,说明GPU显存已被提前占满或模型加载策略未适配当前硬件,必须从环境初始化阶段就切断显存争抢源头。
立即释放被占用的GPU显存
按下 Ctrl + Shift + Esc 打开任务管理器→切换到“性能”选项卡→点击左侧“GPU”→观察右上角“专用GPU内存”使用率。若已超90%,说明有后台进程(如浏览器WebGL、其他AI工具、录屏软件)正在持续占用显存。
在“进程”选项卡中,按“GPU”列排序→找到GPU使用率高于30%的进程→右键“结束任务”。特别注意:Chrome/Edge中打开含Three.js或WebAudio的网页、OBS Studio、Stable Diffusion WebUI后台服务都可能隐式锁定显存,不结束无法释放。
执行命令 nvidia-smi --gpu-reset 会强制重启GPU驱动,但【此操作将中断所有正在运行的GPU程序,包括远程桌面连接】,仅在确认无关键任务时使用。
启动前强制限制显存分配比例
进入你解压SunoAI的目录(例如 D:\suno-local),用记事本打开 config.yaml 文件。
找到 gpu_memory_utilization: 这一行,将其值改为 0.7(即只允许SunoAI使用70%显存)。若该行不存在,在 model: 区块下方新增一行:gpu_memory_utilization: 0.7。
保存文件后,双击运行 suno.exe。这一步能防止模型加载时因贪婪分配导致OOM——【不修改此项,RTX 4090等大显存卡也会因缓存膨胀触发报错】。
启用量化模型加载(必须操作)
默认情况下,SunoAI会尝试加载FP16精度的完整语音模型,这对RTX 3060(12GB)及以下显卡必然失败。
方法一:命令行强制指定量化路径
在SunoAI目录下按住Shift+右键→选择“在此处打开PowerShell窗口”,输入:.\suno.exe --model-quantize q4_k_m→回车。
q4_k_m是目前兼容性最好、显存占用最低的GGUF量化格式,可将1.2GB模型压缩至约480MB显存常驻。
方法二:永久写入配置
编辑 config.yaml,在末尾添加:model_quantize: "q4_k_m"
保存后直接双击 suno.exe 即可生效,无需每次输参数。
验证是否绕过显存瓶颈
第一步:运行最小化测试指令
在suno.exe弹出的命令行窗口中输入:/generate --prompt "a single piano note, no reverb, 44.1kHz" --duration 1→回车。
第二步:观察响应时间与输出
若15秒内生成出 outputs\20260806_140601_001.mp3 文件,且播放为清晰单音,则证明显存限制策略已生效;
若仍报错,立即检查 nvidia-smi 输出中“reserved by PyTorch”数值是否超过你设置的70%上限——超过说明有其他Python进程在后台抢占。


















