8GB显存选≤9B参数+INT4量化模型(如qwen3.5:9b-q4_k_m),12GB选14B模型并转INT4+设--ctx-size 8192,24GB可跑qwen3.5-27B-Q4_K_M;均需用OpenClaw专用转换工具且避开Ollama原生GGUF格式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用OpenClaw调用Ollama本地模型,但显存只有8GB或12GB,又怕选错模型导致加载失败、卡死甚至直接报OOM错误——这种情况下不能凭直觉瞎试,必须按显存容量反向锁定模型参数量与量化档位组合,否则连第一步“ollama run”都执行不下去。
先确认你的显存真实可用容量
在Windows上打开任务管理器→性能→GPU,看“专用GPU内存”实时占用;Linux用户运行nvidia-smi,注意右上角“Memory-Usage”后的数字;Mac用户打开活动监视器→内存,看“图形卡内存”栏。这一步必须做,因为驱动预留、后台进程会偷偷吃掉1–2GB,标称8GB显卡实际只剩6.2GB可用。
记住:【OpenClaw不兼容Ollama默认的GGUF模型格式,只认INT4/INT8量化后的OpenCL专用权重】,所以Ollama里能跑的模型,OpenClaw不一定能直接用。
按显存档位对号入座选模型
显存不是越大越好,而是要留出至少1.5GB给OpenClaw自身调度、KV缓存和上下文扩展。低于这个余量,模型可能加载成功但推理中途崩溃。
方法一:8GB显存(如RTX 4060)
① 执行ollama list,过滤出带:q4_k_m或:q4_0后缀的模型;
② 只选参数≤9B的模型,例如qwen3.5:9b-q4_k_m或phi4:3.8b-q4_0;
③ 下载后用OpenClaw工具链转换:python tools/convert_hf_to_openclaw.py --model qwen3.5 --quantize int4;
④ 启动时强制绑定GPU设备:./openclaw-cli --model ./models/qwen3.5_int4 --device opencl:0。
对当前分支的待审变更进行安全评审,检测密钥泄露、SQL注入、XSS、SSRF、权限绕过、危险依赖六类漏洞,生成风险分级报告并在用户批准后修复。适用于PR合并、对外开源、事故复盘。触发词:安全评审、security review、漏洞检查、密钥扫描、我的代码...
注意:别碰任何带:f16或:q8_0标签的模型——它们在Ollama里能跑,但在OpenClaw里会因显存超限直接拒绝加载。
方法二:12GB显存(如RTX 4070)
可安全运行14B级别模型,但必须跳过Ollama官方库里的“全量版”。
第一步:去Hugging Face搜TheBloke/qwen3-14b-GGUF,下载qwen3-14b.Q4_K_M.gguf文件;
第二步:用llama.cpp的convert-gguf-to-openclaw工具转成INT4 OpenCL格式;
第三步:启动命令加--ctx-size 8192参数,否则默认4K上下文会浪费显存余量。
方法三:24GB显存(如RTX 4090)
直接锁定Qwen3.5 27B + Q4_K_M量化组合,这是当前OpenClaw实测唯一能在单卡上稳定跑满27B参数的方案。其他27B模型(如DeepSeek-V2-Lite)虽标称支持,但OpenClaw对其MoE结构的分组调度尚未优化,容易触发设备索引越界错误。
执行./openclaw-cli --model ./models/qwen3.5_27b_int4 --device opencl:0 --numa-node 0,其中--numa-node 0强制绑定第一路PCIe通道,避免多CPU插槽间内存拷贝拖慢推理速度。

















