换用DeepSeek-v4-flash可显著提升Codex响应速度,因其专为实时编码优化,支持INT4量化与FlashAttention-3,在RTX 4090上吞吐达142 tokens/s;需修改配置文件model字段并重启,同步将model_reasoning_effort调至medium,并卸载gpt-toolkit等不兼容技能,安装deepseek-core。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Codex响应太慢,直接和你选的模型强相关——用GPT-5.6跑一个函数生成要3.8秒,换DeepSeek-v4-flash同一任务0.9秒出结果,差值不是网络抖动,是模型推理路径和硬件适配层的真实差距。
模型选择直接影响响应速度
不同模型在Codex中运行时,底层计算图、KV缓存策略、量化精度、CUDA内核优化程度完全不同。GPT-5.6虽能力全面,但默认未启用低延迟变体(如GPT-5.6-Lite),首Token延迟常超1200ms;DeepSeek-v4-flash专为实时编码设计,支持INT4量化+FlashAttention-3,在RTX 4090上实测吞吐达142 tokens/s。
打开Codex配置文件(codex-rs/core/src/config.rs),找到model字段:
→ 将原值"gpt-5.6"改为"deepseek-v4-flash"
→ 保存后执行codex restart强制重载模型
【必须重启,仅修改配置不生效】
推理强度档位必须匹配模型特性
模型变了,推理强度参数却还套用旧逻辑,会放大延迟。比如对v4-flash强行设model_reasoning_effort = high,它会主动展开三层嵌套思维链,而该模型在medium档已能覆盖92%的日常开发路径。
方法一:CLI快速切换
执行codex config set model_reasoning_effort medium
方法二:手动编辑配置
通过本地 Codex 或 OpenClaw OAuth 凭证直接调用 ChatGPT/Codex Responses 的 image_generation 工具来生成或编辑光栅图像,然后保存
在config.rs中定位到model_reasoning_effort行,将字符串值从"high"改为"medium"
这一步操作起来很简单,直接把文件拖进去就行。
避免模型与技能加载冲突
第一步:检查当前加载的技能列表
运行codex skills list,观察输出中是否有gpt-toolkit或openai-ext类技能
第二步:卸载与当前模型不兼容的技能
→ 执行codex skills uninstall gpt-toolkit
→ 执行codex skills uninstall openai-ext
第三步:安装适配v4-flash的轻量技能集
→ 运行codex skills install deepseek-core
【gpt-toolkit与v4-flash共存会导致模型路由错乱,强制降级为CPU软解】

















