必须启用多模态视觉模型并正确配置帧解析参数,才能生成适配视障用户的逐帧旁白脚本;若使用DeepSeek-VL等纯文本或OCR模型,会导致动作误判、脚本失真。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在Windows 11上用Codex对一段30秒短视频做逐帧内容理解,并自动生成适配视障用户的旁白脚本(含对象描述、动作节奏、语音停顿提示),必须绕过默认的“截图+点击”Computer Use模式,启用多模态视觉解析通道。
确认Codex已加载多模态视觉模型
打开Codex桌面客户端 → 点击左下角「设置」→ 进入「模型与插件」→ 查看当前活跃模型名称是否包含“Opus 4.6”或“GPT-5.5”字样;若显示为“DeepSeek-VL”或纯文本模型,则【无法执行画面理解任务】,需先在插件市场启用“Vision Bridge”插件并重启。
这一步不能跳过。DeepSeek类模型仅调用OCR识别图中文字,会把“女主转身推门”误判为“门上有‘Exit’字样”,导致旁白脚本完全失真。
上传视频并触发逐帧分析指令
方法一:拖拽式上传
直接将MP4文件拖入Codex对话框空白区 → 等待右下角出现“✅ 已解析为287帧”提示(非“✅ 已上传”)→ 输入指令:
“请按时间码顺序,逐帧描述画面主体、空间关系、动作起止点,并标注需朗读的语音停顿位置(用|符号标出),输出为Markdown表格。”
通过本地 Codex 或 OpenClaw OAuth 凭证直接调用 ChatGPT/Codex Responses 的 image_generation 工具来生成或编辑光栅图像,然后保存
方法二:命令行强制帧采样
若拖拽后无帧数提示,说明视频被当作单张封面图处理。此时需在指令开头加:
“/frame_rate 30 /skip_audio true /describe_every_frame true ——”再接上述描述要求。该参数强制Codex以30fps解码,跳过音频轨道,避免因音画不同步导致帧定位偏移。
导出旁白脚本并适配Narrator引擎
第一步:复制Codex生成的Markdown表格 → 粘贴至记事本
第二步:用查找替换功能,将所有“|”替换为“
第三步:在每行开头插入 Narrator 兼容标签:
“
第四步:保存为 .narr 文件(例如:scene1.narr)
第五步:按下 Win + Ctrl + Enter 启动旁白 → 按 Ctrl + Shift + U 打开Narrator Quick Start → 选择「打开文档」→ 导入该.narr文件
注意:Narrator不识别Markdown表格结构,必须转为纯语音流标签格式,否则会把“镜号|动作|时长”整行朗读出来,失去分镜节奏感。

















