应启用音频工具并配置Deepgram或Groq语音识别、开启微信原始音频透传、绑定摘要Skill及事件触发规则,确保audio_transcript事件经转录后调用summarize.text生成限定长度摘要。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在微信中发送语音消息给OpenClaw,但未获得文字转录或摘要回复,则可能是由于音频工具未启用、Deepgram或Groq配置缺失、语言参数未指定,或微信插件未正确处理原始音频流。以下是解决此问题的步骤:
一、启用并配置Deepgram语音转文字
Deepgram提供高精度云端语音识别服务,需显式启用音频工具并绑定有效API密钥,才能将微信语音自动转为结构化文本供后续摘要生成使用。
1、访问Deepgram官网注册账号,进入Dashboard获取以dg_开头的API Key。
2、将该Key写入~/.openclaw/.env文件,格式为:DEEPGRAM_API_KEY=dg_xxx。
3、编辑openclaw.json,定位到tools.media.audio节点,设置"enabled": true,并指定模型与语言:
4、在models数组中添加Deepgram条目,包含"provider": "deepgram"、"model": "nova-3"及"language": "zh"(中文场景)。
5、在providerOptions.deepgram下启用"detect_language": true、"punctuate": true和"smart_format": true三项智能功能。

二、切换至Groq Whisper免费方案
Groq提供每月1000万token免费额度,其Whisper-large-v3模型对中文语音识别准确率高且无需预设语种,适合无稳定网络或规避Deepgram调用限制的本地部署场景。
1、访问Groq官网注册账号,在API Keys页面创建新Key并复制。
2、在~/.openclaw/.env中添加:GROQ_API_KEY=gsk_xxx。
3、修改openclaw.json中tools.media.audio.models,将provider改为"groq",model设为"whisper-large-v3"。
4、确保models.providers.groq节点存在,并填入"apiKey": "${GROQ_API_KEY}"。
5、确认tools.media.audio.enabled为true,且maxFileSize不低于26214400(25MB),以兼容微信长语音。

三、适配微信插件的语音处理路径
微信官方ClawBot插件默认将语音消息先在客户端转为文字再传入OpenClaw,导致原始音频丢失;若需AI直接处理语音波形并生成摘要,必须强制启用原始音频透传模式。
1、检查微信客户端版本:iPhone用户需升级至8.0.70及以上,安卓用户需确认已通过“升级提示”完成后台静默更新。
2、在微信中进入「我」→「设置」→「插件」→「ClawBot」→「高级设置」,开启原始音频上传开关。
监控 OpenClaw GitHub 版本更新,获取最新版本发布说明,翻译成中文, 并推送到 Telegram 和 Feishu。用于:(1) 定时检查版本更新 (2) 推送版本更新通知 (3) 生成中文版发布说明
3、重启OpenClaw服务,确保网关日志中出现audio: raw mode enabled字样。
4、验证是否生效:向OpenClaw发送一段10秒以上中文语音,观察logs/audio/目录下是否生成.wav或.ogg临时文件。
5、若未生成,检查openclaw.json中media.audio.supportedFormats是否包含"ogg"和"wav"。

四、配置摘要生成触发逻辑
语音转文字仅是前置环节,摘要回复需明确指令路径与Skill绑定,否则AI仅返回原文而无提炼行为。
1、确认已启用skills.summarize模块,在openclaw.json中检查"summarize": {"enabled": true}。
2、在workflows节点下新增一条规则,匹配audio_transcript事件类型,动作指向summarize.text Skill。
3、设置摘要长度阈值:在skills.summarize.options中添加"max_length": 120,限制输出不超过120字。
4、为微信通道单独配置摘要模板,在channels.wechat.templates中定义summary_reply字段,内容为:【语音摘要】${summary}。
5、确保微信插件的eventMapping将语音消息映射为audio_transcript而非message.text。
五、验证与调试音频流转链路
端到端语音转摘要依赖多个组件协同,需逐层验证数据是否按预期流动,避免任一环节阻断信号传递。
1、在微信中发送语音后,立即查看OpenClaw终端日志,搜索关键词audio received,确认音频已抵达网关。
2、若日志出现transcribing with deepgram或transcribing with groq,说明转录已启动;若无此行,检查tools.media.audio.enabled是否被覆盖为false。
3、若转录成功但无摘要,搜索summarize invoked,未命中则说明Workflow未触发,需核查事件类型匹配逻辑。
4、手动执行测试命令:openclaw test audio --file test.ogg --provider deepgram,观察是否返回含标点的中文文本。
5、若测试命令失败,检查DEEPGRAM_API_KEY或GROQ_API_KEY环境变量是否在当前Shell会话中生效,可运行echo $DEEPGRAM_API_KEY验证。


















