ToClaw语音控制通过nanobot对接+Whisper.cpp本地ASR+OpenClaw技能映射+Edge-TTS反馈实现闭环。需配置nanobot通信、部署中文Whisper模型、定义指令动作映射、启用离线TTS,并按序启动多进程服务栈。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望摆脱键盘鼠标依赖,仅通过语音指令完成电脑操作,则可能是由于现有交互方式在特定场景下存在物理限制。以下是实现ToClaw语音控制的具体路径:
一、配置ToClaw核心服务与nanobot对接
ToClaw作为ToDesk的AI增强层,需与nanobot建立稳定通信以解析语音意图并触发系统动作。该步骤确保语音输入能被准确转化为可执行指令流。
1、以管理员权限打开PowerShell,执行全局安装命令:npm install -g toclaw @qingchencloud/nanobot
2、运行初始化向导:toclaw onboard --mode VoiceControl
3、在生成的~/.toclaw/config.json中启用nanobot通道,并将端口设为18790,同时开启voiceFeedback选项
4、确认Windows系统中“设置 > 隐私与安全 > 麦克风”已授予toclaw和nanobot应用访问权限
二、部署本地Whisper.cpp语音识别引擎
使用Whisper.cpp替代云端ASR服务,可消除网络延迟与隐私泄露风险,同时适配ToClaw的低延迟语音控制需求。
1、从GitHub releases下载对应平台的Whisper.cpp预编译二进制文件(推荐whisper.cpp-v1.18.0-win-x64.zip)
2、解压至%USERPROFILE%.toclawengineswhisper目录
3、在~/.toclaw/config.json中添加语音识别配置段:{"asr": {"engine": "whisper-cpp", "model": "ggml-base-zh.bin", "beam_size": 5}}
4、将中文优化模型ggml-base-zh.bin放入engines/whisper/models/子目录
三、定义语音指令到OpenClaw动作的映射规则
ToClaw本身不直接执行系统操作,而是通过调用OpenClaw技能模块完成底层控制。该步骤建立自然语言指令与具体操作之间的确定性绑定。
1、在~/.toclaw/skills/voice_commands/index.js中编写指令解析逻辑
2、为“打开微信”指令添加映射:{ "pattern": "打开微信", "action": "open_app", "params": { "app": "WeChat" } }
3、为“截取当前屏幕”添加映射:{ "pattern": "截取当前屏幕", "action": "screenshot", "params": { "save_to": "%USERPROFILE%\Pictures\Screenshots\" } }
4、保存后执行toclaw reload skills使新规则生效
四、启用离线TTS语音反馈模块
为形成完整人机闭环,需在无网络环境下提供操作结果的语音播报。Edge-TTS本地化封装可满足此要求,且避免调用外部API。
1、安装Edge-TTS Python包:pip install edge-tts
2、在~/.toclaw/config.json中配置TTS参数:{"tts": {"engine": "edge-tts", "voice": "zh-CN-XiaoxiaoNeural", "rate": "1.2"}}
3、验证TTS可用性:运行toclaw tts "测试语音反馈正常"
4、确保系统声音输出设备已正确选择,且音量未被静音
五、启动多进程协同服务栈
ToClaw语音控制系统由多个独立进程协同工作,必须按特定顺序启动以保障依赖关系正确建立。
1、先启动nanobot服务:nanobot --port 18790 --model qwen3-4b-instruct
2、再启动Whisper.cpp监听进程:whisper-cpp --port 18791 --threads 4
3、最后启动ToClaw主服务:toclaw start --no-browser
4、观察终端日志中是否连续出现[ASR] Ready、[NANOBOT] Connected、[OPENCLAW] Skills loaded三类就绪标识


















