OpenClaw 实时语音助手。通过可配置的 STT(Deepgram 或 ElevenLabs)将麦克风音频流发送给 OpenClaw 代理,再通过可配置的 TTS(Deepgram Aura 或 ElevenLabs)返回语音。全流程流式传输,首音延迟低于 2 秒。
语音助理 : 您的 OpenClaw 代理的实时语音接口
功能概述
语音助理 : 您的 OpenClaw 代理的实时语音接口是一项面向实际任务的技能,主要用于与您的代理交谈并听到其响应 —— 由可配置的 STT 和 TTS 提供商, 在每个阶段全流, 以及 sub-2 se。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
核心要点
- 使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。
- 该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。
- 从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。
使用与执行
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
结果检查与注意事项
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
语音助手
为您的 OpenClaw agent 提供实时语音接口。与您的 agent 对话,并即时听到其语音回复 —— 支持可配置的 STT(语音转文本)和 TTS(文本转语音)服务提供商,全链路流式处理,首段音频延迟低于 2 秒。
架构
浏览器麦克风 → WebSocket → STT(Deepgram / ElevenLabs)→ 文本 → OpenClaw 网关(/v1/chat/completions,流式响应)→ 响应文本 → TTS(Deepgram Aura / ElevenLabs)→ 音频分块 → 浏览器扬声器
该语音接口连接至您正在运行的 OpenClaw 网关所暴露的 OpenAI 兼容端点。它使用的是同一套 agent,具备全部上下文、工具与记忆能力,仅新增了语音交互能力。
快速开始
cd {baseDir}
cp .env.example .env
# 填写您的 API 密钥和网关 URL
uv run scripts/server.py
# 打开 http://localhost:7860 并点击麦克风按钮
支持的服务提供商
STT(语音转文本)
| 提供商 | 模型 | 延迟 | 说明 |
|---|---|---|---|
| Deepgram | nova-2(流式) | 约 200–300ms | WebSocket 流式传输,准确率与速度综合表现最佳 |
| ElevenLabs | Scribe v1 | 约 300–500ms | 基于 REST,多语言支持良好 |
TTS(文本转语音)
| 提供商 | 模型 | 延迟 | 说明 |
|---|---|---|---|
| Deepgram | aura-2 | 约 200ms | WebSocket 流式传输,成本较低 |
| ElevenLabs | Turbo v2.5 | 约 300ms | 语音质量最优,支持流式输出 |
配置
所有配置均通过 .env 文件中的环境变量完成:
# === 必需项 === OPENCLAW_GATEWAY_URL=http://localhost:4141/v1 # 您的 OpenClaw 网关地址 OPENCLAW_MODEL=claude-sonnet-4-5-20250929 # 网关路由所用模型 # === STT 提供商(二选一)=== VOICE_STT_PROVIDER=deepgram # 可选 "deepgram" 或 "elevenlabs" DEEPGRAM_API_KEY=your-key-here # 若 STT=deepgram,则必需 ELEVENLABS_API_KEY=your-key-here # 若 STT=elevenlabs,则必需 # === TTS 提供商(二选一)=== VOICE_TTS_PROVIDER=elevenlabs # 可选 "deepgram" 或 "elevenlabs" # 使用与上述相同的 API 密钥 # === 可选调优项 === VOICE_TTS_VOICE=rachel # ElevenLabs 语音名称/ID VOICE_TTS_VOICE_DG=aura-2-theia-en # Deepgram Aura 语音标识 VOICE_VAD_SILENCE_MS=400 # 转换轮次前的静音阈值(毫秒) VOICE_SAMPLE_RATE=16000 # 音频采样率 VOICE_SERVER_PORT=7860 # 服务端口 VOICE_SYSTEM_PROMPT="" # 可选:系统提示词覆盖
服务提供商组合方案
| 配置方案 | 适用场景 |
|---|---|
| Deepgram STT + ElevenLabs TTS | 语音输出质量最优 |
| Deepgram STT + Deepgram TTS | 端到端延迟最低,单一供应商集成 |
| ElevenLabs STT + ElevenLabs TTS | 多语言支持最佳 |
工作原理
- 浏览器采集麦克风音频:通过 Web Audio API 获取原始 PCM 音频,并经由 WebSocket 实时流式上传
- 服务端接收音频:将音频流转发至所配置 STT 提供商的流式接口
- STT 实时返回片段化文本:在用户语句结束时,将完整文本发送至 OpenClaw 网关
- OpenClaw 网关流式响应:通过 SSE(Server-Sent Events)逐 token 流式返回 LLM 响应
- 分句累积并转发至 TTS:将响应 tokens 按句子粒度切分后,流式提交给 TTS 提供商
- TTS 返回音频分块:生成的音频分块立即通过同一 WebSocket 转发至浏览器
- 浏览器播放音频:使用 Web Audio API 播放,并内置抖动缓冲区(jitter buffer)保障流畅性
中断处理(Barge-In)
当用户在 agent 正在说话时开始发言:
- 当前 TTS 音频立即中止
- agent 停止当前响应流程
- 新建 STT 会话,开始捕获用户的中断语音
使用示例
用户:"嘿,帮我配置语音助手"
→ OpenClaw 执行:cd {baseDir} && cp .env.example .env
→ 自动打开 .env 文件,提示用户填写 API 密钥
→ 执行:uv run scripts/server.py
用户:"启动语音聊天"
→ 在浏览器中打开 http://localhost:7860
用户:"切换 TTS 到 Deepgram"
→ 将 .env 中 VOICE_TTS_PROVIDER 修改为 deepgram
→ 重启服务端
故障排查
- 无音频输出? 请确认 TTS API 密钥有效,且服务提供商配置正确
- 延迟过高? 建议 STT 和 TTS 均使用 Deepgram;同时确保网关与客户端处于同一网络环境
- 语音被意外截断? 将
VOICE_VAD_SILENCE_MS增加至 600–800ms - 存在回声或啸叫? 建议佩戴耳机,或在浏览器 UI 中启用内置回声消除功能
延迟预算
| 阶段 | 目标延迟 | 实际延迟(典型值) |
|---|---|---|
| 音频采集 + VAD | <200ms | 约 100–150ms |
| STT 转录 | <400ms | 约 200–400ms |
| OpenClaw LLM 首 token | <1500ms | 约 500–1500ms |
| TTS 首音频分块 | <400ms | 约 200–400ms |
| 首段音频总延迟 | <2.5s | 约 1.0–2.5s |
热门AI工具
相关专题
本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。
0
2026.09.30
本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。
0
2026.09.30
本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。
0
2026.09.30
需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。
0
2026.09.30
PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。
0
2026.09.29
本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。
0
2026.09.23
本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。
0
2026.09.23
本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。
0
2026.09.23
本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。
0
2026.09.22
热门下载
相关下载
精品课程
共6课时 | 12万人学习
共79课时 | 161万人学习
共6课时 | 54.6万人学习