讲师中心 微信公众号
AI工具推荐 视频效率加速

Voice Assistant

Polar Sponsor
爱发电 赞助
.NET 9.0

OpenClaw 实时语音助手。通过可配置的 STT(Deepgram 或 ElevenLabs)将麦克风音频流发送给 OpenClaw 代理,再通过可配置的 TTS(Deepgram Aura 或 ElevenLabs)返回语音。全流程流式传输,首音延迟低于 2 秒。

语音助理 : 您的 OpenClaw 代理的实时语音接口

功能概述

语音助理 : 您的 OpenClaw 代理的实时语音接口是一项面向实际任务的技能,主要用于与您的代理交谈并听到其响应 —— 由可配置的 STT 和 TTS 提供商, 在每个阶段全流, 以及 sub-2 se。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。

核心要点

  • 使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。
  • 该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。
  • 从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。

使用与执行

实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。

结果检查与注意事项

执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。

语音助手

为您的 OpenClaw agent 提供实时语音接口。与您的 agent 对话,并即时听到其语音回复 —— 支持可配置的 STT(语音转文本)和 TTS(文本转语音)服务提供商,全链路流式处理,首段音频延迟低于 2 秒。

架构

浏览器麦克风 → WebSocket → STT(Deepgram / ElevenLabs)→ 文本
  → OpenClaw 网关(/v1/chat/completions,流式响应)→ 响应文本
  → TTS(Deepgram Aura / ElevenLabs)→ 音频分块 → 浏览器扬声器

该语音接口连接至您正在运行的 OpenClaw 网关所暴露的 OpenAI 兼容端点。它使用的是同一套 agent,具备全部上下文、工具与记忆能力,仅新增了语音交互能力。

快速开始

cd {baseDir}
cp .env.example .env
# 填写您的 API 密钥和网关 URL
uv run scripts/server.py
# 打开 http://localhost:7860 并点击麦克风按钮

支持的服务提供商

STT(语音转文本)

提供商 模型 延迟 说明
Deepgram nova-2(流式) 约 200–300ms WebSocket 流式传输,准确率与速度综合表现最佳
ElevenLabs Scribe v1 约 300–500ms 基于 REST,多语言支持良好

TTS(文本转语音)

提供商 模型 延迟 说明
Deepgram aura-2 约 200ms WebSocket 流式传输,成本较低
ElevenLabs Turbo v2.5 约 300ms 语音质量最优,支持流式输出

配置

所有配置均通过 .env 文件中的环境变量完成:

# === 必需项 ===
OPENCLAW_GATEWAY_URL=http://localhost:4141/v1    # 您的 OpenClaw 网关地址
OPENCLAW_MODEL=claude-sonnet-4-5-20250929        # 网关路由所用模型

# === STT 提供商(二选一)===
VOICE_STT_PROVIDER=deepgram                      # 可选 "deepgram" 或 "elevenlabs"
DEEPGRAM_API_KEY=your-key-here                   # 若 STT=deepgram,则必需
ELEVENLABS_API_KEY=your-key-here                 # 若 STT=elevenlabs,则必需

# === TTS 提供商(二选一)===
VOICE_TTS_PROVIDER=elevenlabs                    # 可选 "deepgram" 或 "elevenlabs"
# 使用与上述相同的 API 密钥

# === 可选调优项 ===
VOICE_TTS_VOICE=rachel                           # ElevenLabs 语音名称/ID
VOICE_TTS_VOICE_DG=aura-2-theia-en              # Deepgram Aura 语音标识
VOICE_VAD_SILENCE_MS=400                         # 转换轮次前的静音阈值(毫秒)
VOICE_SAMPLE_RATE=16000                          # 音频采样率
VOICE_SERVER_PORT=7860                           # 服务端口
VOICE_SYSTEM_PROMPT=""                           # 可选:系统提示词覆盖

服务提供商组合方案

配置方案 适用场景
Deepgram STT + ElevenLabs TTS 语音输出质量最优
Deepgram STT + Deepgram TTS 端到端延迟最低,单一供应商集成
ElevenLabs STT + ElevenLabs TTS 多语言支持最佳

工作原理

  1. 浏览器采集麦克风音频:通过 Web Audio API 获取原始 PCM 音频,并经由 WebSocket 实时流式上传
  2. 服务端接收音频:将音频流转发至所配置 STT 提供商的流式接口
  3. STT 实时返回片段化文本:在用户语句结束时,将完整文本发送至 OpenClaw 网关
  4. OpenClaw 网关流式响应:通过 SSE(Server-Sent Events)逐 token 流式返回 LLM 响应
  5. 分句累积并转发至 TTS:将响应 tokens 按句子粒度切分后,流式提交给 TTS 提供商
  6. TTS 返回音频分块:生成的音频分块立即通过同一 WebSocket 转发至浏览器
  7. 浏览器播放音频:使用 Web Audio API 播放,并内置抖动缓冲区(jitter buffer)保障流畅性

中断处理(Barge-In)

当用户在 agent 正在说话时开始发言:

  • 当前 TTS 音频立即中止
  • agent 停止当前响应流程
  • 新建 STT 会话,开始捕获用户的中断语音

使用示例

用户:"嘿,帮我配置语音助手"
→ OpenClaw 执行:cd {baseDir} && cp .env.example .env
→ 自动打开 .env 文件,提示用户填写 API 密钥
→ 执行:uv run scripts/server.py

用户:"启动语音聊天"
→ 在浏览器中打开 http://localhost:7860

用户:"切换 TTS 到 Deepgram"
→ 将 .env 中 VOICE_TTS_PROVIDER 修改为 deepgram
→ 重启服务端

故障排查

  • 无音频输出? 请确认 TTS API 密钥有效,且服务提供商配置正确
  • 延迟过高? 建议 STT 和 TTS 均使用 Deepgram;同时确保网关与客户端处于同一网络环境
  • 语音被意外截断? 将 VOICE_VAD_SILENCE_MS 增加至 600–800ms
  • 存在回声或啸叫? 建议佩戴耳机,或在浏览器 UI 中启用内置回声消除功能

延迟预算

阶段 目标延迟 实际延迟(典型值)
音频采集 + VAD <200ms 约 100–150ms
STT 转录 <400ms 约 200–400ms
OpenClaw LLM 首 token <1500ms 约 500–1500ms
TTS 首音频分块 <400ms 约 200–400ms
首段音频总延迟 <2.5s 约 1.0–2.5s
目录

热门AI工具

更多
咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

0

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

0

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

0

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

0

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

0

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn