WorkBuddy通过Skill机制集成TTS服务实现自然语音合成,推荐按场景选方案:日常用Edge-TTS或IndexTTS2,定制音色用MiniMax或FishAudio,隐私敏感用CosyVoice;安装后需配置API Key,并调参语速、情感、读音以提升自然度;支持右键朗读、语音播报回复及MP3导出。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WorkBuddy 本身不内置语音合成模型,但能通过技能(Skill)机制无缝集成高质量TTS服务,实现自然语音合成。关键不在“用哪个模型”,而在于“怎么选+怎么配+怎么调”。下面直接讲清楚实操路径。
选对TTS方案:本地、云API、还是声音克隆?
自然度取决于音源质量与适配场景,不是越贵越好:
- 日常旁白/短视频口播:推荐 Edge-TTS(Windows原生)或 IndexTTS2。Edge-TTS免费、免密、中文语调自然,适合快速试错;IndexTTS2支持声音克隆,克隆5秒真人录音就能生成带情绪的配音,适合IP化内容。
- 需定制音色/品牌声线:MiniMax 或 FishAudio。MiniMax 中文发音清晰、节奏稳,API响应快,适合批量生成;FishAudio 克隆效果更细腻,支持多情感标签(如“亲切”“权威”“紧迫”),适合客服播报或虚拟角色。
- 重视隐私/离线使用:CosyVoice(阿里开源)可本地部署,无需上传文本,适合财务、法务等敏感场景;但需中等GPU(如RTX 3060以上)和Python环境,部署略耗时。
在WorkBuddy里装上语音合成技能
以最常用的 IndexTTS2 为例(企业会员可用):
- 访问官网 indextts.xin 获取企业账号和 API Key(一串以字母数字组成的密钥)
- 打开 WorkBuddy,输入指令:/install-skill
- 选择「导入 ZIP 文件」,上传官方提供的 indextts2-tts.zip(下载地址见技能页)
- 安装后,在设置 → 技能管理中启用该技能,并粘贴你的 API Key
- 测试:输入“用温柔女声读‘今天天气真好’”,看是否返回音频播放按钮
让语音真正“自然”:三个关键调参点
光装上不够,自然语音藏在细节里:
- 语速与停顿:在提示词末尾加说明,例如“语速放慢10%,在逗号后停顿0.3秒”,比单纯调参数更可控
- 情感倾向:IndexTTS2 和 MiniMax 都支持 emotion 参数,写明“带笑意”“略带惊讶”“沉稳播报”,模型会自动匹配韵律
- 人名/术语读音:遇到“SQL”“GitHub”“吴彦祖”等易错词,用拼音标注,如“SQL(读作 S-Q-L)”“吴彦祖(wú yàn zǔ)”,避免机械误读
一键触发朗读:不只是“生成音频”
WorkBuddy 支持两种轻量级语音交互方式,无需额外开发:
- 文字转语音快捷操作:选中一段文案 → 右键菜单出现「?朗读」选项 → 点击即播(底层调用系统TTS或已配置的Skill)
- 对话式语音回复:在设置中开启“语音播报回复”,当AI生成答案后,自动合成语音并播放,适合边听边做其他事
- 导出为MP3文件:生成语音后,点击播放器下方「下载」图标,保存为标准MP3,可直接导入剪映、Premiere等剪辑软件


















