讲师中心 微信公众号
AI工具推荐 视频效率加速

MOSS-TTSD— 清华实验室开源的口语对话语音生成模型

秋萱酱_4140

秋萱酱_4140

发布时间:2025-07-09 14:22:16

|

946人浏览过

|

来源于php中文网

原创

moss-ttsd(text to spoken dialogue)是一款开源的对话语音生成模型,由清华大学语音与语言实验室(tencent ai lab)研发。该模型能够将文本对话脚本转化为自然、富有表现力的口语化语音,并支持中英文双语输出。其基于先进的语义-音学神经网络音频编解码器以及大规模预训练语言模型,利用超过100万小时的单人语音和40万小时的对话语音数据进行训练。具备零样本语音克隆能力,可自动识别并切换对话者角色,适用于ai播客、访谈、新闻播报等多种应用场合。

git-sync
git-sync

全平台统一发布工具。支持 skills 和 agents 的 Gitee/GitHub/ClawHub/SkillHub/PyPI 同步与 Release 创建,LLM 驱动的文件过滤与脱敏。

下载

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

MOSS-TTSD— 清华实验室开源的口语对话语音生成模型MOSS-TTSD的主要功能

  • 高表现力对话语音生成:将对话文本转换为自然流畅、富有情感的语音,准确还原对话中的语气、节奏等细节。
  • 零样本多说话人音色克隆:可根据对话内容自动生成不同说话人的语音,无需额外提供声音样本即可实现两位说话者的音色模拟。
  • 中英双语支持:能够在中文和英文之间自由切换,生成高质量的双语对话语音。
  • 长篇语音生成:借助低比特率编解码器及优化后的训练架构,可一次性生成超长语音内容,避免传统拼接方式带来的不连贯问题。
  • 完全开源且适合商业应用:模型参数、推理代码及API均已公开,允许免费用于商业用途。

MOSS-TTSD的技术原理

  • 基础模型架构:MOSS-TTSD 在 Qwen3-1.7B-base 模型基础上进行持续训练,采用离散语音序列建模方法。通过八层 RVQ(Residual Vector Quantization)码本对语音信号进行离散化处理,将其转化为一系列 token。这些 token 通过自回归结合 Delay Pattern 的方式生成,最终由 Tokenizer 解码器还原为语音波形。
  • 语音离散化与编码器创新:核心组件 XY-Tokenizer 是专为语音设计的离散编码器,采用两阶段多任务学习策略:
    • 第一阶段:通过 ASR 和重建任务联合训练,使编码器在提取语义信息的同时保留粗略的声学特征。
    • 第二阶段:固定编码器和量化层,仅训练解码器部分,通过重建损失与 GAN 损失补充更精细的声学信息。XY-Tokenizer 在 1kbps 比特率和 12.5Hz 帧率下表现出优于其他 Codec 的综合性能。
  • 数据处理与预训练:训练数据包括约100万小时的单人语音和40万小时的对话语音。团队构建了高效的数据流水线,从海量原始音频中筛选出高质量样本并进行标注。此外,还使用110万小时的中英文 TTS 数据对模型进行预训练,显著提升语音的表现力和韵律。
  • 长语音生成能力:得益于超低比特率的 Codec 架构,MOSS-TTSD 可以生成最长960秒的连续语音,实现无缝输出,避免语音片段拼接带来的断续感。

MOSS-TTSD的项目地址

MOSS-TTSD的应用场景

  • AI 播客制作:可生成逼真的对话式语音,广泛应用于AI播客内容创作,模拟真实访谈氛围。
  • 影视配音:支持中英文双语语音生成,具备零样本音色克隆能力,可用于电影、电视剧等作品的对白配音。
  • 长篇访谈语音合成:支持最长960秒的语音连续生成,避免拼接导致的不自然过渡,非常适合用于访谈类节目。
  • 新闻报道:可生成自然流畅的对话式语音,用于新闻播报,增强听众的沉浸感和吸引力。
  • 电商直播:适用于数字人对话带货等电商直播场景,通过生成自然的对话语音吸引用户关注与互动。

热门AI工具

更多
咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

相关专题

更多
FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

0

2026.10.08

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

120

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

100

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

80

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

100

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

300

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

180

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

140

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
vscode手册
vscode手册

共0课时 | 0人学习

Git 教程
Git 教程

共21课时 | 8万人学习

Git版本控制工具
Git版本控制工具

共8课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn