天工SkyMusic网页端可快速克隆声音用于配音等场景,1分钟内完成音色克隆与音频导出;需上传15–30秒清晰单声道朗读音频,支持情绪、语速调节及重点词强调。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用天工AI快速克隆自己或他人的声音来做配音、网课、短视频口播,又担心操作复杂、设备门槛高、效果不自然?天工SkyMusic网页端直接可用,无需安装、不占内存、中文人声合成质量高,1分钟内就能完成从音色克隆到音频导出的全流程。
用天工SkyMusic克隆本人声音
这一步适合想保留自己声音特质用于长期内容创作的用户,比如教师录网课、自媒体做口播、客服训练语音样本。必须使用本人清晰朗读的音频,不能用录音笔远距离拾音或带混响的会议室录音。
第一步:打开tiangong.cn官网,点击顶部导航栏【SkyMusic】进入模块,页面自动加载,无需注册即可试用。
第二步:点击【克隆我的声音】→【上传音频】,选择一段15–30秒的纯人声朗读片段(推荐读“今天天气很好,我们一起来学习AI音频处理”这类中性语句),【音频必须为WAV或MP3格式、单声道、采样率44.1kHz或16kHz、无背景音乐与键盘敲击声】。
第三步:上传后系统自动提取声纹特征,约8秒弹出提示“音色建模完成”,点击【命名并保存】,例如填入“张老师-教学音色”,该音色将永久存于你的浏览器本地缓存中。
第四步:在文本输入框键入配音文案,如“欢迎来到本期AI音频入门课”,点击【生成语音】,等待约12秒,播放预览——人声自然度、语调起伏、停顿节奏会高度贴近原始样本。
用天工SkyMusic给图文/视频配音
当你已有图片、PPT或短视频素材,需要匹配一段符合情绪和节奏的AI配音时,这个路径最高效。它不依赖你本人声音,而是从天工内置的40+专业音色库中调用,支持情绪标签控制。
方法一:网页端图文配音
在SkyMusic首页选择【图文转语音】→粘贴文案→下拉选择音色(如“知性女声-温柔坚定”)→勾选【自动断句】→点击【生成】。系统会按语义自动插入0.3秒自然停顿,避免机械感。
方法二:剪辑软件直连配音
生成音频后点击【导出WAV】,下载文件;打开剪映/PR等软件,将WAV拖入时间轴音频轨道,对齐画面节奏即可。注意:【WAV文件自带精确时间戳,但不嵌入字幕轨,需另配SRT】。
调整克隆音色的情绪与语速
天工支持在生成前微调输出表现,不是所有音色都开放全部参数,仅限已克隆成功的自定义音色及部分高阶内置音色。
① 情绪控制:在文案输入框下方点击【情绪调节】,滑动条可选“平静→严肃→欢快→激昂”五档,选“欢快”时系统自动提升基频+加快语速+增强句尾上扬,适合儿童内容;选“严肃”则压低音高、延长词间间隔、弱化语气词。
② 语速微调:默认语速为1.0x,拖动【语速】滑块至0.8x适合知识讲解类内容,1.3x适合短视频快节奏口播;超过1.4x会导致齿音失真、辅音吞字,不建议启用。
③ 重点词强调:在文案中用【】框出关键词,例如“这个功能【非常关键】”,生成时系统会自动加重该词音量并略作停顿,无需后期加音效。


















