可借助GLM-TTS生成签名语音、清影图生视频提取音频、或调用Ying与GLM-TTS双API组合实现;三路径均支持导出纯净语音片段用于定制签名语音包。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望为智谱清影生成的数字人定制专属签名语音包,但当前功能未直接提供语音包导出或签名语音封装选项,则可能是由于清影本身聚焦于视频生成而非语音资产打包。以下是实现签名语音包效果的可行路径:
一、使用智谱清言内置GLM-TTS生成签名语音
智谱AI已发布超拟人语音合成模型GLM-TTS,支持高自然度、富感染力的语音输出,可独立用于生成签名语音片段。该模型与清影同属智谱AI技术体系,具备风格一致性基础。
1、打开智谱清言PC端或APP,在首页查找“语音合成”或“GLM-TTS”功能入口。
2、在输入框中键入您希望作为签名的短句,例如“你好,我是智谱清影数字人小智”,确保语句简洁、口语化、无歧义。
3、选择目标音色(如“青年男声”“知性女声”),并调节语速、停顿与情感强度参数,使语音更贴合数字人形象设定。
4、点击生成,等待语音合成完成,随后下载生成的WAV或MP3格式音频文件。
二、通过清影图生视频+语音叠加方式间接生成
清影虽不直接输出纯语音包,但可通过“图片+语音描述”触发视频生成,并从中提取音频轨道,从而获得带签名语义的语音素材。
1、准备一张静态数字人形象图(如半身肖像),确保画面清晰、背景干净。
2、在清影图生视频界面上传该图片,并在提示词中明确加入语音内容指令,例如:“数字人张口说:‘欢迎使用清影,这是我的专属签名’,嘴唇同步动作,高清特写”。
3、选择“电影感”风格与“无背景音乐”选项,避免干扰语音清晰度。
4、生成6秒视频后,使用本地音视频工具(如Audacity或剪映)分离音频轨道,导出纯净语音片段。
三、调用清影(Ying)API结合GLM-TTS API组合构建
面向开发者或高级用户,可通过智谱大模型开放平台bigmodel.cn分别调用清影视频生成能力与GLM-TTS语音合成能力,实现签名语音包的程序化生成与封装。
1、访问https://bigmodel.cn,登录账号并开通Ying与GLM-TTS两个API服务权限。
2、使用GLM-TTS API提交签名文本请求,获取base64编码语音数据,解码保存为标准音频文件。
3、将该音频文件作为音源,传入Ying API的图生视频或文生视频请求体中,指定audio_input字段,驱动数字人唇形与语音精准对齐。
4、接收返回视频后,再次提取音频轨道,验证时长、节奏及发音准确性,确认其满足签名语音包质量要求。

















