VibeKnow可快速克隆人声音色并生成AI配音,支持网页端即用:上传15–40秒干净音频建模→粘贴文案生成MP3→一键同步至视频并加字幕。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用VibeKnow把一段30秒的日常说话录成专属AI配音,直接配进教学视频或口播短视频里,不用买麦克风、不用剪辑软件、不折腾代码——它支持网页端即开即用,上传音频后1分钟内生成音色,粘贴文案就能导出MP3。
上传人声样本建模
打开vibeknow.ai官网,点击首页【Voice Clone】按钮,无需注册直接进入克隆页。
点击【Upload Audio】,选择一段你本人朗读的15–40秒干净音频。必须是单声道WAV或MP3,采样率16kHz或44.1kHz;【不能含键盘敲击、空调低频嗡鸣、回声或背景音乐】,否则模型会把噪音当特征学进去,生成语音带明显“嘶嘶”底噪。
上传后页面自动显示波形图,确认语音段落连续无静音断点,点击【Start Cloning】。
等待约45秒,页面弹出“Voice Ready”,音色已存入你的浏览器本地缓存,关闭网页也不丢失。
输入文案生成配音音频
在下方文本框中粘贴你要配音的文案,比如“这个函数的作用是批量处理Excel表格中的空值”。
下拉选择刚生成的音色名称(默认显示为“Cloned Voice #1”),语速保持1.0x,情绪选“Neutral”。
点击【Generate Speech】,12秒后播放预览——注意听“Excel”“空值”等专业词是否发音准确;若“空值”被读成“kōng zhí”而非“kòng zhí”,说明样本里没出现过第四声重音词,需补录一句含“kòng”的新样本重新建模。
满意后点击【Download MP3】,文件自动保存到电脑默认下载目录。
一键匹配已有视频画面
方法一:网页端直连视频合成
点击顶部导航栏【Video Sync】→【Upload Video】,上传你的MP4素材(建议≤60秒、分辨率1080p)→在下方文本框粘贴同一段配音文案→音色自动匹配刚才克隆的声音→勾选“Auto-align audio to speech rhythm”→点击【Sync & Export】,3分钟后生成带配音+时间轴字幕的成品MP4。
方法二:导入剪映/PR对轨
下载好的MP3拖进剪映时间轴音频轨道→选中视频素材→点击底部【文本】→【智能字幕】→【识别字幕】→系统自动按MP3语音节奏生成时间轴→手动微调字幕位置即可导出。
这一步操作起来很简单,直接把文件拖进去就行。


















