用微信「文案提取大神」小程序、水印云网页版、叮咚录音APP或ffmpeg+Whisper命令行,可免费、免安装、不上传隐私地将视频语音转文字,需注意链接公开性、开启降噪与标点、选用合适模型。

想把视频里的声音转成文字,又不想花钱买会员、不折腾安装、不上传隐私文件到云端——用免费工具就能做到,关键是要选对入口、避开识别陷阱、控制好音频质量。
微信里点开就用:文案提取大神小程序
第一步:微信顶部搜索框输入「文案提取大神」,点击进入小程序,无需注册、不用下载APP。
第二步:选择「视频转文字」→ 粘贴短视频链接(如抖音、小红书、B站分享链接),或点击「上传本地视频」选取手机相册里的MP4/MOV文件。
第三步:确认语言为【中文】,点击「开始提取」。AI自动分离人声、过滤背景音乐,3~10秒出稿。
这一步操作起来很简单,直接把链接粘进去就行。注意:【必须是公开可访问的链接,私密合集、未发布草稿、需登录才能看的视频无法解析】。
第四步:预览文本,支持高亮修改错字、长按复制整段、一键导出TXT——导出时不会跳转第三方页面,也不强制关注公众号。
电脑网页端免安装:水印云在线工具
适合处理本地长视频(如网课录屏、会议录像),全程在浏览器完成,不依赖系统权限。
方法一:打开水印云官网 → 进入「视频转文字」模块 → 点击「上传视频」按钮,选取MP4/AVI/MOV等格式文件(单个最大支持2GB)。
方法二:若视频来自网页平台(如YouTube、腾讯视频、爱奇艺),可直接粘贴视频URL链接,系统自动抓取音轨。
上传后选择语言为「中文」或「中英混合」,勾选「智能降噪」和「自动加标点」——这两项默认开启,【关闭它们会导致语气词堆砌、断句混乱,尤其影响口播类视频】。
点击「开始识别」,进度条走完即生成带时间轴的文本,可逐段校对,复制全文或导出TXT/SRT字幕文件。
手机APP本地识别:叮咚录音
适用于采访、课堂录音、临时会议等对隐私要求极高的场景,所有处理都在手机本地完成,音频不上传、模型不联网。
① 下载叮咚录音APP(iOS/Android均上架官方应用商店),打开后点击底部「导入」→ 选择相册中的视频文件。
② 进入识别界面后,先点击右上角「设置」→ 将「识别语言」设为中文、「语速适配」调至「正常」、「是否启用方言模型」根据需要开启(粤语、四川话等需单独下载模型包)。
③ 返回主界面,点击「开始转写」。APP会先提取音频再离线识别,5分钟视频约耗时90秒,期间手机可锁屏运行。
识别完成后,文本按说话人自动分色标注,点击任意一句可跳转对应视频时间点回听——这个功能在多人对话整理时非常关键,避免张冠李戴。
命令行极简方案:ffmpeg + Whisper(仅限Mac/Windows/Linux)
如果你习惯终端操作、追求完全可控的开源流程,且已有Python环境,这条路径最干净。
第一步:安装ffmpeg(官网下载或通过Homebrew/scoop/choco安装)→ 验证是否生效:终端输入 ffmpeg -version,有返回即成功。
第二步:安装Whisper:执行 pip install openai-whisper;再下载中文模型:运行 whisper --model base --language zh --task transcribe sample.mp4,首次会自动拉取base模型(约150MB)。
第三步:提取并识别一体化命令(推荐):whisper input.mp4 --model medium --language zh --output_format txt
medium模型精度比base高约12%,但识别耗时增加约2.3倍;【如果视频含大量专业术语或语速过快,务必用--model large,否则错字率陡升】。
输出的txt文件将保存在当前目录,命名规则为input.txt,内容不含时间戳,纯文本流,适合后续批量处理。

















