WorkBuddy支持实时录音、本地音频导入、文字稿再处理三类语音输入方式;优先推荐文字稿以提升准确率;所有输入均通过自然语言指令触发结构化纪要生成,并支持预览编辑、重生成优化及多格式导出。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WorkBuddy 的语音模型不单独存在,它作为 WorkBuddy 客户端内置的本地语音识别与语义理解模块,直接集成在“会议”功能中。你不需要调用模型、设置参数或切换语音版本——只要提供音频文件或开启实时录音,系统自动启用高质量语音处理链路,完成转写+结构化提炼一体化输出。
支持哪几种语音输入方式
WorkBuddy 当前支持三类语音源,对应不同使用场景:
- 实时录音转写:适合站会、同步会等需当场出纪要的场景。点击“会议”→“+新建会议”→选择“开启实时录音”,授予权限后即开始逐句转写并自动标注发言人;
- 本地音频导入:适用于已有 MP3/WAV/M4A 录音(如手机录的会议、远程会议保存的本地音频)。路径需为英文(如 D:\WB_Audio\),导入后点击“开始转写”,完成后点“生成纪要”;
- 语音转文字稿再处理:推荐用于高准确率需求场景。先用讯飞听见、通义听悟或腾讯会议自带转写生成 UTF-8 编码的 .txt/.md 文稿,再拖入 WorkBuddy 或粘贴文本+指令处理。
为什么建议优先用文字稿而非直接丢音频
虽然 WorkBuddy 支持本地处理音频,但实际效果受几个关键因素影响:
使用 draw.io(.drawio 格式)和 SVG 生成兼容 Microsoft Visio 的架构图。当用户需要以下任一场景时触发: - 用于 Visio 或技术文档的架构/系统/网络图 - 带连接标注的分层控制系统图 - 将 draw.io XML 转换为稳定、可嵌入的 SVG - 修复 Visio 或 draw.io 无法打开的故障排查类图表 - 任何需专业级布局且文本可编辑的图表
- 录音质量差(背景杂音大、多人重叠说话)时,声纹分离可能不准,导致发言人错标;
- 口音重、专业术语多、中英混杂的会议,纯语音识别易漏关键人名/数字/时间节点;
- 本地沙箱处理虽保障隐私,但不联网意味着无法调用云端增强模型,长会议(>90分钟)可能出现断句偏差。
所以官方明确建议:重要会议务必先用会议平台或专业工具生成文字稿,再交由 WorkBuddy 做结构化提炼——这步拆分能显著提升纪要可用性。
一句话触发语音相关纪要生成
无论你用哪种语音源,最终生成纪要都靠自然语言指令。常用模板如下(复制粘贴即可):
- 对已导入的音频:请分析 D:\WB_Audio\weekly_meeting.mp3,提取参会人、会议时间、核心议题、决议事项和待办任务,生成含标题、日期、参会人、议题摘要、决议、待办(含负责人/截止日)六部分的标准会议纪要 Word 文档。
- 对粘贴的文字稿:把上面这段会议文字整理成纪要,按三部分输出:会议结论(3–5条)、待办事项(表格含事项/负责人/截止时间)、遗留问题。
- 对实时录音后的记录:根据当前会议记录,生成正式纪要,要求带【决策】标签的结论项和带责任人字段的待办清单,导出为 Markdown。
生成后还能怎么优化
WorkBuddy 输出不是终点,而是可编辑起点:
- 预览界面中可直接修改负责人、调整截止时间、删减冗余讨论;
- 点击“重新生成”并追加要求,比如:“把待办事项按优先级排序”“补充每项的预期交付物”“改成向领导汇报的简洁版”;
- 导出格式支持 Markdown / Word / PDF,Word 版自动适配公司常用标题层级与表格样式;
- 若一次没出全(如文字超长被截断),补一句“合并以上全部内容,生成完整纪要”即可重排。

















