核心难点是未预处理导致漏决策、混发言人、塞静音;需Audacity降噪裁静音导出16kHz WAV,分两轮调用Gemini:先逐字转录(标姓名/术语),再结构化输出纪要与Action Item。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

处理长达一小时的会议录音,核心难点不是模型听不完,而是Gemini在未预处理、未分步执行、未结构约束时,会漏掉关键决策点、混淆张伟和李敏的发言、把37分钟静音当有效内容塞进上下文——这直接导致行动项丢失、责任人错配、截止日模糊。
音频预处理:裁静音+降噪+导出WAV
用Audacity打开原始录音→点击“效果”→“降噪”,先选取0.5秒纯环境噪音段→点击“获取噪声特征”→再全选波形→再次进入“降噪”,勾选“自动匹配降噪强度”→应用。
接着全选波形→点击“效果”→“裁剪静音”,将“阈值”设为-45 dB,“最小长度”设为0.6秒。这一步很关键:【不裁静音会导致模型把37分钟无效空白塞进上下文,直接挤占对真实发言的理解空间】。
导出时选“文件”→“导出”→“导出为WAV”,采样率强制设为16000 Hz,位深度选16位。MP3虽支持,但WAV在Gemini 3.1 Pro中识别准确率平均高11%。
分两轮调用:先转录,再总结
第一轮只做一件事:干净转录。上传预处理后的WAV文件,在输入框粘贴提示词:
请逐字转录这段会议录音,严格按时间顺序排列;每轮发言前标注[张伟]、[李敏]等真实姓名(若上下文可推断);保留所有技术术语原貌,如“RAG流程”“SOP灰度发布”;不添加解释、不合并重复句、不修正口误。
第二轮必须新建对话窗口(避免上下文污染),把上一轮输出的完整转录文本全部复制粘贴进去,再输入:
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
请基于以上转录内容,生成结构化会议纪要,含:①会议基本信息(时间/主持人/主题);②议题分组(每个议题下写清各方立场+分歧点);③决议事项(仅列已拍板结论,标注责任人和明确截止日);④Action Item列表(格式:[王磊] - 拆分API权限模块 - 6月10日前);⑤遗留问题(未达成共识项,标★)。
三种直连调用方式(国内免翻)
方法一:网页端直传
访问ai.rsk.cn → 登录 → 选择“Gemini 3.1 Pro”模型 → 点击输入框旁“+”图标上传WAV文件 → 粘贴分步提示词 → 发送。
方法二:安卓端边录边析(适合现场轻量会)
打开Gemini安卓App → 点击底部话筒开始录音 → 录到关键决策点时,暂停→输入:“提取当前已录内容中的所有带‘必须’‘本周内’‘由XX负责’字样的句子”→继续录→结束时再发指令:“整合全部录音内容,输出完整会议纪要,按议题分段,每段标注核心结论”。
方法三:RskAi平台函数调用(需开发对接)
调用/api/v1/chat/completions接口,body中设置"model": "gemini-3.1-pro",file_id字段传入已上传音频的ID,messages中嵌入结构化system prompt与user指令。注意:单次请求最大支持2GB文件,但实测超45分钟WAV建议分片上传以保稳定性。
交叉校验:锁定时间戳、术语与插话片段
第一步:打开Gemini返回的纪要,定位任意一条Action Item,例如“[陈芳] - 更新测试用例文档 - 6月12日前”。
第二步:回到原始转录文本,用Ctrl+F搜索“测试用例文档”,找到该句出现的上下文段落,确认前后是否有“陈芳”明确承诺、“6月12日”是否被口头说出而非模型臆断。
第三步:对术语如“灰度发布”“LoRA微调”,检查转录原文是否拼写一致;若发现“灰度布署”“Lora微调”,立即在新对话中输入:“请将全文中所有‘布署’统一替换为‘部署’,所有‘Lora’统一替换为‘LoRA’,并校验发音相近词如‘洛拉’‘罗拉’是否误写”。

















