Nova AI能真正实现多模态融合理解,通过上传会议录像、PDF纪要和录音MP3可自动对齐时间戳、提取矛盾点并生成带时间节点的决策清单;支持视频+文本、音频独立、图文+视频跨模态联动测试,准确率高但受限于格式与分辨率。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要验证Nova AI是否真能同时吃透文字、声音和画面,而不是只在宣传稿里“支持多模态”,就得亲手上传混搭素材——比如一段带字幕的会议录像、配套的会议纪要PDF、还有现场录音MP3,看它能不能自动对齐时间戳、提取矛盾点、生成带时间节点的决策清单。
测试文本+视频联合理解能力
打开鸿蒙版文心App,进入主对话界面→点击右下角“+”图标→选择“上传视频”→从相册选取一段10分钟以内的带说话人字幕的会议录像(注意:必须是MP4或MOV格式,AVI不识别)。
视频上传完成后,直接输入指令:“对比视频里张经理说的预算数字和附件PDF里的书面预算,标出所有不一致的地方,并按时间顺序列出。”
系统会在15秒内返回图文报告,含时间戳截图+红框标注差异项+PDF原文段落引用。若视频无内嵌字幕,AI会先调用语音转文字模块再比对,耗时延长约8~12秒,但准确率仍高于人工听写校对。
验证音频独立解析深度
方法一:在对话框长按麦克风按钮,实时说出30秒以上完整语句,例如“上周三下午三点在3号会议室讨论的客户投诉处理方案,重点有三条:第一…第二…第三…”
方法二:点击“+”→选择“音频文件”→上传一段WAV或M4A格式的会议录音(时长建议2~8分钟,过长会触发分段处理限制)。
【音频文件必须包含清晰人声,背景音乐超过-15dB会导致关键词漏识别】
发送后立刻追问:“把刚才音频里提到的所有待办事项,按负责人姓名归类,生成表格。”AI将输出带姓名列、任务列、截止日预估列的可复制表格,字段间自动补全逻辑关系(如“李工负责调试→需等王经理提供接口文档→预计7月12日前完成”)。
实测图文+视频跨模态联动
第一步:在对话界面连续上传三样东西——1张产品设计草图照片、1段2分钟的产品演示视频、1份Word版功能需求文档。
第二步:输入指令:“找出视频里演示的操作步骤,对照需求文档逐条确认是否全部实现;没实现的,在草图上用箭头标出应增加的UI控件位置。”
第三步:等待约20秒,查看返回结果——AI会生成一张合成图:原草图上叠加半透明箭头与文字标注,同时附带表格说明每处标注对应的需求条款编号和视频时间点。
这一步失败率集中在草图分辨率低于300dpi时,此时AI会误判线条为噪点而忽略关键区域;建议上传前用手机自带编辑工具放大至1200×1600像素再保存。


















