通义千问App支持15秒内拍照识图并实时解析:通过【AI识图】入口调起相机,可直拍或启用增强模式优化手写/低对比识别;文字区域需占画面60%以上;识别后输入指令即可提取结构化信息、复制或追问细节。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用通义千问 App 拍照后立刻识别图中文字、判断场景或提取关键信息,不用先存图再上传,整个过程要在 15 秒内完成,且识别结果要能直接复制或追问细节。
启动拍照识图入口
打开手机上的通义千问 App,确保已登录阿里云账号;若首页未显示“AI识图”按钮,向右滑动底部导航栏,找到并点击【AI识图】图标——这是唯一支持实时拍摄的专用入口,普通聊天框里的“+”按钮仅支持相册选取,无法调起相机。
点击后系统自动请求相机权限,允许即可进入取景界面。
现场拍摄与识别触发
方法一:直接拍摄
对准目标画面(如发票、白板笔记、商品标签),保持手机稳定、光线充足,点击红色快门按钮完成拍摄;照片会自动跳转至识别预览页,无需手动确认上传。
方法二:边拍边调(适合手写体或低对比度场景)
在取景界面左下角点击“增强模式”,开启后屏幕会出现实时对比度/锐化提示;此时再拍摄,系统将优先调用 Qwen2.5-VL 模型进行高鲁棒性解析,对手写连笔、阴影遮挡等干扰更敏感。
【拍摄时务必让文字区域占画面 60% 以上,否则 OCR 区域可能被误判为背景】
输入指令获取结构化结果
第一步:等待右上角出现“识别中…”提示消失,说明图文理解已完成;
第二步:在底部输入框中键入明确指令,例如:“提取所有金额和日期”“把这张会议签到表转成带表头的表格”“图里穿蓝色工装的人有几位?”;
第三步:点击发送,结果将以分段文本+可点击字段形式呈现,关键数值和人名自动高亮;
第四步:长按任意一段结果,弹出菜单选择“复制”或“追问”,比如接着问“把第二行姓名按拼音排序”。


















