MiniMax M3具备原生多模态能力,从预训练第一轮起就让视觉与语言共享同一语义空间,支持跨模态理解与操作。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让AI真正“看懂”一张会议截图里的PPT要点、识别视频中某帧的设备故障特征、或者一边读论文PDF里的公式图一边写对应代码——MiniMax M3的原生多模态能力就是为此设计的,它不是后期拼接文本与图像理解模块,而是从训练第一轮起就让视觉与语言共享同一语义空间。
为什么必须是“原生”多模态
普通多模态模型通常用CLIP式对齐:先分别训练图文编码器,再靠对比学习强行拉近向量距离。M3不同,它在预训练第零步就把百TB级图文、视频、桌面操作录屏混合进同一数据流,文本token和像素块被统一投射到同一个稀疏注意力(MSA)架构下。这意味着你传入一张含手写公式的白板照片,M3不会先“识别文字”再“翻译成LaTeX”,而是直接激活与“偏微分符号+上下文推导逻辑”强关联的联合表征——这是后续长程推理能连贯展开的前提。
若跳过这一步,仅靠后融合方式接入视觉模块,模型在处理《ICLR2025论文》中带坐标轴标注的损失曲线图时,会把横轴标签“epoch”误判为独立文本块,导致后续分析断裂。M3实测在OmnidocBench上得分超越Gemini 3.1 Pro,关键就在这个端到端对齐。
上传一张图,让M3执行跨模态操作
方法一:使用MiniMax Code工具直连桌面
打开MiniMax Code → 点击左下角「+」→ 选择「Upload Image」→ 拖入本地图片(支持PNG/JPEG/WEBP,单张≤20MB)→ 在输入框键入指令,例如:“提取这张服务器监控截图中的CPU占用率峰值时间点,并生成对应Prometheus查询语句”。
方法二:调用M3-highspeed API
构造JSON payload,【必须包含base64字段且image_type明确设为"png"或"jpeg"】;text字段内嵌自然语言指令;请求头需携带Authorization: Bearer
方法三:在HuggingFace Space中试用公开Demo
访问hf.co/minimax/m3-multimodal-demo → 点击“Upload”按钮 → 上传图片 → 输入中文指令 → 点击“Run” → 等待约8秒(因启用1M上下文缓存,首次响应略慢)。
让M3理解一段屏幕录制视频
第一步:将MP4文件转为关键帧序列
使用ffmpeg -i input.mp4 -vf "select=eq(pict_type\,I)" -vsync vfr frame_%04d.png提取所有I帧,确保每帧分辨率≥720p且无压缩伪影;M3对运动信息不建模,只处理静态帧语义,跳过P/B帧可节省92% token消耗。
第二步:批量上传帧+上下文指令
把前5帧+后5帧共10张图打包为zip,上传至MiniMax Code的「Video Analysis」面板;在指令框中写明任务目标,例如:“对比第1帧与第10帧的UI状态变化,指出用户点击了哪个按钮并触发了什么弹窗”。
第三步:验证输出是否含桌面操作映射
检查返回结果中是否存在desktop_action字段,其值应为类似{"x": 842, "y": 517, "action": "click", "target": "Export PDF"}的结构;若为空,说明未启用M3的Computer Use能力,需确认API版本是否为m3-highspeed而非基础版。


















