DeepSeek多模态能力需使用明确标注的版本,如DeepSeek-VL、MM、V4或带适配器的R1-Distill-Qwen-1.5B;纯文本模型(如V3-Chat)不支持图像。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

DeepSeek 的多模态能力不是所有模型都支持,必须确认你用的是明确标注为多模态的版本,比如 DeepSeek-VL、DeepSeek-MM、DeepSeek-V4 或带适配器的 DeepSeek-R1-Distill-Qwen-1.5B。纯文本模型(如 DeepSeek-V3-Chat)收到图像会直接忽略或报错。
哪些图像格式能被 DeepSeek-VL 和 DeepSeek-MM 正确读取
DeepSeek-VL 和 DeepSeek-MM 1.5 官方明确支持以下图像格式:
-
JPEG/JPG PNG
其他格式(如 WebP、GIF、BMP)不保证兼容,部分部署环境可能因底层 PIL 或 torchvision 版本差异而静默失败或解码异常。
- 图像需为 RGB 模式(3通道),灰度图或带 alpha 通道的 PNG 可能触发预处理报错
- 推荐在加载前统一转为
RGB:from PIL import Image<br>img = Image.open("input.webp").convert("RGB") - 最大支持分辨率:官方推荐 ≤
2048×2048(DeepSeek-MM 1.5使用 Swin Transformer v2),超限可能 OOM 或被自动缩放导致细节丢失
DeepSeek-V4 和 DeepSeek-V3 多模态 API 支持哪些额外输入类型
根据 2026 年最新 API 文档,DeepSeek-V4 和 DeepSeek-V3 的多模态 API 在图像基础上扩展了以下输入能力:
-
PDF(单页或多页,文本+图表混合内容可被解析) -
Word(.docx,不支持旧版.doc) -
Excel(.xlsx,表格结构保留,但公式不执行) -
CSV(UTF-8 编码,逗号分隔,首行建议为列名) -
音频(WAV/MP3,采样率需 ≥ 16kHz,48kHz 最佳) -
视频(MP4,H.264 编码,帧率 ≤ 30fps)
注意:
- 文件大小限制因部署方式而异:
API通常限制单文件 ≤50MB,本地部署可调但受显存制约 -
PDF中的扫描图(非文字层)会被送入 OCR 流程,识别效果依赖清晰度和字体;若 PDF 含加密或权限限制,解析会失败并返回错误"failed_to_extract_text" - 音频/视频输入需通过
base64编码或临时上传 URL 提交,不能直接传路径字符串
结构化数据如何与图像/文本联合输入(如 DeepSeek-R1-Distill-Qwen-1.5B)
这个轻量模型本身不原生支持图像,但可通过扩展输入层接入结构化数据 —— 关键是不碰模型权重,只改预处理逻辑:
- 输入必须为 JSON 格式,且顶层含
"instruction"字段 - 结构化数据放在
"structured_data"字段下,支持:-
dict(自动转为 key-value 描述句) -
list(如时间序列,会加序号前缀) -
str(JSON string,需确保合法)
-
- 不支持嵌套过深(建议 ≤ 3 层),否则 tokenizer 可能截断
- 示例有效输入:
{<br> "instruction": "对比 A/B 两组实验结果并指出显著差异",<br> "structured_data": {<br> "group_a": {"mean": 12.4, "std": 1.2},<br> "group_b": {"mean": 9.8, "std": 1.5}<br> }<br>}
这种设计绕开了视觉编码器,适合边缘设备部署,但无法理解图像内容本身 —— 它解决的是「文本 + 表格/参数」场景,不是「图文联合理解」。
真正容易被忽略的一点:多模态能力高度依赖部署时加载的权重和 tokenizer 配置。
比如用 transformers 加载 deepseek-vl 时,如果只拉了文本权重没配视觉编码器检查点,model.generate() 会静默跳过图像、不报错也不警告。务必核对 config.json 中是否存在 "vision_config" 字段,以及初始化时是否传入了 image_processor。



















