【php中文网快讯】it 之家消息,deepseek v4 系列首个多模态模型——deepseek-v4-flash-vision-exp 已正式发布于 hugging face 平台,并以 mit license 协议开源。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
本次公开资源涵盖模型权重、Tokenizer、Prompt Encoding 的参考实现,以及轻量级 PyTorch 推理代码,完整支持视觉编码器、Aligner、DFlash Attention、MoE 结构、Hyper-Connections 和 DSpark 等关键组件。
值得注意的是,早在 8 月 21 日下午,DeepSeek 官方 API 文档中的模型详情页便已悄然上线该模型信息。作为 V4 系列中首个原生支持图像输入的视觉语言模型,它不仅支持常规文本交互,还可直接处理图片,胜任图像描述生成、截图 OCR、图表理解等任务,并兼容 JPEG、PNG、GIF、WebP 等主流图像格式。
据深度求索官方说明,该模型在主流智能 Agent 框架中展现出良好的多模态兼容性,结合外部工具后可灵活拓展至多种实际应用场景。在纯文本类任务(如逻辑推理、常识问答等)方面,其表现与 V4-Flash 正式版相当,延续了原有优势;而在视觉导向的 Agent 基准评测中,则显著优于 V4-Flash,整体多模态 Agent 能力已逼近 Opus-4.8 的水平。



















