DeepSeek发布首个开源多模态模型V4-Flash-Vision-Exp,原生支持图像理解与Agent协同

SmartHey8月31日消息,今日,深度求索正式发布其V4系列首款原生多模态模型——DeepSeek-V4-Flash-Vision-Exp,并已在Hugging Face平台开源,采用MIT License许可协议。

开源内容涵盖完整模型权重、Tokenizer、Prompt Encoding参考实现,以及轻量级PyTorch推理代码,全面覆盖视觉编码器、对齐模块(Aligner)、DFlash注意力机制、混合专家(MoE)、超连接结构(Hyper-Connections)与DSpark推理优化等核心组件。

据悉,该模型是DeepSeek V4系列中首个原生支持图像输入的实验性视觉语言模型,官方明确标注为“Exp”(Experimental)版本,已于2026年8月21日率先上线DeepSeek API平台供开发者试用。

模型在保持原有文本能力基础上,新增对JPEG、PNG、GIF、WebP等多种图像格式的原生支持,可完成图像描述、截图文字识别(OCR-like理解)、图表解析与语义推理等典型视觉任务。

深度求索指出,V4-Flash-Vision-Exp在主流Agent框架中展现出优异的多模态兼容性,能无缝接入工具调用、规划与执行流程,助力开发者构建更智能、更实用的AI工作流。

在纯文本类任务(如Agent编排、复杂推理、世界知识问答)上,其性能与已发布的V4-Flash正式版完全一致,所有原有优势均得以保留;而在需视觉理解的多模态Agent基准测试中,综合表现显著超越V4-Flash,多模态协同能力已逼近业界先进水平Opus-4.8。