SmartHey8月21日消息:DeepSeek上线实验性多模态视觉理解模型V4-Flash-Vision-Exp,API全面支持图文混合输入与Files上传

SmartHey8月21日消息,今日,全新实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 平台。用户可通过设置 model='deepseek-v4-flash-vision-exp' 调用该模型。

文本能力稳健,视觉理解显著跃升

据官方介绍,DeepSeek-V4-Flash-Vision-Exp 在纯文本任务(如智能体(Agent)行为、逻辑推理、世界知识理解等)方面,表现与已发布的 DeepSeek-V4-Flash 正式版相当;而在需视觉理解的 Agent 基准测试中,其性能实现大幅突破——多模态智能体能力已逼近 Opus-4.8 水平。

全格式多模态API支持

该模型通过标准 API 接口开放服务,支持 Chat CompletionsMessagesResponses 三种调用格式,可无缝集成至各类智能体(Agent)系统。API 支持图文混合输入,并兼容三种图片传入方式:base64 内联编码、外部 URL 链接,以及 Files API 文件引用。

图片在请求中将被转换为 token 进行处理,单张图片最多占用 384 tokens,计费标准与 DeepSeek-V4-Flash 模型完全一致。

免费 Files API 正式上线

DeepSeek 同步推出免收费用的 Files API:用户可预先将图片上传至平台获取唯一 file_id,后续请求中直接引用即可。此举有效降低带宽开销——同一张图片在多次调用中无需重复上传,提升多轮交互与批量处理效率。