DeepSeek V4系列首款原生支持图片输入的视觉模型DeepSeek-V4-Flash-Vision-Exp正式以MIT协议在Hugging Face开源,这款此前已于8月21日上线DeepSeek API平台的实验版模型,多模态Agent能力已接近行业顶尖的Opus-4.8,同步公开的还包括模型文件、Tokenizer、Prompt Encoding参考实现,以及覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块的最小化PyTorch推理实现,支持本地部署和二次开发。

核心能力:视觉与文本能力双在线
该模型基于DeepSeek-V4-Flash架构,通过集成视觉模块并经过持续训练解锁视觉理解能力,支持JPEG、PNG、GIF、WebP四种图片格式,可完成图片描述、截图文字识别、图表分析、界面元素识别等视觉任务,同时完整保留了V4-Flash原有的Agent、推理、世界知识等纯文本能力。
官方公布的基准测试显示,在7项纯文本Agent任务中视觉版取得5胜1平1负,原有能力无损耗;多模态Agent任务表现大幅提升,DeepSWE得分59.3反超Opus-4.8,Agents’ Last Exam、ZeroBench(Pass@5)两项测试超越Opus-4.8登顶榜首,Toolathlon-Verified得分75.9仅落后Opus-4.8 0.3分,在高度复杂的数据科学任务上与Opus-4.8仍有10%左右差距。
技术特点:核心模块全量开源
此次开源覆盖了视觉模块的全部核心组件,延续了V4-Flash的MoE架构,总参数284B、每次推理激活13B,支持100万token超长上下文窗口,最大输出384K,支持思考模式(可设置high、max推理强度),兼容Chat Completions、Messages、Responses三种API格式,同时支持Anthropic API和对话前缀续写,适配LangChain、AutoGen、CrewAI等主流Agent框架。
图片按照尺寸折算成token,与文本token一同进入模型处理流程,单次请求最多可输入600张图片,图片最长边最高支持8192像素,提供low(缩放至512×512)、original(保留原图)、auto三种细节等级。
定价:沿用V4-Flash标准
图片按token计费,单张最高折算384个token,不额外收取视觉专项费用,计费标准与V4-Flash完全一致:空闲时段缓存命中输入0.05元/百万Token,缓存未命中输入1.5元/百万Token,输出4.5元/百万Token;高峰时段(9:00-12:00、14:00-18:00)对应价格分别为0.10元、3元、9元,同步上线的免费Files API支持图片先上传后按file_id复用,减少重复传输带宽开销。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



