大模型

DeepSeek V4-Flash-Vision-Exp发布:多模态视觉Agent能力接近Opus 4.8

发布时间:2026年08月21日 09:00:00

8月21日,DeepSeek正式发布V4-Flash-Vision-Exp实验版多模态模型,在保持V4-Flash级文本推理和Agent性能的同时,视觉Agent能力实现大幅跃升。支持文本+图像混合输入,图片输入最高384 tokens,视觉Agent跑分接近Claude Opus 4.8。Files API新增文件ID复用上传功能,DeepSeek Harness 0.1.1提供原生支持。


事件概况

8月21日,DeepSeek正式发布V4-Flash-Vision-Exp实验版多模态模型。这是DeepSeek V4系列首次扩展到多模态视觉领域,在保持V4-Flash级文本推理和Agent性能的同时,视觉Agent能力实现大幅跃升。新模型已同步上线OpenRouter。

模型核心能力

多模态能力

维度详情
输入类型文本+图像混合输入
支持接口Chat Completions/Messages/Responses
图像格式base64编码支持
图片Token成本最高384 tokens(Flash价格)
文本能力保持V4-Flash水平
推理能力保持V4-Flash水平
Agent能力保持V4-Flash水平

Files API升级

功能详情
文件ID复用通过file ID复用上传文件
开发者体验减少重复上传,提升效率
结合视觉模型可与V4-Flash-Vision协同使用

DeepSeek Harness 0.1.1原生支持

功能详情
插件架构一切皆插件
视觉模型支持原生支持V4-Flash-Vision-Exp
MIT协议开源免费商用
Agent能力助力AI完成复杂视觉任务

性能表现

视觉Agent跑分

维度表现
Agents’ Last Exam击败Opus 4.8
ZeroBench击败Opus 4.8
视觉Agent能力接近Claude Opus 4.8水平
研究者评价视觉支持是一个里程碑

与竞品对比

模型视觉Agent文本Agent价格
DeepSeek V4-Flash-Vision-Exp接近Opus 4.8V4-Flash级Flash价格
Claude Opus 5高价
Claude Opus 4.8高价
GPT-5.6 Sol中高
Gemini 3.7中低

技术亮点

保持Flash级性能

V4-Flash-Vision-Exp在添加视觉能力的同时,完全保留了V4-Flash的文本、推理和Agent性能,没有出现多模态模型常见的顾此失彼现象。

实验版定位

该版本被标注为"实验版"(Experimental),表明:

  • 仍在持续优化迭代
  • 开源权重尚未确认
  • 生产可用性需进一步验证
  • DeepSeek正在收集实际使用反馈

行业影响

对多模态市场的影响

维度影响
价格革命多模态能力以Flash低价提供
能力下沉开发者可以低成本使用高质量视觉Agent
竞争加剧压缩Claude Opus等高价模型的视觉场景需求
应用爆发可能催生更多视觉Agent应用

对开发者的影响

维度影响
成本视觉输入成本大幅降低
集成Files API简化文件和图片处理
工具链DeepSeek Harness提供完整Agent工具链
开源生态OpenCode Go等工具已同步支持

后续观察

视觉能力是否会在非实验版中完全保留、开源权重是否释放、以及视觉Agent的实际生产应用案例,将是关键观察点。