8月21日,DeepSeek正式发布V4-Flash-Vision-Exp实验版多模态模型,在保持V4-Flash级文本推理和Agent性能的同时,视觉Agent能力实现大幅跃升。支持文本+图像混合输入,图片输入最高384 tokens,视觉Agent跑分接近Claude Opus 4.8。Files API新增文件ID复用上传功能,DeepSeek Harness 0.1.1提供原生支持。
事件概况
8月21日,DeepSeek正式发布V4-Flash-Vision-Exp实验版多模态模型。这是DeepSeek V4系列首次扩展到多模态视觉领域,在保持V4-Flash级文本推理和Agent性能的同时,视觉Agent能力实现大幅跃升。新模型已同步上线OpenRouter。
模型核心能力
多模态能力
| 维度 | 详情 |
|---|
| 输入类型 | 文本+图像混合输入 |
| 支持接口 | Chat Completions/Messages/Responses |
| 图像格式 | base64编码支持 |
| 图片Token成本 | 最高384 tokens(Flash价格) |
| 文本能力 | 保持V4-Flash水平 |
| 推理能力 | 保持V4-Flash水平 |
| Agent能力 | 保持V4-Flash水平 |
Files API升级
| 功能 | 详情 |
|---|
| 文件ID复用 | 通过file ID复用上传文件 |
| 开发者体验 | 减少重复上传,提升效率 |
| 结合视觉模型 | 可与V4-Flash-Vision协同使用 |
DeepSeek Harness 0.1.1原生支持
| 功能 | 详情 |
|---|
| 插件架构 | 一切皆插件 |
| 视觉模型支持 | 原生支持V4-Flash-Vision-Exp |
| MIT协议 | 开源免费商用 |
| Agent能力 | 助力AI完成复杂视觉任务 |
性能表现
视觉Agent跑分
| 维度 | 表现 |
|---|
| Agents’ Last Exam | 击败Opus 4.8 |
| ZeroBench | 击败Opus 4.8 |
| 视觉Agent能力 | 接近Claude Opus 4.8水平 |
| 研究者评价 | 视觉支持是一个里程碑 |
与竞品对比
| 模型 | 视觉Agent | 文本Agent | 价格 |
|---|
| DeepSeek V4-Flash-Vision-Exp | 接近Opus 4.8 | V4-Flash级 | Flash价格 |
| Claude Opus 5 | 高 | 高 | 高价 |
| Claude Opus 4.8 | 高 | 高 | 高价 |
| GPT-5.6 Sol | 高 | 高 | 中高 |
| Gemini 3.7 | 中 | 中 | 中低 |
技术亮点
保持Flash级性能
V4-Flash-Vision-Exp在添加视觉能力的同时,完全保留了V4-Flash的文本、推理和Agent性能,没有出现多模态模型常见的顾此失彼现象。
实验版定位
该版本被标注为"实验版"(Experimental),表明:
- 仍在持续优化迭代
- 开源权重尚未确认
- 生产可用性需进一步验证
- DeepSeek正在收集实际使用反馈
行业影响
对多模态市场的影响
| 维度 | 影响 |
|---|
| 价格革命 | 多模态能力以Flash低价提供 |
| 能力下沉 | 开发者可以低成本使用高质量视觉Agent |
| 竞争加剧 | 压缩Claude Opus等高价模型的视觉场景需求 |
| 应用爆发 | 可能催生更多视觉Agent应用 |
对开发者的影响
| 维度 | 影响 |
|---|
| 成本 | 视觉输入成本大幅降低 |
| 集成 | Files API简化文件和图片处理 |
| 工具链 | DeepSeek Harness提供完整Agent工具链 |
| 开源生态 | OpenCode Go等工具已同步支持 |
后续观察
视觉能力是否会在非实验版中完全保留、开源权重是否释放、以及视觉Agent的实际生产应用案例,将是关键观察点。