DeepSeek-V4-Flash-Vision-Exp

DeepSeek-V4-Flash-Vision-Exp 的定位很明确:文本能力基本上保持在稳定版 V4-Flash 发布的水平(代理、推理、世界知识),而视觉是主要增量。

DeepSeek-V4-Flash-Vision-Exp
梯形图转SCL | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo

8月21日,DeepSeek 终于为 V4 Flash 产品线装上了"眼睛",推出了一个实验性多模态模型:DeepSeek-V4-Flash-Vision-Exp

在此之前,V4 Flash 系列以高吞吐量和低成本著称——但它只能处理文本、代码、日志和文档。视觉能力明显缺失。过去一周,DeepSeek Harness GitHub 讨论中最常见的问题是"我如何让 DeepSeek 看到图像?"开发者们甚至编写自己的视觉桥接插件,将图像转换为文本后再输入模型。

模型能力对比

现在这个差距已经弥合。DeepSeek 已经将这一能力直接集成到其主线 V4 模型和代理工作流中。

DeepSeek-V4-Flash-Vision-Exp 的定位很明确:文本能力基本上保持在稳定版 V4-Flash 发布的水平(代理、推理、世界知识),而视觉是主要增量。

在纯文本任务上——代理工作流、推理、世界知识——V4-Flash-Vision-Exp 的表现与稳定版 V4-Flash 大致相当,在 Terminal Bench 2.1 和 DeepSWE 等编码代理基准测试上有轻微提升。更大的变化出现在视觉信息进入代理任务时:官方数据显示在 Chartography 等视觉理解基准测试上得分很高,DeepSeek 声称其多模态代理能力正在接近 Claude Opus 4.8。

关键是,DeepSeek 没有因为添加了视觉功能而提高价格。图像按 token 计费,每张图像上限 384 个 token,整体定价与 V4-Flash 保持一致。API 支持 Chat Completions、Messages 和 Responses 格式,图像可通过 Base64、URL 或 Files API 传递——对于已经在 DeepSeek 生态系统中构建的开发者来说,集成门槛很低。

排行榜排名:

排行榜

目前在 Artificial Analysis 排名第 32。

当然,"Exp" 后缀提醒我们这仍然是一个实验性模型。基准测试无法回答它在实际工作负载中如何处理截图识别、UI 理解或图表分析。因此,302.AI 这次让它通过几个实际场景测试,看看真实性能是否符合预期。

1. 模型基础

302.AI 定价

定价对比

是的,你没看错——峰值输出价格大约是 Claude Opus 5 的 1/19,非峰值接近 1/38。这就是在不重新定价的情况下为 Flash 系列添加视觉功能后的成本结构。

2. 案例研究

案例 1:多模态逻辑推理

提示:根据插图,猜测六张图片分别代表哪部著名电影。
答案:1. 杀死比尔 2. 回到未来 3. 美国派 4. 百万美元宝贝 5. 黑客帝国 6. 老无所依
测试结果

DeepSeek-V4-Flash-Vision-Exp:6 个中答对 5 个。

Claude 测试结果

Claude Opus 5:6 个中答对 4 个。

第二个测试

第二个测试——时间排序:

提示:按逻辑顺序排列四个漫画面板。
正确答案:C → A → D → B
DeepSeek 排序结果

DeepSeek-V4-Flash-Vision-Exp:顺序错误。它提供了解释,但推理很牵强——它难以同时结合视觉线索、序列关系和多步推理。

Claude 排序结果

Claude Opus 5:顺序正确,解释合理。

Claude 完整结果

📌 要点:在简单的视觉识别 + 知识检索方面,DeepSeek 在这里实际上优于 Opus 5。但当任务需要链式多模态推理时,稳定性明显下降。

案例 2:程序化 SVG 生成

提示:将参考图像中显示的场景重现为动画 SVG。

参考 1:

参考图像
  • DeepSeek-V4-Flash-Vision-Exp 输出:
DeepSeek SVG 输出
  • Claude Opus 5 输出:
Claude SVG 输出

快速判断:两个模型都准确理解并重现了参考图像的场景逻辑,但在复杂构图和动画执行方面各有缺陷。

Opus 5 构建了更丰富、更复杂的图形;DeepSeek 在意义对意义的重现方面表现完美。

案例 3:网页复制

提示:重新创建截图中显示的网页。
网页截图

两个模型都产生了相当完整的重建,差异在于风格而非失败:

  • DeepSeek-V4-Flash-Vision-Exp 的布局与原始页面更匹配——间距、对齐和元素比例更接近源截图。
DeepSeek 网页输出
  • Opus 5 提供了更强的整体视觉连贯性——更精致的排版节奏和美学统一性。
Claude 网页输出

值得注意的是,DeepSeek 在原始布局保真度上略胜 Opus 5——对于一个预算级实验模型来说,这令人印象深刻。


原文链接:DeepSeek-V4-Flash-Vision-Exp Review

汇智网翻译整理,转载请标明出处