2026 年 8 月 21 日下午,DeepSeek 官方 API 文档里悄悄多了一个新名字:
deepseek-v4-flash-vision-exp。V4 系列第一款原生支持图片输入的视觉模型就这么上线了,没有发布会、没有预告。一周前 DeepSeek 刚开源 Harness 智能体框架,GitHub 讨论区里”怎么让 DeepSeek 看图”还是高频问题,现在官方自己把这块拼图补上了。
太长不看版
| 维度 | 结论 |
|---|---|
| 模型名 | deepseek-v4-flash-vision-exp(Exp = 实验版) |
| 上线时间 | 2026-08-21,V4 系列首款原生视觉模型 |
| 文本能力 | 与 V4-Flash 正式版持平,看图不降智 |
| 视觉能力 | 多模态 Agent 基准接近 Opus-4.8 |
| 图片计费 | 一张图最多 384 token,价格与 V4-Flash 一致 |
| 传图方式 | Base64 内联 / 外部 URL / Files API 三种 |
| 接口兼容 | OpenAI 格式 + Anthropic 格式 + Responses API |
| 适合谁 | 要做"能看图的 Agent"的开发者,成本敏感的项目 |
一句话:DeepSeek 从纯文本模型正式迈进了多模态 Agent 底座,而且价格延续了 Flash 系列的性价比路线。
背景:DeepSeek 终于”睁眼”了
要理解这个模型为什么重要,得先看它上线前一周发生了什么。
8 月 13 日,DeepSeek 开源了 Harness(简称 dsh)——一个”一切皆插件”的智能体框架,模型负责思考、框架负责干活,能调终端、文件、代码和外部工具。热度爆炸,上线 12 小时 star 破 5 万。
但一个尴尬的问题马上暴露出来:DeepSeek 自己的模型看不见图。 V4 Flash 和 V4 Pro 在模型目录里都被声明为纯文本模型,输入模态只有 text。开发者往 Harness 里传截图,直接返回一行报错:MODEL_DOES_NOT_SUPPORT_IMAGES。
于是社区开始自己给 DeepSeek “装眼睛”。一种方案是在前面接一个 Qwen-VL 之类的视觉模型,先把图转成文字描述再交给 DeepSeek 推理;另一种方案是改 Harness,让图片先存到工作区再由视觉插件读取。几天之内 GitHub 上冒出好几个 vision bridge 插件。
结果一周后,官方出手了。deepseek-v4-flash-vision-exp 上线,V4 系列第一次原生支持图片输入,Agent 终于能”自己看图、自己理解、自己推理、自己调工具”。
核心能力:看图不降智
视觉模型最容易踩的坑是”为了看图牺牲文本”。V4-Flash-Vision-Exp 没有这个毛病。
官方明确说:在 Agent、推理、世界知识等纯文本基准上,Vision-Exp 与 V4-Flash 正式版持平。它不是特化模型,而是在 Flash 基础上叠加了视觉理解。
视觉部分提升是结构性的。官方给出的多模态 Agent 基准数据:
| 基准 | V4-Flash-Vision-Exp | V4-Flash | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
Terminal Bench、DeepSWE 这些任务以前是纯文本 Agent 的天下,现在加入视觉输入后依然稳在第一梯队,DeepSWE 甚至超过了 Opus-4.8(59.3 vs 58.0)。官方给的总评是”多模态 Agent 能力已接近 Opus-4.8”,考虑到价格差,这句话含金量不低。
价格:一张图最多 384 token
计费规则是这篇最值得展开的部分,因为它直接决定了你的账单。
图片会按尺寸换算成 token,与文本 token 一起计费,价格和 V4-Flash 完全一致——输入 $0.14/百万 tokens(缓存命中 $0.0028),输出 $0.28/百万 tokens。没有额外的视觉处理溢价。
进模型前每张图片会被自动缩放:
- 总像素小于约 384×384 的图片保持长宽比放大
- 更大的图片保持长宽比缩小,缩小后总像素约相当于 800×800
所以每张图片消耗的 token 有硬上限:384 个。2000×2000 和 5000×5000 的图,处理后 token 数相同。
对比一下隔壁:GPT 和 Claude 处理同等分辨率的图片通常消耗 800 到 1100 个 token。同一张图,DeepSeek 的 token 开销不到竞品一半。 这个数字背后是 DeepSeek 此前公布的 “Thinking with Visual Primitives” 框架——把视觉元素压缩成空间坐标式的原语,而不是把整张图拆成密密麻麻的图像 patch。
多张图独立计费,每张都按同一规则算,没有额外计算方式。
接入教程:三种传图方式
上手很简单:模型参数设成 deepseek-v4-flash-vision-exp,base_url 用 https://api.deepseek.com,图片以 content 块数组传入,标准 OpenAI 兼容格式。
1. Base64 内联(本地文件最简单)
1 | import base64 |
2. 外部图片 URL(图片已在网上)
1 | response = client.chat.completions.create( |
URL 最长 8192 个字符,图片最大 32 MiB,需在 60 秒内下载完成。
3. Files API(多请求复用同一张图)
上传一次拿 file_id,之后反复引用,不用重复上传:
1 | response = client.chat.completions.create( |
图片很大(超过 32 MiB)或者请求体接近 48 MiB 限制时,Files API 是唯一解——它支持单图最大 64 MiB。
Anthropic 兼容格式
用 Claude SDK 的,base_url 换成 https://api.deepseek.com/anthropic 即可,图片用 image 块:
1 | import anthropic |
detail 参数:控制精度和省钱
对 image_url 输入可以加 detail 字段控制处理方式:
| 取值 | 行为 |
|---|---|
low | 缩放至 512×512,不需要精细细节时更快更省 token |
high / original | 保留原图 |
auto | 自动选择,当前等价于 original |
批量 OCR、快速识别场景用 low 能再省一笔;需要读小字、细线条时用 original。
限制清单(写代码前先看)
| 限制项 | 数值 |
|---|---|
| 支持格式 | JPEG、PNG、GIF、WebP |
| 请求体大小 | 48 MiB |
| 单图最大(base64 / URL) | 32 MiB |
| 单图最大(Files API) | 64 MiB |
| 单请求最大图片数 | 600 张 |
| 图片最大尺寸 | 单边 8192 像素(≥15 张图时降为 4096) |
两个硬性规则要记住:图片只能出现在 user 消息里,system/assistant 消息带图直接 400;只有 deepseek-v4-flash-vision-exp 这个模型接受图片,其他模型传图也会 400。
适合谁用
| 人群 | 推荐理由 |
|---|---|
| Agent 开发者 | 终于不用再外接视觉模型做 bridge,原生看图让 Harness 类框架闭环 |
| 文档/流程自动化 | 界面截图解析、报错截图识别、图表数据提取一条龙 |
| 前端工程师 | 设计稿截图转描述、UI 重构参考,图文联合输入 |
| 成本敏感的个人开发者 | 一张图最多 384 token,价格碾压同级别视觉模型 |
官方演示的案例是生成商业定制 PPT——给一组图片和需求,直接产出完整方案。这类”看图干活”的场景会越来越多。
FAQ
Q:Exp 后缀是什么意思?能用于生产吗? A:实验版(Experimental)。官方提示快速迭代中、可能有破坏性变更,生产环境建议先小流量验证再上。
Q:图片怎么计费? A:按尺寸换算成 token,每张最多 384 个,与文本一起按 V4-Flash 价格计费,无视觉溢价。
Q:纯文本任务用这个模型会变贵吗? A:不会。纯文本能力与 V4-Flash 持平,价格也一样。但纯文本场景直接用 V4-Flash 更省心,Vision 版留给需要看图的。
Q:图片能放 system 消息里吗? A:不能。图片只支持 user 消息,否则返回 400。
Q:和 Qwen-VL 这类视觉模型比怎么选? A:如果已经在用 DeepSeek 生态(API、Harness),Vision-Exp 免去桥接层、格式统一,迁移成本最低;对比竞品 token 开销不到一半。
Q:响应速度怎么样? A:与 V4-Flash 同规格,实际速度取决于图片大小和 detail 等级,low 模式明显更快。
总结
V4-Flash-Vision-Exp 是 DeepSeek 补齐多模态闭环的关键一步:模型能看图了,Agent 才算真正”睁眼”。价格延续 Flash 系列的高性价比——一张图最多 384 token、文本能力不降级、多模态 Agent 逼近 Opus-4.8,对开发者是实打实的低成本选项。Exp 后缀提醒你它还在快速迭代,但方向已经很明确:DeepSeek 的下半场,是能看、能想、能干活的多模态 Agent。
想第一时间用上这类新模型、跑通自己的 Agent 项目,稳定的跨境网络加速服务是基础配置。下面是几个实测稳定的国际网络优化方案:
| 服务商 | 特点 | 适合 |
|---|---|---|
| 光速云 | IEPL 专线 + IEPL专线 多路复用,100+ 节点 | 主力首选,开发者重度使用 |
| 飞猫云 | 老牌稳定,IEPL 专线 | 长期稳定党 |
| 微风网络 | 低价入门,¥6.99/月 | 新用户尝鲜 |
| 飞猫云 | IEPL 专线,性价比高 | 进阶用户 |
延伸阅读:DeepSeek V4-Flash 正式版指南(纯文本 API 接入)、DeepSeek Harness 上手指南(Agent 框架)、DeepSeek 入门到精通(注册与基础用法)