2026 年 8 月 31 日 19:35,IT之家(IThome)报道了一条容易被开发者忽略、但值得记住的消息:DeepSeek 放出了 DeepSeek-V4-Flash-Vision-Exp——一个 DeepSeek-V4-Flash 的视觉实验变体。它不是又一篇论文,也不是路线图上的占位符,而是一个已经能拿到的开源权重模型,采用 MIT 许可,开放权重、允许商用。本文是一篇"实际怎么拿到、怎么用"的开源资源帖:先讲清楚它到底在哪、能做什么、哪些信息是确认过的、哪些还只是媒体口径,再把获取与调用路径、和闭源视觉模型的对标、以及几个容易踩的坑一次讲透。关于 V4-Flash 纯文本能力的横向评测,见 DeepSeek-V4-Flash 热点解读;想要看旗舰级编码与推理模型的对照,见 旗舰编码推理横评。
一、先说结论:它是什么、在哪、是不是开源
把最关键的事实先摆在最前面,免得读者绕路。
第一,它是一个"视觉变体",不是 V4-Flash 本身。DeepSeek-V4-Flash 是纯文本模型,而 DeepSeek-V4-Flash-Vision-Exp 在它基础上加了图像输入能力,官方的命名里 "Vision" 与 "Exp(Experimental,实验)" 两个词都很关键,下文会分别解释。
第二,它确实是开源权重,而且是 MIT 许可。MIT 是最宽松的常见开源许可之一,意味着你可以下载权重、自己部署、修改、并且用于商业用途,只要保留许可声明即可。这一点对想把它接进自己产品的团队很重要:你不必担心商用手收授权费的问题。
第三,它不托管在 GitHub。这一点必须强调,因为它和很多人的直觉相反。DeepSeek 的不少模型过去常先在 GitHub 上出现,但这次实测 GitHub 的仓库接口对 DeepSeek-V4-Flash-Vision-Exp 返回的是 HTTP 404,也就是说仓库根本不存在。正确的位置是 Hugging Face 上的 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 模型卡。
第四,能力边界要明确:它支持图像输入,接受 JPEG、PNG、GIF、WebP 四种格式;视觉能力"接近 Claude Opus 4.8"(这是官方 API 文档与媒体口径,不是独立第三方评测的数字);纯文本能力与 V4-Flash 持平。参数规模约 305B、上下文约 1M 这两条是媒体口径,官方尚未确认,下文单列一节讲为什么必须标注"未确认"。
把"确认过"和"只是媒体说"分开看,是读这篇文章最重要的一件事:
| 项目 | 状态 | 来源 |
|---|---|---|
| 模型归属 | 已确认:V4-Flash 的视觉变体 | Hugging Face 模型卡 / IT之家 |
| 托管位置 | 已确认:Hugging Face,非 GitHub | api.github.com 返回 404 + IT之家 |
| 许可 | 已确认:MIT,允许商用 | Hugging Face 模型卡 |
| 图像格式 | 已确认:JPEG / PNG / GIF / WebP | 官方 API 文档 |
| 视觉水平 | 媒体口径:接近 Claude Opus 4.8 | 官方 API 文档 / 媒体 |
| 纯文本能力 | 已确认:与 V4-Flash 持平 | 官方口径 |
| 参数规模 | 未确认:约 305B,媒体口径 | 媒体,未经 DeepSeek 确认 |
| 上下文长度 | 未确认:约 1M,媒体口径 | 媒体,未经 DeepSeek 确认 |
二、关键纠正:别去 GitHub 翻了,它在 Hugging Face
这一节专门救读者的时间,因为预期错了会很浪费功夫。
很多人找 DeepSeek 新模型的第一反应是打开 GitHub,搜 deepseek-ai 组织下的仓库。对这次的 Vision-Exp,这个动作会扑空。我们按 GitHub 的公开仓库接口做了一致性核对,地址 api.github.com/repos/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 返回的是 HTTP 404,代表该仓库在 GitHub 上不存在。所以如果你在 GitHub 上翻了半天没找到,那不是你搜错了,而是它压根不在那里。
真正的地址是 Hugging Face:deepseek-ai/DeepSeek-V4-Flash-Vision-Exp。模型卡里给出权重文件、基础用法说明与许可信息。Hugging Face 的模型卡地址通常形如 https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp,请以模型卡页面实际展示的内容为准,本文不替你锁定一个可能变动的具体 URL。
为什么这次不在 GitHub?一个合理的推测是:DeepSeek 现在把权重分发的主要阵地转移到了 Hugging Face,那里更接近推理部署的生态(transformers、vLLM、各家的推理引擎都直接读 Hugging Face 的格式)。但这是推测,不是确认的事实。对用户而言,结论很简单:去找 Hugging Face,别在 GitHub 上耗时间。
发布时间也要说准。IT之家(IThome)的报道时间是 2026 年 8 月 31 日 19:35,而不是某些人以为是的 9 月 1 日。如果你在核对时间线,以 8 月 31 日晚这条为准。这个小差别不重要到影响技术,但涉及"谁先报、什么时候能拿到"时,准确的时间戳能避免你被二手信息带偏。
三、能力边界:图像输入与"接近 Claude Opus 4.8"的视觉
把能力讲清楚,分三块:输入、格式、质量水平。
输入侧,它接受图像,可以处理"图 + 文"的多模态请求。这意味着它能做看图问答、图片内容理解、以图为基础的推理这一类任务,而不是只能处理纯文本。对需要把视觉信号接进工作流的团队,多模态是质的不同,不是量的叠加。
格式侧,明确支持 JPEG、PNG、GIF、WebP 四种。GIF 在列值得注意,因为它暗示对动图序列有一定的包容(具体是抽帧还是视作多帧输入,以模型卡与 API 文档说明为准,未确认)。日常最常见的 JPEG 与 PNG 自然覆盖,WebP 则是 web 场景里很常见的格式,覆盖它能少做一层转码。
质量侧,最常被引用的说法是"视觉能力接近 Claude Opus 4.8"。这里必须咬准字眼:这是官方 API 文档与媒体口径给出的定性描述,不是一张带对照组的公开 benchmark 表,更不是独立第三方复现的数字。正确的读法是——它把开放权重的视觉模型水平推到了"接近一线闭源视觉模型"的区间,是一个量级信号,而不是一个可以抄进选型文档的精确分数。在拿它做严肃对比之前,建议先用你自己的业务图片集跑一轮小评测,把"接近 Opus 4.8"这种说法在你关心的任务上落到实处。
纯文本能力方面,官方口径是"与 V4-Flash 持平"。换句话说,加视觉没有以牺牲文本能力为代价(至少官方口径如此)。如果你的场景主要是文本,又偶尔需要看图,这一个模型就能同时覆盖两段,不必在文本模型和视觉模型之间做路由切换。
四、参数与上下文:标注"未确认"的原因
参数约 305B、上下文约 1M 这两条,本文一律标注"未确认"。这不是故弄玄虚,而是因为它直接影响你"能不能部署、要多少卡"的判断,所以不能含糊。
为什么标"未确认"?因为这两条目前只出现在媒体报道里,DeepSeek 官方没有在模型卡或公告中给出确认数字。媒体口径有它的价值——它给出量级参考,让你心里有数这大概是个多大的东西;但它不等于官方规格。把未经确认的数字当确定值写进采购或部署方案,是会出事的:305B 级别意味着你需要相当可观的显存与并行策略,如果真实数字差出一截,你的容量规划就会整个失真。
上下文 1M 同理。1M 是个很诱人的数字,意味着能塞进很长的文档或多轮对话,但它同样只是媒体口径。在官方确认前,把它当"目标上界参考"而非"已验证能力"来用,更稳妥。
所以这一节的建议是:把"约 305B、约 1M 上下文"当量级感知,不要据此做硬性硬件决策,也不要在对外文档里写成确认规格;等 DeepSeek 官方确认数字,再回填方案。
五、怎么拿到并调用:两条路
落到实操,有两条主路径:Hugging Face 自部署,以及 DeepSeek 官方 API。
路径一,Hugging Face 自部署。去模型卡拉取权重,用兼容的推理框架加载。下面是一段最小示意(具体参数名以模型卡与推理框架文档为准):
from transformers import AutoModelForCausalLM, AutoProcessor
model = AutoModelForCausalLM.from_pretrained(
"deepseek-ai/DeepSeek-V4-Flash-Vision-Exp",
trust_remote_code=True,
)
processor = AutoProcessor.from_pretrained(
"deepseek-ai/DeepSeek-V4-Flash-Vision-Exp",
)
# 把图像与文本一起送进去,具体调用形态以模型卡说明为准注意 trust_remote_code 这类开关、以及图像张量的预处理方式,都应以模型卡的实际说明为准,上面的片段只是形态示意,不要照抄参数。
路径二,官方 API。如果你的场景不需要自己托管权重,直接走 DeepSeek 官方 API 是更省事的选择:你不必准备显卡,按调用量付费即可,而且官方 API 文档正是"视觉接近 Claude Opus 4.8"这一说法的出处之一。具体端点、鉴权方式与请求体结构,以官方 API 文档为准,本文不锁定可能变动的具体地址。
两条路怎么选?自部署适合对数据驻留、延迟、私有化有要求的团队,代价是你要准备硬件与运维;官方 API 适合想快速验证、或调用量还不大的团队,代价是数据要出网、且受 API 配额与定价约束。无论哪条路,都建议先用一小批真实业务图片做冒烟测试,确认格式与质量符合预期再放量。
顺带一提,关于 V4-Flash 本身的纯文本能力横评,见 DeepSeek-V4-Flash 热点解读;想要把一个开源视觉模型放进"旗舰级编码与推理"的大盘里看位置,见 旗舰编码推理横评。
六、与闭源视觉模型怎么比,以及"实验"标签的分量
把 DeepSeek-V4-Flash-Vision-Exp 放进整个视觉模型版图里看,它的位置很清晰:开放权重、MIT 可商用、视觉水平接近一线闭源。这三点叠在一起,正是它值得关注的原因。
和 Claude Opus 4.8 这类闭源视觉模型比,它的核心差异不在"谁更强"一句话能概括,而在"控制权":闭源模型你只能调用、不能改、商用往往要谈授权与定价;而这个模型你拿得到权重,能自己部署、能微调、能嵌进私有链路。代价是你得自己扛部署与运维,而且"接近"不等于"持平"——在官方与独立评测拿出更硬的数字之前,"接近"只是量级描述。
和别的开放权重视觉模型比,它的卖点是"前沿邻接"的视觉质量加上 MIT 商用的宽松度。很多开源视觉模型在质量或许可上有一项短板,而这个模型两项都给了,因此对想做商用产品的团队尤其友好。
最后说"实验(Exp)"这个标签的分量。它不是一个装饰词。DeepSeek 在正式放出完整的 V4-Vision 之前,先以 "Exp" 的形式放出这个视觉变体,最合理的解释是:它在用社区的反馈与真实负载来探路,验证视觉能力接进 V4 体系的效果,为后续更完整的视觉版本铺路。对读者而言,这有两层含义:一是它可能会迭代、甚至可能改名或被正式版取代,不要把它当成"最终形态"锁死;二是现在正是尝鲜和建立自有评测的好窗口,等正式版出来,你手里已有的对比数据会很有价值。
七、落地清单
把上文落成一张可勾选的清单:
| 动作 | 依据 | 优先级 |
|---|---|---|
| 去 Hugging Face 而非 GitHub 取模型 | GitHub 仓库返回 404 | 高 |
| 确认 MIT 许可满足你的商用合规 | Hugging Face 模型卡 | 高 |
| 用真实业务图片做冒烟测试 | "接近 Opus 4.8"为口径,非实测分数 | 高 |
| 自部署前按约 305B 量级估硬件,但等官方确认数字再定采购 | 参数规模未确认 | 中 |
| 选自部署还是官方 API,先定数据驻留与延迟要求 | 两条路径权衡 | 中 |
| 把"接近 Opus 4.8"在自己任务上复测,别直接抄进选型文档 | 媒体口径,非第三方复核 | 中 |
| 关注 Exp 标签,预留后续被正式版取代的迁移空间 | 实验性质,可能迭代 | 低 |
参考来源
- Hugging Face 模型卡 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp——模型归属(V4-Flash 的视觉变体)、MIT 许可与商用允许、JPEG/PNG/GIF/WebP 格式支持、权重与模型卡说明,均出自本条。具体模型卡 URL 以 Hugging Face 实际页面为准。
- GitHub 公开仓库接口 api.github.com/repos/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 实测返回 HTTP 404——证明该模型不托管在 GitHub,本文据此提示读者不要去 GitHub 寻找。
- IT之家(IThome)2026 年 8 月 31 日 19:35 报道——模型现身的报道时间与基础信息的中文交叉印证;注意报道时间为 8 月 31 日而非 9 月 1 日。
- DeepSeek 官方 API 文档——"视觉能力接近 Claude Opus 4.8"的口径出处之一、纯文本能力与 V4-Flash 持平的官方表述、图像格式与调用方式说明。具体文档 URL 以官方为准。
- 媒体对参数约 305B、上下文约 1M 的报道——本文标注为未确认,仅作量级参考,未经 DeepSeek 官方确认。
- 除上述条目外,本文关于"实验标签含义""两条路径权衡""对标闭源模型"等论述为编者分析与推断,已在正文逐处标注,不属于官方来源。
常见问题
Q1:在哪能下载或调用这个模型? A1:不要去 GitHub 找——GitHub 仓库接口对该模型返回 HTTP 404,它并不在 GitHub 上。正确位置是 Hugging Face 的 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 模型卡,你可以在那里下载权重自行部署;如果不想自己托管,也可以走 DeepSeek 官方 API 直接调用。两条路的具体地址与参数以模型卡和官方 API 文档为准。
Q2:它和 DeepSeek-V4-Flash 是什么关系? A2:DeepSeek-V4-Flash 是纯文本模型,而 DeepSeek-V4-Flash-Vision-Exp 是它加了图像输入能力的视觉变体,命名里的 "Vision" 与 "Exp" 分别对应"视觉"和"实验"。官方口径称它的纯文本能力与 V4-Flash 持平,也就是说加视觉基本没有以牺牲文本能力为代价,一个模型可以同时覆盖文本与看图两类任务。
Q3:支持哪些图片格式? A3:明确支持 JPEG、PNG、GIF、WebP 四种。其中 GIF 在列值得注意,暗示对动图序列有一定包容,但具体是抽帧还是视作多帧输入,以模型卡与 API 文档说明为准(未确认)。日常最常见的 JPEG 与 PNG 自然覆盖,WebP 也覆盖,能省去一层转码。
Q4:视觉能力和 Claude Opus 4.8 比如何? A4:常见说法是"接近 Claude Opus 4.8",但这只是官方 API 文档与媒体给出的定性口径,不是带对照组的公开 benchmark,也不是独立第三方复现的数字。正确理解是:它把开放权重视觉模型推到了"接近一线闭源"的量级,是一个量级信号而非精确分数。在严肃对比前,建议用你自己的业务图片集跑一轮小评测把它落到实处。
Q5:参数量和上下文是多少,为什么标"未确认"? A5:媒体口径称参数约 305B、上下文约 1M,但 DeepSeek 官方尚未在模型卡或公告中确认这两个数字,所以本文一律标"未确认"。之所以要标,是因为它们直接决定你部署要多少显存与并行策略,把未确认数字当确定值写进方案会失真。建议把它当量级感知,等官方确认再回填到采购与部署文档里。