开源项目
开源项目

DeepSeek-V4-Flash-Vision-Exp 开源发布

DeepSeek-V4-Flash-Vision-Exp 是 V4-Flash 的视觉实验版。核真更正:它不在 GitHub(api.github.com 该仓库返回 HTTP 404),开源地在 Hugging Face(deepseek-ai/DeepSeek-V4-Flash-Vision-Exp);IT之家实际报道于 2026/8/31 19:35,非 9/1。MIT 许可(可商用),支持 JPEG/PNG/GIF/WebP 图片输入,视觉能力接近 Claude Opus 4.8、纯文本与 V4-Flash 持平,均出自官方 API 文档与媒体。参数量约 305B、1M 上下文为媒体转述【未确认】。本文给落地指引:自部署走 HF 模型卡、轻量调用走官方 API,并提醒先拿真实业务图做冒烟测试。已确认与未确认项在文中分表呈现。

发布于 2026年9月1日10 分钟阅读
<!-- deepseek-v4-flash-vision-exp-resource | open-source | DeepSeek-V4-Flash-Vision-Exp 开源发布 -->

2026 年 8 月 31 日 19:35,IT之家(IThome)报道了一条容易被开发者忽略、但值得记住的消息:DeepSeek 放出了 DeepSeek-V4-Flash-Vision-Exp——一个 DeepSeek-V4-Flash 的视觉实验变体。它不是又一篇论文,也不是路线图上的占位符,而是一个已经能拿到的开源权重模型,采用 MIT 许可,开放权重、允许商用。本文是一篇"实际怎么拿到、怎么用"的开源资源帖:先讲清楚它到底在哪、能做什么、哪些信息是确认过的、哪些还只是媒体口径,再把获取与调用路径、和闭源视觉模型的对标、以及几个容易踩的坑一次讲透。关于 V4-Flash 纯文本能力的横向评测,见 DeepSeek-V4-Flash 热点解读;想要看旗舰级编码与推理模型的对照,见 旗舰编码推理横评


一、先说结论:它是什么、在哪、是不是开源

把最关键的事实先摆在最前面,免得读者绕路。

第一,它是一个"视觉变体",不是 V4-Flash 本身。DeepSeek-V4-Flash 是纯文本模型,而 DeepSeek-V4-Flash-Vision-Exp 在它基础上加了图像输入能力,官方的命名里 "Vision" 与 "Exp(Experimental,实验)" 两个词都很关键,下文会分别解释。

第二,它确实是开源权重,而且是 MIT 许可。MIT 是最宽松的常见开源许可之一,意味着你可以下载权重、自己部署、修改、并且用于商业用途,只要保留许可声明即可。这一点对想把它接进自己产品的团队很重要:你不必担心商用手收授权费的问题。

第三,它不托管在 GitHub。这一点必须强调,因为它和很多人的直觉相反。DeepSeek 的不少模型过去常先在 GitHub 上出现,但这次实测 GitHub 的仓库接口对 DeepSeek-V4-Flash-Vision-Exp 返回的是 HTTP 404,也就是说仓库根本不存在。正确的位置是 Hugging Face 上的 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 模型卡。

第四,能力边界要明确:它支持图像输入,接受 JPEG、PNG、GIF、WebP 四种格式;视觉能力"接近 Claude Opus 4.8"(这是官方 API 文档与媒体口径,不是独立第三方评测的数字);纯文本能力与 V4-Flash 持平。参数规模约 305B、上下文约 1M 这两条是媒体口径,官方尚未确认,下文单列一节讲为什么必须标注"未确认"。

把"确认过"和"只是媒体说"分开看,是读这篇文章最重要的一件事:

项目状态来源
模型归属已确认:V4-Flash 的视觉变体Hugging Face 模型卡 / IT之家
托管位置已确认:Hugging Face,非 GitHubapi.github.com 返回 404 + IT之家
许可已确认:MIT,允许商用Hugging Face 模型卡
图像格式已确认:JPEG / PNG / GIF / WebP官方 API 文档
视觉水平媒体口径:接近 Claude Opus 4.8官方 API 文档 / 媒体
纯文本能力已确认:与 V4-Flash 持平官方口径
参数规模未确认:约 305B,媒体口径媒体,未经 DeepSeek 确认
上下文长度未确认:约 1M,媒体口径媒体,未经 DeepSeek 确认

二、关键纠正:别去 GitHub 翻了,它在 Hugging Face

这一节专门救读者的时间,因为预期错了会很浪费功夫。

很多人找 DeepSeek 新模型的第一反应是打开 GitHub,搜 deepseek-ai 组织下的仓库。对这次的 Vision-Exp,这个动作会扑空。我们按 GitHub 的公开仓库接口做了一致性核对,地址 api.github.com/repos/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 返回的是 HTTP 404,代表该仓库在 GitHub 上不存在。所以如果你在 GitHub 上翻了半天没找到,那不是你搜错了,而是它压根不在那里。

真正的地址是 Hugging Face:deepseek-ai/DeepSeek-V4-Flash-Vision-Exp。模型卡里给出权重文件、基础用法说明与许可信息。Hugging Face 的模型卡地址通常形如 https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp,请以模型卡页面实际展示的内容为准,本文不替你锁定一个可能变动的具体 URL。

为什么这次不在 GitHub?一个合理的推测是:DeepSeek 现在把权重分发的主要阵地转移到了 Hugging Face,那里更接近推理部署的生态(transformers、vLLM、各家的推理引擎都直接读 Hugging Face 的格式)。但这是推测,不是确认的事实。对用户而言,结论很简单:去找 Hugging Face,别在 GitHub 上耗时间。

发布时间也要说准。IT之家(IThome)的报道时间是 2026 年 8 月 31 日 19:35,而不是某些人以为是的 9 月 1 日。如果你在核对时间线,以 8 月 31 日晚这条为准。这个小差别不重要到影响技术,但涉及"谁先报、什么时候能拿到"时,准确的时间戳能避免你被二手信息带偏。


三、能力边界:图像输入与"接近 Claude Opus 4.8"的视觉

把能力讲清楚,分三块:输入、格式、质量水平。

输入侧,它接受图像,可以处理"图 + 文"的多模态请求。这意味着它能做看图问答、图片内容理解、以图为基础的推理这一类任务,而不是只能处理纯文本。对需要把视觉信号接进工作流的团队,多模态是质的不同,不是量的叠加。

格式侧,明确支持 JPEG、PNG、GIF、WebP 四种。GIF 在列值得注意,因为它暗示对动图序列有一定的包容(具体是抽帧还是视作多帧输入,以模型卡与 API 文档说明为准,未确认)。日常最常见的 JPEG 与 PNG 自然覆盖,WebP 则是 web 场景里很常见的格式,覆盖它能少做一层转码。

质量侧,最常被引用的说法是"视觉能力接近 Claude Opus 4.8"。这里必须咬准字眼:这是官方 API 文档与媒体口径给出的定性描述,不是一张带对照组的公开 benchmark 表,更不是独立第三方复现的数字。正确的读法是——它把开放权重的视觉模型水平推到了"接近一线闭源视觉模型"的区间,是一个量级信号,而不是一个可以抄进选型文档的精确分数。在拿它做严肃对比之前,建议先用你自己的业务图片集跑一轮小评测,把"接近 Opus 4.8"这种说法在你关心的任务上落到实处。

纯文本能力方面,官方口径是"与 V4-Flash 持平"。换句话说,加视觉没有以牺牲文本能力为代价(至少官方口径如此)。如果你的场景主要是文本,又偶尔需要看图,这一个模型就能同时覆盖两段,不必在文本模型和视觉模型之间做路由切换。


四、参数与上下文:标注"未确认"的原因

参数约 305B、上下文约 1M 这两条,本文一律标注"未确认"。这不是故弄玄虚,而是因为它直接影响你"能不能部署、要多少卡"的判断,所以不能含糊。

为什么标"未确认"?因为这两条目前只出现在媒体报道里,DeepSeek 官方没有在模型卡或公告中给出确认数字。媒体口径有它的价值——它给出量级参考,让你心里有数这大概是个多大的东西;但它不等于官方规格。把未经确认的数字当确定值写进采购或部署方案,是会出事的:305B 级别意味着你需要相当可观的显存与并行策略,如果真实数字差出一截,你的容量规划就会整个失真。

上下文 1M 同理。1M 是个很诱人的数字,意味着能塞进很长的文档或多轮对话,但它同样只是媒体口径。在官方确认前,把它当"目标上界参考"而非"已验证能力"来用,更稳妥。

所以这一节的建议是:把"约 305B、约 1M 上下文"当量级感知,不要据此做硬性硬件决策,也不要在对外文档里写成确认规格;等 DeepSeek 官方确认数字,再回填方案。


五、怎么拿到并调用:两条路

落到实操,有两条主路径:Hugging Face 自部署,以及 DeepSeek 官方 API。

路径一,Hugging Face 自部署。去模型卡拉取权重,用兼容的推理框架加载。下面是一段最小示意(具体参数名以模型卡与推理框架文档为准):

python
from transformers import AutoModelForCausalLM, AutoProcessor

model = AutoModelForCausalLM.from_pretrained(
    "deepseek-ai/DeepSeek-V4-Flash-Vision-Exp",
    trust_remote_code=True,
)
processor = AutoProcessor.from_pretrained(
    "deepseek-ai/DeepSeek-V4-Flash-Vision-Exp",
)
# 把图像与文本一起送进去,具体调用形态以模型卡说明为准

注意 trust_remote_code 这类开关、以及图像张量的预处理方式,都应以模型卡的实际说明为准,上面的片段只是形态示意,不要照抄参数。

路径二,官方 API。如果你的场景不需要自己托管权重,直接走 DeepSeek 官方 API 是更省事的选择:你不必准备显卡,按调用量付费即可,而且官方 API 文档正是"视觉接近 Claude Opus 4.8"这一说法的出处之一。具体端点、鉴权方式与请求体结构,以官方 API 文档为准,本文不锁定可能变动的具体地址。

两条路怎么选?自部署适合对数据驻留、延迟、私有化有要求的团队,代价是你要准备硬件与运维;官方 API 适合想快速验证、或调用量还不大的团队,代价是数据要出网、且受 API 配额与定价约束。无论哪条路,都建议先用一小批真实业务图片做冒烟测试,确认格式与质量符合预期再放量。

顺带一提,关于 V4-Flash 本身的纯文本能力横评,见 DeepSeek-V4-Flash 热点解读;想要把一个开源视觉模型放进"旗舰级编码与推理"的大盘里看位置,见 旗舰编码推理横评


六、与闭源视觉模型怎么比,以及"实验"标签的分量

把 DeepSeek-V4-Flash-Vision-Exp 放进整个视觉模型版图里看,它的位置很清晰:开放权重、MIT 可商用、视觉水平接近一线闭源。这三点叠在一起,正是它值得关注的原因。

和 Claude Opus 4.8 这类闭源视觉模型比,它的核心差异不在"谁更强"一句话能概括,而在"控制权":闭源模型你只能调用、不能改、商用往往要谈授权与定价;而这个模型你拿得到权重,能自己部署、能微调、能嵌进私有链路。代价是你得自己扛部署与运维,而且"接近"不等于"持平"——在官方与独立评测拿出更硬的数字之前,"接近"只是量级描述。

和别的开放权重视觉模型比,它的卖点是"前沿邻接"的视觉质量加上 MIT 商用的宽松度。很多开源视觉模型在质量或许可上有一项短板,而这个模型两项都给了,因此对想做商用产品的团队尤其友好。

最后说"实验(Exp)"这个标签的分量。它不是一个装饰词。DeepSeek 在正式放出完整的 V4-Vision 之前,先以 "Exp" 的形式放出这个视觉变体,最合理的解释是:它在用社区的反馈与真实负载来探路,验证视觉能力接进 V4 体系的效果,为后续更完整的视觉版本铺路。对读者而言,这有两层含义:一是它可能会迭代、甚至可能改名或被正式版取代,不要把它当成"最终形态"锁死;二是现在正是尝鲜和建立自有评测的好窗口,等正式版出来,你手里已有的对比数据会很有价值。


七、落地清单

把上文落成一张可勾选的清单:

动作依据优先级
去 Hugging Face 而非 GitHub 取模型GitHub 仓库返回 404
确认 MIT 许可满足你的商用合规Hugging Face 模型卡
用真实业务图片做冒烟测试"接近 Opus 4.8"为口径,非实测分数
自部署前按约 305B 量级估硬件,但等官方确认数字再定采购参数规模未确认
选自部署还是官方 API,先定数据驻留与延迟要求两条路径权衡
把"接近 Opus 4.8"在自己任务上复测,别直接抄进选型文档媒体口径,非第三方复核
关注 Exp 标签,预留后续被正式版取代的迁移空间实验性质,可能迭代

参考来源

  • Hugging Face 模型卡 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp——模型归属(V4-Flash 的视觉变体)、MIT 许可与商用允许、JPEG/PNG/GIF/WebP 格式支持、权重与模型卡说明,均出自本条。具体模型卡 URL 以 Hugging Face 实际页面为准。
  • GitHub 公开仓库接口 api.github.com/repos/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 实测返回 HTTP 404——证明该模型不托管在 GitHub,本文据此提示读者不要去 GitHub 寻找。
  • IT之家(IThome)2026 年 8 月 31 日 19:35 报道——模型现身的报道时间与基础信息的中文交叉印证;注意报道时间为 8 月 31 日而非 9 月 1 日。
  • DeepSeek 官方 API 文档——"视觉能力接近 Claude Opus 4.8"的口径出处之一、纯文本能力与 V4-Flash 持平的官方表述、图像格式与调用方式说明。具体文档 URL 以官方为准。
  • 媒体对参数约 305B、上下文约 1M 的报道——本文标注为未确认,仅作量级参考,未经 DeepSeek 官方确认。
  • 除上述条目外,本文关于"实验标签含义""两条路径权衡""对标闭源模型"等论述为编者分析与推断,已在正文逐处标注,不属于官方来源。

常见问题

Q1:在哪能下载或调用这个模型? A1:不要去 GitHub 找——GitHub 仓库接口对该模型返回 HTTP 404,它并不在 GitHub 上。正确位置是 Hugging Face 的 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 模型卡,你可以在那里下载权重自行部署;如果不想自己托管,也可以走 DeepSeek 官方 API 直接调用。两条路的具体地址与参数以模型卡和官方 API 文档为准。

Q2:它和 DeepSeek-V4-Flash 是什么关系? A2:DeepSeek-V4-Flash 是纯文本模型,而 DeepSeek-V4-Flash-Vision-Exp 是它加了图像输入能力的视觉变体,命名里的 "Vision" 与 "Exp" 分别对应"视觉"和"实验"。官方口径称它的纯文本能力与 V4-Flash 持平,也就是说加视觉基本没有以牺牲文本能力为代价,一个模型可以同时覆盖文本与看图两类任务。

Q3:支持哪些图片格式? A3:明确支持 JPEG、PNG、GIF、WebP 四种。其中 GIF 在列值得注意,暗示对动图序列有一定包容,但具体是抽帧还是视作多帧输入,以模型卡与 API 文档说明为准(未确认)。日常最常见的 JPEG 与 PNG 自然覆盖,WebP 也覆盖,能省去一层转码。

Q4:视觉能力和 Claude Opus 4.8 比如何? A4:常见说法是"接近 Claude Opus 4.8",但这只是官方 API 文档与媒体给出的定性口径,不是带对照组的公开 benchmark,也不是独立第三方复现的数字。正确理解是:它把开放权重视觉模型推到了"接近一线闭源"的量级,是一个量级信号而非精确分数。在严肃对比前,建议用你自己的业务图片集跑一轮小评测把它落到实处。

Q5:参数量和上下文是多少,为什么标"未确认"? A5:媒体口径称参数约 305B、上下文约 1M,但 DeepSeek 官方尚未在模型卡或公告中确认这两个数字,所以本文一律标"未确认"。之所以要标,是因为它们直接决定你部署要多少显存与并行策略,把未确认数字当确定值写进方案会失真。建议把它当量级感知,等官方确认再回填到采购与部署文档里。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-01

常见问题

在哪能下载或调用这个模型?
不要去 GitHub 找——GitHub 仓库接口对该模型返回 HTTP 404,它并不在 GitHub 上。正确位置是 Hugging Face 的 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 模型卡,你可以在那里下载权重自行部署;如果不想自己托管,也可以走 DeepSeek 官方 API 直接调用。两条路的具体地址与参数以模型卡和官方 API 文档为准。
它和 DeepSeek-V4-Flash 是什么关系?
DeepSeek-V4-Flash 是纯文本模型,而 DeepSeek-V4-Flash-Vision-Exp 是它加了图像输入能力的视觉变体,命名里的 "Vision" 与 "Exp" 分别对应"视觉"和"实验"。官方口径称它的纯文本能力与 V4-Flash 持平,也就是说加视觉基本没有以牺牲文本能力为代价,一个模型可以同时覆盖文本与看图两类任务。
支持哪些图片格式?
明确支持 JPEG、PNG、GIF、WebP 四种。其中 GIF 在列值得注意,暗示对动图序列有一定包容,但具体是抽帧还是视作多帧输入,以模型卡与 API 文档说明为准(未确认)。日常最常见的 JPEG 与 PNG 自然覆盖,WebP 也覆盖,能省去一层转码。
视觉能力和 Claude Opus 4.8 比如何?
常见说法是"接近 Claude Opus 4.8",但这只是官方 API 文档与媒体给出的定性口径,不是带对照组的公开 benchmark,也不是独立第三方复现的数字。正确理解是:它把开放权重视觉模型推到了"接近一线闭源"的量级,是一个量级信号而非精确分数。在严肃对比前,建议用你自己的业务图片集跑一轮小评测把它落到实处。
参数量和上下文是多少,为什么标"未确认"?
媒体口径称参数约 305B、上下文约 1M,但 DeepSeek 官方尚未在模型卡或公告中确认这两个数字,所以本文一律标"未确认"。之所以要标,是因为它们直接决定你部署要多少显存与并行策略,把未确认数字当确定值写进方案会失真。建议把它当量级感知,等官方确认再回填到采购与部署文档里。

相关文章

开源项目

Hugging Face 的 399 美元机器鸭 Microduck:双仓库 5100 星全开源,但硬件设计文件是否开源存在分歧

2026 年 8 月 27 日,Hugging Face 与旗下 Pollen Robotics 发布 Microduck:25 厘米高、不到 800 克的鸭形双足机器人,售价 399 美元,当天开放预订。硬件参数是 RK3566 主控、1GB 内存加 32GB 存储、15 个 XL330 舵机、8×8 ToF 激光雷达、2600mAh 电池(标称续航约一小时),控制策略以 ONNX 跑在板载芯片上、控制环 50Hz——这一条把它和「带 App 的玩具」区分开。真正值钱的是随硬件一起放出来的软件:运行时与 SDK、物理仿真环境、完整强化学习训练栈,两个 GitHub 仓库 `pollen-robotics/microduck` 与 `microduck_rl` 均以 Apache-2.0 发布,2026-08-31 经 API 实测分别为 4108★/485 fork 与 1037★/179 fork。训练侧用 MuJoCo Warp(mjlab)加 PPO,4096 个并行环境下 1 到 2 小时能出可部署步态,并用执行器模型、域随机化与 backlash 仿真解决 sim-to-real,观测归一化在导出 ONNX 时烘焙进图里。需要说清的是:硬件设计文件是否一并开源,来源之间存在分歧,本文单列一节拆成四层供读者自查,不替任何一方下结论。

2026年8月31日8 分钟阅读
开源项目

LLaDA-Image:蚂蚁全开源的 6B 统一生图编辑模型

蚂蚁 InclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image(GitHub 2026-09-09 快照 208 星 / Python / 创建 2026-08-31)。单一权重同时做文生图与指令编辑,backbone 与 DiT 都是扩散模型的统一框架,图像-only 预训练建视觉先验,Turbo 版用 Twin-DMD 蒸馏把 50 步压到 4 步;Qwen-Image-Bench 英文 53.53、中文 53.38 双料 SOTA;HF 与 ModelScope 提供 Base/Turbo 各含 FP8 四档权重,9-07 起有社区 ComfyUI。最重要避坑:仓库 license 字段为 null、无 LICENSE 文件,商用前须向官方确认,不可臆测为 Apache/MIT。

2026年9月9日10 分钟阅读
开源项目

OpenMAIC周增八千星登顶,把文档变多智能体课堂

THU-MAIC/OpenMAIC 以周增 8,095 星登顶 GitHub 周榜(2026-09-08 快照 33,053 星 / 5,369 fork / TypeScript / MIT)。它把任意主题或文档变成多智能体互动课堂:AI 老师与 AI 同学实时讲课、讨论、白板板书、TTS 朗读,生成幻灯片、测验、交互式模拟与 PBL 项目制学习,可导出 .pptx 与交互 HTML。v1.0.0(2026-08-27)新增 Agent workbench 聊天式构建、持久化会话、20 个内置技能;技术栈 Next.js 16 / React 19 / LangGraph 1.1;v0.3.0 起由 AGPL-3.0 转 MIT,并内置 SKILL.md 标准技能包,可从 OpenClaw、Codex、WorkBuddy 等工作台直接生成课堂。

2026年9月8日10 分钟阅读