2026 年 9 月 16 日,生数科技(Shengshu)正式发布 Vidu S2。和过去一年里我们写过的很多"视频生成模型又升级了"不同,这一次的关键词不是"更长""更清晰""更便宜",而是"实时"。Vidu S2 不是一条等你提交提示词、几十秒后取片的离线管线,而是一套可以在对话里即时响应、边聊边改、所见即所得的视频生成系统。更准确地说,它包含两个模型:Vidu S2-Avatar 和 Vidu S2-Editing。前者解决"人和虚拟形象实时互动"的问题,后者把风格迁移、虚拟试穿、人物替换、背景替换四类编辑任务做到了实时。这篇文章想说清楚一件事:实时,可能才是视频生成真正分水岭级别的变量,而它难的不是算力,是范式。我们不做厂商通稿,只把这次发布放在行业坐标系里,看清楚它到底新在哪、难在哪、对从业者意味着什么。
一、这次发布到底新在哪:从离线生成到实时交互与编辑
过去两年视频生成的主线一直是"离线生成"。你给一段提示词、几张参考图,模型在后台跑几十秒到几分钟,吐出一条成片。Sora、可灵、即梦、Seedance 大体都还在这个框架里。它的本质是"批处理":提交、等待、取结果,不满意就改提示词重跑。这种模式的代价是交互成本高到离谱——你想把主角的帽子换掉,得重新生成整条片子;你想把背景从白天调到黄昏,又得等一轮。创作过程被切割成"生成"和"修改"两个断裂的阶段,而修改几乎等于重做。
Vidu S2 想干掉的正是这个断裂。先看 S2-Avatar。它的卖点是:在对话互动过程中,参考图可以动态更新,模型实时输出,分辨率从上一时代的 540P 提升到 720P,而且能完成摘戴帽子这类连续动作并保持状态。翻译成人话就是:你一边说话,虚拟形象一边动,你随手换一张图,它的外观跟着变,整个过程是连续的、低延迟的、可中途干预的。这和过去"生成一段固定视频再播放"完全不是一回事,它是把生成嵌进了对话回路里。
再看 S2-Editing。它把四类任务实时化:风格迁移(把一段视频的画风换成另一种)、虚拟试穿(给画面里的人物换衣服)、人物替换(换掉主角)、背景替换(换掉场景)。这四类恰好覆盖了电商、广告、短剧里最反复的"改来改去"环节。过去这些事要丢进后期软件里一帧帧抠,或者重新生成整条片子;现在它被压缩成一次实时操作。
所以"新"不在某个单项指标,而在工作流的形状变了:生成不再是一次性的后台任务,而是变成了一个可以持续对话、随时改向、即时看到结果的过程。这是从"批处理"到"实时交互"的范式切换。这也是为什么我们认为它比单纯"画质又提升一档"更值得写——画质提升是量变,工作流切换才是质变。
二、实时交互对比离线生成:两种工作流对内容创作者意味着什么
把两种工作流摆到一起看,差异比参数表更刺眼。下面这张表把关键维度列出来,每一项都关系到创作者的真实成本。
| 维度 | 离线生成(Sora、可灵、即梦、Seedance 等) | 实时交互(Vidu S2) |
|---|---|---|
| 交互方式 | 提交提示词,后台等待数十秒到数分钟,取出成片 | 对话式交互,边说边改,所见即所得 |
| 改稿成本 | 一次修改往往等于一次完整重生成,付整条片子的算力 | 修改是增量、局部、可逆的,只动对应那一块 |
| 可控性 | 改向靠重写提示词重跑,难以精确到某一帧某一物 | 参考图动态更新,可中途干预,改动范围可控 |
| 实时分辨率现状 | 离线旗舰可冲 1080P 甚至更高 | 实时输出为 720P,画质与离线旗舰仍有差距 |
| 反馈闭环 | 导演、剪辑、客户围着成片来回传文件,天级或小时级 | 同一块屏幕边说边看边改,闭环压缩到秒级 |
| 典型适用场景 | 对画质和时长要求高的成片、广告大片 | 电商试穿、虚拟人直播、互动短剧、多版本小样 |
这张表里面,最该被从业者盯住的是"改稿成本"和"可控性"两行。在离线生成里,一次修改常常意味着一次完整重生成:你付的是整条片子的算力,等的是整条片子的时延,得到的却只是某一个局部的变化。而在实时交互里,修改是增量的、局部的、可逆的——你动一下参考图,画面里只对应那一块跟着变,其余保持不动。这意味着创作者的试错成本从"重来一遍"降到了"挪一下"。对经常要出十几个版本的小团队来说,这条差异直接决定了交付速度。
协作方式的改变更隐蔽,也更重要。离线模式下,导演、剪辑、客户是围着"成片"来回传文件的,一轮反馈可能要等半天。实时模式下,他们可以围着同一块屏幕,边说边看边改,反馈闭环从天级、小时级压缩到秒级。这条变化对短剧、直播切片、广告小样这类"快速出多版"的需求尤其关键——它直接把"多版本试错"的经济成本打了下来,让小团队也能负担得起过去只有大厂玩得起的反复打磨。
当然也要泼盆冷水:实时交互不是免费午餐。它把等待时延从几十秒压到近乎即时,代价是单帧画质和单条时长通常要往下让。720P 实时是当前工程的现实选择,离离线旗舰的 1080P 甚至更高清成片还有肉眼可见的差距。换句话说,实时赢在"过程",离线暂时还赢在"结果画质"。选型时别只盯着"实时"两个字,要看你的场景到底卡在时延还是卡在画质。
三、技术信号:为什么"实时"难,难在耦合不在算力
很多人直觉以为"实时"就是把模型跑得更快、堆更多显卡。这是误解。实时视频生成的难点不在单点速度,而在多模态理解和生成的高度耦合。
离线生成可以拆成一条清晰的流水线:理解提示词、规划镜头、逐帧扩散去噪、后处理。每一步都能独立优化、独立缓存、独立重试。某一帧崩了,可以只重跑那一段。实时不行。实时要求模型在每一帧都同时做三件事:理解用户刚说的一句话或者刚换的一张图、把它映射到当前视频的时空结构、并增量地生成下一帧——而且还要保持前后帧一致、人物身份一致、动作连贯。理解、规划、生成这三件事被压进了同一个低延迟回路,任何一环慢了,体验就崩。它不是"更快的离线",而是"另一种架构"。
这也是为什么 720P 是当下稳妥的上限,而不是妥协话术。分辨率每高一档,单帧的计算量就指数级往上走,而实时回路对单帧预算卡得非常死。生数科技把实时分辨率定在 720P,既是对画质和延迟的折中,也是工程现实的无声交代:在今天的算力和模型效率下,实时和超高清还无法兼得。谁先在这条耦合链路上做出突破,谁就掌握了下一阶段的话语权,而不是谁显卡多。
顺着这个判断往下看,行业里真正的护城河会从"谁的模型参数大"转向"谁的实时回路做得稳"。这恰恰是不好抄的一点:堆算力可以靠钱解决,把理解、规划、生成耦合进一个低延迟闭环,靠的是架构设计和工程打磨,是慢功夫。所以别一看到"实时"就觉得明天所有人都能做出来,真正的门槛在看不见的地方。
四、对从业者与小团队的启发:机会在场景,约束在商业
说了这么多技术,落到地面上,实时编辑类能力最先会落在哪些地方?我们按"离钱最近"排个序。
第一,电商试穿。虚拟试穿实时化之后,商家可以做到"用户上传一张照,镜头里的人瞬间换上这件衣服",把商品详情页从静态图变成可交互的视频。这比传统换脸、换衣后期便宜得多,也快得多,而且能直接拉动转化。对中小商家来说,过去请团队做一套试穿视频成本高、周期长,现在有可能变成一次实时生成。
第二,虚拟人直播与数字员工。S2-Avatar 的"对话中动态更新参考图加状态保持"正好对应虚拟主播需要边播边换造型、边答边动的需求。连续动作和身份稳定是虚拟人能不能"像个人"的关键,也是过去最烧钱的部分。实时化把这部分成本往下拉,对想做数字员工但养不起大团队的小公司是个好消息。
第三,互动内容与短剧。背景替换、人物替换实时化,让"同一剧本多版本"从后期工程变成现场操作。营销侧可以一镜拍完、当场出多个地域、多个主角版本,极大降低多版本内容的边际成本。
但有一个边界必须写清楚:Vidu S2 是生数科技的商用产品,目前没有公开的独立 GitHub 代码仓,也就是说没有开源权重可以本地部署、自行微调。这对小团队的含义很直接——你能用到的能力上限,等于厂商 API 开放的能力上限;你要付的成本,等于厂商的定价。实时能力的便利性,是用"被锁定在厂商生态里"换来的。如果定价偏高或者 API 限流,实时编辑的性价比会迅速塌方。所以我们的建议是:把它当作趁手的外部工具,而不是可以嵌进自己技术栈的底层能力。关键决策前,先问清楚三件事——按什么收费、限不限流、数据归谁。
五、冷静看待:等实测与定价,再下结论
最后必须降温。关于 Vidu S2,目前能确认的事实有限:发布方是生数科技,发布时间是 2026 年 9 月 16 日,产品包含 S2-Avatar 与 S2-Editing 两个模型,Avatar 实时分辨率从 540P 升到 720P 并支持参考图动态更新与状态保持,Editing 支持风格迁移、虚拟试穿、人物替换、背景替换四类实时任务。这些信息来自厂商发布与媒体快讯,属于"已官宣"的范畴,本文直接复用,不做二次加工。
但有两件事现在还不能下结论。其一,实时画质到底如何、单条能撑多长、连续交互下会不会崩一致性,目前缺少第三方独立评测,几乎全是厂商自述。没有盲测、没有横向对比、没有长时段压力测试,任何"效果惊艳"的判断都先打个问号。其二,定价尚未公布,而商用产品的真实门槛往往藏在价格里——同样的能力,按次收费还是包月、贵还是便宜,直接决定它能不能进小团队的日常流水线。一个实时编辑很香但按秒计费的产品,和一个小团队用不起的产品,是同一件事的两面。
所以判断先收着:Vidu S2 把"实时"这个变量摆上了台面,方向我们认可,它是不是真的分水岭,要等第三方实测和定价出来再说。对从业者最务实的做法是:先盯住官方演示里你最关心的那个场景,等实测视频和价格公布,再做"要不要接"的决定。别被"实时"两个字冲昏头,也别因为"又是个商业产品"就直接划走——它能省掉的改稿时间,可能比你想象的更值钱。我们后续会跟进第三方评测与定价信息,届时再补一篇实测向的更新。
把 Vidu S2 放回行业坐标系里看,它真正的信号不是"又一个视频模型发布了",而是视频生成开始从"批处理工具"转向"实时交互媒介"。离线生成解决的是"能不能产片",实时交互解决的是"能不能边做边改"。前者拼画质和时长,后者拼回路和稳定。生数科技这次把实时分辨率定在 720P,等于坦率承认了工程现实:实时和超高清暂时无法兼得。对内容从业者来说,值得兴奋的是工作流真的要变了,值得警惕的是它仍是商业产品、无开源权重,能力边界由厂商定价说了算。先观察,等实测,再动手,是对这次发布最稳妥的态度。