Vidu S2把视频模型推向实时

生数科技发布Vidu S2,用两款模型同时升级实时数字人、流式视频编辑和空间视频。真正值得关注的不是720p,而是视频生成开始从一次性交付转向持续运行、随时可改。
Vidu S2一次更新了三条产品线
生数科技昨日(9月15日)正式发布 Vidu S2,并在发布后直接开放在线体验。
这次更新包含两款模型:
- Vidu S2-Avatar:面向可持续交互的实时数字角色;
- Vidu S2-Editing:面向持续输入视频流的实时编辑。
在此基础上,Vidu还把生成或编辑后的画面转换为左右眼视频,开始探索可通过VR头显观看的空间视频。
简单概括,Vidu S2想做三件事:让数字人一边和用户说话一边做动作,让正在播放的视频不用暂停就能换人、换衣服、换背景,再把这些实时画面送进头显。

这并不是常规的画质升级。相比此前只能围绕一张初始图像持续生成的S1,S2把控制对象扩展到了动态参考图和连续视频流。用户可以在运行过程中不断追加图片与指令,模型则需要在不中断输出的情况下接住这些变化。
从产品方向看,Vidu S2正在把视频模型从“提交任务、等待结果”的生成工具,改造成一个持续运行的视频系统。这一步比把离线视频从5秒延长到10秒更重要,也更难。
数字人不再只动嘴,开始处理全身动作
S2-Avatar的实时输出分辨率由上一代的540p提升到720p,公开演示中的帧率维持在25至42 FPS区间。对桌面端数字人、直播窗口和视频通话来说,这已经跨过了“能连续看”的门槛。
更明显的变化发生在动作上。
过去一批实时数字人产品,重点通常是语音驱动口型,最多再加入眨眼、点头和轻微手势。它们本质上更像一张会说话的证件照:脸部可以动,但身体不敢大幅度活动,因为动作范围一旦扩大,人物结构、服装纹理和背景就更容易发生漂移。
S2-Avatar把控制范围推进到了摆臂、扭身、踏步、抬腿和舞蹈等全身动作。用户也可以在对话过程中加入新的参考图,让角色拿起指定物品、替换服装或者切换场景,而不必结束当前会话后重新生成。
这里的关键不只是“能做动作”,而是模型要理解动作发生的顺序。例如,人物接到抬腿指令后,需要从当前姿态自然过渡,完成动作,再保持一个合理的结束状态。若系统只会逐帧匹配文本,人物很容易在动作中途突然复位,或者像游戏角色丢失骨骼绑定一样发生肢体错位。
从公开技术说明看,团队为S2-Avatar补充了直播、访谈、影视、舞蹈、二维动画和三维动画等训练素材,并按照事件发生顺序标记动作的开始、变化和结束状态。这种标注方法不是只告诉模型“画面里有人跳舞”,而是进一步告诉它:动作什么时候启动、如何推进、结束后人物处于什么姿态。
这让实时数字人的目标从“保持一张脸”变成了“保持一个正在行动的角色”。
S2-Editing更像视频流上的生成式滤镜
另一款S2-Editing处理的不是模型自行生成的角色,而是外部持续输入的真人视频流。
人物可以继续表演,用户则能在不中断视频的情况下修改:
- 人物身份与外观;
- 服装和配饰;
- 背景与环境;
- 整体艺术风格;
- 画面中的主体或指定物体。
例如,一名主播正在镜头前移动,系统可以把衣服替换成另一张参考图中的款式,同时尽量保留原视频的动作节奏;也可以把现实房间改成动画场景,或者将真人转换为风格化角色。
它看起来像直播软件里的滤镜,但底层难度不是一个级别。传统滤镜通常围绕人脸关键点、分割蒙版或预制特效工作,能改的内容有限,却很容易保持稳定。生成式编辑能重绘人物与环境,控制空间大得多,相应地也更容易让脸、手、衣服和背景在连续画面中悄悄变形。
因此,实时视频编辑真正需要考察的不是某一帧有多惊艳,而是运行几分钟之后,人物是否还是同一个人,衣服纹理有没有闪烁,快速转身时背景会不会崩掉,以及新指令是否只修改该修改的部分。
这也是Vidu S2此次最有产品价值、同时最需要长期验证的能力。一次漂亮的演示并不难,稳定接入直播、电商、游戏和视频会议才难。
流式生成为什么比离线视频更棘手
普通视频扩散模型通常先拿到完整输入,再经过多轮去噪交付一段成片。它有机会同时观察片段的开头和结尾,发现中间出现偏差时也可以整体调整。
流式模型没有这种余地。
它只能依据已经发生的画面,逐段预测接下来的内容。上一段出现的面部变形、动作偏差或背景漂移,会被当成下一段的历史条件继续传递。误差就像滚雪球,运行时间越长,越可能从轻微闪烁积累成角色彻底崩坏。
用户中途再加入一张参考图或一条新指令,问题会进一步复杂化。模型至少要同时回答三个问题:
- 人物此刻正在做什么,动作进行到了哪一步;
- 现有画面中哪些内容应该继续保持;
- 新指令从什么时候开始生效,又应该影响哪些区域。
如果响应过慢,实时交互就失去意义;如果为了速度牺牲一致性,角色会越生成越不像;如果控制边界不准,换衣服可能顺手把脸和背景一起重画。
Vidu S2的技术路线可以归纳为一个“速度—稳定—控制”的三角:速度决定能否互动,稳定决定能否长时间运行,控制决定产品是否真的可用。三者必须同时成立,仅有高帧率并不足以构成实时视频产品。
这也是为什么从S1的实时对话推进到S2的动态参考图和连续视频编辑,工作量远不只是升级分辨率。
空间视频有想象力,但目前仍是早期能力
Vidu S2还展示了空间视频方向:把S2-Avatar生成的数字角色,或者经过S2-Editing修改的现实视频流,转换为分别供左右眼观看的视频,并通过VR头显呈现立体效果。
难点在于,左右眼画面必须保持严格一致,同时又要存在符合深度关系的细微视差。若左眼中的人物抬起右手,右眼画面却在手指数量、服装纹理或背景边缘上发生变化,普通屏幕里不明显的生成瑕疵,进入头显后会被迅速放大,甚至造成视觉不适。
但需要把产品边界说清楚:当前能力仍以固定视角的双目视频为主,更接近一块具有立体感的动态窗口,而不是可以自由转头、绕到角色身后观察的完整三维世界。
它与真正的六自由度沉浸环境之间,至少还隔着多视角一致性、场景几何重建、遮挡关系处理和实时视点合成等问题。头显的大视野也会进一步放大720p分辨率的不足,端到端延迟则会直接影响交互体验。
所以,空间视频更像Vidu S2提前放出的一张路线图,而不是已经成熟的主力功能。它的意义在于证明实时生成链路可以向双目显示继续延伸,但离“走进AI生成世界”还有明显距离。
69天迭代,生数在抢实时视频的窗口
Vidu S1论文于今年7月3日提交,S2论文在9月10日公开,两者相隔约69天。S2随后于9月15日发布并开放体验,这个节奏在视频模型行业里相当激进。
短周期内,Vidu完成了几项实质变化:
- 输出从540p提高到720p;
- 从以说话为主扩展到舞蹈等全身动作;
- 从固定数字人扩展到可随时加入的新参考图;
- 从模型自行生成扩展到持续输入的真人视频流;
- 将实时链路延伸到左右眼同步的空间视频。
根据生数科技公布的技术报告,S2-Avatar在实时数字角色基准StreamAV-Bench的九项指标中,均取得报告所列对比模型的最优结果;S2-Editing在多项视频编辑测试中的总体得分,也超过报告选取的离线及流式模型。
不过,这类结果仍应谨慎解读。一方面,实时视频尚未形成像语言模型那样相对成熟、被广泛接受的评测体系;另一方面,企业自行选择的测试集、对比模型和运行条件,未必完整反映真实业务中的长时稳定性、网络延迟与推理成本。
对开发者来说,比榜单更值得关注的是几个没有完全公开的指标:单路720p视频需要多少算力、并发扩大后延迟如何变化、参考图注入需要多久生效、连续运行半小时后的身份一致性,以及API能否提供足够细的状态与错误控制。
这些指标决定它究竟是一个演示效果很强的模型,还是能被嵌进直播、电商和互动娱乐业务的基础设施。
实时视频的竞争,不再只是生成一条好片
过去两年,视频模型竞争的主要尺度是画质、时长、镜头运动和提示词遵循。产品形态大多类似:输入提示词或图片,等待几十秒到几分钟,得到一段成片。
Vidu S2所代表的方向不同。模型不再等待用户把需求一次说完,而是始终在线,持续接收音频、图像、视频和文本状态,再即时改变输出。
这会打开一批离线视频模型不容易覆盖的场景:
- 游戏中的实时NPC和虚拟伙伴;
- 能做全身动作的数字客服、教师与主播;
- 直播间实时换装和虚拟场景改造;
- 视频会议中的风格化形象与环境替换;
- 面向头显的互动角色和空间内容;
- 由观众指令实时改变的互动节目。
我们的判断是,Vidu S2最重要的更新不是720p,也不是空间视频,而是把“编辑”放进了视频正在发生的过程里。从行业位置看,它比单纯刷新离线生成画质更有辨识度。
但实时产品也意味着更残酷的检验。离线模型生成失败,用户可以重试;直播过程中的模型一旦崩坏,错误会直接出现在观众面前。能否长期稳定、是否支持可预测的延迟、推理成本能不能撑住商业并发,都会比单条演示视频的观感更重要。
Vidu S2已经把实时生成、实时编辑和双目空间视频串成了一条技术链。下一步要证明的,是这条链不仅跑得起来,还能足够便宜、足够稳定地一直跑下去。
参考来源
受文章外链域名限制,以下原始报道域名不在允许保留的列表中,因此不附直接链接。
- 量子位:Vidu S2实时互动、视频编辑与空间视频能力梳理。
- 网易智能:Vidu S2技术流程、训练数据与实际效果介绍。
- 新浪财经:生数科技发布S2-Avatar和S2-Editing及开放体验信息。
- Vidu官方产品资料:Vidu S1既有规格及S2上线时间说明。



