Vidu S2 实测:乔布斯数字人开口点评 iPhone Duo,还能实时换装

视频生成模型大多还在比时长和清晰度。生成完,再等结果。生数科技刚发布的 Vidu S2 换了条路。它把战场挪到了边看边改的实时操控上。

Vidu S2 实时视频生成能力

Vidu S2 的能力分成两块。S2-Avatar 面向实时数字人互动。它支持 720p 高清输出。动作指令遵循和人物表演都有增强。直播中还能输入参考图。让角色拿着物品互动。也能换服装和换背景。

S2-Editing 面向正在流动的画面。风格可以实时改。服装可以实时改。人物主体和背景同样可以。直播、虚拟演绎和互动内容因此多了即时编辑的能力。

Vidu S2-Editing 实时编辑视频流

我们第一时间上手测了一轮。数字人的表现更丰富。交互控制更灵活。正在播放的画面也多了可编辑空间。

AI 视频终于能边播边改了

S2-Avatar 对舞蹈和手势的理解提升明显。说一句话,或者打一行字。角色就会摆臂。会扭身。会踏步。也会抬腿。

上传一张图就能创建角色。真人照片可以。动漫形象可以。宠物照片也可以。

上传图片创建数字人角色

开启麦克风和摄像头权限后,就能和创建出来的角色对话。视频流走到任意一刻,都能往场景里加东西。让角色拿起图里的杯子。换上指定服装。或者走进新的场景。输出分辨率同步提到 720p。

最近 iPhone 首款折叠屏成了科技圈的热门话题。争议也不小。有外媒认为 iPhone Duo 找回了乔布斯时代的惊艳。也有人觉得创新不足。

iPhone Duo 折叠屏引发热议

我也好奇。如果乔布斯能重新站在我们面前,看到今天的 iPhone Duo,他会怎么评价。

所以这次我直接在 Vidu S2 里建了一个乔布斯数字人。创建方式不复杂。给它一张乔布斯的全身参考图。再补一份比较完整的角色描述。写清他的性格。也写清他的表达方式。还有他对产品、设计和用户体验的态度。

我比较在意的是,模型最后生成出来的不能只是一个长得像乔布斯的人。交流和行为上也得尽可能维持住这个角色。

乔布斯数字人形象

角色建立完成后,我问了乔布斯数字人一句。iPhone Duo 达到你的预期了吗。

这考验的是实时数字人能不能结合自己的人设,对眼前的产品做出符合角色逻辑的回应。而不是突然变成一个普通的智能助手。

实际体验下来,这种感觉挺奇妙。他说,iPhone Duo 比我预想的流畅,但价格让人犹豫。

当然,只会站着说话还不够。所以我又做了一个有点离谱的实验。让乔布斯跳舞。

这一步看的是对全身动作的控制能力。点头抬手简单。跳舞涉及躯干和手臂。也涉及腿部和重心的连续变化。对人物一致性和动作连贯性的要求高得多。

印象里永远穿黑色高领衫、站在台上冷静讲产品的乔布斯,突然真的在我面前跳起舞。还挺有意思。

Vidu S2 做的已经不只是让一张乔布斯的照片动起来。它更像在尝试把一个固定的人物形象,变成一个可以拿东西、评价东西的数字角色。

我还尝试了和一名叫 Himari 的女生视频通话。也和一位 30 多岁的美国送货司机 Tom Miller 通了话。我输入介绍下你的穿搭。Himari 便说自己穿的是校服。我问 Tom Miller 在做什么。他立即回我。正忙着送货。

实时数字人 Himari

为了终结长时间流式生成带来的崩溃与漂移,生数独创了 SRF 训练技术。简单来说,模型拥有了自我纠错的记忆。它学会直面自己的生成历史。再修正误差。

而 Vidu S2-Editing 此次最大的升级是,只需一张简单的参考图,就能对正在播放的视频流进行实时编辑。能做四件事。虚拟试穿。换背景。改风格。换角色。

传统数字人直播只能机械播报预制脚本。遇到观众临时要求看看上身效果,或者展示细节,它无能为力。真人直播换装成本高。SKU 展示又有限。

现在 Vidu S2-Editing 能根据服装参考图实时编辑人物服装。实时生成多样穿搭效果。

我上传了一张能清晰展示服装整个边缘和轮廓的参考图。得到了蓝色 POLO 衫和米色大衣的上身效果。也试了黑色皮衣与棒球服。

服装参考图实时换装效果

模型展现出较高的动作流畅度与面部特征稳定性。面料随肢体运动产生的物理形变也足够逼真。

未来的直播带货如果依托 Vidu S2-Editing 的动态参考图更新能力,运营人员只需要在后台上传商品白底图。数字人主播就能在说话间隙无缝换装。或者做持品讲解。直播互动从单向广播变成即时响应式导购。这也是 AI电商 正在补的一环。

Vidu S2-Editing 也可以用来做流媒体实时特效与视频包装。传统影视与短视频的风格化渲染、背景扣像严重依赖后期调色与合成。周期以天为单位计算。

运用 Vidu S2-Editing,打开摄像头,选择不同风格,实时视频画面流能够呈现不同美学质感。全程在线的稳定性与风格迁移能力让人眼前一亮。

而角色替换功能,可以瞬间无缝替换为另一个形象。这里建议使用正面朝向且清晰可见的半身参考图像。质量会大幅提升。

角色替换功能效果

实测过程中,Vidu S2-Editing 可以实现精准的透视对齐与自然的遮挡处理。鲜少有后期拼贴痕迹。

实时背景替换演示

我也在公司过了把薛甄珠瘾。说实话,用角色替换功能把自己打扮成薛甄珠后,说台词更放得开了。

这一秒在阳光沙滩。下一秒就能在安静的咖啡馆。杂乱背景实时清退。特效不再需要漫长的离线等待。

画面继续,指令也可以继续

实时视频生成主要是为了交互娱乐。画面持续输出。用户也能持续输入。新的要求会影响后续内容。上一代 Vidu S1 已经走上这条路,S2 进一步补上了动态参考图与复杂动作,也补上了实时编辑能力。数字人的实时输出也提升至 720p。

Vidu S2 实时输出提升至 720p

这项变化听上去像给视频装了个聊天框。实际上麻烦得多。聊天可以稍作停顿。正在抬起的手却不能悬在那里等模型算完。

离线制作还能把前后镜头放在一起修补。实时系统却无法提前知道你下一句会说什么。它要利用已经生成的画面往前走。又得为随时插入的要求留出空间。

这套系统的全链路研发,由生数科技流式视频生成与推理负责人张金涛负责。他是朱军老师带的 00 后博士生。

Vidu S2 采用了 Backbone-Refiner 两阶段架构。主干网络以极低延迟专注负责骨架运动、物理规律和镜头语言的实时推流。精炼网络以异步流水线方式在毫秒级内完成 720P 高清细节重构。还包括材质纹理与光影修复。

可以理解为,负责推进动作的主干部分先把节奏跟住。负责修饰画面的精炼部分跟进。避免所有任务挤在同一道计算关口。两者并行作业。第一次在保证低延迟的同时,维持了可用度很高的画面质感。

临时加入的参考图,则交给基于视觉语言模型的 VLM Agent 协调。它作为中控调度脑,负责实时解析当前画面的运动相位和空间状态。并在毫秒级的时间戳上完成特征对齐。确保新元素的介入符合惯性与光照物理规律。

VLM Agent 中控调度示意

传统视频模型在面对复杂连续的交互指令时,极易出现幻觉或动作变形。Vidu S2 直接在部署端针对因果流式生成进行强化学习策略。让模型在单向时间流中具备较强的因果逻辑推理能力。大幅降低了指令漂移率。

它的底层逻辑已经不是一个单纯的视频渲染器。而是一个具备实时感知、规划与执行能力的实时视频模型。

实时视频模型能力示意

从生成一段视频,到运行一个实时世界

过去一百多年,视频的基本单位始终是一段已经完成的时间。它可以被拍摄。被剪辑。被压缩。被分发。甚至由 AI 凭空生成。但人与视频的关系一直没变。内容先完成。观众后抵达。

现在,实时生成开始改变这种关系。画面继续。人的意图也能继续进入。模型要记住上一秒发生了什么。理解此刻插入的变化。再让下一秒在人物和空间上保持一致。

交互式视频生成让成片这个沿用百年的内容单位,第一次有机会变成持续运行的过程。而下一代 AI视频 的分水岭,开始从生成结束走向世界继续。

有分析认为到 2026 年底,创作者将不再需要等待渲染队列。下一代 AI 系统会支持对画面本身的实时交互。导演式的调度将实时发生。而不再依赖静态的提示词。广告甚至可能从一条视频面对一百万观众,变成一百万条视频各为一个人定制。

据彭博社报道,字节也准备推出一款允许用户创建实时空间视频的 AI 模型。张一鸣正在亲自监督开发进程。模型最快可能在下个月面世。

生数的 Vidu S 系列则围绕生成展开。它把视频从一次性输出的内容,延伸为能够持续接收输入和理解指令的交互过程。还能即时反馈。面向实时对话和 AI 情感陪伴。也面向虚拟 IP 与互动游戏。教育、文旅和直播同样在内。

作为该系列的最新迭代,Vidu S2 率先将这一方向拓展到实时空间视频的生成与编辑。实时生成或编辑后的画面,可以转换为同步的左右眼视图。通过兼容头显呈现人物与场景的立体深度。已有的立体视频,也可以接受实时编辑。

这让持续交互与空间体验开始结合。用户的输入不断改变接下来的内容。生成的人物与场景则以更具临场感的方式呈现。

与人对话,参与游戏,即兴互动,本就是人们熟悉的体验。实时视频生成正在把这些体验带入 AI 创造的画面。让视频成为一个可以持续参与其中的过程。

实时交互画面演示

张金涛曾在播客里讲到两个 Vidu S1 社区案例。他解释了实时交互为什么容易让人上头。

Vidu S1 社区案例

一个用户上传自家小狗的照片,和屏幕里的数字小狗聊天。另一个玩家把游戏画面作为输入。让旁边的二次元角色看着游戏进程陪自己说话。角色会根据画面里的变化作出反应。

张金涛在采访中说,未来大量视觉内容可能由 AI 实时生成。每个人都可以拥有独立的交互会话。

在恋爱和游戏里,甚至在几乎所有的日常社交场景里,这种实时交互才是人类最大最本能的视觉娱乐需求。在数字革命之前,人类所有的视觉娱乐基本都是实时在线交互的。

离线预制视频有播放量的上限。但实时交互视频的奇妙之处在于,每个人都拥有独一无二的会话。你看到的画面只属于你。

将目光转向其他厂商。Adobe 做的 MotionStream 让创作者可以在视频生成的同时用鼠标和滑块实时拖动镜头,改变物体运动轨迹。边生成边操控。可以视作未来人们控制视频方式的一次大改变。

MotionStream 实时操控演示

HeyGen 的 LiveAvatar 主打实时交互式 AI 数字人。可以用自己的数据自定义。被不少团队当作客服新渠道。也用在直播和企业沟通上。偏商业化落地。

差别只在于,这一次,屏幕对面陪你聊天、陪你打游戏的,可能真的只是为你一个人实时生成的。

视频这个内容单位,正从拍完再看变成一直在跑。真正的门槛不在清晰度。而在能不能把下一秒留住。对普通用户来说,这类实时模型眼下更像一件新鲜的 AI工具