讲师中心 微信公众号
AI工具推荐 视频效率加速

​生数科技正式发布 Vidu S2,支持实时编辑、动态参考图与头显适配

风磊小哥_1878

风磊小哥_1878

发布时间:2026-09-16 18:27:11

|

129人浏览过

|

来源于php中文网

原创

实时交互与实时编辑双引擎驱动,Vidu S2正式发布即开放体验
AI 视频正加速演进为一个“边播、边演、边改”的实时系统。例如,开启摄像头后,只需点击一张参考角色图,即可瞬时替换视频中的人物形象,动作节奏丝毫无损;与虚拟人对话时,一句“跳个舞”,角色立刻响应,肢体舒展自然,情绪饱满流畅。更进一步,就像修图一样,摄像头捕获的真人视频流也能实现“边拍边修”——在完全保留原始姿态、运动节律与镜头逻辑的前提下,实时切换画风、更换人物或更新背景。

视频地址: https://www.php.cn/link/8df71b1a941cf3ed804e8b1d89f9c426
视频地址: https://www.php.cn/link/8df71b1a941cf3ed804e8b1d89f9c426

这正是生数科技全新推出的 vidu s2——一套专为实时交互实时编辑深度优化的视频生成模型体系,全面覆盖实时数字人、离线数字人及实时视频编辑三大核心场景。

其中,S2-Avatar 聚焦实时数字人的“沉浸式表演”,支持 720p 分辨率、25~42 FPS 高帧率输出,不仅能精准还原说话微表情,更能稳定驱动舞蹈等全身性大幅度动作;尤为关键的是,它支持在生成过程中动态插入新元素:一张服装图、一件道具照、一个场景参考,都能即时融入正在播放的视频流,实现“演着演着就换装”“说着说着就入场”的无缝衔接。

而本次最引人瞩目的升级,则是 S2-Editing ——首个面向连续视频流的实时编辑模型。它持续接收来自摄像头或已有视频源的输入流,并让新指令(如文本提示+参考图)即时生效于后续画面:人物抬手时风格同步变化,转身时服装纹理自然延展,镜头推进时背景空间关系始终稳固。所有编辑均严格维持原有姿态、肢体轨迹、运镜逻辑与时间顺序,真正实现“所见即所得”的视频流式重塑。

此外,S2-Avatar [Offline] 面向批量内容生产,支持基于图片、文案或音频,批量生成动作节奏可控、口型时间点精准匹配的数字人口播视频,兼顾效率与表现力。

这些能力并非概念演示,而是已落地的产品级能力。发布前夕,生数团队同步公开技术论文,详述实时数字人建模、流式视频编辑机制与空间视频生成路径;发布当日即开放网页体验与 API 接入,邀请全球用户共同参与迭代共创。

体验链接: https://www.php.cn/link/599a318840a9f0acba0e40c9f56bfc92
API 平台: https://www.php.cn/link/29ed3d416cd513893ea80d1e6c9a560e
技术报告: https://www.php.cn/link/657989c9751e4f61cbf730c67ae15d4e

从 Vidu S1 论文于 7 月 3 日提交,到 S2 论文于 9 月 10 日正式公开,仅间隔约 69 天——如此紧凑的迭代节奏背后,是控制维度、输出质量与实时深度的三重跃迁:控制对象从静态数字人扩展至动态参考图与完整视频流;分辨率由 540p 升级至 720p;动作能力从基础口型扩展至全身舞蹈;实时链路更延伸至左右眼同步的空间视频生成。

如果说 S1 实现了数字人在生成过程中的“实时对话”,那么 S2 则真正开启了“实时共演”时代:当角色大幅运动、用户持续追加新素材、输入本身已是连续视频流时,系统能否依然做到及时响应、稳定承载、精确执行?Vidu S2 给出了肯定的答案。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

​生数科技正式发布 Vidu S2,支持实时编辑、动态参考图与头显适配

生数科技于9月15日正式发布了全新的 Vidu S2视频大模型系列。本次发布的 Vidu S2包含两个核心模型:面向持续交互数字角色生成的 Vidu S2-Avatar,以及面向输入视频流进行实时编辑的 Vidu S2-Editing。在此基础之上,生数科技还进一步探索了面向 VR 头显的实时空间视频生成与编辑能力。整个全链路研发由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。

Vidu
Vidu

Vidu 是 AI 视频生成工具,支持文生视频、图生视频等创作方式。

下载

在模型特色方面,Vidu S2-Avatar 实现了从语音持续控制到更高交互自由度的跨越。用户上传一张角色图片后,即可通过文本或语音与模型互动,模型不仅支持说话时的表情与姿态,还增强了舞蹈等大幅度动作的指令跟随能力。更重要的是,该模型支持在视频流进行中的任意时刻动态加入物品、服装或背景参考图,让角色在互动中拿起杯子、换上指定服装或进入新场景。同时,模型引入了视觉反馈机制,确保诸如“拿起杯子然后微笑”等连续动作与状态保持的可靠性。此外,S2-Avatar 将实时输出分辨率从上一代的540P 提升至720P。

​生数科技正式发布 Vidu S2,支持实时编辑、动态参考图与头显适配

Vidu S2-Editing 则专注于接收持续输入的视频流,并根据文本指令和可选参考图进行实时编辑,让画面跟随人物抬手、转身或镜头移动自然变化。目前该模型主要支持四类任务:一是风格迁移,在保留人物轮廓、姿态和场景布局的同时改变画面笔触与色彩;二是虚拟试穿,将参考服装迁移到视频人物身上,精准处理服装边界、材质纹理及肢体遮挡关系;三是人物替换,将参考角色的面部、发型、服装和外观整体迁移至源视频,同时保留原有姿态与运动;四是背景替换,根据参考图更换环境并在人物持续运动时保持稳定的空间关系。

在空间视频探索方面,Vidu S2将 Avatar 的实时输出接入空间视频转换流程,生成同步的左右眼视图;Editing 则支持先编辑普通单目视频再转换为空间视频,或直接编辑已有的空间视频,且两类模式均支持上述四类编辑任务,相关结果可流式传输至 VR 头显。

在底层技术选择上,Vidu S2进行了多项关键技术创新。首先是提出了 Self-Replay Forcing(SRF)训练方法,模型先生成较长的自生成轨迹,再从中采样连续片段重新加噪并进行可传播梯度的因果重放训练,有效避免了小误差累积导致的身份漂移或动作断裂。其次在数据处理上,兼顾了舞蹈视频的动作丰富度与画面稳定性,并采用事件顺序描述的视频标注和偏好奖励优化。同时,S2-Avatar 引入了 VLM 智能体作为视觉反馈,用于检查动作完成情况并调整后续提示词。在性能与效率优化方面,采用轻量级单步 Refiner 恢复高分辨率细节,结合 TurboDiffusion 与 TurboServe 技术降低计算开销,实现各模块共享时间线调度。

在公开与专业评测中,Vidu S2展现了出色的综合性能。在 StreamAV-Bench 评测中,S2-Avatar 在视觉与音频质量、音画对齐及主体背景一致性等9项指标上均取得最优。在视频编辑方面,S2-Editing 在 OpenVE 与 RefVIE 联合评测中取得4.26分,在 Sparkle-Bench 上各项指标均为最优,并在 ViViD 虚拟试穿测试及多项专业人工偏好对比中大幅超越同类模型。

谈及未来规划,生数科技表示空间视频目前仍处于固定视角探索阶段,如何在头显中保持清晰画质并进一步降低延迟、探索全景空间视频将是接下来的核心攻坚方向。

体验网址:https://www.php.cn/link/04159afa219c56abc29eca1a8dc018dd

热门AI工具

更多
蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

0

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

0

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

20

2026.09.22

Vibeknow在线使用入口合集
Vibeknow在线使用入口合集

本专题汇总了Vibeknow在线创作视频的官方入口及网页版使用教程,涵盖PPT、PDF、Word等文档一键转讲解视频的核心操作,并整理了免费版水印规则与手机端浏览器访问指南,助你快速将知识内容视频化。

20

2026.09.21

NumPy随机数文件读写与dtype数据类型
NumPy随机数文件读写与dtype数据类型

本专题整理 NumPy 随机数、文件读写与 dtype 数据类型相关教程,覆盖 Generator/random、随机数种子、正态分布采样、npy/npz/CSV/TXT 保存读取、loadtxt/savetxt、memmap、大文件处理、astype 类型转换、结构化 dtype、整数溢出和精度丢失等场景。

20

2026.09.21

NumPy矩阵运算与线性代数计算
NumPy矩阵运算与线性代数计算

本专题整理 NumPy 矩阵运算与线性代数计算相关教程,覆盖矩阵乘法、dot 与 @ 运算符、逆矩阵、行列式、特征值与特征向量、SVD、线性方程组、欧氏距离、矩阵分解和大规模矩阵性能优化等内容,帮助读者掌握 np.linalg 与矩阵计算实战。

0

2026.09.21

NumPy广播机制数学运算与统计分析
NumPy广播机制数学运算与统计分析

本专题整理 NumPy 广播机制、数组数学运算与统计分析相关教程,覆盖广播规则、维度对齐、矩阵与数组加减除法、向量化计算、均值方差、分位数、中位数、直方图和 unique 频次统计等场景,帮助读者掌握 ndarray 高效计算与统计处理方法。

0

2026.09.21

NumPy数组创建索引切片与数据选择
NumPy数组创建索引切片与数据选择

本专题整理 NumPy 数组创建、索引、切片与数据选择相关教程,覆盖 np.array、zeros/ones、多维数组形状、基础切片、花式索引、布尔索引、条件筛选、视图与副本等常用场景,帮助读者系统掌握 ndarray 数据构造与高效提取方法。

20

2026.09.21

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

40

2026.09.20

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Vidu 模型映射资料
Vidu 模型映射资料

共0课时 | 0人学习

Vidu 快速入门手册
Vidu 快速入门手册

共0课时 | 0人学习

Vidu API 文档
Vidu API 文档

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn