實時焦點:實時互動、實時改視頻、探索空間視頻,Vidu S2一次放了三個大招
2026-09-16 11:35:45 來源:量子位
有沒有人跟我一樣,天天對著AI小貓小狗短視頻傻笑?誰說觀眾不喜歡看AI啊,這AI可太好了!(戰術后仰.jpg)
【資料圖】
今天,家人們有福了!生數科技發布了Vidu S2模型,不僅能讓你和虛擬數字形象實時互動,還能對著正在播放的視頻,現場換裝、換人、換背景、換畫風。
不管你是想給屏幕里的小奶狗男友換套西裝,還是想讓二次元小偶像一秒切到賽博朋克風,甚至想把老板變成一只“尖叫雞”……它都能絲滑搞定。
數字人這邊,也開始接“新活兒”了:跳舞、轉身,動動嘴就能安排;聊到一半再遞張參考圖,還能讓它換上同款衣服、拿起指定物品。你負責出主意,它負責加戲。
好家伙,這哪里是AI視頻生成模型,這分明是“某跡暖暖Pro Max之導演剪輯版”啊!
這項神奇的能力來自生數科技最新發布的Vidu S2,不僅讓數字人更加能說會動,也能像P圖一樣P視頻,邊播邊改。
要知道,就在短短兩個月前,上個版本的Vidu S1才剛讓大家見識了什么叫“數字人成精”。數字人從依賴“音頻驅動口型+預設動作庫”的傳統模式,進化到能通過語音控制數字人的行為,還能實現無限時長連續互動。
Vidu S1一經推出,便被網友玩出了花。有的把自己貓的照片喂給模型,讓它開口講話;有的把Coding界面傳給模型,讓它扮演“程序員鼓勵師”小姐姐;還有的讓自己去世的親人“復活”,互相傾訴思念…
這次Vidu S2帶來了全方位升級,一口氣放出三個大招:
- S2-Editing:正在輸入的視頻,可以實時換裝、換角色、換背景、換風格。這是本次最值得先上手的升級,堪稱視頻版“某圖秀秀”;
- S2-Avatar:實時互動角色升級到720P,還能接住中途遞來的物品參考圖,按指令拿起、展示,完成更豐富的肢體表演。
- 實時空間視頻探索:進一步把生成或編輯的視頻轉換成左右眼畫面,送進VR頭顯,探索與角色更有縱深感的互動。
而且Vidu S2發布當天就全量開放,不搞內測、不限名額,這波操作屬實是把“技術自信”寫在腦門上了!
實測模型,這AI是不是偷偷學了魔術?
老規矩,先來測試一波這次更新的Vidu S2。
Vidu S2包含兩個細分模型:
Vidu S2-Avatar:實時交互模型,支持語音對話、語音控制數字人做動作、實時交互中輸入參考圖
Vidu S2-Editing:實時視頻編輯模型,可以改變服裝、人物、背景和視頻風格
老規矩,先上實測。先看Vidu S2-Avatar,除了能在互動過程中接收新的參考圖,它執行動作指令的能力也升級了。
到底進步了多少?把上一代請出來,同屏比一比就知道了。
同樣讓數字人跳舞、轉圈和跺腳,左邊的S1沒能完成要求,右邊的S2則跟著指令動起來了。
以前S1主要是聊天互動,現在S2將大幅度的身體動作也安排上。“嘴上答應”和“身體力行”的區別,這下終于有畫面了。
不僅動作更聽指揮,畫面也更清楚了。Vidu S2-Avatar將實時輸出分辨率從上一代的540p提升到了720p,數字角色面部和衣服上的細節等變得更加豐富。這種提升放在持續互動里很直觀:人物在動、對話在繼續,清晰度也得跟上。
接下來,輪到參考圖發揮作用。
你可以在互動過程中隨時遞給數字人一張新圖片,讓它拿起圖里的物品、換上指定的衣服,或者進入新的場景。既能聽指令做動作,又能照著參考圖調整內容,這位數字搭檔能接的“活兒”,明顯更多了。
再來看看Vidu S2-Editing ,它帶來的實時視頻編輯能力,是這次最大的更新之一。
畫面對準一位正在接受采訪的女士,秒切不同款式的服裝,它們都非常合體,好像本來就穿在她身上似的。
人物動作連貫,臉部一致性很好,服裝隨著動作產生的形變也非常真實。尤其是最后一套駝色大衣,袖口半遮住了女士佩戴的首飾,處理得非常真實。
非要挑刺的話,第二套衣服在呈現色塊時仍有一點涂抹感;人物佩戴帽子時,頭發仍然有一點穿模。
不僅能換裝,還可以更換背景。看看這個視頻,小姐姐在各個場景絲滑地跳著女團舞,我感覺自己在看一個制作精良的MV。
不換背景只換人?聽說《牛來2》要來了?在辦公室的我變成了牛來跟大伙say hi……
嚯!我感覺自己好像加班加出幻覺了。
最離譜的是,我變成的這些奇怪東西居然完美融入了辦公室環境,透視、遮擋都挑不出毛病。建議各位打工人收藏此功能,開會時把自己替換成財神爺,說不定老板看你都順眼了。
再來看看視頻風格轉換的表現。
小哥哥切換不同的風格,視頻全程的畫面一致性以及風格的遷移能力表現得相當不錯!
小小總結一下,Vidu S2-Editing,對正在進行的畫面提供四類實時編輯能力:
- 實時人物換裝:淘寶店家、穿搭博主狂喜
- 實時更換背景:足不出戶環游世界
- 實時更換主體角色:萬物皆可打工,包括財神爺
- 實時風格渲染:審美疲勞?換個濾鏡繼續嗨
這意味著,直播間的視覺效果、虛擬角色的演出、創意視頻的玩法,都有了更多臨場發揮的空間。
觀眾彈幕發個“想看主播穿恐龍服”,下一秒可能就真穿上了。觀眾聊著聊著就當上了導演,主播演著演著就成了NPC。
69天完成版本更迭
只用了69天,Vidu S2就完成了一次大版本躍遷,視頻模型賽道現在真的是卷麻了!
兩個月前,Vidu S1的亮相同樣驚艷,有必要來回顧一下這位“前輩”。Vidu S1、Vidu S2的全鏈路研發均由清華大學朱軍教授的博士生、生數科技流式視頻生成與推理負責人張金濤負責。
之前絕大多數數字人,都是“音頻驅動口型+預設動作庫”的傳統模式,本質上跟一個會動的PPT沒太大區別。
而Vidu S讓AI視頻從“離線生成”跨越到“實時交互”。只需要上傳一張照片,模型就能生成一個可以和你實時互動的AI角色。
這里要劃個重點:實時交互視頻,和傳統視頻生成模型走的是不同的路。
實時交互視頻的每一幀,都是根據用戶輸入現場算出來的。這意味著模型的生成速度必須跑贏播放速度,不然用戶看到的就是PPT式的卡頓。
這可不是簡單地“把生成速度拉高”就完事了,而是要重塑整條生成鏈路。團隊用SageAttention等技術給計算提速,再通過多GPU協同調度減少模塊間的等待,讓顯卡少閑著、整條生成鏈路跑得更順。
到了S2,這種交互又向前邁了一步:畫面從540p提升到720p,數字人能執行更復雜的動作,還能在互動中接收新的參考圖;新增的Editing模型,則把換裝、換人、換背景和換畫風帶進了實時視頻流。
此外,還有一件事值得單獨嘮嘮。
最近“實時空間視頻”成為了視頻模型行業的競爭前沿,業內有公司剛開始布局,而生數已經把空間視頻做成了可體驗的產品。
所謂的空間視頻,是一種能夠呈現三維立體深度和沉浸感的立體視頻格式。它基于人類的雙目立體視覺原理,利用兩個不同視角(例如主攝和超廣角攝像頭)同時錄制影像,記錄下景物的立體深度信息。
空間視頻需要在支持空間計算的設備上觀看,比如Apple Vision Pro,在普通設備上它只是普通的二維視頻。
如今,基于Vidu S2-Avatar,用戶可以實時生成空間視頻;基于Vidu S2-Editing,用戶還能實時編輯空間視頻。
你可以把一段普通視頻實時轉成空間視頻,還能將你通過頭顯攝像頭看到的真實物理世界,當成“畫布”來創作。
也就是說,Vidu S2不光能讓AI角色在屏幕里跟你互動,還打算讓它們“走出屏幕”。
當然,團隊也坦誠地表示:頭顯對分辨率和延遲的要求極其苛刻,畫面糊了會暈,延遲高了轉頭和畫面會“打架”,這塊還在持續優化中。
未來,團隊計劃從固定視角擴展到全景空間視頻,讓你轉頭就能自由探索AI生成的場景。元宇宙真的要實現了?!(doge)
技術揭秘:如何做到“邊播邊改”?
看完這些讓人驚艷的視頻效果,問題來了:Vidu S2到底是怎么做到的?
在數據處理方面,為了讓數字人表現出更豐富的動作與表情,團隊補充了舞蹈、二維動畫和三維動畫等訓練素材,并對符合條件的視頻進行背景穩定處理,在保留大幅動作的同時,減少鏡頭運動帶來的干擾。
標注方式也圍繞連續互動重新設計:按照事件發生的順序,記錄動作何時開始、帶來什么變化,以及結束后人物處于什么狀態。片段描述根據事件邊界劃分,訓練時,每個時間片段都有對應的條件。這讓“抬手、拿起杯子、端著杯子繼續說話”中的動作銜接與狀態變化,都有了更清晰的學習依據。
流式訓練一直是一個難點,因為這個過程像一場接力:下一段畫面接著上一段往前走,前面的一點偏差,也可能被一路傳下去。
Vidu S2選擇先通過Hybrid Forcing學會逐段生成,然后讓模型練習接住自己產生的偏差。為此,Vidu S2引入Self-Replay Forcing:先讓模型連續生成一段視頻,再給生成結果分塊加噪,進行一次可訓練的因果回放。
這次“復盤”把前后片段連起來訓練,讓后續片段的訓練反饋也能影響較早片段的表示,幫助模型學會:即使前面出現偏差,后面也能盡量接得穩、接得順。
接著是畫質和實時性的問題。Vidu S2采用了Backbone-Refiner兩階段架構。Backbone先在低分辨率下生成畫面的主體結構、運動和語義內容,確定“畫面里有什么、正在做什么”;Refiner再負責生成細節,把畫面做得更清楚。
可以把它理解成兩位畫師配合:一位負責打底稿、抓動作,另一位負責精修。
關鍵是,兩位不用排隊等著干活。通過異步流水線,細節重建與后續內容生成可以并行推進,這讓模型在720P輸出下仍然不掉幀。
而換裝、換背景能做到“邊播邊改”,靠的是“時間戳對齊”。
用戶中途發來一張衣服圖片,模型需要知道的不只是“換成什么”,還有“從什么時候開始換”。
Vidu S2通過重新設計位置編碼,將參考圖的注入位置與時間戳對齊,讓模型知道新條件應該從哪個時間點開始生效。
因此,新參考圖中的內容可以根據指令進入后續畫面,并保持運動與光照的連續性,實現生成條件的平滑過渡。
模型光會換裝還不夠,還得學會看場合換。于是Vidu S2請來一位盯著現場的“執行導演”:VLM Agent。
實時互動時,用戶可能接連提出要求。模型在執行下一步之前得先搞清楚:畫面里現在有什么?人物正在做什么?上一條指令執行完了嗎?
VLM Agent是基于視覺語言模型的智能體,會持續解析已經生成的畫面,跟蹤這些狀態,再據此規劃后續生成,并在合適的時機調整生成條件,讓互動更好地結合畫面狀態與用戶意圖。
最后是強化學習。Vidu S2在雙向與流式兩個階段都加入了偏好與獎勵優化,讓模型生成的內容更符合人的期待。
雙向階段采用DPO,改善畫質、表情、動作自然度和音畫同步,為后續流式訓練提供更強的教師模型。
流式階段則采用Streaming NFT,直接優化承擔持續生成任務的因果模型。模型先生成自己的視頻軌跡,再沿用SRF的回放思路進行獎勵優化,讓訓練貼近實際運行時的狀態,進一步提升畫面質量、動作可控性和指令遵循。
從Vidu S1的語音互動,到Vidu S2更清晰的畫面、更準確的動作響應、隨時加入參考圖和實時編輯視頻,再到空間視頻體驗,人與AI的交互正在變得更加自然、豐富。
一個虛擬數字人能理解你此刻在做什么,并且立刻跟著指令行動,這事放在兩年前聽著還挺科幻。現在Vidu S2把它做成了直播間里隨手一點的功能,仔細想想也真是奇妙。
傳送門:立即體驗:https://vidu.cn/vidu-stream? API平臺:http://platform.vidu.cn/vidu-stream/doc技術報告:https://arxiv.org/pdf/2609.11638
相關閱讀

