东升国际官网

推理速度25fps ,首幀延遲3.5s!商湯SekoTalk:讓實時語音數字人更近一步

商湯科技品牌中心6 分鐘閱读

在數字人技術蓬勃發展的今天 ,生功效能仍是行業面臨的主题挑战。商湯科技凭借在天生式?AI 與多模態交互領域的深厚積累 ,推出了實時語音驅動數字人技術——SekoTalk。

通過多方面的創新技術 ,SekoTalk顯著提升了數字人視頻的生功效能 ,在8卡服務器上能够達到25 fps的天生速度 ,首幀延遲低至3.5s ,在業內率先實現了實時天生。同時 ,SekoTalk还能支持多人、多語言的口型精準匹配 ,和超長時的穩定天生。這一技術突破了數字人發展的机能瓶颈 ,為數字人的大規模、實時應用打開更多可能。

SekoTalk今年8月上線 ,應用在商湯Seko、影數字人等產品中 ,已助力用戶創作出數十萬部文章 ,并誕生了全網播放量超2000萬播放的爆款文章。

算法系統協同:實現極致性價比突破

生功效能是數字人走向實用化的關鍵 ,而實時性又是生功效能的北極星。SekoTalk通過模型蒸馏 ,模型結構優化 ,以及模型與系統的協同設計 ,在保證天生質量的前提下 ,實現推理效能的逾越式提升。

與其它规划相比 ,SekoTalk展現出卓越的性價比優勢:開源模型天生一段5s視頻通常超過极度鐘 ,商用閉源模型天生5s的視頻通常也需1至10分鐘不等。相比之下 ,SekoTalk在8卡服務器上能够達到25 fps的天生速度 ,即便將SekoTalk與多模態模型相結合 ,整體系統的首幀延遲也可低至3.5s。

Phased DMD散布匹配蒸馏技術 ,無限逼近base模型成效:

以往的扩散模型蒸馏經驗發現 ,扩散模型低步數天生的質量受到等效模型容量的造约。而主流的SOTA視頻天生模型已經證明混合專家(MoE)技術在扩散模型領域的巨大潜力:不增长推理開銷的同時 ,增大等效模型容量 ,進而導致更強的机能表現。

然而 ,MoE技術在扩散模型蒸馏中的應用尚未得到索求。商湯科技團隊發現 ,简單地將散布匹配蒸馏(DMD)應用到MoE模型中 ,會導致天生視頻的運動成效和指令遵循能力降落。

為相识决這一問題 ,钻研團隊提出了Phased DMD技術 ,把去噪過程建模為多阶段的MoE模型。Phased DMD不僅原生支持MoE模型 ,并且對於非MoE的教師模型 ,該技術也能够將之蒸馏為MoE學生模型。

這一技術顯著提升了蒸馏模型天生的動態成效和多樣性 ,使SekoTalk推理開銷在降低25倍的情况下 ,仍维持教師模型优良的肢體運動成效和感情表現力。除了應用於SekoTalk ,Phased DMD也對開源社區常用的基模型進行了蒸馏并贡献回開源社區 ,相關優勢也得到開源社區的認可 ,進一步證了然Phased DMD的通用性和有效性。

LightX2V與模型協同設計 ,支持低資源部署:

LightX2V是商湯開源的行業首個可能達到實時視頻天生的推理框架。在模型和系統設計之初 ,就讓它們融入低比特量化感知训练、稀少把稳力等原生優化 ,共同自延装SPARSE+NVFP4+低比特通讯”高效把稳力算子 ,模型训练实现後可直接低資源部署。

從測試數據來看 ,在分歧GPU硬件環境下 ,LightX2V均能實現SekoTalk 的高效推理 ,為分歧場景的落地提供靈活支持。

ST3.png

聲形同步:多語言+多人場景口型精準匹配

傳統數字人技術在處理多語言、多人交互的复杂場景時 ,常出現口型與語音匹配不準的問題。SekoTalk通過一系列創新設計 ,實現了從單人丁形到多人互動的高度精準的聲形同步。

多語言高效同步:在2D數字人天生領域 ,一些工作沿用了早期的wav2vec2系列的预训练語音編碼器來驅動角色。商湯團隊根據在3D數字人語音驅動(UniTalker)中積累的算法經驗 ,發現語音編碼器的選擇對於數字人驅動成效有極大影響。

ST1.1.png

為此 ,钻研團隊探索了蕴含wav2vec2,hubert,wavlm,whisper等多種語音編碼器在2D數字人驅動中的机能表現 ,發現若是沿用wav2vec2系列的語音編碼器 ,即便是多語言预训练的wav2vec2-large-xlsr-53 ,在英語口型驅動和多語言泛化性上的定量指標中也落後其他編碼器。

通過详细的消融實驗 ,SekoTalk使用了探索中表現最好的音頻編碼器 ,通過規;难盗 ,SekoTalk在中英文、多種幼語種、日常講話、說唱等場景中上均获得了準确的驅動成效。

音視頻幀率解耦 ,杜絕细節迷失:主流視頻天生模型选取了“1+4N”時序压缩机造 ,為實現與與視頻幀的嚴格同步 ,SekoTalk對音頻處理分支進行了精密優化。它創新地將視頻幀率(16-25fps)與語音特点幀率(50fps)解耦 ,预防了傳統下采樣放到帶來的口型细節迷失 ,使得音頻能够和肆意幀率的視頻在時序上對齐 ,保證音頻與畫面的高質量同步。

可支持中文/法語/日語/葡萄牙語/韩語等多語種語音驅動

多人場景高度可控:借助优良的模型泛化能力和創新的掩碼把稳力机造(Attention Mask) ,SekoTalk可在多人對話場景中 ,獨立、精準地节造每個角色的口型與動作 ,输出天然流畅的群組互動成效 ,拓展了技術的適用場景和應用潜力。

高效力、低成本的語音?椋類似文生視頻中时时借助文本條件的Classifier-Free Guidance(CFG)來提升視頻天生質量 ,在數字人天生領域中 ,以往工作也借助這一做法 ,使用語音條件的CFG來提升口型驅動的準确性 ,然而這相比於單獨文本條件天生視頻又多出了50%的計算開銷。另一方面 ,類似於文本條件的CFG通常伴隨著天生畫面過鼓和的問題 ,語音條件的CFG在提升口型驅動準确性的同時 ,通常也帶來夸張不天然的人臉畫面。商湯團隊認為 ,通過更好的語音注入?榈脑O計 ,能够更本質地解决這一問題。結合DiT的設計經驗 ,钻研團隊在語音?橹幸惨肓薃daptive Layer Normalization(AdaLN) ,并且使用可學習参數的注入方式包办了Linear Projection ,在维持表現力的前提降落低了計算開銷。經過這些改進 ,SekoTalk模型無需借助語音條件的CFG ,就能够達到準确的嘴形驅動。這一改進不僅降低了計算開銷 ,同時也预防了語音條件的CFG帶來的口型準确性和臉部畫面天然性之間的弃取。

超長時穩定天生:告別畫面漂移與人物偏移

在天生長視頻時 ,畫面色彩漂移和人物ID不一致 ,一向是行業的沉要挑战。SekoTalk提出混合参考圖注入等规划 ,有效平衡動作多樣性與畫面穩定性。

ST2.png

混合参考圖注入战术 ,兼顧“段內穩定”與“段表泛化”:通過在训练阶段隨机選擇片段內、表的参考圖 ,并辅助標志位批示参考圖來源 ,使模型同時把握了“段內穩定”與“段表泛化”兩種能力。在推理時靈活切換 ,有效兼顧了動作多樣性與畫面穩定性。

凹凸語義特点聯合注入 ,加快模型收敛速度:选取“高語義特点+低語義特点”的雙通路注入机造 ,利用分歧層級的語義資訊引導模型 ,這不僅加強了人物ID的一致性 ,还加快了模型的收敛。

分離式Patchify編碼 ,高保真條件注入:將加噪視頻、参考圖、前序幀等分歧類型的特点交给獨立的Patchify分支處理 ,使模型把稳力更容易區分并理解多源資訊。這不僅增強了長視頻天生中的人物一致性 ,还提升了續寫的連續性與穩定性。

隐空間續寫優化效能 ,保险流畅續寫:在效能優化上 ,SekoTalk在時序維度上引入前序幀特点 ,通過直接取用上毕天生片段末尾的隐空間特点 ,预防了傳統规划中?“解碼-再編碼”的冗餘流程 ,并結合層級化KV缓存與因果把稳力机造 ,在确保續寫穩定性的同時 ,大幅提升了長視頻天生的推理效能。

SekoTalk的技術價值已在實践中得到驗證。其在線體驗平台作為首個支持2人以上對口型、天生2分鐘長視頻的免費技術體驗平台 ,已天生大量文章 ,SekoTalk模型也集成進入Seko、如影數字人等產品中使用。此表 ,SekoTalk實時版在感情陪同、在線教育、專業征询領域的實時交互案例 ,也展現了其推動數字人走向更天然、智能、實時的未來潜力。

免費在線體驗平台:https://sekotalk.com/

更多創意樣例(Project Page)可访問:http://sekotalk.com/showcase/

相關產品链接:https://seko.sensetime.com

技術互换與合作欢迎前往?Github:https://github.com/OpenSenseNova/SekoTalk

LightX2V試用:?https://github.com/ModelTC/LightX2V

One more thing,

SekoTalk應用到具體AI產品又會碰撞出怎樣的火花?下周一(12月15日)起 ,商湯科技即將開啟“2025商湯產品發布周” ,更多新品盡在商湯視頻號~

12月15日-19日 ,我們天天見!

KV.jpg

#新聞#SenseTime
【网站地图】