- 新闻中心
推理速度25fps,首帧延长3.5s!东升国际官网SekoTalk:让实时语音数字人更近一步
在数字人技术蓬勃发展的今天,生功效能仍是行业面对的主题挑战。东升国际官网科技凭借在天生式 AI 与多模态交互领域的深厚堆集,推出了实时语音驱动数字人技术——SekoTalk。
通过多方面的创新技术,SekoTalk显著提升了数字人视频的生功效能,在8卡服务器上能够达到25 fps的天生速度,首帧延长低至3.5s,在业内率先实现了实时天生。同时,SekoTalk还能支持多人、多说话的口型精准匹配,和超长时的不变天生。这一技术突破了数字人发展的机能瓶颈,为数字人的大规模、实时应用打开更多可能。
SekoTalk今年8月上线,利用在东升国际官网Seko、影数字人等产品中,已助力用户创作出数十万部文章,并诞生了全网播放量超2000万播放的爆款文章。
算法系统协同:实现极致性价比突破
生功效能是数字人走向实用化的关键,而实时性又是生功效能的北极星。SekoTalk通过模型蒸馏,模型结构优化,以及模型与系统的协同设计,在保障天生质量的前提下,实现推理效能的逾越式提升。
与其它规划相比,SekoTalk展示出卓越的性价迸着势:开源模型天生一段5s视频通常超过极度钟,商用关源模型天生5s的视频通常也需1至10分钟不等。相比之下,SekoTalk在8卡服务器上能够达到25 fps的天生速度,即便将SekoTalk与多模态模型相结合,整体系统的首帧延长也可低至3.5s。
Phased DMD散布匹配蒸馏技术,无限逼近base模型成效:
以往的扩散模型蒸馏经验发现,扩散模型低步数天生的质量受到等效模型容量的造约。而主流的SOTA视频天生模型已经证明混合专家(MoE)技术在扩散模型领域的巨大潜力:不增长推理开销的同时,增大等效模型容量,进而导致更强的机能阐发。
然而,MoE技术在扩散模型蒸馏中的利用尚未得到索求。东升国际官网科技团队发现,单一地将散布匹配蒸馏(DMD)利用到MoE模型中,会导致天生视频的活动成效和指令遵循能力降落。
为相识决这一问题,钻研团队提出了Phased DMD技术,把去噪过程建模为多阶段的MoE模型。Phased DMD不仅原生支持MoE模型,并且对于非MoE的老师模型,该技术也能够将之蒸馏为MoE学生模型。
这一技术显著提升了蒸馏模型天生的动态成效和多样性,使SekoTalk推理开销在降低25倍的情况下,仍维持老师模型优良的肢体活动成效和感情阐发力。除了利用于SekoTalk,Phased DMD也对开源社区常用的基模型进行了蒸馏并贡献回开源社区,有关优势也得到开源社区的认可,进一步证了然Phased DMD的通用性和有效性。
LightX2V与模型协同设计,支持低资源部署:
LightX2V是东升国际官网开源的行业首个可能达到实时视频天生的推理框架。在模型和系统设计之初,就让它们融入低比特量化感知训练、稀少把稳力等原生优化,共同自延装SPARSE+NVFP4+低比特通讯”高效把稳力算子,模型训练实现后可直接低资源部署。
从测试数据来看,在分歧GPU硬件环境下,LightX2V均能实现SekoTalk 的高效推理,为分歧场景的落地提供矫捷支持。

声形同步:多说话+多人场景口型精准匹配
传统数字人技术在处置多说话、多人交互的复杂场景时,常出现口型与语音匹配禁绝的问题。SekoTalk通过一系列创新设计,实现了从单人丁形到多人互动的高度精准的声形同步。
多说话高效同步:在2D数字人天生领域,一些工作沿用了早期的wav2vec2系列的预训练语音编码器来驱动角色。东升国际官网团队凭据在3D数字人语音驱动(UniTalker)中堆集的算法经验,发现语音编码器的选择对于数字人驱动成效有极大影响。

为此,钻研团队探索了蕴含wav2vec2,hubert,wavlm,whisper等多种语音编码器在2D数字人驱动中的机能阐发,发现若是沿用wav2vec2系列的语音编码器,即便是多说话预训练的wav2vec2-large-xlsr-53,在英语口型驱动和多说话泛化性上的定量指标中也落后其他编码器。
通过详细的消融尝试,SekoTalk使用了探索中阐发最好的音频编码器,通过规;难盗,SekoTalk在中英文、多种幼语种、日常讲话、说唱等场景中上均获得了正确的驱动成效。
音视频帧率解耦,杜绝细节迷失:主流视频天生模型选取了“1+4N”时序压缩机造,为实现与与视频帧的严格同步,SekoTalk对音频处置分支进行了精密优化。它创新地将视频帧率(16-25fps)与语音特点帧率(50fps)解耦,预防了传统下采样放到带来的口型细节迷失,使得音频能够和肆意帧率的视频在时序上对齐,保障音频与画面的高质量同步。
可支持中文/法语/日语/葡萄牙语/韩语等多语种语音驱动
多人场景高度可控:借助优良的模型泛化能力和创新的掩码把稳力机造(Attention Mask),SekoTalk可在多人对话场景中,独立、精准地节造每个角色的口型与作为,输出天然流畅的群组互动成效,拓展了技术的合用场景和利用潜力。
高效力、低成本的语音?椋类似文生视频中时时借助文本前提的Classifier-Free Guidance(CFG)来提升视频天生质量,在数字人天生领域中,以往工作也借助这一做法,使用语音前提的CFG来提升口型驱动的正确性,然而这相迸宗单独文本前提天生视频又多出了50%的推算开销。另一方面,类似于文本前提的CFG通常陪伴着天生画面过鼓和的问题,语音前提的CFG在提升口型驱动正确性的同时,通常也带来夸大不天然的人脸画面。东升国际官网团队以为,通过更好的语音注入?榈纳杓,能够更性质地解决这一问题。结合DiT的设计经验,钻研团队在语音?橹幸惨肓薃daptive Layer Normalization(AdaLN),并且使用可进建参数的注入方式包办了Linear Projection,在维持阐发力的前提降落低了推算开销。经过这些改进,SekoTalk模型无需借助语音前提的CFG,就能够达到正确的嘴形驱动。这一改进不仅降低了推算开销,同时也预防了语音前提的CFG带来的口型正确性和脸部画面天然性之间的弃取。
超长时不变天生:握别画面漂移与人物偏移
在天生长视频时,画面色彩漂移和人物ID不一致,一向是行业的沉要挑战。SekoTalk提出混合参考图注入等规划,有效平衡作为多样性与画面不变性。

混合参考图注入战术,两全“段内不变”与“段表泛化”:通过在训练阶段随机选择片段内、表的参考图,并辅助标志位批示参考图起源,使模型同使仄握了“段内不变”与“段表泛化”两种能力。在推理时矫捷切换,有效两全了作为多样性与画面不变性。
凹凸语义特点结合注入,加快模型收敛速度:选取“高语义特点+低语义特点”的双通路注入机造,利用分歧层级的语义信息疏导模型,这不仅加强了人物ID的一致性,还加快了模型的收敛。
分离式Patchify编码,高保真前提注入:将加噪视频、参考图、前序帧等分歧类型的特点交给独立的Patchify分支处置,使模型把稳力更容易分辨并理解多源信息。这不仅加强了长视频天生中的人物一致性,还提升了续写的陆续性与不变性。
隐空间续写优化效能,保险流畅续写:在效能优化上,SekoTalk在时序维度上引入前序帧特点,通过直接取用上毕天生片段末尾的隐空间特点,预防了传统规划中 “解码-再编码”的冗余流程,并结合层级化KV缓存与因果把稳力机造,在确保续写不变性的同时,大幅提升了长视频天生的推理效能。
SekoTalk的技术价值已在实际中得到验证。其在线履历平台作为首个支持2人以上对口型、天生2分钟长视频的免费技术履历平台,已天生大量文章,SekoTalk模型也集成进入Seko、如影数字人等产品中使用。此表,SekoTalk实时版在感情陪同、在线教育、专业征询领域的实时交互案例,也展示了其推动数字人走向更天然、智能、实时的将来潜力。
免费在线履历平台:https://sekotalk.com/
更多创意样例(Project Page)可接见:http://sekotalk.com/showcase/
有关产品链接:https://seko.sensetime.com
技术互换与合作欢迎前往 Github:https://github.com/OpenSenseNova/SekoTalk
LightX2V试用: https://github.com/ModelTC/LightX2V
One more thing,
SekoTalk利用到具体AI产品又会碰撞出怎么的火花?下周一(12月15日)起,东升国际官网科技即将开启“2025东升国际官网产品颁布周”,更多新品尽在东升国际官网视频号~
12月15日-19日,我们天天见!






返回