2张显卡即可20FPS流式生成!SoulX-LiveAct开启“小时级”实时数字人交互新时代

生成 LiveAct SoulX 推理 显存
发布于 2026-06-11
280

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:Soul AI 团队提出的 SoulX-LiveAct 模型,通过 Neighbor Forcing 和 ConvKV Memory 两项创新,在仅需 2 张 H100/H200 GPU 的条件下实现了小时级实时数字人视频生成,解决了长视频生成中的训练不一致性和显存爆炸问题。

关键要点:

  1. Neighbor Forcing 策略:通过扩散步一致的自回归公式,使相邻帧在相同噪声条件下传播,稳定学习信号并避免身份漂移。
  2. ConvKV Memory 机制:将因果注意力中的键值对压缩为固定长度表示,实现恒定显存推理和真正无限时长生成。
  3. 实时性能:在双卡(H100/H200)环境下以 20 FPS 进行流式推理,每帧 512×512 计算成本仅 27.2 TFLOPs,远低于同类模型。
  4. 综合指标:在唇形同步准确度、人体动画质量和情感表达上达到 SOTA,推理成本最低。
  5. 开源状态:技术报告、代码及预训练模型已全面开源。

内容结构:

概述: SoulX-LiveAct 针对数字人从“实验室点播”迈入“直播间实战”时面临的长时生成崩溃和算力黑洞问题,提出两项核心技术:Neighbor Forcing 和 ConvKV Memory,实现了小时级实时人物动画。

解决的问题:

  • 不一致的学习信号: 传统强制策略中扩散状态不匹配,导致学习信号不稳定、收敛困难。
  • 推理效率限制: 历史表示无限制增长且缺乏结构,无法实现真正无限的视频生成。

提出的方案:

  • Neighbor Forcing: 将时间相邻帧作为潜在邻居在相同噪声条件下传播,提供分布对齐且稳定的学习信号,避免漂移。
  • ConvKV Memory: 用轻量级 1D 卷积将因果注意力中的键和值压缩为固定长度表示,实现恒定内存推理与无限生成。

应用的技术:

  • 自回归(AR)扩散模型 + DiT(Diffusion Transformer) + Flow Matching。
  • 音频交叉注意力实现唇部同步与情感表达。
  • 块级 AR 扩散策略、FP8 精度、序列并行与操作融合。
  • 情感与动作编辑辅助模块。

达到的效果:

  • 显著改进训练收敛性、小时级生成质量和推理效率。
  • 双卡 20 FPS 实时流式推理,计算成本 27.2 TFLOPs/帧。
  • 长视频中保持稳定身份与细粒度细节,无面部崩坏或衣着突变。
  • 支持图像、音频、文字多模态驱动,表情生动、情绪可控。

挑战:实时数字人的“长跑”难题

  • 训练不一致性:传统 Forcing 策略扩散状态不匹配导致数字人长时间生成后崩坏。
  • 显存黑洞:KV Cache 线性增长,单卡无法支撑小时级对话。

核心突破:Neighbor Forcing 与 ConvKV Memory

  • Neighbor Forcing:扩散步一致的自回归公式,确保学习信号分布对齐,动作衔接平滑。
  • ConvKV Memory:将 KV 压缩为固定长度,显存占用恒定,不随生成时长增长。

性能表现:

  • 实时流式推理:双卡 20 FPS。
  • 小时级连续生成,身份特征稳定。
  • 多模态驱动,表情生动、全身动作丰富。

实验结果: 在唇形同步准确度、人体动画质量、情感表达上均达 SOTA,推理成本最低。

原理详解

  • Neighbor Forcing:训练时强制相邻帧处于相同扩散时间步 s,学习条件联合分布,建立“局部信任域”,杜绝面部崩坏。
  • ConvKV Memory:用深度可分离卷积对旧 KV 缓存进行时域压缩,结合因果掩码,将注意力开销从 O(n) 降低至 O(1) 常数级显存。

开源与未来: Soul AI 团队已全面公开技术报告、代码及预训练模型。

文章总结: 本文介绍了 SoulX-LiveAct 模型,通过创新的训练机制和内存管理,为实时数字人应用提供了高效、稳定且开源的解决方案,推动行业从实验室走向实战。

AI生成未来