2张显卡即可20FPS流式生成!SoulX-LiveAct开启“小时级”实时数字人交互新时代
版权声明
我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。
AI生成未来
扫码关注公众号
扫码阅读
手机扫码阅读
文章主旨:Soul AI 团队提出的 SoulX-LiveAct 模型,通过 Neighbor Forcing 和 ConvKV Memory 两项创新,在仅需 2 张 H100/H200 GPU 的条件下实现了小时级实时数字人视频生成,解决了长视频生成中的训练不一致性和显存爆炸问题。
关键要点:
- Neighbor Forcing 策略:通过扩散步一致的自回归公式,使相邻帧在相同噪声条件下传播,稳定学习信号并避免身份漂移。
- ConvKV Memory 机制:将因果注意力中的键值对压缩为固定长度表示,实现恒定显存推理和真正无限时长生成。
- 实时性能:在双卡(H100/H200)环境下以 20 FPS 进行流式推理,每帧 512×512 计算成本仅 27.2 TFLOPs,远低于同类模型。
- 综合指标:在唇形同步准确度、人体动画质量和情感表达上达到 SOTA,推理成本最低。
- 开源状态:技术报告、代码及预训练模型已全面开源。
内容结构:
概述: SoulX-LiveAct 针对数字人从“实验室点播”迈入“直播间实战”时面临的长时生成崩溃和算力黑洞问题,提出两项核心技术:Neighbor Forcing 和 ConvKV Memory,实现了小时级实时人物动画。
解决的问题:
- 不一致的学习信号: 传统强制策略中扩散状态不匹配,导致学习信号不稳定、收敛困难。
- 推理效率限制: 历史表示无限制增长且缺乏结构,无法实现真正无限的视频生成。
提出的方案:
- Neighbor Forcing: 将时间相邻帧作为潜在邻居在相同噪声条件下传播,提供分布对齐且稳定的学习信号,避免漂移。
- ConvKV Memory: 用轻量级 1D 卷积将因果注意力中的键和值压缩为固定长度表示,实现恒定内存推理与无限生成。
应用的技术:
- 自回归(AR)扩散模型 + DiT(Diffusion Transformer) + Flow Matching。
- 音频交叉注意力实现唇部同步与情感表达。
- 块级 AR 扩散策略、FP8 精度、序列并行与操作融合。
- 情感与动作编辑辅助模块。
达到的效果:
- 显著改进训练收敛性、小时级生成质量和推理效率。
- 双卡 20 FPS 实时流式推理,计算成本 27.2 TFLOPs/帧。
- 长视频中保持稳定身份与细粒度细节,无面部崩坏或衣着突变。
- 支持图像、音频、文字多模态驱动,表情生动、情绪可控。
挑战:实时数字人的“长跑”难题
- 训练不一致性:传统 Forcing 策略扩散状态不匹配导致数字人长时间生成后崩坏。
- 显存黑洞:KV Cache 线性增长,单卡无法支撑小时级对话。
核心突破:Neighbor Forcing 与 ConvKV Memory
- Neighbor Forcing:扩散步一致的自回归公式,确保学习信号分布对齐,动作衔接平滑。
- ConvKV Memory:将 KV 压缩为固定长度,显存占用恒定,不随生成时长增长。
性能表现:
- 实时流式推理:双卡 20 FPS。
- 小时级连续生成,身份特征稳定。
- 多模态驱动,表情生动、全身动作丰富。
实验结果: 在唇形同步准确度、人体动画质量、情感表达上均达 SOTA,推理成本最低。
原理详解
- Neighbor Forcing:训练时强制相邻帧处于相同扩散时间步 s,学习条件联合分布,建立“局部信任域”,杜绝面部崩坏。
- ConvKV Memory:用深度可分离卷积对旧 KV 缓存进行时域压缩,结合因果掩码,将注意力开销从 O(n) 降低至 O(1) 常数级显存。
开源与未来: Soul AI 团队已全面公开技术报告、代码及预训练模型。
文章总结: 本文介绍了 SoulX-LiveAct 模型,通过创新的训练机制和内存管理,为实时数字人应用提供了高效、稳定且开源的解决方案,推动行业从实验室走向实战。
AI生成未来
AI生成未来
扫码关注公众号
还在用多套工具管项目?
一个平台搞定产品、项目、质量与效能,告别整合之苦,实现全流程闭环。
查看方案
AI生成未来的其他文章
3D版"裁缝"开源来袭!Tailor3D:自定义3D编辑和资产生成(港大&上海AI-Lab&港中文)
点击下方卡片,关注“AI生成未来”>>后台回复“
OpenAI上周解散核心安全团队,今天就发布了安全更新信息?
点击下方卡片,关注“AI生成未来”>>关注【AI生?
寥寥数笔,动画自成!阿里Tora: 首个轨迹引导的DiT创新实现精确运动控制视频生成
点击下方卡片,关注“AI生成未来”>>后台回复“
Qwen2-VL全面解读!阿里开源多模态视觉语言模型,多项超越GPT4o与Claude 3.5-Sonnet
Qwen2-VL全面解读!阿里开源多模态视觉语言模型,多项超越GPT4o与Claude 3.5-Sonnet
一言、一格和一念,百度的生成内容生态圈
文心一言、文心一格和百度智能云一念都是百度推出?
加入社区微信群
与行业大咖零距离交流学习
PMO实践白皮书
白皮书上线
白皮书上线