复旦大学 × 阶跃星辰开源最新力作PixelSmile:AI 终于实现人脸表情PhotoShop

表情 编辑 PixelSmile 模型 细粒度
发布于 2026-06-11
100

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:

PixelSmile 是一种基于扩散模型的细粒度人脸表情编辑框架,通过全对称联合训练和文本隐空间插值技术,实现了连续可控、语义解耦且保留身份的人脸表情编辑,并配套了统一的数据集与评估框架。

关键要点:

  • 揭示了细粒度表情编辑中语义重叠的本质是结构化重叠,而非单纯分类错误。
  • 构建了FFE数据集(12类表情+连续情感标注)和FFE-Bench多维度评估体系。
  • 提出PixelSmile框架,通过全对称联合训练与文本隐空间插值解耦重叠情感表征,实现非纠缠且线性可控的表情编辑。
  • 实现了12类目标表情的连续强度控制,在表情准确性、身份保持与可控性上优于现有模型。
  • 支持表情混合(如惊讶+开心合成“惊喜”)及动漫风格图像编辑。

内容结构:

问题背景:现有AI图像编辑在人脸细粒度表情编辑上存在“改不动、改不对、改崩”问题,即编辑不准确(相近情绪混淆)或身份一致性下降。

核心贡献

  • 连续可控:通过文本隐空间插值,实现单图编辑沿同一方向连续推进,形成平滑动态效果。
  • 语义解耦:全对称联合训练减少惊讶与恐惧、愤怒与厌恶等重叠表情的混淆,同时保留人物身份。
  • 表情混合:支持组合不同表情(如惊喜、礼貌嫌弃),符合真实情绪的非单一性。

数据集与评估框架

  • FFE数据集:首个为细粒度表情编辑提供连续分数标注的数据集。
  • FFE-Bench:首个统一评估框架,涵盖表情准确性、控制稳定性、身份保持等多维度。

效果对比:与Nano Banana Pro、GPT-Image-1.5等通用模型相比,PixelSmile在细粒度表情编辑中表现出更低的语义混淆和更高的身份一致性。

开源资源:论文、代码、模型、Benchmark和Demo均已公开(项目页、GitHub、Hugging Face)。

文章总结:

PixelSmile 不仅提升了细粒度表情编辑的可控性和可用性,还填补了连续表情数据集与统一评估的空白,是推动该方向系统化发展的重要工作。

AI生成未来