复旦大学 × 阶跃星辰开源最新力作PixelSmile:AI 终于实现人脸表情PhotoShop
版权声明
我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。
AI生成未来
扫码关注公众号
扫码阅读
手机扫码阅读
文章主旨:
PixelSmile 是一种基于扩散模型的细粒度人脸表情编辑框架,通过全对称联合训练和文本隐空间插值技术,实现了连续可控、语义解耦且保留身份的人脸表情编辑,并配套了统一的数据集与评估框架。
关键要点:
- 揭示了细粒度表情编辑中语义重叠的本质是结构化重叠,而非单纯分类错误。
- 构建了FFE数据集(12类表情+连续情感标注)和FFE-Bench多维度评估体系。
- 提出PixelSmile框架,通过全对称联合训练与文本隐空间插值解耦重叠情感表征,实现非纠缠且线性可控的表情编辑。
- 实现了12类目标表情的连续强度控制,在表情准确性、身份保持与可控性上优于现有模型。
- 支持表情混合(如惊讶+开心合成“惊喜”)及动漫风格图像编辑。
内容结构:
问题背景:现有AI图像编辑在人脸细粒度表情编辑上存在“改不动、改不对、改崩”问题,即编辑不准确(相近情绪混淆)或身份一致性下降。
核心贡献:
- 连续可控:通过文本隐空间插值,实现单图编辑沿同一方向连续推进,形成平滑动态效果。
- 语义解耦:全对称联合训练减少惊讶与恐惧、愤怒与厌恶等重叠表情的混淆,同时保留人物身份。
- 表情混合:支持组合不同表情(如惊喜、礼貌嫌弃),符合真实情绪的非单一性。
数据集与评估框架:
- FFE数据集:首个为细粒度表情编辑提供连续分数标注的数据集。
- FFE-Bench:首个统一评估框架,涵盖表情准确性、控制稳定性、身份保持等多维度。
效果对比:与Nano Banana Pro、GPT-Image-1.5等通用模型相比,PixelSmile在细粒度表情编辑中表现出更低的语义混淆和更高的身份一致性。
开源资源:论文、代码、模型、Benchmark和Demo均已公开(项目页、GitHub、Hugging Face)。
文章总结:
PixelSmile 不仅提升了细粒度表情编辑的可控性和可用性,还填补了连续表情数据集与统一评估的空白,是推动该方向系统化发展的重要工作。
AI生成未来
AI生成未来
扫码关注公众号
还在用多套工具管项目?
一个平台搞定产品、项目、质量与效能,告别整合之苦,实现全流程闭环。
查看方案
AI生成未来的其他文章
AI镜头控制黑科技喜提多项SOTA!浙大&上交等发布统一多模态视频生成框架OmniCam
点击下方卡片,关注“AI生成未来”如您有工作需要??
DiT迎来真·一致性之王!CharaConsist双杀角色变形&背景撕裂:跨场景换装不崩人设
点击下方卡片,关注“AI生成未来”如您有工作需要??
免费图片无损放大:8大平台突破画质极限
之前介绍过图片提高清晰度的工具平台,这次AIGCer介?
ECCV`24 | 蚂蚁集团开源风格控制新SOTA!StyleTokenizer:零样本精确控制图像生成
点击下方卡片,关注“AI生成未来”作者:Wen Li等
具身智能成败之关键!干货长文首次全面回顾具身智能领域中的视觉-语言-动作模型!
点击下方卡片,关注“AI生成未来”>>后台回复“
加入社区微信群
与行业大咖零距离交流学习
PMO实践白皮书
白皮书上线
白皮书上线