媲美Nano Banana Pro!南科大&阶跃星辰等开源真实世界图像恢复之王RealRestorer
版权声明
我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。
AI生成未来
扫码关注公众号
扫码阅读
手机扫码阅读
结构化摘要
文章主旨:
本文介绍了一个名为RealRestorer的开源真实世界图像修复模型,该模型基于大规模图像编辑模型改造,通过合成与真实退化混合数据训练及两阶段微调策略,实现了在多种复杂真实退化场景下兼顾修复质量与内容一致性的开源SOTA性能,并配套发布了贴近真实场景的评测基准RealIR-Bench。
关键要点:
- RealRestorer基于开源图像编辑模型Step1X-Edit的DiT架构进行微调,仅微调DiT主干,将高层编辑能力迁移至低层真实修复任务。
- 数据构建覆盖合成退化(9类退化管线)和真实退化(网络采集+高质量参考图生成)两部分,并采用两阶段训练:第一阶段用约100万合成对迁移训练,第二阶段引入约10万真实对进行监督微调,辅以Progressively-Mixed策略防过拟合。
- RealRestorer在自建的真实世界评测基准RealIR-Bench上位居开源方法第一,整体排名第三,接近顶尖闭源模型;在9类任务中开源模型里5项第一、2项第二。
- 采用非参考评测体系,通过VLM评估Restoration Score和LPIPS衡量内容一致性,综合得到Final Score,并经用户研究验证与人类主观感知一致性。
内容结构:
1. 亮点直击
核心点:真实世界图像修复需兼顾“修得干净”与“内容不跑偏”,避免常见问题。论文提出数据、模型、评测三位一体的开源方案,模型在开源方法中登顶。
2. 总结速览
- 解决的问题:真实退化泛化差;评测方式不够真实(依赖PSNR/SSIM);开源与闭源之间有明显差距。
- 提出的方案:以开源图像编辑模型Step1X-Edit为基础,通过大规模编辑模型先验配合合成+真实混合数据流水线训练。关键技术点:覆盖9类退化的大规模退化合成管线;额外采集真实退化图并生成配对高质量图;两阶段训练(第一阶段约100万合成对;第二阶段约10万真实对,使用Progressively-Mixed策略)。
- 应用的技术:大规模图像编辑模型迁移;合成+真实混合数据构建;非参考评测基准RealIR-Bench(引入VLM评估RS,结合LPIPS得FS)。
- 达到的效果:开源SOTA,在RealIR-Bench上排名第三,接近顶级闭源模型;多任务表现均衡,内容一致性更强;具备零样本泛化能力。
3. 方法
- 模型设计:基于Step1X-Edit微调,核心为大规模DiT,使用QwenVL文本编码器和Flux-VAE,仅微调DiT主体。
- 数据集构建:合成退化数据(高质量退化模拟,借助SAM-2、MiDaS、VLM筛选);真实退化数据(网络采集真实退化图,生成对应高质量参考图,经CLIP、Qwen3-VL等过滤并人工复核)。
- 训练方案:两阶段:第一阶段迁移训练(约100万合成对,建立基础修复能力);第二阶段监督微调(约10万真实对,采用渐进式混合训练保留部分合成数据,全程1024×1024分辨率)。
4. 实验
- RealIR-Bench:464张真实退化图像,覆盖9类退化,人工过滤保证多样性。
- 评测方式:RS(修复效果)+ LPIPS/LPS(内容一致性)+ 综合FS。
- 结果表现:RealRestorer在Bench上持续优于现有开源模型,接近闭源系统。
- 消融实验:两阶段训练是性能关键。仅合成数据训练FS峰值0.122但泛化不足;引入真实数据后快速提升;过久训练会导致过拟合。Progressively-Mixed策略有效防止过拟合,提升结构一致性与内容保真。
- 用户研究:32名参与者对5个模型3200组结果排序,人工偏好比例与自动评测排序基本一致,验证了Benchmark的可信度。自动指标与人类感知达到中等程度一致性(Kendall's τ、SRCC、PLCC)。
5. 结论
RealRestorer填补了开源社区面向真实世界多退化统一修复方案的空白,配套完整benchmark。局限:计算成本高(28步去噪推理);对镜子自拍、极端退化、复杂物理一致性场景仍可能失效。
文章总结:
本文全面介绍了RealRestorer模型的设计初衷、技术方案、实验效果及局限,认为其为开源社区提供了一个兼顾修复质量与内容一致性的真实世界图像修复方案,并提供了可信的评测基准,但仍有计算成本和极端场景失效等改进空间。
AI生成未来
AI生成未来
扫码关注公众号
还在用多套工具管项目?
一个平台搞定产品、项目、质量与效能,告别整合之苦,实现全流程闭环。
查看方案
AI生成未来的其他文章
个性化图像生成新王炸!无需微调,Meta重磅发布Imagine yourself:三大核心全面SOTA!
点击下方卡片,关注“AI生成未来”作者:Zecheng He等?
铁钉水上漂、子弹穿苹果不炸?Nano-Banana等17款SOTA模型颤抖迎物理逻辑推理大考!
点击下方卡片,关注“AI生成未来”????扫码免费加入A
OpenAI 推出 GPT-4o,"魔法" 是否成真?
击下方卡片,关注“AI生成未来”>>后台回复“GAI
具身智能成败之关键!干货长文首次全面回顾具身智能领域中的视觉-语言-动作模型!
点击下方卡片,关注“AI生成未来”>>后台回复“
单图创造虚拟世界只需10秒!斯坦福&MIT联合发布WonderWorld:高质量交互生成
点击下方卡片,关注“AI生成未来”>>后台回复“
加入社区微信群
与行业大咖零距离交流学习
PMO实践白皮书
白皮书上线
白皮书上线