视觉AR逆袭!177M效果媲美675M最新SOTA扩散模型,仅需一个“即插即用”的正则化reAR

AR 模型 嵌入 token reAR
发布于 2026-06-11
117

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

扫码阅读
手机扫码阅读

文章主旨:本文指出视觉自回归生成模型的性能瓶颈在于生成器与分词器之间的不一致性(包括暴露偏差和嵌入无感知),并提出一种即插即用的训练正则化方法 reAR,通过噪声上下文正则化和码本嵌入正则化来对齐二者,从而显著提升图像生成质量与泛化能力。

关键要点:

  • 将生成器-分词器不一致性(暴露偏差与嵌入无感知)确定为视觉自回归生成的性能瓶颈。
  • 提出 reAR 框架,包含噪声上下文正则化(缓解暴露偏差)和码本嵌入正则化(对齐嵌入空间)两个互补策略。
  • 在 ImageNet 256×256 上,使用标准 VQGAN 分词器将 FID 从 3.02 降至 1.86(reAR-S),超越多种基线模型且参数量更少。
  • reAR 对不同分词器(TiTok、AliTok)均有效,且能匹配更先进扩散模型(如 REPA)的性能,同时采样速度更快。
  • reAR 具备良好的缩放行为,且不需要修改现有模型的组件或推理流程。

内容结构:

一、问题诊断: 理解视觉自回归生成的瓶颈

  • 放大的暴露偏差:训练时教师强制(真实上下文) vs 推理时自回归(可能错误上下文)导致更多未见 token 序列,进而造成图像结构性伪影。
  • 嵌入无感知:仅优化 token 索引正确性,忽略嵌入空间中相似性对解码图像质量的影响;即使 token 预测错误,若嵌入接近正确图像仍可能较好,但模型无法感知。

二、解决方案: 生成器-分词器一致性正则化

  • 噪声上下文正则化:在训练中对输入 token 序列施加均匀噪声(采用退火调度控制噪声水平),减少模型对干净上下文的依赖,提高对不完美历史预测的鲁棒性。
  • 码本嵌入正则化:在浅层恢复当前 token 的视觉嵌入,在深层预测下一个 token 的嵌入,通过余弦距离对齐 Transformer 隐藏状态与分词器嵌入空间。
  • 联合目标:结合传统下一个 token 预测损失与上述正则化项,使生成序列对分词器更“友好”。

三、实验与分析

  • 实验设置:ImageNet-1K 256×256,MaskGIT VQGAN 分词器,DiT 风格 AR 主干,训练 400 epoch。
  • 主要结果:reAR-S 超越 LlamaGen-XL(FID 2.00 vs 2.34)且仅用 14% 参数;reAR-L 超越 MAR-L、VAR-d30;兼容 TiTok/AliTok 并持续改进;采样速度远快于扩散模型和 MAR。
  • 消融研究:验证了正则化层位置(浅层编码+深层解码最佳)、正则化权重影响较小、退火噪声增强最佳、联合噪声与嵌入正则化效果优于单独使用。

四、结论

  • 视觉 AR 生成瓶颈是生成器-分词器不匹配;reAR 提供简单有效的正则化解,不依赖特定分词器设计,可推广至统一多模态模型。

文章总结:本文通过系统性分析暴露偏差与嵌入无感知问题,提出了轻量级正则化方法 reAR,有效弥合了视觉自回归模型中生成器与分词器之间的鸿沟,在性能、泛化与采样速度上均取得显著提升,为未来统一生成器-分词器设计提供了新思路。

AI生成未来