ARTICLE · 人工智能
扩散模型自引导新范式 SSG:直接交换 Token 就能变强! | CVPR 2026 Oral
一语总结vivo BlueImage Lab 提出扩散模型自交换引导(SSG),通过空间和通道维度交换最不相似的 Token 特征实现无文本、无加噪、不改模型的轻量化引导,在 CVPR 2026 Oral 论文中超越现有无条件引导方法。
本文介绍 vivo BlueImage Lab 与上海交通大学合作的 CVPR 2026 Oral 论文——自交换引导(Self-Swap Guidance, SSG)。针对 CFG 依赖文本条件、需专门训练,以及 SAG/PAG/TSG 等无条件引导方法通过加噪声导致扰动粒度难以控制的问题,SSG 提出在推理阶段对模型内部 Token 特征进行空间维度和通道维度的“最不相似”对交换,构造结构性扰动生成“变差”预测路径,再利用差值反向指导生成。实验在 SD1.5、SDXL 模型上,针对 ImageNet、COCO 数据集的无条件/有条件生成任务,SSG 在 FID、CLIP Score、Inception Score 及人类偏好指标(AES、PickScore、ImageReward)上均超越 SAG、SEG、PAG 等基线,且对引导系数更鲁棒。消融实验显示:随机交换已优于现有方法,最不相似交换更优;通道交换效果优于空间交换,二者结合最佳。文中也诚恳讨论了缺乏系统理论支撑、对扰动层位置敏感、计算开销较大等局限,并对比了同期工作 TPG。
- SSG 引入无需文本、不加噪声、不改模型的自交换引导新范式。
在推理阶段通过空间和通道维度交换最不相似的 Token 特征对,构造结构性扰动生成负向预测,再以差值指导模型向高质量方向生成,避免了 CFG 对文本的依赖和加噪方法的粒度失控。
- 最不相似 Token/通道交换策略显著优于随机交换及现有无条件引导基线。
消融实验表明,随机交换已能超越 SAG、PAG 等方法;基于特征相似度选择最不相似对进行交换可进一步提升生成质量,在 FID、CLIP Score、人类偏好分数等指标上均取得最优。
- 通道维度扰动效果优于空间维度,二者结合实现最佳权衡。
实验发现通道交换整体指标优于空间交换,且两者引导模式具有互补性,同时使用可在图像质量与美学感知分数上达到最佳平衡,为后续高效引导机制设计提供新思路。
- SSG 在有条件与无条件生成任务中均表现出更强的鲁棒性。
在不同引导系数下,SSG 生成质量稳定,不易出现高引导系数下的过饱和、细节崩坏、高噪声等失真现象,适用于 SD1.5 与 SDXL 等主流模型。
- 工作存在理论支撑不足、层位置敏感、计算开销较大等局限。
作者指出缺乏系统性理论解释,扰动添加的具体层位置对性能影响较大,且多层计算 Token 相似度带来额外推理开销,是后续优化方向。
扩散模型自引导新范式 SSG:直接交换 Token 就能变强! | CVPR 2026 Oral
本文介绍 vivo BlueImage Lab 与上海交通大学合作的 CVPR 2026 Oral 论文——自交换引导(Self-Swap Guidance, SSG)。针对 CFG 依赖文本条件、需专门训练,以及 SAG/PAG/TSG 等无条件引导方法通过加噪声导致扰动粒度难以控制的问题,SSG 提出在推理阶段对模型内部 Token 特征进行空间维度和通道维度的“最不相似”对交换,构造结构性扰动生成“变差”预测路径,再利用差值反向指导生成。实验在 SD1.5、SDXL 模型上,针对 ImageNet、COCO 数据集的无条件/有条件生成任务,SSG 在 FID、CLIP Score、Inception Score 及人类偏好指标(AES、PickScore、ImageReward)上均超越 SAG、SEG、PAG 等基线,且对引导系数更鲁棒。消融实验显示:随机交换已优于现有方法,最不相似交换更优;通道交换效果优于空间交换,二者结合最佳。文中也诚恳讨论了缺乏系统理论支撑、对扰动层位置敏感、计算开销较大等局限,并对比了同期工作 TPG。
文章金句
"通过在空间和通道维度上交换 token 特征,把模型"搞差",再用这个"变差"的路径去指导自己的生成。
"不需要文本条件,不加噪声,不改模型,只在内部交换 token。
"通道维度扰动的引导效果显著优于空间维度