ARTICLE · 人工智能

我们把世界模型做得更小,效果反而更好了。然后,“高效”注意力并没有让任何东西变得更快。

作者:Rickesh T N 来源:DEV Community: machinelearning 2026-08-07 13:56 5 分钟 4 阅读 1239 字
世界模型Transformer 架构注意力机制计算机视觉模型效率
一语总结

本文报告了在一个动态场景重建世界模型上进行的两个实验:一个更小的宽度主导模型优于更大的基线模型,而注意力复用未能在现代 GPU 上改善实际运行时间。

AI 总结

本文介绍了基于 STORM 构建的动态场景重建世界模型上的两个实验。在第一个实验中,作者构建了一个宽度主导的 Transformer 变体,层数更少,但嵌入维度和头维度更大。尽管模型更小,它在基线之上取得了 +0.75 PSNR 和 +0.036 SSIM,且收敛更快、梯度更稳定,但深度 RMSE 变差了。第二个实验将注意力复用(Less-Attention 层)集成到骨干网络中,但在任何复用比例下,与优化后的全注意力相比都没有实际运行时间上的改善,因为融合注意力内核已将瓶颈从算术运算转移到内存访问。作者由此得出结论:容量分配比总容量更重要,而基于 FLOP 的优化只是关于硬件的假设,而非事实。他们强调应在目标硬件上测量实际运行时间,并报告你输掉的那一项指标。

核心要点
  1. 更小的宽度主导模型在光度质量上优于更大的基线模型。

    宽度主导变体取得了 +0.75 PSNR 和 +0.036 SSIM,收敛更快、梯度更稳定,但深度 RMSE 变差了。

  2. 注意力复用并不能在现代 GPU 上改善实际运行时间。

    融合注意力内核已将瓶颈从算术运算转移到内存访问,因此跳过 FLOPs 并不会转化为加速。

  3. 容量分配比总容量更重要。

    参数放在哪里是一个真实的设计决策;“做得更大”并不总是正确答案。

  4. 报告你输掉的那一项指标。

    作者诚实地披露了更差的深度 RMSE,这对下游规划器至关重要。

我们把世界模型做得更小,效果反而更好了。然后,“高效”注意力并没有让任何东西变得更快。

本文介绍了基于 STORM 构建的动态场景重建世界模型上的两个实验。在第一个实验中,作者构建了一个宽度主导的 Transformer 变体,层数更少,但嵌入维度和头维度更大。尽管模型更小,它在基线之上取得了 +0.75 PSNR 和 +0.036 SSIM,且收敛更快、梯度更稳定,但深度 RMSE 变差了。第二个实验将注意力复用(Less-Attention 层)集成到骨干网络中,但在任何复用比例下,与优化后的全注意力相比都没有实际运行时间上的改善,因为融合注意力内核已将瓶颈从算术运算转移到内存访问。作者由此得出结论:容量分配比总容量更重要,而基于 FLOP 的优化只是关于硬件的假设,而非事实。他们强调应在目标硬件上测量实际运行时间,并报告你输掉的那一项指标。

文章金句

"

一个根据 FLOP 数推导出的算法优化,只是对硬件的一种假设,而不是关于硬件的事实。

"

容量分配比总容量更重要。

"

报告你输掉的那一项指标。