ARTICLE · 人工智能
我们把世界模型做得更小,效果反而更好了。然后,“高效”注意力并没有让任何东西变得更快。
一语总结本文报告了在一个动态场景重建世界模型上进行的两个实验:一个更小的宽度主导模型优于更大的基线模型,而注意力复用未能在现代 GPU 上改善实际运行时间。
本文介绍了基于 STORM 构建的动态场景重建世界模型上的两个实验。在第一个实验中,作者构建了一个宽度主导的 Transformer 变体,层数更少,但嵌入维度和头维度更大。尽管模型更小,它在基线之上取得了 +0.75 PSNR 和 +0.036 SSIM,且收敛更快、梯度更稳定,但深度 RMSE 变差了。第二个实验将注意力复用(Less-Attention 层)集成到骨干网络中,但在任何复用比例下,与优化后的全注意力相比都没有实际运行时间上的改善,因为融合注意力内核已将瓶颈从算术运算转移到内存访问。作者由此得出结论:容量分配比总容量更重要,而基于 FLOP 的优化只是关于硬件的假设,而非事实。他们强调应在目标硬件上测量实际运行时间,并报告你输掉的那一项指标。
- 更小的宽度主导模型在光度质量上优于更大的基线模型。
宽度主导变体取得了 +0.75 PSNR 和 +0.036 SSIM,收敛更快、梯度更稳定,但深度 RMSE 变差了。
- 注意力复用并不能在现代 GPU 上改善实际运行时间。
融合注意力内核已将瓶颈从算术运算转移到内存访问,因此跳过 FLOPs 并不会转化为加速。
- 容量分配比总容量更重要。
参数放在哪里是一个真实的设计决策;“做得更大”并不总是正确答案。
- 报告你输掉的那一项指标。
作者诚实地披露了更差的深度 RMSE,这对下游规划器至关重要。
我们把世界模型做得更小,效果反而更好了。然后,“高效”注意力并没有让任何东西变得更快。
本文介绍了基于 STORM 构建的动态场景重建世界模型上的两个实验。在第一个实验中,作者构建了一个宽度主导的 Transformer 变体,层数更少,但嵌入维度和头维度更大。尽管模型更小,它在基线之上取得了 +0.75 PSNR 和 +0.036 SSIM,且收敛更快、梯度更稳定,但深度 RMSE 变差了。第二个实验将注意力复用(Less-Attention 层)集成到骨干网络中,但在任何复用比例下,与优化后的全注意力相比都没有实际运行时间上的改善,因为融合注意力内核已将瓶颈从算术运算转移到内存访问。作者由此得出结论:容量分配比总容量更重要,而基于 FLOP 的优化只是关于硬件的假设,而非事实。他们强调应在目标硬件上测量实际运行时间,并报告你输掉的那一项指标。
文章金句
"一个根据 FLOP 数推导出的算法优化,只是对硬件的一种假设,而不是关于硬件的事实。
"容量分配比总容量更重要。
"报告你输掉的那一项指标。