核心信息
滑动窗口注意力(SWA)将每个 token 的注意力限制在固定大小的局部邻域内,从而降低长上下文模型的注意力和 KV 缓存内存占用。一项新研究表明,在训练后切换到带注意力汇聚(attention sinks)的滑动窗口掩码,可以在不增加成本的情况下超越线性注意力。
要点
- SWA 通过将注意力限制在局部窗口内减少内存和计算,并周期性加入全局注意力层来保留更广的上下文。
- 论文结论:简单的滑动窗口掩码加上注意力汇聚,在训练后表现优于线性注意力,且无需额外成本。
- 该方法已收录于 Papers with Code,方便研究者查看和对比。