视觉Transformer处理高分辨率图片时,全注意力要让每个图像Token与所有Token交互,计算量增长很快。北京大学、小米、香港大学等机构发现,全注意力中的不同注意力头会分别关注前景物体和背景,并据此设计Ariadne混合注意力。
在20项图像任务的8k训练检查点上,Ariadne平均分40.40,全注意力为40.92,相差0.52分;注意力FLOPs减少6.5倍。在896×896分辨率下,端到端视觉编码器时间降低13.5%。这些数字属于受控模型与训练设置,不能直接外推到所有多模态大模型。
全注意力里的头会各自找工作
研究团队把图像Token标成前景或背景,再检查每个注意力头接收注意力的分布。全注意力模型里,一些头的高响应集中在物体,另一些更偏向背景;到了较深层,这种区分仍然存在。窗口注意力把Token切成互不重叠的小块后,热图更容易出现网格边界,前景与背景分工变弱。
团队把这种现象称为语义头专门化,并定义SHS-Index,以AUROC量化一个头区分前景和背景Token的程度。对16个开源视觉编码器和多模态模型的观察中,全注意力与分块窗口模型的SHS-Index范围没有重叠。
图1:训练过程中,部分注意力头逐步提高对前景物体Token的选择性。
指标来自视觉编码器,不靠语言模型变大
在Qwen2.5-VL系列中,语言模型从3B扩到72B时,SHS-Index变化小于0.002。研究者据此把信号定位在视觉编码器的注意力设计,而不是后端语言模型规模。这个结论说明指标适合诊断ViT内部结构,但尚不能证明提高SHS一定会因果性地提高所有下游任务。
受控训练进一步比较窗口交互、Token序列化和局部Softmax分配。窗口之间缺少信息交换时,头更难形成全局物体概念;不合适的二维序列顺序会把空间相邻关系打断;每个局部窗口单独归一化,还可能让注意力被迫平均分配给不重要区域。
图2:不同注意力结构训练时,SHS-Index随迭代次数的变化。
Ariadne把局部窗口与全局通道组合
Ariadne使用滑动窗口保留局部计算效率,并加入每个头可学习的汇聚偏置,为跨区域信息提供通道;图像Token按行列交替序列化,减少单一方向窗口切分造成的结构损失。设计目标不是复制全部全注意力连接,而是保留形成语义分工所需的交互。
跨模型散点图显示,在论文控制的设计空间内,SHS-Index与下游图像任务均值相关。开源模型间还存在数据、架构和训练配方差异,因此跨架构点只能作为一致性证据,不能单独当作性能预测器。
图3:受控配置中,SHS-Index与20项图像任务均值的关系。
下一步:把稀疏注意力变成端到端收益
8k检查点上,Ariadne在20项图像任务得到40.40,全注意力为40.92,分块窗口为更低的对照。注意力FLOPs减少6.5倍,但整段ViT还包含卷积、线性层、归一化和数据移动,所以896×896输入的端到端时间只降低13.5%。计算量下降不能按同一倍数换算成用户延迟。
图4:Ariadne在任务均值接近全注意力的同时降低注意力FLOPs与ViT运行时间。
下一步应在更长训练、更大视觉编码器、视频和文档高分辨率场景中复测,并分别报告显存、吞吐和端到端延迟。若语义头专门化在这些设置中仍稳定,SHS-Index可以进入视觉编码器设计流程,用来筛选混合注意力结构,再由完整多模态评测确认实际收益。
工程评测还应分别报告预处理、显存峰值、注意力算子和后续语言模型耗时。只有当批量大小、硬件和编译设置保持一致,6.5倍的算子计算差异才能与真实服务吞吐对应起来。
线上还需按图像分辨率和请求批量分别测量尾延迟。
参考资料
https://arxiv.org/abs/2608.28383