JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
JetViT: 高效高分辨率视觉Transformer与训练后注意力搜索
机构 * MIT(麻省理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; NVIDIA(NVIDIA公司) ; Physical Intelligence(物理智能)
AI总结 提出JetViT混合架构视觉Transformer,通过训练后注意力搜索将预训练全注意力ViT转换为高效混合注意力变体,在高分辨率图像上实现更高推理效率且不损失精度。
Comments Accepted to CVPR 2026 Findings