Morphing into Hybrid Attention Models
变形为混合注意力模型
机构 * Fudan University(复旦大学) ; ByteDance Seed(字节跳动种子) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出FlashMorph方法,将层选择建模为预算约束子集优化问题,通过可变形模型和门控学习高效选择全注意力层,实现Transformer到混合注意力的转换,在保持性能的同时降低选择成本。
大厂专区
变形为混合注意力模型
机构 * Fudan University(复旦大学) ; ByteDance Seed(字节跳动种子) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出FlashMorph方法,将层选择建模为预算约束子集优化问题,通过可变形模型和门控学习高效选择全注意力层,实现Transformer到混合注意力的转换,在保持性能的同时降低选择成本。
GLIP:面向图级任务的图与大型语言模型联合预训练
机构 * Fudan University(复旦大学) ; ByteDance(字节跳动)
AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。
D$^{2}$R$^{2}$OSR: 面向真实世界全向图像超分辨率的退化解耦表示
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) ; ByteDance Inc.(字节跳动公司) ; School of Computer Science, Peking University(北京大学计算机学院)
AI总结 提出D$^{2}$R$^{2}$OSR框架,通过显式建模鱼眼成像和ERP投影的退化,结合视角投影表示和退化特定模块,实现真实世界全向图像超分辨率,达到SOTA性能。
超越轨迹匹配:基于边缘分布对齐的Reflow方法
机构 * Department of Statistics and Data Science, Tsinghua University(统计与数据科学系,清华大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; Bytedance Inc(字节跳动公司)
AI总结 针对扩散模型加速生成中轨迹匹配导致学生模型边缘分布不确定的问题,提出边缘对齐正则化,通过跟踪ODE对数密度变化并利用冻结教师模型评分计算,无需额外网络,有效提升少步生成质量。
SWE-MeM:面向长周期编码代理的自适应内存管理学习
机构 * The Chinese University of Hong Kong, China(香港中文大学) ; Shanghai Jiao Tong University, China(上海交通大学) ; Tsinghua University, China(清华大学) ; ByteDance, China(字节跳动)
AI总结 提出SWE-MeM训练框架,通过灵活的内存工具和Memory-aware GRPO优化,让代理在有限上下文预算下自主决定压缩时机、内容和方式,在SWE-Bench Verified上以4B和30B模型分别达到43.4%和60.2%的解决率,优于现有方法。
双端一致性模型
机构 * Zhejiang University(浙江大学) ; Bytedance Inc.(字节跳动公司) ; Zhejiang Lab(浙江实验室)
AI总结 本文提出双端一致性模型,通过选择关键子轨迹集群解决训练不稳定和采样灵活性问题,实现稳定高效的生成。
Comments ECCV 2026
TAR:基于时间锚的视频时间定位推理
机构 * South China University of Technology(华南理工大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; Bytedance Inc.(字节跳动有限公司)
AI总结 TAR通过引入时间锚机制,提升视频时间定位任务中推理过程的可信度和自主性,采用自举方法生成高质量推理轨迹,实现更精确的最终预测。
Comments Accepted by ECCV2026