FREE-Switch: Frequency-based Dynamic LoRA Switch for Style Transfer
FREE-Switch: 基于频率的动态LoRA切换用于风格迁移
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出FREE-Switch方法,通过频率域重要性驱动动态LoRA切换,结合不同对象和风格的适配器,降低高质量定制生成的训练成本。
Comments CVPR Findings 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
FREE-Switch: 基于频率的动态LoRA切换用于风格迁移
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出FREE-Switch方法,通过频率域重要性驱动动态LoRA切换,结合不同对象和风格的适配器,降低高质量定制生成的训练成本。
Comments CVPR Findings 2026
在何处以及何物进行适应:通过协同适配器实现机器视觉压缩的结构-语义协同调节
机构 * Xidian University(西安电子科技大学)
AI总结 本文提出S2-CoT框架,通过结构和语义协同适配器提升图像压缩性能,实现高效参数调节与高质量编码。
Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings, 2026
可学习的运动聚焦分块化方法用于高效且有效的视频无监督领域自适应
机构 * University of Saskatchewan(萨斯喀彻温大学)
AI总结 本文提出LMFT方法,通过学习去除低运动冗余分块,保留动作相关分块,提升视频无监督领域自适应的效果与效率。
Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
FF3R:从无约束视角实现前馈特征三维重建
机构 * Microsoft(微软) ; Clemson University(克莱姆森大学) ; Texas A&M University(德克萨斯A&M大学)
AI总结 FF3R提出一种无需标注的前馈框架,统一处理几何与语义推理,解决全局语义不一致和局部结构不一致问题,实验显示其在视图合成、语义分割和深度估计中表现优异。
Comments CVPR 2026 Findings. Project Page: https://chaoyizh.github.io/ff3r_project/
NeuroFlow:迈向从神经活动统一的视觉编码和解码
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Hong Kong(香港大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Tsinghua University(清华大学) ; Chinese University of Hong Kong(香港中文大学)
AI总结 NeuroFlow首次提出统一框架,通过单一流模型联合建模视觉和神经活动的编码解码,提升效率与一致性。
Comments Accepted to CVPR 2026. Project page: https://michaelmaiii.github.io/NeuroFlow-S
在CT图像中实现鲁棒的公平疾病诊断
机构 * Carmel High School(卡梅尔高中) ; Capstone School Dhaka(达卡顶点学校) ; Clarkstown High School South(克拉克镇南部高中) ; University at Albany, State University of New York(纽约州立大学奥尔巴尼分校) ; Purdue University(普渡大学)
AI总结 本文提出双层目标解决CT图像中因数据不平衡和群体代表性不足导致的诊断不公问题,通过样本级和群体级损失函数提升模型公平性与准确性。
Comments 8 pages, 3 figures, 2 tables. Accepted at the 3rd Workshop on New Trends in AI-Generated Media and Security (AIMS) @ CVPR 2026
AI媒体检测中的部署差距:平台感知与视觉受限的对抗评估
机构 * Indiana University(印第安纳大学) ; Upper Hand ; Ace Rent a Car
AI总结 本文提出平台感知的对抗评估框架,揭示实验室环境下的高准确率在实际部署中显著下降,强调需考虑图像处理对检测性能的影响。
Comments Accepted at CVPR AIMS 2026
一种用于交通监控视频事故检测、定位和分类的模块化零样本流水线
机构 * Independent Researcher(独立研究员)
AI总结 本文提出一种零样本流水线,通过三个独立模块分别实现交通事故的时间定位、位置确定和类型分类,无需真实世界标注数据。
Comments 9 pages, 7 figures, 2 tables. Submitted to the ACCIDENT @ CVPR 2026 Workshop. Source code and notebook available at https://www.kaggle.com/code/ameythakur20/zero-shot-cctv-traffic-accident-understanding/
FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击
机构 * Zhejiang University(浙江大学) ; Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) ; Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)
AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。
Comments Accepted at CVPR 2026
ProDiG:渐进式扩散引导高斯点云法用于空到地重建
机构 * CRCV, University of Central Florida(中佛罗里达大学计算机视觉研究中心)
AI总结 本文提出ProDiG方法,通过扩散引导逐步将空视图转换为地面级视图,利用几何感知因果注意力模块和距离自适应高斯模块,实现高斯点云的渐进式优化,提升重建的几何一致性和鲁棒性。
Comments CVPR Findings 2026
分解、混合、适应:一种统一的框架用于参数高效神经网络重组与压缩
机构 * Boston University(波士顿大学) ; NVIDIA(英伟达)
AI总结 本文提出CRISP框架,通过分解预训练权重为基矩阵和混合投影,实现参数高效重组与压缩,优于现有方法4-5%,并在PEFT和PEFT+MC组合中表现更优。
Comments Accepted in CVPR, 2026 (Main Track)
学习协助:通过多智能体强化学习实现物理基础的人机控制
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Keio AI Research Center(庆应义塾大学人工智能研究中心) ; Keio University(庆应义塾大学)
AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。
Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/
BiCLIP:通过结构几何变换实现领域规范化
机构 * University of Houston(休斯顿大学) ; The University of Oklahoma(俄克拉荷马大学)
AI总结 BiCLIP通过结构几何变换提升跨模态对齐,利用少量锚点样本实现领域规范化,实验表明其在11个基准测试中均取得最优性能。
Comments Accepted at Domain Generalization: Evolution, Breakthroughs, and Future Horizons Workshop at CVPR 2026
Nano-EmoX:从感知到共情的多模态情感智能统一框架
机构 * Fujian Normal University(福建师范大学) ; RMIT University(皇家墨尔本理工大学) ; Minjiang University(闽江学院)
AI总结 本文提出Nano-EmoX,通过认知启发的三级架构整合感知、理解与交互层面的情感任务,首次实现六项核心情感任务的统一建模,展现高效且强大的泛化能力。
Comments This paper has been accepted by CVPR 2026
文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?
机构 * Michigan State University(密歇根州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。
Comments CVPR Finding, 2026
SciPostLayoutTree:用于科学海报结构分析的数据集
机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)
AI总结 本文提出SciPostLayoutTree数据集,用于研究科学海报的结构分析,通过标注阅读顺序和父子关系,提升结构感知界面的准确性。
Comments CVPR Findings 2026
CylinderDepth:多视角一致自监督周围深度估计的圆柱空间注意力
机构 * Leibniz University Hannover(莱布尼茨汉诺威大学)
AI总结 本文提出一种几何引导方法,通过圆柱空间注意力机制提升多视角自监督周围深度估计的精度和一致性。
Comments Accepted at 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)
Ninja Codes: 由神经生成的隐匿式六自由度跟踪标记
机构 * Osaka University(大阪大学) ; Kyoto University(京都大学)
AI总结 本文提出Ninja Codes,一种由神经网络生成的隐匿式标记,能自然融入真实环境,通过编码网络将任意图像转换为标记,用于机器人和增强现实等领域的隐匿六自由度跟踪。
Comments CVPR 2026 Findings; Project page: https://sento.net/research/ninjacodes
用自然语言组织无结构图像集合
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ; ENSTA Paris, Institut Polytechnique de Paris(巴黎高等先进技术学院,巴黎综合理工学院) ; Hefei University of Technology(合肥工业大学) ; University of Bergamo(贝加莫大学) ; Technical University of Munich(慕尼黑工业大学)
AI总结 本文提出OpenSMC任务,通过自然语言发现图像的多种语义聚类标准,并实现自动组织。X-Cluster框架通过文本推理代理,发现多种聚类标准并生成有意义的簇。
Comments Accepted to CVPR 2026 Findings. Project page: https://oatmealliu.github.io/xcluster.html
逐步展望未来
机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Netflix
AI总结 本文提出通过稀疏点轨迹逐步推断来预测开放集未来场景动态,提升大规模探索效率,同时引入OWM基准测试预测准确性与现实不确定性下的多样性。
Comments CVPR 2026. For code and models, see http://compvis.github.io/myriad
实现沉浸式体积分量视频:一种多模态框架用于6自由度VR互动
机构 * Tsinghua University(清华大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Migu Beijing Research Institute(咪咕北京研究院) ; School of Architecture, Tsinghua University(清华大学建筑学院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
AI总结 本文提出了一种多模态框架,用于构建沉浸式体积分量视频,通过多视角多模态数据集和动态光场重建框架,实现高分辨率、高帧率的动态内容,支持6自由度VR交互。
Comments Journal extension of CVPR 2025. See also arXiv:2503.14359 . Project page and code: https://github.com/Metaverse-AI-Lab-THU/ImViD
视觉语言模型是否需要处理图像标记?
机构 * IBM ; Indian Institute of Science(印度科学研究所) ; University of Virginia(弗吉尼亚大学)
AI总结 本文研究了视觉语言模型中图像标记的功能,发现视觉表示快速收敛至有限复杂度,而文本表示持续重构。视觉表示在不同层间可互换,任务依赖性影响视觉处理的必要性。
Comments Accepted (Oral) at TRUE-V Workshop CVPR 2026
PhysInOne:一套视觉物理学习与推理系统
机构 * vLAR Group(vLAR 研究组) ; The Hong Kong Polytechnic University(香港理工大学) ; Syai Singapore(Syai 新加坡) ; Meta
AI总结 PhysInOne通过大规模合成数据提升AI系统对物理现象的理解,包含200万视频和15万动态3D场景,涵盖71种基本物理现象,用于物理感知视频生成、未来帧预测、物理属性估计和运动转移等应用。
Comments CVPR 2026. Siyuan, Hejun, Hu, Jinxi, Dongsheng, Junwei, Yixiao, Jiayue, and Shiwei are co-first authors. Project page: https://vlar-group.github.io/PhysInOne.html
VSI:视觉字幕整合用于关键帧选择以增强长视频理解
机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) ; Shandong University(山东大学)
AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。
Comments Accepted to CVPR 2026 Findings, 10 pages
ClusterMark:面向自回归图像生成器的鲁棒水印技术:基于视觉token聚类
机构 * Ruhr University Bochum(波鸿鲁尔大学) ; _fbeta
AI总结 本文提出ClusterMark,通过视觉token聚类提升自回归图像生成器的水印鲁棒性,有效对抗图像扰动和再生攻击,同时保持图像质量,优于现有基线方法。
Comments CVPR 2026
Gen-n-Val:代理图像数据生成与验证
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心)
AI总结 针对计算机视觉任务中数据稀缺、标签噪声和长尾类别不平衡问题,Gen-n-Val引入基于Layer Diffusion和大语言模型的代理生成框架,有效提升实例分割和目标检测的合成数据质量与性能。
Comments Accepted to the CVPR 2026 Findings track
Long-SCOPE:完全稀疏的长距离协作3D感知
机构 * Tsinghua University(清华大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Nanyang Technological University(南洋理工大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 本文提出Long-SCOPE框架,通过几何引导查询生成模块和上下文感知关联模块,解决远距离协作3D感知中的计算复杂性和特征关联问题,实现高精度低开销的长距离感知。
Comments Accepted by CVPR 2026
从正交轮廓确定全局最优姿态
机构 * Freie Universität Berlin(柏林自由大学) ; Zuse Institute Berlin(柏林祖斯研究所)
AI总结 本文提出利用轮廓面积连续性特性,通过预计算的轮廓签名响应面实现全局最优姿态估计,无需对应关系,适用于任意形状。
Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026. Denver, Colorado
CLIP-Inspector:通过OoD触发器反向工程实现提示调优CLIP的模型级后门检测
机构 * IIIT Delhi(印度德里国际信息技术学院) ; IIT Delhi(印度德里理工学院)
AI总结 针对提示调优CLIP模型中潜在的后门攻击,CLIP-Inspector通过OoD触发器反向工程实现模型级后门检测,利用白盒访问和未标记OoD图像重建可能触发器,验证模型安全性并修复后门效果。
Comments 17 pages (8 main + 2 references + 7 supplementary), Accepted to CVPR Findings 2026
从空间转录组到组织学的跨模态知识蒸馏
机构 * Weizmann Institute of Science(魏茨曼科学研究所) ; Reichman University(赖希曼大学)
AI总结 本文提出利用空间转录组与H&E数据进行跨模态蒸馏,将转录组学的 niches 结构转移到仅依赖组织学的模型中,提升与转录组学 niches 结构的一致性,并通过细胞类型分析验证生物意义的邻近组成。
Comments Accepted to the CVMI Workshop at CVPR 2026. Project page: https://cross-modal-distillation.github.io/