STORM: End-to-End Referring Multi-Object Tracking in Videos
STORM:视频中的端到端提及多目标跟踪
机构 * Amazon(亚马逊)
AI总结 STORM通过统一框架联合执行目标定位与跟踪,提升数据效率并构建新数据集,实现多目标跟踪的先进性能。
Comments CVPR 2026 Findings
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
STORM:视频中的端到端提及多目标跟踪
机构 * Amazon(亚马逊)
AI总结 STORM通过统一框架联合执行目标定位与跟踪,提升数据效率并构建新数据集,实现多目标跟踪的先进性能。
Comments CVPR 2026 Findings
UDAPose:无监督领域适应用于低光人类姿态估计
机构 * University of Mississippi(密西西比大学) ; National University of Singapore(新加坡国立大学) ; Duksung Women’s University(德成女子大学) ; ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))
AI总结 UDAPose提出了一种新的框架,通过合成低光图像并动态融合视觉线索与姿态先验,提升低光环境下的人体姿态估计性能。
Comments Accepted at CVPR 2026
领域特定胃肠道疾病识别的参数高效微调
机构 * Auburn University(奥本大学) ; Tribhuvan University(特里布万大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Georgia State University(佐治亚州立大学) ; Middle Tennessee State University(中田纳西州立大学)
AI总结 本文提出使用低秩适应(LoRA)模块进行参数高效微调,以解决跨源医学图像分布偏移问题,提升胃肠道疾病识别的参数效率和性能。
Comments 6 pages, 3 figures, CVPR conference
DeepShapeMatchingKit:加速的功能映射求解器和形状匹配流程再审视
机构 * Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; MIT(麻省理工学院) ; Adobe ; Imperial College London(帝国理工学院) ; Simon Fraser University(西蒙菲莎大学)
AI总结 本文提出了一种向量化方法,通过单次核调用解决所有线性系统,提升计算效率,并分析了DiffusionNet的空间梯度特征差异,提供了改进的开源代码库。
Comments 10 pages, 8 figures, CVPR 2026 Image Matching Workshop (IEEE proceedings)
在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试
机构 * Duke University(杜克大学)
AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。
Comments CVPR 2026 Findings
DRIFT:深度恢复、ISP融合与色调映射
机构 * Samsung Research America(三星美国研究院)
AI总结 本文提出DRIFT方法,通过多帧处理网络和深度学习色调映射实现高效移动相机流水线,生成高质量RGB图像,验证了其在性能和效率上的优势。
Comments Proceedings of CVPR 2026
THOM:从文本生成物理合理的手-物体网格
机构 * UNIST(蔚山科学技术院) ; University of Birmingham(伯明翰大学) ; POSTECH(浦项科技大学)
AI总结 THOM通过两阶段流程从文本生成物理合理的手-物体网格,无需模板网格,结合物理优化和视觉语言模型提升交互合理性。
Comments accepted to CVPR Findings 2026
HG-Lane:在恶劣天气和光照条件下无需重新标注的高保真车道场景生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; School of Artificial Intelligence, Henan University(河南大学人工智能学院) ; University of Science and Technology of China(中国科学技术大学) ; AnnLab, Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所 AnnLab) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出HG-Lane框架,通过构建包含30000张图像的基准数据集,提升恶劣天气下车道检测性能,实验显示基于CLRNet的mF1得分提升20.87%。
Comments Accepted by CVPR 2026 (HighLight)
具有特异性的强化学习用于细粒度开放世界分类
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
AI总结 本文提出SpeciaRL框架,通过强化学习提升细粒度开放世界分类的准确性和特异性,优于现有方法。
Comments Accepted at CVPR 2026
构形:基于生成重建的3D构形定位
机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学) ; RLWRLD
AI总结 本文提出Affostruction框架,通过生成式重建完整物体几何并基于全形体进行构形定位,优于现有方法,在构形定位和3D重建上取得显著成绩。
Comments Accepted to CVPR 2026
M$^3$KG-RAG:多跳多模态知识图谱增强的检索增强生成
机构 * Korea University(高丽大学) ; Sungkyunkwan University(成均馆大学) ; NVIDIA Research(英伟达研究院) ; Hanwha Systems(韩华系统)
AI总结 本文提出M$^3$KG-RAG,通过构建多跳多模态知识图谱并引入GRASP机制,提升多模态大语言模型的推理深度和回答准确性。
Comments Accepted to CVPR 2026
4D-RGPT:通过感知蒸馏实现区域级4D理解
机构 * NVIDIA(英伟达)
AI总结 本文提出4D-RGPT和P4D框架,解决3D/4D视频问答中4D感知和时间理解不足的问题,并构建了区域级提示的R4D-Bench基准。
Comments CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench
GrOCE:基于图的在线概念擦除用于文本到图像扩散模型
机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
AI总结 GrOCE提出一种无需训练的框架,通过动态语义图和适应性聚类识别实现精准的在线概念擦除,提升文本到图像扩散模型的语义准确性和稳定性。
Comments Accepted to CVPR 2026 Highlight
CoPS:用于零样本异常检测的条件提示合成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; CASIVISION(中科视语) ; THU(清华大学) ; HNU(湖南大学) ; HUST(华中科技大学)
AI总结 本文提出CoPS框架,通过动态提示合成提升零样本异常检测性能,利用视觉特征生成适应性状态模型,并在13个工业和医疗数据集上取得分类AUROC和分割AUROC的提升。
Comments Accepted by CVPR 2026 Findings
感知归纳偏置是在对比学习之前所需的东西
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出在对比学习前引入感知归纳偏置,通过构建边界和表面表示来提升ResNet18的收敛速度和最终表示质量。
Comments CVPR 2025. Tianqin Li and Junru Zhao contributed equally to this work. Due to a formatting error during the CVPR submission, the equal contribution note was omitted in the official proceedings. This arXiv version corrects that oversight. The author order follows alphabetical order by last name. Code: https://github.com/juz031/MidVCL
探索在低空多视角观测条件下无人机视觉定位的最佳方法:一个基准
机构 * National University of Defense Technology(国防科技大学)
AI总结 本文提出一个基准,用于评估低空多视角条件下无人机视觉定位方法,通过构建大规模数据集和统一框架,分析影响定位精度的关键因素,并提出新的检索指标PDM@K。
Comments Accepted by CVPRF 2026 (Findings of the Conference on Computer Vision and Pattern Recognition 2026)
OSDFace:面向面部修复的一步扩散模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)
AI总结 OSDFace提出一种一步扩散模型,通过视觉嵌入器和面部身份损失提升面部修复的视觉质量和身份一致性。
Comments Accepted to CVPR 2025. The code and model will be available at https://github.com/jkwang28/OSDFace
VGA-Bench:一个统一的基准和多模型框架用于视频审美和生成质量评估
机构 * Ant Group(蚂蚁集团) ; Beijing Film Academy(北京电影学院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)
AI总结 本文提出VGA-Bench,通过三层次分类体系,结合1016个多样化提示生成60000+视频数据集,设计多任务神经评估器,实现视频生成质量与审美质量的系统评估。
Comments CVPR 2026
多模态Transformer中线性注意力的应用
机构 * University of Maryland(马里兰大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文研究了线性注意力在多模态框架中的应用,通过减少计算开销并保持性能,证明了线性注意力在多模态Transformer中的有效性。
Comments Workshop on Any-to-Any Multimodal Learning (Any2Any), CVPR 2026
U²Flow:基于不确定性的无监督光流估计
机构 * Sun Yat-sen University(中山大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 U²Flow是首个联合估计光流和像素不确定性的无监督框架,通过解耦学习策略从增强一致性中获取不确定性监督,提升训练稳定性。引入不确定性引导的双向流融合机制,实验表明其在KITTI和Sintel上达到无监督方法最优,生成可靠不确定性图。
Comments Accepted as an oral presentation at CVPR 2026
基于扩散模型的指纹生成内部手指变异性研究
机构 * Michigan State University(密歇根州立大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文系统评估了使用先进扩散模型生成的合成指纹(特别是潜在指纹)的内部手指变异性,通过构建包含七种多样数据集的潜在风格库,提高了生成模型的潜在风格多样性,并分析了生成指纹中ridge和 minutiae的完整性。
Comments Accepted at the 2nd Workshop on Foundation and Generative Models in Biometrics (FoundGen-Bio), held in conjunction with CVPR 2026
FREE-Switch: 基于频率的动态LoRA切换用于风格迁移
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出FREE-Switch方法,通过频率域重要性驱动动态LoRA切换,结合不同对象和风格的适配器,降低高质量定制生成的训练成本。
Comments CVPR Findings 2026
在何处以及何物进行适应:通过协同适配器实现机器视觉压缩的结构-语义协同调节
机构 * Xidian University(西安电子科技大学)
AI总结 本文提出S2-CoT框架,通过结构和语义协同适配器提升图像压缩性能,实现高效参数调节与高质量编码。
Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings, 2026
可学习的运动聚焦分块化方法用于高效且有效的视频无监督领域自适应
机构 * University of Saskatchewan(萨斯喀彻温大学)
AI总结 本文提出LMFT方法,通过学习去除低运动冗余分块,保留动作相关分块,提升视频无监督领域自适应的效果与效率。
Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
FF3R:从无约束视角实现前馈特征三维重建
机构 * Microsoft(微软) ; Clemson University(克莱姆森大学) ; Texas A&M University(德克萨斯A&M大学)
AI总结 FF3R提出一种无需标注的前馈框架,统一处理几何与语义推理,解决全局语义不一致和局部结构不一致问题,实验显示其在视图合成、语义分割和深度估计中表现优异。
Comments CVPR 2026 Findings. Project Page: https://chaoyizh.github.io/ff3r_project/
NeuroFlow:迈向从神经活动统一的视觉编码和解码
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Hong Kong(香港大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Tsinghua University(清华大学) ; Chinese University of Hong Kong(香港中文大学)
AI总结 NeuroFlow首次提出统一框架,通过单一流模型联合建模视觉和神经活动的编码解码,提升效率与一致性。
Comments Accepted to CVPR 2026. Project page: https://michaelmaiii.github.io/NeuroFlow-S
在CT图像中实现鲁棒的公平疾病诊断
机构 * Carmel High School(卡梅尔高中) ; Capstone School Dhaka(达卡顶点学校) ; Clarkstown High School South(克拉克镇南部高中) ; University at Albany, State University of New York(纽约州立大学奥尔巴尼分校) ; Purdue University(普渡大学)
AI总结 本文提出双层目标解决CT图像中因数据不平衡和群体代表性不足导致的诊断不公问题,通过样本级和群体级损失函数提升模型公平性与准确性。
Comments 8 pages, 3 figures, 2 tables. Accepted at the 3rd Workshop on New Trends in AI-Generated Media and Security (AIMS) @ CVPR 2026
AI媒体检测中的部署差距:平台感知与视觉受限的对抗评估
机构 * Indiana University(印第安纳大学) ; Upper Hand ; Ace Rent a Car
AI总结 本文提出平台感知的对抗评估框架,揭示实验室环境下的高准确率在实际部署中显著下降,强调需考虑图像处理对检测性能的影响。
Comments Accepted at CVPR AIMS 2026
一种用于交通监控视频事故检测、定位和分类的模块化零样本流水线
机构 * Independent Researcher(独立研究员)
AI总结 本文提出一种零样本流水线,通过三个独立模块分别实现交通事故的时间定位、位置确定和类型分类,无需真实世界标注数据。
Comments 9 pages, 7 figures, 2 tables. Submitted to the ACCIDENT @ CVPR 2026 Workshop. Source code and notebook available at https://www.kaggle.com/code/ameythakur20/zero-shot-cctv-traffic-accident-understanding/
FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击
机构 * Zhejiang University(浙江大学) ; Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) ; Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)
AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。
Comments Accepted at CVPR 2026