Act2See: Emergent Active Visual Perception for Video Reasoning
Act2See:面向视频推理的涌现式主动视觉感知
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MIT(麻省理工学院)
AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。
Comments CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
Act2See:面向视频推理的涌现式主动视觉感知
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MIT(麻省理工学院)
AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。
Comments CVPR 2026
Omni-Fake:面向社交媒体的统一多模态深度伪造检测基准测试
机构 * University of Liverpool(利物浦大学) ; University of Exeter(埃克塞特大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出Omni-Fake多模态深度伪造检测基准,包含大规模数据集和分布外基准,支持联合检测-定位-解释协议,并提出基于强化学习的多模态检测器,提升检测准确性和可解释性。
Comments Accepted to CVPR 2026
面向3D世界的视觉查询定位
机构 * Wuhan University(武汉大学) ; AutoLab, SAI, Shanghai Jiao Tong University(AutoLab、SAI、上海交通大学) ; Anyverse Dynamics ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
AI总结 本文首次提出3D多模态视觉查询定位基准3DVQL,包含2002个序列和17万帧数据,通过点云、RGB图像和深度图像多模态数据提升研究灵活性,并提出LaF算法提升性能。
Comments Accepted to CVPR 2026. 8 pages
面向长尾学习的决策边界感知生成
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(中国教育部多媒体可信感知与高效计算重点实验室) ; Xiamen University(厦门大学) ; College of Computer Science and Software Engineering(计算机科学与软件工程学院) ; Shenzhen University(深圳大学) ; Department of Statistical Science(统计科学系) ; University College London(伦敦大学学院) ; Division of Arts and Machine Creativity(艺术与机器创造力 division) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出DBG框架,通过生成边界附近样本提升表示学习,缓解长尾数据分布不均问题,提升尾类和整体准确率。
Comments Accepted by CVPR 2026
无需注册的可学习多视角面部密集语义对应捕捉
机构 * Institute of Robotics, Athena Research Center(机器人研究所,雅典研究中心) ; School of ECE, NTUA(电子工程学院,NTUA) ; HERON – Hellenic Robotics Center of Excellence(希腊机器人 excellence 中心) ; MPI for Intelligent Systems(智能系统研究所) ; ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌)
AI总结 本文提出MOCHI框架,无需注册数据直接从多视角图像预测3D面部,通过伪线性逆运动学求解器确保拓扑一致性,改进损失函数提升重建精度。
Comments 19 pages, CVPR 2026
通过格罗莫夫-瓦瑟斯坦距离重新思考VLM中的模型选择
机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) ; Dolby Laboratories(杜比实验室) ; TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)
AI总结 本文通过系统实验探讨视觉编码器选择的关键因素,发现模态间结构相似性通过格罗莫夫-瓦瑟斯坦距离衡量能提升VLM性能预测。
Comments Accepted as Highlight publication for CVPR 2026
CUE: 基于概念的多标签扩展以缓解长尾学习中的概念混淆
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) ; College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) ; Institute of High Performance Computing, A*STAR, Singapore(新加坡A*STAR高性能计算研究所)
AI总结 本文提出CUE,通过引入多标签概念信号缓解长尾分布下类别间关系的破坏,实验表明其在多个长尾基准上表现优异。
Comments 10 pages. Accepted by CVPR 2026
NAKUL-Med: 带动态核的谱-图状态空间模型用于医学信号
机构 * Microsoft(微软)
AI总结 NAKUL-Med通过动态核生成、谱上下文建模和图引导的空间注意力,提升多通道生理信号分析的性能,实现高准确率和高效推理。
Comments Accepted CVPR Finding Track
合成设计实验用于诊断视觉模型失效
机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)
AI总结 本文提出SDRS方法,通过方差分析分解高效审计模型的因子敏感性,识别并解决类型I和II失效缺口,通过针对性合成数据提升模型性能。
Comments Under review at CVPR SynData4CV 2026
SpatialStack:用于3D VLM空间推理的分层几何-语言融合
机构 * XMU(厦门大学) ; UCLA(美国大学) ; Google(谷歌) ; UW-Madison(威斯康星大学麦迪逊分校) ; TAMU(德克萨斯农工大学)
AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。
Comments CVPR 2026, Project Website: https://spatial-stack.github.io/
基于视觉和语言模型的合成数据生成基础
机构 * Graduate School of Informatics(信息学院)
AI总结 本文提出一种视觉-语言 grounded 框架,用于可解释的遥感合成数据增强与评估,引入 ARAS400k 数据集,包含 100k 真实图像和 300k 合成图像,用于语义分割和图像描述生成。
Comments Accepted for presentation at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Synthetic Data for Computer Vision Workshop (SynData4CV) 2026
折射现实:生成具有真实透明物体的图像
机构 * The Australian National University(澳大利亚国立大学)
AI总结 本文提出通过Snell定律在生成过程中同步像素,生成更符合物理约束的透明物体图像。
Comments CVPR 2026 (Highlight), Code: https://github.com/YueYin27/snellcaster, Project page: https://yueyin27.github.io/snellcaster-page/