Prompt-Free Universal Region Proposal Network
无提示通用区域提议网络
机构 * Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出无提示通用区域提议网络PF-RPN,通过自适应查询嵌入和级联自提示模块实现无需外部提示的对象定位,适用于多种目标检测场景。
Comments Accepted to CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
无提示通用区域提议网络
机构 * Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出无提示通用区域提议网络PF-RPN,通过自适应查询嵌入和级联自提示模块实现无需外部提示的对象定位,适用于多种目标检测场景。
Comments Accepted to CVPR 2026
学习基于坐标的卷积核以实现连续SE(3)等价性和高效的点云分析
机构 * Interdisciplinary Program in Neuroscience, Seoul National University(首尔国立大学神经科学跨学科项目) ; Département d’Informatique, École Normale Supérieure (ENS)(规范高等学校计算机系) ; Department of Computing, Imperial College London(伦敦帝国学院计算系) ; Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系)
AI总结 本文提出ECKConv,通过坐标基网络设计实现SE(3)等价性和高效点云处理,在分类、姿态注册等任务中验证了其性能优势。
Comments Accepted at CVPR 2026
OnlineHMR:基于视频的在线世界坐标人体网格恢复
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文提出OnlineHMR,一种在线处理框架,通过因果键值缓存和滑动窗口学习策略实现在线世界坐标人体网格恢复,适用于AR/VR等交互场景。
Comments Accepted by CVPR 2026
基于视觉语言模型的递归推理用于估计长周期具身任务进度
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。
Comments CVPR 2026
GazeOnce360:基于鱼眼的360°多人凝视估计与全局-局部特征融合
机构 * State Key Laboratory of VR Technology and Systems, School of CSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学计算机科学与工程学院)
AI总结 本文提出GazeOnce360,一种端到端模型,用于从单个桌面安装的向上鱼眼摄像头估计多人凝视方向。通过引入MPSGaze360大规模合成数据集,融合全局低分辨率上下文与高分辨率局部眼区,解决鱼眼图像的严重失真和视角变化问题。
Comments Accepted to CVPR 2026
BEV-SLD:基于LiDAR鸟瞰图像的自监督场景地标检测用于全局定位
机构 * Institute for Photogrammetry and Geoinformatics, University of Stuttgart, Germany(摄影测量与地理信息研究所,斯图加特大学,德国)
AI总结 本文提出BEV-SLD,通过自监督学习利用鸟瞰图像发现特定场景模式,实现鲁棒的全局定位,优于现有方法。
Comments Accepted to CVPR 2026
CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类
机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。
Comments Accepted to CVPR 2026
F2HDR:通过流适配器和物理运动建模的两阶段HDR视频重建
机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) ; State Key Laboratory of Smart Power Distribution Equipment and System, Tianjin University(天津大学智能电力分配设备与系统国家重点实验室) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
AI总结 本文提出F2HDR框架,通过流适配器和物理运动建模解决HDR视频重建中的动态场景对齐和细节恢复问题,实现高质量重建。
Comments Accepted by CVPR 2026
Context-Nav: 基于上下文的探索与视点感知的3D空间推理用于实例导航
机构 * Department of AI Convergence(人工智能融合系)
AI总结 Context-Nav通过上下文驱动的探索和视点感知的3D空间推理,提升实例导航任务的性能,无需特定任务训练,实现最先进的结果。
Comments Accepted to CVPR 2026. Code is available at https://github.com/AutoCompSysLab/ContextNav
VL-RouterBench:一种用于视觉-语言模型路由的基准测试
机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(3 香港科学与技术大学)
AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。
Comments CVPR 2026 Accepted
TALO:推动3D视觉基础模型向全球一致的在线重建迈进
机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出基于薄板样条的高自由度长期对齐框架,通过全局传播控制点纠正空间变化不一致,并采用点无关子图注册设计提升鲁棒性,实验表明其在多数据集和相机配置下均能获得更一致的几何和更低的轨迹误差。
Comments CVPR 2026
邻居GRPO:对比ODE策略优化对齐流模型
机构 * CUHK MMLab(香港中文大学多模态实验室) ; Vivix Group Limited(Vivix集团有限公司) ; HKUST(香港理工大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; CPII under InnoHK(创新香港下的CPII)
AI总结 本文提出Neighbor GRPO,通过扰动ODE初始噪声条件生成候选轨迹,基于softmax距离优化,避免SDE,提升效率与生成质量。
Comments CVPR 2026
草稿与润色:借助视觉专家
机构 * University of California, Irvine(加州大学尔湾分校) ; Northeastern University(东北大学) ; MOLOCO
AI总结 本文提出DnR框架,通过可视化专家反馈提升模型视觉利用能力,减少幻觉并提高多模态系统可解释性。
Comments Accepted to CVPR 2026
M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成
机构 * Tsinghua University(清华大学) ; Beihang University(北京航空航天大学) ; Migu Beijing Research Institute(咪咕北京研究院)
AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。
Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/
MLLMs关注什么以及依赖什么:解释自回归标记生成
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; College of Computing and Data Science, NTU(NTU 计算与数据科学学院) ; Huawei(华为) ; School of Flexible Electronics, SYSU(SYSU 灵活电子学院) ; School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(Sun Yat-sen 大学深圳校区计算机科学与技术学院)
AI总结 本文提出EAGLE框架,通过轻量级黑盒方法解释MLLMs的自回归标记生成,量化语言先验和感知证据的影响,提升模型可解释性。
Comments Accepted to CVPR 2026
看见、思考、行动:通过识别切换器教多模态代理有效交互GUI
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
AI总结 本文提出State-aware Reasoning方法,通过识别当前切换状态和指令目标状态,提升多模态代理在GUI切换指令执行的准确性,实验显示准确率提升超30%。
Comments Accepted at CVPR 2026
学习感知与行动:面向机器人操作的任务感知虚拟视角探索
机构 * Sun Yat-sen University(中山大学) ; Pengcheng Laboratory(鹏城实验室) ; Nanyang Technological University(南洋理工大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; X-Era AI Lab(X-Era AI实验室)
AI总结 本文提出TVVE框架,通过动态选择任务相关虚拟视角和重构场景表示,提升机器人操作在遮挡和跨任务迁移中的性能,实验验证其鲁棒性。
Comments 24 pages, 15 figures, Project page: https://hcplab-sysu.github.io/TAVP, Code: https://github.com/HCPLab-SYSU/TAVP.git, Accepted at CVPR 2026
内窥手术图像修复与更广泛的评估
机构 * The Chinese University of Hong Kong(香港中文大学) ; Dalian University of Technology(大连理工大学) ; Southern Medical University(南方医科大学) ; Xidian University(西安电子科技大学) ; Wuhan University(武汉大学)
AI总结 本文提出SurgClean数据集,用于评估内窥手术场景中的多种图像修复任务,揭示现有算法与临床需求间的差距,并从结构和语义角度分析手术与自然场景的退化差异。
Comments This work has been accepted by CVPR 2026
SCAM:多模态基础模型的现实世界字形鲁棒性评估
机构 * BLISS e.V.(BLISS协会) ; Berliner Hochschule für Technik (BHT)(柏林技术大学) ; Technische Universität Berlin(柏林技术大学) ; KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院) ; Merantix Momentum(Merantix Momentum公司) ; Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)
AI总结 本文提出SCAM数据集,用于评估多模态基础模型对字形攻击的鲁棒性,发现训练数据和模型架构影响攻击敏感性,且大语言模型基座可降低攻击影响。
Comments Accepted at CVPR 2025 Workshop EVAL-FoMo-2
Journal ref Journal of Data-centric Machine Learning Research (2026)
高保真扩散面部交换与ID约束面部条件化
机构 * CUHK MMLab(香港中文大学多模态实验室) ; Vivix Group Limited(Vivix集团有限公司) ; Shenzhen Loop Area Institute(深圳河套学院) ; CPII under InnoHK(创新香港下的CPII)
AI总结 本文提出了一种ID约束的面部条件化框架,通过解耦条件注入确保身份保持并优化属性对齐,结合身份和对抗损失提升生成质量,在定性和定量评估中均优于现有方法。
Comments CVPR 2026
腹腔镜手术视频中出血区域与点的协同检测
机构 * The Chinese University of Hong Kong(香港中文大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Southern Medical University(南方医科大学) ; Wuhan University(武汉大学)
AI总结 本文提出BlooDet模型,通过协同检测腹腔镜手术中的出血区域和点,提升手术成功率。
Comments This work has been accepted by CVPR 2026
测试时3D占用预测
机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) ; Harbin Institute of Technology(哈尔滨工程大学)
AI总结 本文提出TT-Occ框架,通过实时集成视觉基础模型,实现灵活的3D高斯表示和占用预测,适用于不同体素分辨率和新类别识别。
Comments CVPR 2026
高效扩散作为低光照增强器
机构 * Northwestern Polytechnical University(西北工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室) ; TeleAI
AI总结 本文提出ReDDiT框架,通过线性外推错误分数函数和迁移高斯流到反射感知残差空间,提升低光照图像增强效率,仅用2步即可达到SOTA效果。
Comments CVPR 2025 Camera Ready
多模态AI代理的前瞻性规划
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; The Ohio State University(俄亥俄州立大学) ; Adobe Research(Adobe研究) ; State University of New York at Buffalo(纽约州立大学布法罗分校)
AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。
Comments Published at CVPR 2026 Findings Track
检索反事实改进视觉上下文学习
机构 * University of Virginia(弗吉尼亚大学)
AI总结 本文提出CIRCLES框架,通过主动检索反事实样例提升视觉语言模型的因果推理能力,实验表明其在多个数据集上优于现有方法,尤其在小规模模型和信息稀缺场景下表现突出。
Comments CVPR 2026
$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology(哈尔滨工业大学) ; The University of Hong Kong(香港大学)
AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。
Comments This version is the camera-ready version accepted at CVPR 2026
BUSSARD:基于归一化流的生物jective通用场景特定异常关系检测
机构 * Institute for Information Processing, L3S - Leibniz University Hannover(信息处理研究所,L3S-汉诺威莱布尼茨大学)
AI总结 本文提出BUSSARD模型,通过归一化流学习场景图中对象-关系-对象三元组到基础分布的可逆变换,实现异常关系检测。在SARD数据集上取得优于当前SOTA的AUROC提升,并展示出更强的鲁棒性和通用性。
Comments CVPR 2026 Main Track
ACPV-Net:所有类别的多边形向量化用于从航空影像生成无缝矢量地图
机构 * Faculty of Geo-Information Science and Earth Observation (ITC) University of Twente(地理信息科学与地球观测学院(ITC)代尔夫特理工大学)
AI总结 本文提出ACPV-Net,通过引入语义监督条件机制和拓扑重建,实现了多类多边形向量化,解决了现有方法在多类处理中的拓扑不一致问题,并在Deventer-512数据集上取得最佳性能。
Comments Accepted to CVPR 2026. The supplementary material available in the conference proceedings
重新思考在姿态先验和几何不确定性下的3D高斯点散布姿态细化
机构 * Yonsei University(延世大学) ; Kookmin University(韩国庆熙大学) ; Korea Institution of Science and Technology(韩国科学技术院)
AI总结 本文针对3DGS姿态细化的鲁棒性问题,提出结合蒙特卡洛姿态采样与Fisher信息PnP优化的重定位框架,提升定位精度和稳定性。
Comments 17 pages, 11 figures, CVPR 2026
渐进式动画3D高斯化身:ProgressiveAvatars
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出ProgressiveAvatars,基于自适应隐式细分的模板网格构建层次化3D高斯表示,实现网络和计算资源波动下的渐进式动画3D化身生成与渲染。
Comments Accepted to CVPR 2026, Project page: https://ustc3dv.github.io/ProgressiveAvatars/