arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2603.05330 2026-03-16 cs.CV

Dark3R: Learning Structure from Motion in the Dark

Dark3R: 在黑暗中学习结构从运动

Andrew Y Guo, Anagh Malik, SaiKiran Tedla, Yutong Dai, Yiqian Qin, Zach Salehe, Benjamin Attal, Sotiris Nousias, Kiriakos N. Kutulakos, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学) Sony Corporation of America(美国索尼公司) Harvard University(哈佛大学) Purdue University(普渡大学)

AI总结 Dark3R通过教师-学生蒸馏适应大规模3D基础模型以应对极低光照条件,无需3D监督,仅需噪声-清洁原始图像对进行训练,实现低信噪比下的鲁棒特征匹配和相机姿态估计。

Comments CVPR 2026, Project Page: https://andrewguo.com/pub/dark3r

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01000 2026-03-16 cs.CV

Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer

让您的图像随您的动作移动!-- 隐式多对象多动作转移

Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang

机构 * Tianjin University(天津大学) University of New South Wales(新南威尔士大学) University of Electronic Science and Technology of China(电子科技大学) Hainan University(海南大学) University of Auckland(奥克兰大学)

AI总结 本文提出FlexiMMT框架,实现多对象多动作的隐式图像到视频转换,通过解耦注意力机制和改进的掩码传播机制,实现精确且高质量的多对象动作迁移。

Comments 15 pages, 11 figures, cvpr 2026, see https://ethan-li123.github.io/FlexiMMT_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24084 2026-03-16 cs.CV

FoV-Net: Rotation-Invariant CAD B-rep Learning via Field-of-View Ray Casting

FoV-Net:通过视场射线投射实现旋转不变的CAD B-rep学习

Matteo Ballegeer, Dries F. Benoit

机构 * Ghent University(根特大学) CVAMO, Flanders(弗拉芒计算机视觉与建模实验室)

AI总结 本文提出FoV-Net,通过局部参考框架和视场网格实现旋转不变的B-rep学习,提升3D CAD分析的鲁棒性与效率。

Comments Manuscript accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19205 2026-03-16 cs.CV cs.LG

From Activation to Initialization: Scaling Insights for Optimizing Neural Fields

从激活到初始化:为优化神经场扩展规模洞察

Hemanth Saratchandran, Sameera Ramasinghe, Simon Lucey

机构 * Australian Institute of Machine Learning, University of Adelaide, Australia(澳大利亚机器学习研究所,阿德莱德大学,澳大利亚) Amazon, Australia(亚马逊,澳大利亚)

AI总结 本文探讨神经场中初始化与激活的相互作用,揭示网络初始化、架构选择与优化过程之间的深层联系,为设计高效神经场提供理论基础。

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12764 2026-03-16 cs.CV

SAVA-X: Ego-to-Exo Imitation Error Detection via Scene-Adaptive View Alignment and Bidirectional Cross View Fusion

SAVA-X:通过场景自适应视角对齐和双向跨视角融合进行视角到非视角模仿错误检测

Xiang Li, Heqian Qiu, Lanxiao Wang, Benliu Qiu, Fanman Meng, Linfeng Xu, Hongliang Li

机构 * University of Electronic Sience and Technology of China(电子科技大学)

AI总结 本文提出SAVA-X框架,通过场景自适应视角对齐和双向跨视角融合解决视角到非视角模仿错误检测问题,提升了在EgoMe基准上的AUPRC和均值tIoU表现。

Comments This article was accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12693 2026-03-16 cs.CV cs.AI

HSEmotion Team at ABAW-10 Competition: Facial Expression Recognition, Valence-Arousal Estimation, Action Unit Detection and Fine-Grained Violence Classification

HSEmotion团队在ABAW-10竞赛中的表现:面部表情识别、情绪估值估计、动作单元检测和细粒度暴力分类

Andrey V. Savchenko, Kseniia Tsypliakova

机构 * Sber AI Lab(Sber AI实验室) HSE University(俄罗斯高等经济学院)

AI总结 本文提出了一种基于预训练EfficientNet模型的快速方法,用于面部情绪理解任务,同时通过滑动窗口平滑噪声以提升预测精度,并在细粒度暴力检测任务中评估了多种预训练架构。

Comments to be submitted to ABAW-10 workshop of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12659 2026-03-16 cs.CV

AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network

AVION:从离线教师到提示调优网络的空域视觉-语言指令

Yu Hu, Jianyang Gu, Hao Liu, Yue Cao, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia, Okanagan(不列颠哥伦比亚大学奥克兰分校) The Ohio State University(俄亥俄州立大学) TerraSense Analytics(TerraSense分析)

AI总结 AVION提出一种知识蒸馏框架,通过构建语义丰富的文本原型和轻量级提示,提升视觉语言模型在遥感图像中的适应能力,提升少样本分类和跨模态检索性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12605 2026-03-16 cs.CV

A2Z-10M+: Geometric Deep Learning with A-to-Z BRep Annotations for AI-Assisted CAD Modeling and Reverse Engineering

A2Z-10M+: 通过A到Z BRep注释进行几何深度学习用于辅助CAD建模与逆向工程

Pritham Kumar Jena, Bhavika Baburaj, Tushar Anand, Vedant Dutta, Vineeth Ulavala, Sk Aziz Ali

AI总结 本文提出A2Z-10M+数据集,包含1000万种多模态注释,用于提升CAD逆向工程中的BRep学习能力,通过高分辨率网格、手绘草图和文本描述等多源数据训练基础模型,实现对CAD特征的精准识别。

Comments 27 pages, accepted to IEEE CVF CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12493 2026-03-16 cs.CV

RAW-Domain Degradation Models for Realistic Smartphone Super-Resolution

真实智能手机超分辨率的RAW域退化模型

Ali Mosleh, Faraz Ali, Fengjia Zhang, Stavros Tsogkas, Junyong Lee, Alex Levinshtein, Michael S. Brown

AI总结 本文提出通过校准和未处理公开渲染图像生成不同智能手机的RAW域图像对,训练单图像RAW到RGB超分辨率模型,以提升真实场景下的超分辨率性能。

Comments This paper has been accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12382 2026-03-16 cs.CV cs.AI

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11460 2026-03-16 cs.CV

Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning

跟随显著性:用于检索增强的密集视频描述的监督显著性

Seung hee Choi, MinJu Jeon, Hyunwoo Oh, Jihwan Lee, Dong-Jin Kim

AI总结 本文提出STaRC框架,通过显著性检测模块监督帧级显著性,以提升密集视频描述中时间分割的准确性,实现更精确的检索和上下文相关的描述生成。

Comments CVPR 2026 accepted paper (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00947 2026-03-16 cs.CV

Mobile-VTON: High-Fidelity On-Device Virtual Try-On

Mobile-VTON: 高保真设备端虚拟试衣

Zhenchen Wan, Ce Chen, Runqi Lin, Jiaxin Huang, Tianxi Chen, Yanwu Xu, Tongliang Liu, Mingming Gong

AI总结 本文提出Mobile-VTON,一种基于设备端的高保真虚拟试衣框架,通过模块化架构和隐私保护技术,在无需云端支持的情况下实现高质量试衣效果。

Comments The project page is available at: https://zhenchenwan.github.io/Mobile-VTON/

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23790 2026-03-16 cs.CV

Fourier Angle Alignment for Oriented Object Detection in Remote Sensing

基于傅里叶角对齐的遥感定向目标检测

Changyu Gu, Linwei Chen, Lin Gu, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学) University of Hong Kong(香港大学) Tohoku University(东北大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与发展中心)

AI总结 本文提出傅里叶角对齐方法,通过频谱分析角度信息并对其对齐,提升遥感中旋转目标检测的性能,实验显示在DOTA数据集上取得新的SOTA结果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18396 2026-03-16 cs.RO

AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation

AOMGen: 为关节物体操控生成逼真、物理一致的演示

Yulu Wu, Jiujun Cheng, Haowen Wang, Dengyang Suo, Pei Ren, Qichao Mao, Shangce Gao, Yakun Huang

AI总结 本文提出AOMGen框架,通过单次真实扫描、演示和数字资产库生成逼真训练数据,提升机器人操控任务的成功率。

Comments Accepted by CVPR Findings2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06684 2026-03-16 cs.CV

EMGauss: Continuous Slice-to-3D Reconstruction via Dynamic Gaussian Modeling in Volume Electron Microscopy

EMGauss:通过动态高斯建模在体积电子显微镜中实现连续切片到三维重建

Yumeng He, Zanwei Zhou, Yekun Zheng, Chen Liang, Yunbo Wang, Xiaokang Yang

AI总结 EMGauss通过动态高斯建模方法,解决体积电子显微镜中切片到三维重建的异质性限制,提升插值质量并实现连续切片合成。

Comments Accepted by CVPR 2026. Project page: https://raynehe.github.io/EMGauss/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21662 2026-03-16 cs.CV

Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

多标准:在多元标准下评估多模态裁判

Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Waterloo(滑铁卢大学)

AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00511 2026-03-16 cs.CV

ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

ID-Crafter:基于视觉语言模型的在线强化学习多主体视频生成框架

Panwang Pan, Jingjing Zhao, Yuchen Lin, Chenguo Lin, Chenxin Li, Hengyu Liu, Tingting Shen, Yadong MU

AI总结 本文提出ID-Crafter框架,通过层次化注意力机制、预训练视觉语言模型和在线强化学习,提升多主体视频生成中身份保持与语义一致性。

Comments Project page: https://angericky.github.io/ID-Crafter, Code: https://github.com/paulpanwang/IDCrafter

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12225 2026-03-16 cs.CV cs.LG

HoneyBee: Data Recipes for Vision-Language Reasoners

HoneyBee: 用于视觉-语言推理器的数据食谱

Hritik Bansal, Devendra Singh Sachan, Kai-Wei Chang, Aditya Grover, Gargi Ghosh, Wen-tau Yih, Ramakanth Pasunuru

AI总结 本文提出HoneyBee数据集,通过数据整理方法提升视觉-语言推理能力,发现上下文来源策略和数据干预显著提升性能,并提出测试时缩放策略以降低解码成本。

Comments 32 pages. Accepted to CVPR 2026 in Denver, Colorado, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14327 2026-03-16 cs.CV

MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer

MoVieDrive:基于多模态多视角视频扩散变换器的城市场景合成

Guile Wu, David Huang, Dongfeng Bai, Bingbing Liu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学)

AI总结 本文提出MoVieDrive,通过多模态多视角视频扩散变换器生成城市驾驶场景视频,实现多模态数据生成与可控生成。

Comments CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05914 2026-03-16 cs.LG

Accelerating Diffusion Model Training under Minimal Budgets: A Condensation-Based Perspective

在有限预算下加速扩散模型训练:基于凝聚的视角

Rui Huang, Shitong Shao, Zikai Zhou, Pukun Zhao, Hangyu Guo, Tian Ye, Lichen Bai, Shuo Yang, Zeke Xie

AI总结 本文提出D2C框架,通过选择和附加两阶段方法,从大规模数据集中凝聚出小数据集,从而在有限资源下加速扩散模型训练并保持生成质量。

Comments CVPR 2026 camera-ready version. Introduces D2C, a framework for efficient diffusion model training

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17476 2026-03-16 cs.CV

The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文

Yuchen Zhang, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12267 2026-03-13 cs.CV

EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation

EVATok: 适应性长度视频分块化以实现高效的视觉自回归生成

Tianwei Xiong, Jun Hao Liew, Zilong Huang, Zhijie Lin, Jiashi Feng, Xihui Liu

AI总结 EVATok通过自适应分块器提升视频重建和自回归生成的效率与质量,实现令牌使用量减少24.4%。

Comments Accepted by CVPR 2026. Project page: https://silentview.github.io/EVATok/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12254 2026-03-13 cs.CV

Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

先关注再注意:通过自回归注视实现高效的可扩展视频理解

Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Boyi Li, Jan Kautz, Song Han, David M. Chan, Pavlo Molchanov, Trevor Darrell, Hongxu Yin

机构 * UC Berkeley(伯克利大学) MIT(麻省理工学院) Clarifai(Clarifai公司) NVIDIA(英伟达公司)

AI总结 AutoGaze通过自回归选择视频中的关键块,减少冗余并提升处理效率,使大语言模型能处理长视频并取得更优表现。

Comments CVPR 2026. Project page: https://autogaze.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12240 2026-03-13 cs.CV cs.LG

BiGain: Unified Token Compression for Joint Generation and Classification

BiGain:联合生成与分类的统一标记压缩

Jiacheng Liu, Shengkun Tang, Jiacheng Cui, Dongkuan Xu, Zhiqiang Shen

机构 * VILA Lab, MBZUAI(MBZUAI视觉实验室) North Carolina State University(北卡罗来纳州立大学)

AI总结 BiGain通过频率分离技术,实现生成与分类的统一标记压缩,提升扩散模型的加速性能和分类准确率,同时保持生成质量。

Comments CVPR 2026. Code: https://github.com/Greenoso/BiGain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12217 2026-03-13 cs.CV

Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

现实世界点跟踪中的验证者引导伪标签方法

Görkay Aydemir, Fatma Güney, Weidi Xie

机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) KUIS AI Center(KUIS人工智能中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12193 2026-03-13 cs.RO cs.CV

SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics

SaPaVe:迈向视觉-语言-动作模型中的主动感知与操作

Mengzhen Liu, Enshen Zhou, Cheng Chi, Yi Han, Shanyu Rong, Liming Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学) School of Software, Beihang University(软件学院,北航) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 SaPaVe通过解耦相机与操作动作,结合自下而上训练策略,实现高效且可推广的主动感知与操作,在现实任务中成功率达31.25%。

Comments Accepted to CVPR 2026. See project page at https://lmzpai.github.io/SaPaVe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12138 2026-03-13 cs.CV

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

HATS: 为GUI代理的硬度感知轨迹合成

Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

AI总结 HATS通过硬度感知轨迹合成框架,解决GUI代理训练中语义模糊性问题,提升任务执行鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12083 2026-03-13 cs.CV cs.RO eess.IV physics.optics

Towards Universal Computational Aberration Correction in Photographic Cameras: A Comprehensive Benchmark Analysis

面向摄影相机通用计算畸变校正的综合基准分析

Xiaolong Qian, Qi Jiang, Yao Gao, Lei Sun, Zhonghua Yi, Kailun Yang, Luc Van Gool, Kaiwei Wang

AI总结 本文提出UniCAC基准,通过自动光学设计构建,评估24种图像修复和CAC算法,识别影响性能的关键因素,为摄影相机通用计算畸变校正提供基础研究支持。

Comments Accepted to CVPR 2026. Benchmarks, codes, and Zemax files will be available at https://github.com/XiaolongQian/UniCAC

详情

展开后加载摘要…

URL PDF HTML 收藏