arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-31 至 2026-03-31 共收录 111
2602.04361 2026-03-31 cs.CV cs.AI cs.LG

SparVAR: Exploring Sparsity in Visual AutoRegressive Modeling for Training-Free Acceleration

SparVAR:探索视觉自回归建模中的稀疏性以实现无训练加速

Zekun Li, Ning Wang, Tongxin Bai, Changwang Mei, Peisong Wang, Shuang Qiu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Nanjing University of Science and Technology(南京理工大学) City University of Hong Kong(香港城市大学)

AI总结 SparVAR通过利用自回归注意力的稀疏性,提出了一种无需训练的加速框架,有效降低计算复杂度,提升生成速度并保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17470 2026-03-31 cs.CV

PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors

PhaSR:基于物理对齐先验的通用图像阴影去除

Chia-Ming Lee, Yu-Fan Lin, Yu-Jou Hsiao, Jin-Hui Jiang, Yu-Lun Liu, Chih-Chung Hsu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Cheng Kung University(国立成功大学)

AI总结 PhaSR通过双层先验对齐解决不同光照条件下阴影去除问题,结合物理对齐归一化和几何-语义校正注意力,提升单光源到多源环境的鲁棒性,实验显示其在复杂光照下表现优异。

Comments CVPR 2026 Camera Ready; Project Page: https://ming053l.github.io/PhaSR_github

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13680 2026-03-31 cs.CV

LASER: Layer-wise Scale Alignment for Training-Free Streaming 4D Reconstruction

LASER:基于分层尺度对齐的无训练流式4D重建

Tianye Ding, Yiming Xie, Yiqing Liang, Moitreya Chatterjee, Pedro Miraldo, Huaizu Jiang

机构 * Northeastern University(东北大学) Independent Researcher(独立研究员) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

AI总结 本文提出LASER框架,通过分层尺度对齐将离线重建模型转换为流式系统,实现14fps和6GB内存下的千米级流式视频重建,优于现有方法。

Comments CVPR 2026, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10950 2026-03-31 cs.CV

E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training

E-RayZer:基于空间视觉预训练的自监督3D重建

Qitao Zhao, Hao Tan, Qianqian Wang, Sai Bi, Kai Zhang, Kalyan Sunkavalli, Shubham Tulsiani, Hanwen Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究院) Harvard University(哈佛大学)

AI总结 本文提出E-RayZer,一种通过未标注图像直接学习几何基础表示的自监督3D视觉模型,通过显式几何实现3D重建,优于现有方法。

Comments CVPR 2026 Camera-ready. Project website: https://qitaozhao.github.io/E-RayZer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03350 2026-03-31 cs.CV

SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation

SeeU: 通过4D动态感知生成可见的世界

Yu Yuan, Tharindu Wickremasinghe, Zeeshan Nadir, Xijun Wang, Yiheng Chi, Stanley H. Chan

机构 * Purdue University(普渡大学) Samsung Research America(三星美国研究院)

AI总结 SeeU通过4D动态感知生成框架,从稀疏单目2D帧重建4D世界,学习连续4D动态并生成未见视觉内容,实现物理一致的连续生成。

Comments Accepted by CVPR 2026. Camera-Ready Version. Project Page: https://yuyuanspace.com/SeeU/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03336 2026-03-31 cs.LG cs.AI stat.ML

Single-Round Scalable Analytic Federated Learning

单轮可扩展的分析联邦学习

Alan T. L. Bacellar, Mustafa Munir, Felipe M. G. França, Priscila M. V. Lima, Radu Marculescu, Lizy K. John

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Federal University of Rio de Janeiro(里约热内卢联邦大学) Instituto de Telecomunicações, Porto(波尔图电信研究所)

AI总结 本文提出SAFLe框架,通过引入分桶特征结构头部和稀疏分组嵌入,实现非线性可扩展性,证明其等价于高维线性回归,从而在单轮分析联邦学习中实现高效可扩展的联邦视觉解决方案。

Comments To appear in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18600 2026-03-31 cs.CV

NeAR: Coupled Neural Asset-Renderer Stack

NeAR:耦合神经资产-渲染堆栈

Hong Li, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Ziyang Yan, Lixing Xiao, Zhaoxi Chen, Jianfeng Xiang, Shaocong Xu, Xuhui Liu, Yikai Wang, Baochang Zhang, Xiaoguang Han, Jiaolong Yang, Hao Zhao

机构 * BUAA(北京航空航天大学) BAAI(北京智源人工智能研究院) FNii, CUHKSZ(香港中文大学(深圳)未来网络创新研究院) HKUST(香港科技大学) NJU(南京大学) UniTn(特伦托大学) ZJU(浙江大学) NTU(南洋理工大学) THU(清华大学) BNU(北京师范大学) SSE, CUHKSZ(香港中文大学(深圳)理工学院) AIR, THU(清华大学智能产业研究院)

AI总结 NeAR通过耦合资产表示与渲染器设计,提升生成质量和一致性。引入Lighting-Homogenized SLAT和光照感知解码器,实现实时可重照明的3D高斯溅射生成,优于现有方法。

Comments Accepted by CVPR 2026. The project page: https://near-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13719 2026-03-31 cs.CV cs.AI cs.LG cs.MM cs.RO

Scaling Spatial Intelligence with Multimodal Foundation Models

通过多模态基础模型提升空间智能

Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun, Tongxi Zhou, Jiaqi Li, Hui En Pang, Oscar Qian, Yukun Wei, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。

Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03100 2026-03-31 cs.CV

AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video

AVATAR:通过视频进行视觉、听觉和推理的强化学习

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

AI总结 AVATAR通过离线训练架构和时间优势塑造策略解决多模态长时视频推理中的数据效率、消失优势和信用分配问题,实现跨多个基准测试的优越性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24862 2026-03-31 cs.CV

ViStoryBench: Comprehensive Benchmark Suite for Story Visualization

ViStoryBench:故事可视化全面评估基准套件

Cailin Zhuang, Ailin Huang, Yaoqi Hu, Jingwei Wu, Wei Cheng, Jiaqi Liao, Hongyuan Wang, Xinyao Liao, Weiwei Cai, Hengyuan Xu, Xuanyang Zhang, Xianfang Zeng, Zhewei Huang, Gang Yu, Chi Zhang

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) AGI Lab, Westlake University(西湖大学AGI实验室)

AI总结 本文提出ViStoryBench,一个全面评估故事可视化模型的基准套件,通过多维度指标评估叙事结构、视觉风格和角色设定,结合人类验证确保一致性与真实性,推动视觉叙事技术发展。

Comments Accepted by CVPR 2026. 44 Pages, Project Page: https://vistorybench.github.io, Code: https://github.com/vistorybench/vistorybench, Dataset: https://huggingface.co/datasets/ViStoryBench/ViStoryBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04594 2026-03-31 cs.CV

Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection

释放链式预测在单目3D物体检测中的潜力

Zhihao Zhang, Abhinav Kumar, Girish Chandar Ganesan, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出MonoCoP框架,通过链式预测和不确定性引导选择器结合,提升单目3D检测的深度精度,尤其在远距离物体上表现优异。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11967 2026-03-31 cs.CV cs.AI cs.RO

Securing the Skies: A Comprehensive Survey on Anti-UAV Methods, Benchmarking, and Future Directions

守护天空:反无人机方法的全面调查、基准测试与未来方向

Yifei Dong, Fengyi Wu, Sanjian Zhang, Guangyu Chen, Yuzhi Hu, Masumi Yano, Jingdong Sun, Siyu Huang, Feng Liu, Qi Dai, Zhi-Qi Cheng

AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。

Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14015 2026-03-31 cs.CV

Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation

通过提示深度任何事实现4K分辨率的准确度量深度估计

Haotong Lin, Sida Peng, Jingxiao Chen, Songyou Peng, Jiaming Sun, Minghuan Liu, Hujun Bao, Jiashi Feng, Xiaowei Zhou, Bingyi Kang

机构 * Zhejiang University(浙江大学) ByteDance Seed(字节跳动Seed) Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出Prompt Depth Anything,利用低成本LiDAR作为提示,通过多尺度融合设计实现4K分辨率的度量深度估计,并在ARKitScenes和ScanNet++数据集上取得新突破。

Comments CVPR 2025; Project page: https://PromptDA.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26908 2026-03-31 cs.CV

FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

FusionAgent:一种具有动态模型选择的多模态代理用于人体识别

Jie Zhu, Xiao Guo, Yiyang Su, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 FusionAgent通过动态模型选择提升人体识别鲁棒性,利用多模态大语言模型进行样本特定的模型选择,结合ACT分数融合方法,实验表明其在效率和性能上优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26810 2026-03-31 cs.CV eess.IV

Unblur-SLAM: Dense Neural SLAM for Blurry Inputs

Unblur-SLAM:用于模糊输入的密集神经SLAM

Qi Zhang, Denis Rozumny, Francesco Girlanda, Sezer Karaoglu, Marc Pollefeys, Theo Gevers, Martin R. Oswald

机构 * University of Amsterdam(阿姆斯特丹大学) Meta Reality Labs(Meta现实实验室) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出Unblur-SLAM,一种针对模糊图像输入的RGB SLAM pipeline,能够处理多种模糊类型,在运动模糊和失焦模糊情况下表现出最佳性能,通过调整计算量和多视图优化提升重建效果。

Comments 14 pages, 9 figures (based on the document's total length and the final Figure 9 ). Accepted By CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26777 2026-03-31 cs.CV astro-ph.IM cs.LG

BHCast: Unlocking Black Hole Plasma Dynamics from a Single Blurry Image with Long-Term Forecasting

BHCast: 从单张模糊图像解锁黑洞等离子体动力学的长期预测

Renbo Tu, Ali SaraerToosi, Nicholas S. Conroy, Gennady Pekhimenko, Aviad Levis

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

AI总结 BHCast通过单张模糊图像预测黑洞等离子体动力学,结合多尺度金字塔损失实现超分辨率和长期稳定预测,提取时空特征并利用梯度提升树恢复黑洞属性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10833 2026-03-31 cs.LG cs.AI cs.CV

Measuring the (Un)Faithfulness of Concept-Based Explanations

测量基于概念的解释的(不)忠实性

Shubham Kumar, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文研究了基于概念的解释方法的忠实性,提出Surrogate Faithfulness方法以评估其忠实度,发现许多视觉上吸引人的U-CBEMs并不忠实。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏