arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.28091 2026-03-31 cs.CV cs.RO

SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting

SHARP:短窗口流式处理用于运动预测中的准确性和鲁棒性

Alexander Prutsch, Christian Fruhwirth-Reisinger, David Schinagl, Horst Possegger

机构 * Institute of Visual Computing, Graz University of Technology(格拉茨技术大学视觉计算研究所)

AI总结 本文提出了一种基于流式处理的运动预测框架,通过逐步处理输入观测窗口和实例感知上下文流,提升在动态交通环境中的预测准确性与鲁棒性。

Comments CVPR 2026. Project page at https://a-pru.github.io/sharp

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28064 2026-03-31 cs.CV

\textit{4DSurf}: High-Fidelity Dynamic Scene Surface Reconstruction

4DSurf:高保真动态场景表面重建

Renjie Wu, Hongdong Li, Jose M. Alvarez, Miaomiao Liu

机构 * Australian National University(澳大利亚国立大学) NVIDIA(英伟达) Amazon(亚马逊)

AI总结 本文提出4DSurf框架,解决动态场景表面重建问题,通过高斯变形和重叠分段策略实现大变形和时间一致性,实验显示在Chamfer距离上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28020 2026-03-31 cs.CV

Physically Inspired Gaussian Splatting for HDR Novel View Synthesis

基于物理的高动态范围新型视图合成的高斯点散射

Huimin Zeng, Yue Bai, Hailing Wang, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Science, Northeastern University(东北大学Khoury计算机科学学院)

AI总结 本文提出PhysHDR-GS框架,通过建模内在反射率和可调环境光照,改进HDR-NVS在动态细节重建和光照依赖外观捕捉中的性能,实验表明在真实和合成数据集上具有更高的PSNR和实时渲染速度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27970 2026-03-31 cs.CV

AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers

AffordMatcher: 从视觉符号中学习3D场景中的 affordance

Nghia Vu, Tuong Do, Khang Nguyen, Baoru Huang, Nhat Le, Binh Xuan Nguyen, Erman Tjiputra, Quang D. Tran, Ravi Prakash, Te-Chuan Chiu, Anh Nguyen

机构 * University of Liverpool(利物浦大学) AIOZ Ltd.(AIOZ有限公司) National Tsing Hua University(国立清华大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Western Australia(西澳大学) Indian Institute of Science(印度科学理工学院) NVIDIA(英伟达)

AI总结 本文提出AffordMatcher,通过结合点云和图像实例,利用视觉符号实现更精确的affordance区域识别,基于大规模数据集验证了方法有效性。

Comments 14 pages. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27969 2026-03-31 cs.CV

Hg-I2P: Bridging Modalities for Generalizable Image-to-Point-Cloud Registration via Heterogeneous Graphs

Hg-I2P:通过异构图实现通用的图像到点云配准

Pei An, Junfeng Ding, Jiaqi Yang, Yulong Wang, Jie Ma, Liangliang Nan

机构 * Huazhong University of Science and Technology(华中科技大学) Northwestern Polytechnical University(西北工业大学) Huazhong Agricultural University(华中农业大学) Delft University of Technology(代尔夫特理工大学)

AI总结 本文提出Hg-I2P方法,通过异构图融合多模态特征,提升图像与点云配准的泛化能力和精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27773 2026-03-31 cs.CV

RINO: Rotation-Invariant Non-Rigid Correspondences

RINO:旋转不变非刚性对应

Maolin Gao, Shao Jie Hu-Chen, Congyue Deng, Riccardo Marin, Leonidas Guibas, Daniel Cremers

机构 * TUM(慕尼黑工业大学) Stanford University(斯坦福大学) MCML(慕尼黑机器学习中心) MIT(麻省理工学院)

AI总结 本文提出RINO框架,通过旋转不变的特征提取器实现非刚性形状匹配,无需预对齐或手工特征,提升非等距变形等任务的性能。

Comments 17 pages, 36 Figures, Computer Vision and Pattern Recognition (CVPR) 2026

Journal ref Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26425 2026-03-31 cs.CV cs.AI

CPUBone: Efficient Vision Backbone Design for Devices with Low Parallelization Capabilities

CPUBone:为低并行化能力设备设计的高效视觉骨干网络

Moritz Nottebaum, Matteo Dunnhofer, Christian Micheloni

机构 * University of Udine, Italy(意大利乌迪内大学) York University, Canada(加拿大约克大学)

AI总结 本文提出CPUBone,一种针对CPU推理优化的视觉骨干网络,通过改进卷积操作降低计算成本,实现高效的Speed-Accuracy Trade-offs。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26285 2026-03-31 cs.CV cs.AI

PhysVid: Physics Aware Local Conditioning for Generative Video Models

PhysVid: 基于物理的局部条件生成视频模型

Saurabh Pathak, Elahe Arani, Mykola Pechenizkiy, Bahram Zonooz

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 PhysVid通过引入物理感知的局部条件生成视频,提升物理合理性。在VideoPhy上,其物理常识得分比基线模型提高约33%,在VideoPhy2上提高约8%。

Comments Accepted for publication in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26068 2026-03-31 cs.CV

PAD-Hand: Physics-Aware Diffusion for Hand Motion Recovery

PAD-Hand: 基于物理的扩散方法用于手部运动恢复

Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

机构 * Michigan State University(密歇根州立大学) Independent Researcher(独立研究者)

AI总结 本文提出了一种物理感知的条件扩散框架,通过MeshCNN-Transformer架构,利用欧拉-拉格朗日动力学提升手部运动的物理一致性,并通过方差估计增强运动的可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25706 2026-03-31 cs.CV

Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training

Wan-Weaver:通过解耦训练实现交错多模态生成

Jinbo Xing, Zeyinzi Jiang, Yuxiang Tuo, Chaojie Mao, Xiaotang Gai, Xi Chen, Jingfeng Zhang, Yulin Pan, Zhen Han, Jie Xiao, Keyu Yan, Chenwei Xie, Chongyang Zhong, Kai Zhu, Tong Shen, Lianghua Huang, Yu Liu, Yujiu Yang

机构 * Tongyi Lab(通义实验室) Tsinghua University(清华大学)

AI总结 本文提出Wan-Weaver,通过解耦训练实现交错多模态生成,利用文本规划和视觉一致性建模,生成长文本连贯性和视觉一致性。

Comments CVPR 2026 Camera-ready, Webpage: https://doubiiu.github.io/projects/WanWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22601 2026-03-31 cs.LG cs.CV

$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

$ϕ$-DPO:面向大多模态模型持续学习的公平性直接偏好优化方法

Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas(阿肯色大学 CVIU 实验室) Dep. of Geosciences, University of Arkansas(阿肯色大学地球科学系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出$ϕ$-DPO框架,通过直接偏好优化缓解持续学习中的灾难性遗忘问题,并解决数据不平衡导致的公平性问题,实验表明其在多个基准上表现优异。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19575 2026-03-31 cs.CV

ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization

ConceptPrism:通过残差标记优化实现个性化扩散模型的概念解耦

Minseo Kim, Minchan Kwon, Dongyeun Lee, Yunho Jeon, Junmo Kim

机构 * KAIST(韩国科学技术院) Hanbat National University(韩巴大学)

AI总结 本文提出ConceptPrism框架,通过残差标记优化实现个性化扩散模型中的概念解耦,提升生成图像的质量与准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20770 2026-03-31 cs.CV

OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective

OccuFly:一种用于从空中视角进行语义场景补全的3D视觉基准

Markus Gross, Sai B. Matha, Aya Fahmy, Rui Song, Daniel Cremers, Henri Meess

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校)

AI总结 本文提出OccuFly基准,通过无LiDAR相机数据生成框架,提供21类语义的20000+样本,评估视觉模型在空中场景中的局限性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16727 2026-03-31 cs.CV cs.HC

OMG-Bench: A New Challenging Benchmark for Skeleton-based Online Micro Hand Gesture Recognition

OMG-Bench:一种新的挑战性基准,用于基于骨架的在线微手部手势识别

Haochen Chang, Pengfei Ren, Buyuan Zhang, Da Li, Tianhao Han, Haoyang Zhang, Liang Xie, Hongbo Chen, Erwei Yin

机构 * School of Systems Science and Engineering, Sun Yat-sen University(中山大学系统科学与工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学) Defense Innovation Institute, Academy of Military Sciences(军事科学院国防创新研究院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心)

AI总结 本文提出OMG-Bench,首个大规模公开基准,用于基于骨架的在线微手势识别,包含40个细粒度手势类别,提出HMATr框架提升识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15508 2026-03-31 cs.CV

Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting

脱离网格:用于前馈3D高斯散射的原始形检测

Arthur Moreau, Richard Shaw, Michal Nazarczuk, Jisu Shin, Thomas Tanay, Zhensong Zhang, Songcen Xu, Eduardo Pérez-Pellitero

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 本文提出了一种前馈架构,通过子像素级检测3D高斯原始形,替代传统网格,提升质量和效率。结合预训练的3D重建模型,无需3D标注即可生成逼真3DGS场景,实现最先进的视图合成。

Comments CVPR 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13689 2026-03-31 cs.CV

LitePT: Lighter Yet Stronger Point Transformer

LitePT: 更轻更强大的点云变换器

Yuanwen Yue, Damien Robert, Jianyuan Wang, Sunghwan Hong, Jan Dirk Wegner, Christian Rupprecht, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) University of Zurich(苏黎世大学)

AI总结 本文提出LitePT模型,通过在早期阶段使用卷积层,后期切换至注意力机制,减少参数并提升效率,同时在多个任务和数据集上表现优异。

Comments CVPR 2026, Project page: https://litept.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12360 2026-03-31 cs.CV cs.CL

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

VideoARM:基于分层记忆的代理推理用于长视频理解

Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

AI总结 VideoARM通过自适应代理推理和分层记忆结构,有效降低长视频理解的token消耗,优于现有方法DVD。

Comments Accepted to CVPR 2026, code available at https://milvlg.github.io/videoarm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10932 2026-03-31 cs.CV cs.AI

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2:迈向基于发展基础的视觉基础模型预训练与基准测试

Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学) Sony Group Corporation(索尼集团公司)

AI总结 BabyVLM-V2通过纵向多维预训练集、灵活模型和DevCV工具箱,提升婴儿启发式视觉语言模型性能,实验证明其在基准测试中表现优异。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09327 2026-03-31 cs.CV cs.SD

UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking

UniLS: 端到端的音频驱动统一说话和倾听虚拟角色

Xuangeng Chu, Ruicong Liu, Yifei Huang, Yun Liu, Yichen Peng, Bo Zheng

机构 * Shanda AI Research Tokyo(盛大人工智能研究院东京) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学大学)

AI总结 UniLS通过双轨音频驱动,提出端到端框架生成统一的说话和倾听表达,解决听众动作建模难题,提升倾听表现达44.1%。

Comments CVPR 2026, code is available at https://github.com/xg-chu/UniLS, more demos are available at https://xg-chu.site/project_unils/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03619 2026-03-31 cs.CV

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

LAMP:语言辅助运动规划用于可控视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科奇大学) University College London(伦敦大学学院) Hacettepe University(哈斯特帕大学) Adobe Research(Adobe研究院)

AI总结 LAMP通过大语言模型生成3D轨迹,实现基于自然语言的视频生成,提升运动可控性和用户意图对齐。

Comments CVPR 2026. Project Page: https://cyberiada.github.io/LAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21428 2026-03-31 cs.CV cs.AI cs.RO

From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings

从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割

Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner

AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。

Comments 10 pages, 5 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19413 2026-03-31 cs.LG cs.AI cs.CV

UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

UniGame: 将统一多模态模型转变为自身对手

Zhaolong Su, Wang Lu, Hao Chen, Sharon Li, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 UniGame通过自对抗框架提升多模态模型的一致性与鲁棒性,显著增强理解、生成和对抗鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18174 2026-03-31 cs.CV

Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera

统一球面前端:从任何相机学习旋转等变的球面图像表示

Mukai Yu, Mosam Dabhi, Liuyue Xie, Sebastian Scherer, László A. Jeni

机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所)

AI总结 本文提出USF框架,通过射线方向对应将任意相机图像映射到单位球面,实现旋转等变的球面卷积,提升宽视场图像处理性能。

Comments Accepted to CVPR 2026. Camera-ready version. Added computation benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12931 2026-03-31 eess.IV q-bio.BM

cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold

cryoSENSE:压缩感知实现高通量显微成像,利用稀疏和生成先验在蛋白质冷冻电镜图像流形上

Zain Shabeeb, Daniel Saeedi, Darin Tsui, Vida Jamali, Amirali Aghazadeh

AI总结 cryoSENSE利用稀疏和生成先验在蛋白质冷冻电镜图像流形上实现高通量显微成像,通过压缩感知提高数据采集效率并保持三维分辨率。

Comments Accepted into CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14255 2026-03-31 cs.CV

Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization

通过奖励引导优化实现身份保持的图像到视频生成

Liao Shen, Wentao Jiang, Yiran Zhu, Jiahe Li, Tiezheng Ge, Zhiguo Cao, Bo Zheng

机构 * Huazhong University of Science and Technology(华中科技大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) Alibaba Group(阿里巴巴集团)

AI总结 本文提出IPRO框架,通过强化学习优化扩散模型,提升身份一致性。引入面部评分机制和KL散度正则化,改进性能并加速收敛。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11334 2026-03-31 cs.CV

Dual Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions

双频热成像:在近环境条件下分离时间变化的反射和发射

Sriram Narayanan, Mani Ramanagopal, Srinivasa G. Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出双频热成像方法,通过光谱和时间线索分离近环境条件下物体和背景的温度,解决热成像中反射和发射信号分离难题。

Comments CVPR 2026. Project Page: https://dual-band-thermal.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏