arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-31 至 2026-03-31 共收录 111
2603.26285 2026-03-31 cs.CV cs.AI

PhysVid: Physics Aware Local Conditioning for Generative Video Models

PhysVid: 基于物理的局部条件生成视频模型

Saurabh Pathak, Elahe Arani, Mykola Pechenizkiy, Bahram Zonooz

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 PhysVid通过引入物理感知的局部条件生成视频,提升物理合理性。在VideoPhy上,其物理常识得分比基线模型提高约33%,在VideoPhy2上提高约8%。

Comments Accepted for publication in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26068 2026-03-31 cs.CV

PAD-Hand: Physics-Aware Diffusion for Hand Motion Recovery

PAD-Hand: 基于物理的扩散方法用于手部运动恢复

Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

机构 * Michigan State University(密歇根州立大学) Independent Researcher(独立研究者)

AI总结 本文提出了一种物理感知的条件扩散框架,通过MeshCNN-Transformer架构,利用欧拉-拉格朗日动力学提升手部运动的物理一致性,并通过方差估计增强运动的可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25706 2026-03-31 cs.CV

Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training

Wan-Weaver:通过解耦训练实现交错多模态生成

Jinbo Xing, Zeyinzi Jiang, Yuxiang Tuo, Chaojie Mao, Xiaotang Gai, Xi Chen, Jingfeng Zhang, Yulin Pan, Zhen Han, Jie Xiao, Keyu Yan, Chenwei Xie, Chongyang Zhong, Kai Zhu, Tong Shen, Lianghua Huang, Yu Liu, Yujiu Yang

机构 * Tongyi Lab(通义实验室) Tsinghua University(清华大学)

AI总结 本文提出Wan-Weaver,通过解耦训练实现交错多模态生成,利用文本规划和视觉一致性建模,生成长文本连贯性和视觉一致性。

Comments CVPR 2026 Camera-ready, Webpage: https://doubiiu.github.io/projects/WanWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22601 2026-03-31 cs.LG cs.CV

$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

$ϕ$-DPO:面向大多模态模型持续学习的公平性直接偏好优化方法

Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas(阿肯色大学 CVIU 实验室) Dep. of Geosciences, University of Arkansas(阿肯色大学地球科学系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出$ϕ$-DPO框架,通过直接偏好优化缓解持续学习中的灾难性遗忘问题,并解决数据不平衡导致的公平性问题,实验表明其在多个基准上表现优异。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19575 2026-03-31 cs.CV

ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization

ConceptPrism:通过残差标记优化实现个性化扩散模型的概念解耦

Minseo Kim, Minchan Kwon, Dongyeun Lee, Yunho Jeon, Junmo Kim

机构 * KAIST(韩国科学技术院) Hanbat National University(韩巴大学)

AI总结 本文提出ConceptPrism框架,通过残差标记优化实现个性化扩散模型中的概念解耦,提升生成图像的质量与准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20770 2026-03-31 cs.CV

OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective

OccuFly:一种用于从空中视角进行语义场景补全的3D视觉基准

Markus Gross, Sai B. Matha, Aya Fahmy, Rui Song, Daniel Cremers, Henri Meess

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校)

AI总结 本文提出OccuFly基准,通过无LiDAR相机数据生成框架,提供21类语义的20000+样本,评估视觉模型在空中场景中的局限性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16727 2026-03-31 cs.CV cs.HC

OMG-Bench: A New Challenging Benchmark for Skeleton-based Online Micro Hand Gesture Recognition

OMG-Bench:一种新的挑战性基准,用于基于骨架的在线微手部手势识别

Haochen Chang, Pengfei Ren, Buyuan Zhang, Da Li, Tianhao Han, Haoyang Zhang, Liang Xie, Hongbo Chen, Erwei Yin

机构 * School of Systems Science and Engineering, Sun Yat-sen University(中山大学系统科学与工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学) Defense Innovation Institute, Academy of Military Sciences(军事科学院国防创新研究院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心)

AI总结 本文提出OMG-Bench,首个大规模公开基准,用于基于骨架的在线微手势识别,包含40个细粒度手势类别,提出HMATr框架提升识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15508 2026-03-31 cs.CV

Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting

脱离网格:用于前馈3D高斯散射的原始形检测

Arthur Moreau, Richard Shaw, Michal Nazarczuk, Jisu Shin, Thomas Tanay, Zhensong Zhang, Songcen Xu, Eduardo Pérez-Pellitero

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 本文提出了一种前馈架构,通过子像素级检测3D高斯原始形,替代传统网格,提升质量和效率。结合预训练的3D重建模型,无需3D标注即可生成逼真3DGS场景,实现最先进的视图合成。

Comments CVPR 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13689 2026-03-31 cs.CV

LitePT: Lighter Yet Stronger Point Transformer

LitePT: 更轻更强大的点云变换器

Yuanwen Yue, Damien Robert, Jianyuan Wang, Sunghwan Hong, Jan Dirk Wegner, Christian Rupprecht, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) University of Zurich(苏黎世大学)

AI总结 本文提出LitePT模型,通过在早期阶段使用卷积层,后期切换至注意力机制,减少参数并提升效率,同时在多个任务和数据集上表现优异。

Comments CVPR 2026, Project page: https://litept.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12360 2026-03-31 cs.CV cs.CL

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

VideoARM:基于分层记忆的代理推理用于长视频理解

Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

AI总结 VideoARM通过自适应代理推理和分层记忆结构,有效降低长视频理解的token消耗,优于现有方法DVD。

Comments Accepted to CVPR 2026, code available at https://milvlg.github.io/videoarm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10932 2026-03-31 cs.CV cs.AI

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2:迈向基于发展基础的视觉基础模型预训练与基准测试

Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学) Sony Group Corporation(索尼集团公司)

AI总结 BabyVLM-V2通过纵向多维预训练集、灵活模型和DevCV工具箱,提升婴儿启发式视觉语言模型性能,实验证明其在基准测试中表现优异。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09327 2026-03-31 cs.CV cs.SD

UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking

UniLS: 端到端的音频驱动统一说话和倾听虚拟角色

Xuangeng Chu, Ruicong Liu, Yifei Huang, Yun Liu, Yichen Peng, Bo Zheng

机构 * Shanda AI Research Tokyo(盛大人工智能研究院东京) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学大学)

AI总结 UniLS通过双轨音频驱动,提出端到端框架生成统一的说话和倾听表达,解决听众动作建模难题,提升倾听表现达44.1%。

Comments CVPR 2026, code is available at https://github.com/xg-chu/UniLS, more demos are available at https://xg-chu.site/project_unils/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03619 2026-03-31 cs.CV

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

LAMP:语言辅助运动规划用于可控视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科奇大学) University College London(伦敦大学学院) Hacettepe University(哈斯特帕大学) Adobe Research(Adobe研究院)

AI总结 LAMP通过大语言模型生成3D轨迹,实现基于自然语言的视频生成,提升运动可控性和用户意图对齐。

Comments CVPR 2026. Project Page: https://cyberiada.github.io/LAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21428 2026-03-31 cs.CV cs.AI cs.RO

From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings

从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割

Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner

AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。

Comments 10 pages, 5 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19413 2026-03-31 cs.LG cs.AI cs.CV

UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

UniGame: 将统一多模态模型转变为自身对手

Zhaolong Su, Wang Lu, Hao Chen, Sharon Li, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 UniGame通过自对抗框架提升多模态模型的一致性与鲁棒性,显著增强理解、生成和对抗鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18174 2026-03-31 cs.CV

Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera

统一球面前端:从任何相机学习旋转等变的球面图像表示

Mukai Yu, Mosam Dabhi, Liuyue Xie, Sebastian Scherer, László A. Jeni

机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所)

AI总结 本文提出USF框架,通过射线方向对应将任意相机图像映射到单位球面,实现旋转等变的球面卷积,提升宽视场图像处理性能。

Comments Accepted to CVPR 2026. Camera-ready version. Added computation benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12931 2026-03-31 eess.IV q-bio.BM

cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold

cryoSENSE:压缩感知实现高通量显微成像,利用稀疏和生成先验在蛋白质冷冻电镜图像流形上

Zain Shabeeb, Daniel Saeedi, Darin Tsui, Vida Jamali, Amirali Aghazadeh

AI总结 cryoSENSE利用稀疏和生成先验在蛋白质冷冻电镜图像流形上实现高通量显微成像,通过压缩感知提高数据采集效率并保持三维分辨率。

Comments Accepted into CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14255 2026-03-31 cs.CV

Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization

通过奖励引导优化实现身份保持的图像到视频生成

Liao Shen, Wentao Jiang, Yiran Zhu, Jiahe Li, Tiezheng Ge, Zhiguo Cao, Bo Zheng

机构 * Huazhong University of Science and Technology(华中科技大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) Alibaba Group(阿里巴巴集团)

AI总结 本文提出IPRO框架,通过强化学习优化扩散模型,提升身份一致性。引入面部评分机制和KL散度正则化,改进性能并加速收敛。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11334 2026-03-31 cs.CV

Dual Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions

双频热成像:在近环境条件下分离时间变化的反射和发射

Sriram Narayanan, Mani Ramanagopal, Srinivasa G. Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出双频热成像方法,通过光谱和时间线索分离近环境条件下物体和背景的温度,解决热成像中反射和发射信号分离难题。

Comments CVPR 2026. Project Page: https://dual-band-thermal.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06233 2026-03-31 cs.CV

AnthroTAP: Learning Point Tracking with Real-World Motion

AnthroTAP: 通过真实世界运动学习点跟踪

Inès Hyeonsu Kim, Seokju Cho, Jahyeok Koo, Junghyun Park, Jiahui Huang, Honglak Lee, Joon-Young Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Adobe Research(Adobe研究院) University of Michigan(密歇根大学) LG AI Research(LG人工智能研究院)

AI总结 AnthroTAP通过生成大规模伪标注点跟踪数据提升真实世界视频的点跟踪性能,利用人类运动的结构复杂性,结合SMPL模型和光流一致性过滤,实现优于现有方法的性能。

Comments CVPR 2026. Project Page: https://cvlab-kaist.github.io/AnthroTAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21742 2026-03-31 cs.CV

VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues

VRR-QA:超越显性提示的视频视觉关系推理

Sirnam Swetha, Rohit Gupta, Parth Parag Kulkarni, David G Shatwell, Jeffrey A Chan Santiago, Nyle Siddiqui, Joseph Fioresi, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida, USA(美国中佛罗里达大学人工智能研究所)

AI总结 VRR-QA通过精心 curated 的创意视频数据集,评估视频问答模型在隐含关系推理上的表现,揭示现有模型对显性视觉线索的依赖及隐含推理的难度。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13516 2026-03-31 cs.CV cs.AI

Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection

双向多模态提示学习与尺度感知训练用于少样本多类异常检测

Yujin Lee, Sewon Kim, Daeun Moon, Seoyoon Jang, Hyunsoo Yoon

机构 * Yonsei University(延世大学)

AI总结 本文提出AnoPLe框架,通过双向交互文本与视觉提示,实现高效多类异常检测,在MVTec-AD等数据集上超越现有方法,且具备良好的泛化能力。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27690 2026-03-31 cs.CV

Customized Visual Storytelling with Unified Multimodal LLMs

基于统一多模态大语言模型的定制化视觉叙事

Wei-Hua Li, Cheng Sun, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。

Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27665 2026-03-31 cs.CV cs.LG

Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling

测试时实例特定参数组合:适应生成建模的新范式

Minh-Tuan Tran, Xuan-May Le, Quan Hung Tran, Mehrtash Harandi, Dinh Phung, Trung Le

机构 * Monash University(莫纳什大学) The University of Melbourne(墨尔本大学) Meta Inc(Meta公司)

AI总结 本文提出Composer,一种基于测试时实例特定参数组合的适应生成建模新范式,通过在推理时生成输入条件化的参数适应,提升生成质量与效率,适用于多种生成模型。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27637 2026-03-31 cs.CV

OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

OPRO:用于面板感知上下文图像生成的正交面板相对运算符

Sanghyeon Lee, Minwoo Lee, Euijin Shin, Kangyeol Kim, Seunghwan Choi, Jaegul Choo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出一种参数高效的方法,通过在预训练扩散转换器的冻结位置编码上添加可学习的面板特定正交运算符,提升上下文图像生成的面板感知能力,实验表明其方法具有通用性和有效性。

Comments Accepted to CVPR 2026. 16 pages, 9 figures. Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27558 2026-03-31 cs.CV

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27542 2026-03-31 cs.CV

MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction

MV-RoMa:从成对匹配到多视角轨迹重建

Jongmin Lee, Seungyeop Kang, Sungjoo Yoo

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学)

AI总结 MV-RoMa通过多视角密集匹配模型,联合估计源图像到多个共视目标的密集对应关系,提升3D重建的准确性和密度。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏