arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2507.06233 2026-03-31 cs.CV

AnthroTAP: Learning Point Tracking with Real-World Motion

AnthroTAP: 通过真实世界运动学习点跟踪

Inès Hyeonsu Kim, Seokju Cho, Jahyeok Koo, Junghyun Park, Jiahui Huang, Honglak Lee, Joon-Young Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Adobe Research(Adobe研究院) University of Michigan(密歇根大学) LG AI Research(LG人工智能研究院)

AI总结 AnthroTAP通过生成大规模伪标注点跟踪数据提升真实世界视频的点跟踪性能,利用人类运动的结构复杂性,结合SMPL模型和光流一致性过滤,实现优于现有方法的性能。

Comments CVPR 2026. Project Page: https://cvlab-kaist.github.io/AnthroTAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21742 2026-03-31 cs.CV

VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues

VRR-QA:超越显性提示的视频视觉关系推理

Sirnam Swetha, Rohit Gupta, Parth Parag Kulkarni, David G Shatwell, Jeffrey A Chan Santiago, Nyle Siddiqui, Joseph Fioresi, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida, USA(美国中佛罗里达大学人工智能研究所)

AI总结 VRR-QA通过精心 curated 的创意视频数据集,评估视频问答模型在隐含关系推理上的表现,揭示现有模型对显性视觉线索的依赖及隐含推理的难度。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13516 2026-03-31 cs.CV cs.AI

Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection

双向多模态提示学习与尺度感知训练用于少样本多类异常检测

Yujin Lee, Sewon Kim, Daeun Moon, Seoyoon Jang, Hyunsoo Yoon

机构 * Yonsei University(延世大学)

AI总结 本文提出AnoPLe框架,通过双向交互文本与视觉提示,实现高效多类异常检测,在MVTec-AD等数据集上超越现有方法,且具备良好的泛化能力。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27690 2026-03-31 cs.CV

Customized Visual Storytelling with Unified Multimodal LLMs

基于统一多模态大语言模型的定制化视觉叙事

Wei-Hua Li, Cheng Sun, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。

Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27665 2026-03-31 cs.CV cs.LG

Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling

测试时实例特定参数组合:适应生成建模的新范式

Minh-Tuan Tran, Xuan-May Le, Quan Hung Tran, Mehrtash Harandi, Dinh Phung, Trung Le

机构 * Monash University(莫纳什大学) The University of Melbourne(墨尔本大学) Meta Inc(Meta公司)

AI总结 本文提出Composer,一种基于测试时实例特定参数组合的适应生成建模新范式,通过在推理时生成输入条件化的参数适应,提升生成质量与效率,适用于多种生成模型。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27637 2026-03-31 cs.CV

OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

OPRO:用于面板感知上下文图像生成的正交面板相对运算符

Sanghyeon Lee, Minwoo Lee, Euijin Shin, Kangyeol Kim, Seunghwan Choi, Jaegul Choo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出一种参数高效的方法,通过在预训练扩散转换器的冻结位置编码上添加可学习的面板特定正交运算符,提升上下文图像生成的面板感知能力,实验表明其方法具有通用性和有效性。

Comments Accepted to CVPR 2026. 16 pages, 9 figures. Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27558 2026-03-31 cs.CV

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27542 2026-03-31 cs.CV

MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction

MV-RoMa:从成对匹配到多视角轨迹重建

Jongmin Lee, Seungyeop Kang, Sungjoo Yoo

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学)

AI总结 MV-RoMa通过多视角密集匹配模型,联合估计源图像到多个共视目标的密集对应关系,提升3D重建的准确性和密度。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27481 2026-03-31 cs.LG cs.AI

On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models

关于令牌的困境:具有漂移感知令牌分配的动态MoE用于大视觉语言模型的持续学习

Chongyang Zhao, Mingsong Li, Haodong Lu, Dong Gong

机构 * University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼新南威尔士大学))

AI总结 本文提出LLaVA-DyMoE框架,通过动态MoE和漂移感知令牌分配缓解持续学习中的路由漂移问题,提升模型在持续学习中的性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27403 2026-03-31 cs.LG cs.AI

Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

基于符合采样的通用化证书的条件事实性控制大语言模型

Kai Ye, Qingtao Pan, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

AI总结 本文提出条件事实性控制框架CFC,通过增强分位数回归定义连续特征条件接受阈值,实现条件覆盖保证,并在理论和实验上证明其高效性与稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27344 2026-03-31 cs.CV

TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR

TerraSeg: 任意LiDAR的自监督地面分割

Ted Lentsch, Santiago Montiel-Marín, Holger Caesar, Dariu M. Gavrila

机构 * Delft University of Technology(代尔夫特理工大学) University of Alcalá(阿尔卡拉大学)

AI总结 TerraSeg通过自监督学习实现任意LiDAR的地面分割,利用大规模统一数据集OmniLiDAR提升泛化能力,无需人工标注即可在多个数据集上取得最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27268 2026-03-31 cs.CV

TrackMAE: Video Representation Learning via Track Mask and Predict

TrackMAE:通过轨迹掩码和预测进行视频表示学习

Renaud Vandeghen, Fida Mohammad Thoker, Marc Van Droogenbroeck, Bernard Ghanem

机构 * University of Liège(列日大学) KAUST(阿卜杜拉国王科技大学)

AI总结 TrackMAE通过显式利用运动信息作为重建信号,改进随机管掩码策略,提升视频表示学习的判别性和通用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27240 2026-03-31 cs.CV cs.AI

Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection

通过因果发现和双模态安全子空间投影诊断和修复视觉-语言模型中的不安全通道

Jinhu Fu, Yihang Lou, Qingyi Si, Shudong Zhang, Yan Bai, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huawei Technologies Ltd.(华为技术有限公司) Peking University(北京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 本文提出CARE框架,通过因果分析和双模态安全子空间投影修复视觉-语言模型中的不安全通道,提升安全性而不影响多模态能力。

Comments Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27238 2026-03-31 cs.CV

An Instance-Centric Panoptic Occupancy Prediction Benchmark for Autonomous Driving

面向自动驾驶的实例中心全景占用预测基准测试

Yi Feng, Junwu E, Zizhan Guo, Yu Ma, Hanli Wang, Rui Fan

机构 * Tongji University(同济大学)

AI总结 本文提出实例中心的全景占用预测基准测试,引入ADMesh和CarlaOcc数据集,提供高精度3D模型和实例级标注,建立标准化评估指标并系统评估代表性模型。

Comments Accepted to CVPR 2026. Code and dataset are available at https://mias.group/CarlaOcc

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27201 2026-03-31 cs.CV

Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

理解并缓解多模态推理链模型中的幻觉

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * School of Computer Science and Ningbo Institute, Northwestern Polytechnical University, China(西北工业大学计算机学院和宁波研究院) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, China(国家空天地海一体化大数据应用技术国家工程实验室)

AI总结 本文研究多模态推理链模型中的幻觉问题,发现其源于联想推理步骤中的虚假文本生成,提出一种有效策略缓解幻觉,实验表明方法效果显著且可与其他缓解方法结合提升性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27199 2026-03-31 cs.CV

Let Triggers Control: Frequency-Aware Dropout for Effective Token Control

让触发器控制:面向频率的Dropout用于有效的标记控制

Junyoung Koh, Hoyeon Moon, Dongha Kim, Seungmin Lee, Sanghyun Park, Min Song

机构 * Yonsei University(延世大学) Onoma AI

AI总结 本文提出频率感知Dropout方法,通过分析触发器与上下文的共现关系,提升文本到图像生成中触发器的可控性与个性化能力,无需增加参数或架构修改。

Comments CVPR 2026 P13N: Personalization in Generative AI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27197 2026-03-31 cs.CV

K$α$LOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks

K$α$LOS 寻求共识:一种用于评估复杂视觉任务中多标注者一致性的元算法

David Tschirschwitz, Volker Rodehorst

机构 * Bauhaus-Universität Weimar(包豪斯大学魏玛校区)

AI总结 本文提出K$α$LOS元算法,通过标准化数据集质量评估,解决视觉任务中的实例对应问题,提供更细粒度的诊断指标,如标注者活力和定位敏感性。

Comments Accepted at CVPR 2026. Also known as KALOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27179 2026-03-31 cs.CV

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

基于推理的异常检测与定位:图像级监督

Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27165 2026-03-31 cs.CV

RiskProp: Collision-Anchored Self-Supervised Risk Propagation for Early Accident Anticipation

RiskProp: 基于碰撞锚定的自监督风险传播用于早期事故预警

Yiyang Zou, Tianhao Zhao, Peilun Xiao, Hongyu Jin, Longyu Qi, Yuxuan Li, Liyin Liang, Yifeng Qian, Chunbo Lai, Yutian Lin, Zhihui Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Didi Chuxing(滴滴出行) University of Science and Technology of China(中国科学技术大学)

AI总结 RiskProp通过自监督学习消除对异常起始帧的依赖,利用可靠标注的碰撞帧建模时间风险演变,提升早期事故预警的准确性和可解释性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27101 2026-03-31 cs.CV cs.LG

PRUE: A Practical Recipe for Field Boundary Segmentation at Scale

PRUE:一种大规模田界边界分割的实用配方

Gedeon Muhawenayo, Caleb Robinson, Subash Khanal, Zhanpei Fang, Isaac Corley, Alexander Wollam, Tianyi Gao, Leonard Strnad, Ryan Avery, Lyndon Estes, Ana M. Tárano, Nathan Jacobs, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Microsoft AI for Good(微软人工智能公益) Washington University in St. Louis(圣路易斯华盛顿大学) Oregon State University(俄勒冈州立大学) Wherobots Clark University(克拉克大学)

AI总结 本文提出一种结合U-Net和复合损失函数的分割方法,提升田界分割的性能和鲁棒性,实现了76%的IoU和47%的object-F1,为大规模可靠田界分割提供了实用框架。

Comments 12 pages, 3 figures, supplementary material. Accepted at CVPR 2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27070 2026-03-31 cs.CV

Structural Graph Probing of Vision-Language Models

视觉-语言模型的结构图谱探查

Haoyu He, Yue Zhuo, Yu Zheng, Qi R. Wang

机构 * Northeastern University(东北大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究通过神经拓扑分析视觉-语言模型的层间相关图谱,揭示群体结构对行为的意义、跨模态变化及因果影响,提出神经拓扑作为解释性中间尺度。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27059 2026-03-31 cs.CV

Towards Intrinsic-Aware Monocular 3D Object Detection

面向内在感知的单目三维物体检测

Zhihao Zhang, Abhinav Kumar, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出MonoIA框架,通过语言引导表示建模和适应相机内在变化,实现鲁棒的三维物体检测,实验表明在KITTI等基准上取得新突破。

Comments This paper is accepted by CVPR 2026

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25053 2026-03-31 cs.CV

GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

GaussFusion: 通过几何引导的视频生成提升野外3D重建

Liyuan Zhu, Manjunath Narayana, Michal Stary, Will Hutchcroft, Gordon Wetzstein, Iro Armeni

机构 * Stanford University(斯坦福大学) Zillow Group(Zillow集团)

AI总结 GaussFusion通过几何引导的视频生成技术改进3DGS重建,解决常见伪影问题,提供更鲁棒的3D重建方法,实现在新型视图合成中的最佳性能。

Comments CVPR 2026 main paper camera-ready. Project page: http://research.zhuliyuan.net/projects/GaussFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24984 2026-03-31 cs.CV

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24749 2026-03-31 cs.CV

TIGeR: A Unified Framework for Time, Images and Geo-location Retrieval

TIGeR:时间、图像和地理定位检索的统一框架

David G. Shatwell, Sirnam Swetha, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

AI总结 TIGeR通过统一时间、图像和地理定位模型,实现基于时间和地点的图像检索,提升复杂场景下的定位与时间预测能力。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22054 2026-03-31 cs.CV

FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation

FontCrafter: 基于元素驱动的高保真艺术字体创作与视觉上下文生成

Wuyang Luo, Chengkai Tan, Chang Ge, Binye Hong, Su Yang, Yongjiu Ma

机构 * Dalian University of Technology(大连理工大学) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学上海市智能信息处理重点实验室)

AI总结 本文提出FontCrafter框架,通过元素驱动方法生成艺术字体,结合上下文生成策略和轻量级CMA模块,实现高保真纹理与结构重建及灵活风格控制。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21356 2026-03-31 cs.CV

FluidGaussian: Propagating Simulation-Based Uncertainty Toward Functionally-Intelligent 3D Reconstruction

FluidGaussian: 通过基于仿真的不确定性传播实现功能智能的3D重建

Yuqiu Liu, Jialin Song, Marissa Ramirez de Chanlatte, Rochishnu Chowdhury, Rushil Paresh Desai, Wuyang Chen, Daniel Martin, Michael W. Mahoney

机构 * Simon Fraser University(西蒙弗雷泽大学) Lawrence Berkeley National Lab(劳伦斯伯克利国家实验室) University of California, Berkeley(加州大学伯克利分校) International Computer Science Institute(国际计算机科学研究所)

AI总结 本文提出FluidGaussian方法,通过耦合几何重建与流体-结构相互作用,提升3D重建的物理真实性和功能感知能力,实验显示在多个数据集上提升了视觉质量和物理仿真精度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21332 2026-03-31 cs.CV

EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization

EmoTaG:基于高斯点云的情绪感知谈话头合成与少样本个性化

Haolan Xu, Keli Cheng, Lei Wang, Ning Bi, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) Qualcomm Technologies Inc.(高通技术公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出EmoTaG框架,通过结构化FLAME参数空间改进运动稳定性,结合门控残差运动网络实现情绪感知的高质量谈话头合成。

Comments Accepted by CVPR 2026. Page: https://emotag26.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏