arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-31 至 2026-03-31 共收录 111
2603.27481 2026-03-31 cs.LG cs.AI

On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models

关于令牌的困境:具有漂移感知令牌分配的动态MoE用于大视觉语言模型的持续学习

Chongyang Zhao, Mingsong Li, Haodong Lu, Dong Gong

机构 * University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼新南威尔士大学))

AI总结 本文提出LLaVA-DyMoE框架,通过动态MoE和漂移感知令牌分配缓解持续学习中的路由漂移问题,提升模型在持续学习中的性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27403 2026-03-31 cs.LG cs.AI

Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

基于符合采样的通用化证书的条件事实性控制大语言模型

Kai Ye, Qingtao Pan, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

AI总结 本文提出条件事实性控制框架CFC,通过增强分位数回归定义连续特征条件接受阈值,实现条件覆盖保证,并在理论和实验上证明其高效性与稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27344 2026-03-31 cs.CV

TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR

TerraSeg: 任意LiDAR的自监督地面分割

Ted Lentsch, Santiago Montiel-Marín, Holger Caesar, Dariu M. Gavrila

机构 * Delft University of Technology(代尔夫特理工大学) University of Alcalá(阿尔卡拉大学)

AI总结 TerraSeg通过自监督学习实现任意LiDAR的地面分割,利用大规模统一数据集OmniLiDAR提升泛化能力,无需人工标注即可在多个数据集上取得最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27268 2026-03-31 cs.CV

TrackMAE: Video Representation Learning via Track Mask and Predict

TrackMAE:通过轨迹掩码和预测进行视频表示学习

Renaud Vandeghen, Fida Mohammad Thoker, Marc Van Droogenbroeck, Bernard Ghanem

机构 * University of Liège(列日大学) KAUST(阿卜杜拉国王科技大学)

AI总结 TrackMAE通过显式利用运动信息作为重建信号,改进随机管掩码策略,提升视频表示学习的判别性和通用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27240 2026-03-31 cs.CV cs.AI

Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection

通过因果发现和双模态安全子空间投影诊断和修复视觉-语言模型中的不安全通道

Jinhu Fu, Yihang Lou, Qingyi Si, Shudong Zhang, Yan Bai, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huawei Technologies Ltd.(华为技术有限公司) Peking University(北京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 本文提出CARE框架,通过因果分析和双模态安全子空间投影修复视觉-语言模型中的不安全通道,提升安全性而不影响多模态能力。

Comments Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27238 2026-03-31 cs.CV

An Instance-Centric Panoptic Occupancy Prediction Benchmark for Autonomous Driving

面向自动驾驶的实例中心全景占用预测基准测试

Yi Feng, Junwu E, Zizhan Guo, Yu Ma, Hanli Wang, Rui Fan

机构 * Tongji University(同济大学)

AI总结 本文提出实例中心的全景占用预测基准测试,引入ADMesh和CarlaOcc数据集,提供高精度3D模型和实例级标注,建立标准化评估指标并系统评估代表性模型。

Comments Accepted to CVPR 2026. Code and dataset are available at https://mias.group/CarlaOcc

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27201 2026-03-31 cs.CV

Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

理解并缓解多模态推理链模型中的幻觉

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * School of Computer Science and Ningbo Institute, Northwestern Polytechnical University, China(西北工业大学计算机学院和宁波研究院) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, China(国家空天地海一体化大数据应用技术国家工程实验室)

AI总结 本文研究多模态推理链模型中的幻觉问题,发现其源于联想推理步骤中的虚假文本生成,提出一种有效策略缓解幻觉,实验表明方法效果显著且可与其他缓解方法结合提升性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27199 2026-03-31 cs.CV

Let Triggers Control: Frequency-Aware Dropout for Effective Token Control

让触发器控制:面向频率的Dropout用于有效的标记控制

Junyoung Koh, Hoyeon Moon, Dongha Kim, Seungmin Lee, Sanghyun Park, Min Song

机构 * Yonsei University(延世大学) Onoma AI

AI总结 本文提出频率感知Dropout方法,通过分析触发器与上下文的共现关系,提升文本到图像生成中触发器的可控性与个性化能力,无需增加参数或架构修改。

Comments CVPR 2026 P13N: Personalization in Generative AI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27197 2026-03-31 cs.CV

K$α$LOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasks

K$α$LOS 寻求共识:一种用于评估复杂视觉任务中多标注者一致性的元算法

David Tschirschwitz, Volker Rodehorst

机构 * Bauhaus-Universität Weimar(包豪斯大学魏玛校区)

AI总结 本文提出K$α$LOS元算法,通过标准化数据集质量评估,解决视觉任务中的实例对应问题,提供更细粒度的诊断指标,如标注者活力和定位敏感性。

Comments Accepted at CVPR 2026. Also known as KALOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27179 2026-03-31 cs.CV

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

基于推理的异常检测与定位:图像级监督

Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27165 2026-03-31 cs.CV

RiskProp: Collision-Anchored Self-Supervised Risk Propagation for Early Accident Anticipation

RiskProp: 基于碰撞锚定的自监督风险传播用于早期事故预警

Yiyang Zou, Tianhao Zhao, Peilun Xiao, Hongyu Jin, Longyu Qi, Yuxuan Li, Liyin Liang, Yifeng Qian, Chunbo Lai, Yutian Lin, Zhihui Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Didi Chuxing(滴滴出行) University of Science and Technology of China(中国科学技术大学)

AI总结 RiskProp通过自监督学习消除对异常起始帧的依赖,利用可靠标注的碰撞帧建模时间风险演变,提升早期事故预警的准确性和可解释性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27101 2026-03-31 cs.CV cs.LG

PRUE: A Practical Recipe for Field Boundary Segmentation at Scale

PRUE:一种大规模田界边界分割的实用配方

Gedeon Muhawenayo, Caleb Robinson, Subash Khanal, Zhanpei Fang, Isaac Corley, Alexander Wollam, Tianyi Gao, Leonard Strnad, Ryan Avery, Lyndon Estes, Ana M. Tárano, Nathan Jacobs, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Microsoft AI for Good(微软人工智能公益) Washington University in St. Louis(圣路易斯华盛顿大学) Oregon State University(俄勒冈州立大学) Wherobots Clark University(克拉克大学)

AI总结 本文提出一种结合U-Net和复合损失函数的分割方法,提升田界分割的性能和鲁棒性,实现了76%的IoU和47%的object-F1,为大规模可靠田界分割提供了实用框架。

Comments 12 pages, 3 figures, supplementary material. Accepted at CVPR 2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27070 2026-03-31 cs.CV

Structural Graph Probing of Vision-Language Models

视觉-语言模型的结构图谱探查

Haoyu He, Yue Zhuo, Yu Zheng, Qi R. Wang

机构 * Northeastern University(东北大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究通过神经拓扑分析视觉-语言模型的层间相关图谱,揭示群体结构对行为的意义、跨模态变化及因果影响,提出神经拓扑作为解释性中间尺度。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27059 2026-03-31 cs.CV

Towards Intrinsic-Aware Monocular 3D Object Detection

面向内在感知的单目三维物体检测

Zhihao Zhang, Abhinav Kumar, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出MonoIA框架,通过语言引导表示建模和适应相机内在变化,实现鲁棒的三维物体检测,实验表明在KITTI等基准上取得新突破。

Comments This paper is accepted by CVPR 2026

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25053 2026-03-31 cs.CV

GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

GaussFusion: 通过几何引导的视频生成提升野外3D重建

Liyuan Zhu, Manjunath Narayana, Michal Stary, Will Hutchcroft, Gordon Wetzstein, Iro Armeni

机构 * Stanford University(斯坦福大学) Zillow Group(Zillow集团)

AI总结 GaussFusion通过几何引导的视频生成技术改进3DGS重建,解决常见伪影问题,提供更鲁棒的3D重建方法,实现在新型视图合成中的最佳性能。

Comments CVPR 2026 main paper camera-ready. Project page: http://research.zhuliyuan.net/projects/GaussFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24984 2026-03-31 cs.CV

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24749 2026-03-31 cs.CV

TIGeR: A Unified Framework for Time, Images and Geo-location Retrieval

TIGeR:时间、图像和地理定位检索的统一框架

David G. Shatwell, Sirnam Swetha, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

AI总结 TIGeR通过统一时间、图像和地理定位模型,实现基于时间和地点的图像检索,提升复杂场景下的定位与时间预测能力。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22054 2026-03-31 cs.CV

FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation

FontCrafter: 基于元素驱动的高保真艺术字体创作与视觉上下文生成

Wuyang Luo, Chengkai Tan, Chang Ge, Binye Hong, Su Yang, Yongjiu Ma

机构 * Dalian University of Technology(大连理工大学) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学上海市智能信息处理重点实验室)

AI总结 本文提出FontCrafter框架,通过元素驱动方法生成艺术字体,结合上下文生成策略和轻量级CMA模块,实现高保真纹理与结构重建及灵活风格控制。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21356 2026-03-31 cs.CV

FluidGaussian: Propagating Simulation-Based Uncertainty Toward Functionally-Intelligent 3D Reconstruction

FluidGaussian: 通过基于仿真的不确定性传播实现功能智能的3D重建

Yuqiu Liu, Jialin Song, Marissa Ramirez de Chanlatte, Rochishnu Chowdhury, Rushil Paresh Desai, Wuyang Chen, Daniel Martin, Michael W. Mahoney

机构 * Simon Fraser University(西蒙弗雷泽大学) Lawrence Berkeley National Lab(劳伦斯伯克利国家实验室) University of California, Berkeley(加州大学伯克利分校) International Computer Science Institute(国际计算机科学研究所)

AI总结 本文提出FluidGaussian方法,通过耦合几何重建与流体-结构相互作用,提升3D重建的物理真实性和功能感知能力,实验显示在多个数据集上提升了视觉质量和物理仿真精度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21332 2026-03-31 cs.CV

EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization

EmoTaG:基于高斯点云的情绪感知谈话头合成与少样本个性化

Haolan Xu, Keli Cheng, Lei Wang, Ning Bi, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) Qualcomm Technologies Inc.(高通技术公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出EmoTaG框架,通过结构化FLAME参数空间改进运动稳定性,结合门控残差运动网络实现情绪感知的高质量谈话头合成。

Comments Accepted by CVPR 2026. Page: https://emotag26.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12533 2026-03-31 cs.CV

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

你看到我指向的是什么?基于手势的 egocentric 视频问答

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院)

AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08021 2026-03-31 cs.RO cs.CV

AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

AffordGrasp:跨模态扩散用于感知意识抓取合成

Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出AffordGrasp,通过跨模态扩散模型生成准确反映物体几何和用户指令的抓取姿态,提升AR/VR和具身AI中的手-物交互质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03192 2026-03-31 cs.CV cs.CL cs.LG

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02190 2026-03-31 cs.CV cs.AI cs.GR cs.HC cs.LG

Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation

Sketch2Colab: 通过可控流蒸馏实现基于草图的多人体动画

Divyanshu Daiya, Aniket Bera

机构 * IDEAS Lab, Department of Computer Science, Purdue University(普渡大学计算机科学系IDEAS实验室)

AI总结 Sketch2Colab通过可控流蒸馏将故事板风格的2D草图转化为连贯的3D多人体运动,实现对代理、关节、时序和接触的精细控制,实验显示其在约束遵循和感知质量上优于基线方法。

Comments Accepted to CVPR 2026 Main Conference (11 pages, 8 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23153 2026-03-31 cs.CV cs.AI

Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

高效无编码器的基于傅里叶的3D大多模态模型

Guofeng Mei, Wei Lin, Luigi Riz, Yujiao Wu, Yiming Wang, Fabio Poiesi

机构 * Fondazione Bruno Kessler, Italy(意大利布鲁诺·凯斯勒基金会) JKU Linz, Austria(奥地利林茨约翰·开普勒大学) CSIRO, Australia(澳大利亚联邦科学与工业研究组织)

AI总结 本文提出Fase3D,一种基于傅里叶变换的无编码器3D多模态模型,通过结构化超点和空间填充曲线实现高效全局上下文建模,显著提升计算效率和参数效率。

Journal ref CVPR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21655 2026-03-31 cs.CV cs.AI

CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning

CCCaption: 为完整和正确图像描述的双奖励强化学习

Zhijiang Tang, Linhua Wang, Jiaxin Qi, Weihao Jiang, Peng Hou, Anxiang Zeng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) LLM Team, Shopee Pte. Ltd.(Shopee私人有限公司大语言模型团队)

AI总结 本文提出CCCaption框架,通过双奖励强化学习优化图像描述的完整性和正确性,利用多样化LVLMs和动态查询采样策略提升训练效率,并通过验证子描述查询的真实性来惩罚幻觉,从而生成更符合客观标准的描述。

Comments Accept by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18845 2026-03-31 cs.CV

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

所有权的回声:对抗引导的双注入用于MLLMs中的版权保护

Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出一种生成版权触发器的框架,通过双注入方法在MLLMs中嵌入可验证的版权信息,以在微调衍生模型中触发专属文本响应,同时在非衍生模型中保持无活性。

Comments Accepted to CVPR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏