arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.08309 2026-03-17 cs.CV cs.AI cs.LG

Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

基于概念引导的微调:引导ViT远离虚假相关性以提高鲁棒性

Yehonatan Elisha, Oren Barkan, Noam Koenigstein

AI总结 本文提出一种引导模型推理至概念层面语义的微调框架,通过优化内部相关性映射对齐空间 grounded 的概念掩码,提升模型在分布偏移下的鲁棒性。

Comments CVPR 2026 ; Project page: https://yonisgit.github.io/concept-ft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06242 2026-03-17 cs.LG cs.CV

DC-Merge: Improving Model Merging with Directional Consistency

DC-Merge:通过方向一致性提升模型合并

Han-Chen Zhang, Zi-Hao Zhou, Mao-Lin Luo, Shimin Di, Min-Ling Zhang, Tong Wei

AI总结 本文提出DC-Merge方法,通过平衡任务向量能量分布和对齐方向几何,解决模型合并中的方向一致性问题,实验表明在视觉和视觉-语言基准上均取得最优性能。

Comments Accepted by CVPR 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05530 2026-03-17 cs.RO cs.CV

ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation

ProFocus:面向视觉-语言导航的前瞻性感知与聚焦推理

Wei Xue, Mingcheng Li, Xuecheng Wu, Jingqun Tang, Dingkang Yang, Lihua Zhang

AI总结 ProFocus通过大语言模型与视觉-语言模型的协作,实现前瞻性感知和聚焦推理,提升视觉-语言导航任务的效率与准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20629 2026-03-17 cs.CV cs.AI cs.LG

MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models

MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿

Chieh-Yun Chen, Zhonghao Wang, Qi Chen, Zhifan Ye, Min Shi, Yue Zhao, Yinan Zhao, Hui Qu, Wei-An Lin, Yiru Shen, Ajinkya Kale, Irfan Essa, Humphrey Shi

AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。

Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18519 2026-03-17 cs.LG

CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection

CHIPS: 通过曲率感知的混合影响数据选择实现高效的CLIP适应

Xinlin Zhuang, Yichen Li, Xiwei Liu, Haolin Yang, Yifan Lu, Ziyun Zou, Yulong Li, Huifa Li, Dongliang Chen, Qinglei Wang, Weiyang Liu, Ying Qian, Jiangming Shi, Imran Razzak

AI总结 本文提出CHIPS方法,通过曲率感知和混合影响数据选择,实现高效的CLIP垂直领域适应,在医疗和通用领域基准中均表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12207 2026-03-17 cs.CV

Mixture of States: Routing Token-Level Dynamics for Multimodal Generation

状态混合:用于多模态生成的路由令牌级动态

Haozhe Liu, Ding Liu, Mingchen Zhuge, Zijian Zhou, Tian Xie, Sen He, Yukang Yang, Shuming Liu, Yuren Cong, Jiadong Guo, Hongyu Xu, Ke Xu, Kam-Woh Ng, Juan C. Pérez, Juan-Manuel Pérez-Rúa, Tao Xiang, Wei Liu, Shikun Liu, Jürgen Schmidhuber

AI总结 本文提出MoS,一种多模态扩散模型的融合范式,通过灵活的状态交互融合模态。核心是可学习的令牌路由器,通过时间步和输入依赖的交互对模态隐藏状态进行去噪,实现令牌级特征与扩散轨迹的精确对齐。

Comments Accepted to CVPR 2026; Homepage: https://haozheliu-st.github.io/mos-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03571 2026-03-17 cs.RO cs.CV eess.IV

OneOcc: Semantic Occupancy Prediction for Legged Robots with a Single Panoramic Camera

OneOcc: 为四足机器人和人形机器人提供基于单个全景相机的语义占用预测

Hao Shi, Ze Wang, Shangwei Guo, Mengfei Duan, Song Wang, Teng Chen, Kailun Yang, Lin Wang, Kaiwei Wang

AI总结 OneOcc通过双投影融合、双格体素化、轻量解码器和步态位移补偿模块,实现四足机器人和人形机器人的语义占用预测,解决了步态引起的身体抖动和360度连续性问题。

Comments Accepted to CVPR 2026. Datasets and code will be publicly available at https://github.com/MasterHow/OneOcc

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18269 2026-03-17 cs.CV cs.AI

StreamingTOM: Streaming Token Compression for Efficient Video Understanding

StreamingTOM: 流式令牌压缩以实现高效的视频理解

Xueyi Chen, Keda Tao, Kele Shao, Huan Wang

AI总结 StreamingTOM通过双阶段框架解决流式视频视觉-语言模型中预-后LLM瓶颈,实现kv-cache压缩和低延迟,提升实时视频理解效率。

Comments Accepted at CVPR 2026. Project page: https://yige24.github.io/StreamingTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25934 2026-03-17 cs.CV

UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression

UniMMAD: 一种基于MoE驱动特征解压的多模态多类别异常检测统一框架

Yuan Zhao, Youwei Pang, Lihe Zhang, Hanqi Liu, Jiaming Zuo, Huchuan Lu, Xiaoqi Zhao

AI总结 UniMMAD通过MoE驱动的特征解压机制,实现多模态和多类别异常检测的统一,解决传统方法在领域变化和内存占用上的不足,提升检测效率与准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14811 2026-03-17 cs.CV cs.AI

SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models

SegQuant: 一种语义感知且通用的扩散模型量化框架

Jiaji Zhang, Ruichao Sun, Hailiang Zhao, Jiaju Wu, Peng Chen, Hao Li, Yuying Liu, Kingsum Chow, Gang Xiong, Shuiguang Deng

AI总结 SegQuant提出一种统一的量化框架,通过自适应结合互补技术提升跨模型通用性,采用结构感知图量化策略和双尺度量化方案,有效保持视觉保真度,适用于Transformer扩散模型及其他模型。

Comments 22 pages, 15 figures, to be published in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026), code is available at https://github.com/OptiSys-ZJU/segquant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13912 2026-03-17 cs.CV

Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video

迈向无约束第一人称视频中稳定的自监督物体表示

Yuting Tan, Xilong Cheng, Yunxiao Qin, Zhengnan Li, Jingjing Zhang

AI总结 本文提出EgoViT框架,通过三种协同机制学习稳定物体表示,提升无监督物体发现和语义分割性能。

Comments 24 pages, 11 figures. Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13878 2026-03-17 cs.CV cs.AI cs.CL

Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering

步级推理:面向医学视觉问答的逐步视觉推理

Lin Fan, Yafei Ou, Zhipeng Deng, Pengyu Dai, Hou Chongxian, Jiale Yan, Yaqian Li, Kaiwen Long, Xun Gong, Masayuki Ikebe, Yefeng Zheng

AI总结 本文提出Step-CoT,通过结构化多步推理提升医学视觉问答的准确性和可解释性,引入专家 curated 的医疗诊断流程对齐的推理数据集和动态图结构聚焦机制。

Comments Accepted by CVPR 2026 Finding Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13795 2026-03-17 cs.LG cs.AI

Computation and Communication Efficient Federated Unlearning via On-server Gradient Conflict Mitigation and Expression

通过服务器梯度冲突缓解和表达实现高效的联邦反学习

Minh-Duong Nguyen, Senura Hansaja, Le-Tuan Nguyen, Quoc-Viet Pham, Ken-Tye Yong, Nguyen H. Tran, Dung D. Le

AI总结 本文提出FOUL框架,通过学习-反学习阶段和服务器知识聚合阶段,解决联邦反学习中的跨客户端知识不可达和高计算通信成本问题,提出时间到遗忘指标,实验证明其在效率和隐私保护上的优势。

Comments 21 pages, 11 figures, 4 tables, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13741 2026-03-17 cs.CV

Ego-1K -- A Large-Scale Multiview Video Dataset for Egocentric Vision

Ego-1K -- 一个大规模多视角视频数据集用于第一人称视觉

Jae Yong Lee, Daniel Scharstein, Akash Bapat, Hao Hu, Andrew Fu, Haoru Zhao, Paul Sammut, Xiang Li, Stephen Jeapes, Anik Gupta, Lior David, Saketh Madhuvarasu, Jay Girish Joshi, Jason Wither

AI总结 Ego-1K数据集通过12个同步相机采集近1000个短视频,用于推动神经3D视频合成和动态场景理解,其核心挑战在于近距离动态物体和设备自身运动导致的大视差和图像运动。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13682 2026-03-17 cs.CV

Every Error has Its Magnitude: Asymmetric Mistake Severity Training for Multiclass Multiple Instance Learning

每种错误都有其严重性:面向多类多实例学习的不对称错误严重性训练

Sungrae Hong, Jiwon Jeong, Jisu Shin, Donghee Han, Sol Lee, Kyungeun Kim, Mun Yong Yi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Seegene Medical Foundation(Seegene医疗基金会)

AI总结 本文提出一种考虑错误严重性的训练策略,通过层次结构优化和概率对齐提升多类多实例学习的诊断准确性,减少临床关键错误。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13660 2026-03-17 cs.CV

Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision

从掩码引导自监督学习中学习通用的3D医学图像表示

Yunhe Gao, Yabin Zhang, Chong Wang, Jiaming Liu, Maya Varma, Jean-Benoit Delbrouck, Akshay Chaudhari, Curtis Langlotz

机构 * Stanford University(斯坦福大学)

AI总结 本文提出MASS方法,通过掩码引导自监督学习,学习通用的医学图像表示,实现了在不同数据集上的高效分割和分类任务。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13395 2026-03-17 cs.CV cs.LG cs.RO

COT-FM: Cluster-wise Optimal Transport Flow Matching

COT-FM:分簇最优传输流匹配

Chiensheng Chiang, Kuan-Hsun Tu, Jia-Wei Liao, Cheng-Fu Chou, Tsung-Wei Ke

机构 * National Taiwan University(台湾大学)

AI总结 COT-FM通过分簇策略优化流匹配框架,提升生成速度与可靠性,适用于图像生成和机器人任务。

Comments 18pages, CVPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13370 2026-03-17 cs.CV cs.LG

GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

GraphVLM:多模态图学习的视觉语言模型基准测试

Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * NYU Shanghai(纽约大学上海分校) New York University(纽约大学) Rice University(休斯顿大学) East China Normal University(华东师范大学)

AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13341 2026-03-17 cs.CV cs.AI

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09824 2026-03-17 cs.CV cs.AI cs.MM

Composing Concepts from Images and Videos via Concept-prompt Binding

通过概念提示绑定从图像和视频中组合概念

Xianghao Kong, Zeyu Zhang, Yuwei Guo, Zhuoran Zhao, Songchun Zhang, Anyi Rao

机构 * HKUST(香港科技大学) CUHK(香港大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出Bind & Compose方法,通过绑定视觉概念与提示标记实现灵活的视觉概念组合,提升概念一致性和运动质量。

Comments CVPR 2026. Project page: https://refkxh.github.io/BiCo_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22287 2026-03-17 cs.CV

Match-and-Fuse: Consistent Generation from Unstructured Image Sets

匹配与融合:从无结构图像集实现一致生成

Kate Feingold, Omri Kaduri, Tali Dekel

AI总结 本文提出Match-and-Fuse方法,通过图模型实现无结构图像集的一致生成,利用内部特征融合和密集输入对应关系,在无需掩码或人工监督的情况下生成一致且高质量的图像集。

Comments CVPR 2026. Project page: https://match-and-fuse.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18600 2026-03-17 cs.CV cs.AI cs.CL

OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation

OraPO:基于 oracle 的强化学习用于数据高效且事实准确的放射科报告生成

Zhuoxiao Chen, Hongyang Yu, Ying Xu, Yadan Luo, Long Duong, Yuan-Fang Li

机构 * Oracle Health & AI(Oracle健康与人工智能)

AI总结 OraPO 通过 FactScore 奖励机制提升放射科报告生成效率,在受限预算下实现 SOTA 性能,使用小规模 VLM 和适度硬件,在 CheXpert Plus 数据集上取得 0.341 的 F1 分数。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13801 2026-03-17 cs.CV

Masked Representation Modeling for Domain-Adaptive Segmentation

域适应分割的掩码表示建模

Wenlve Zhou, Zhiheng Zhou, Tiantao Xian, Yikui Zhai, Weibin Wu, Biyun Ma

机构 * South China University of Technology(华南理工大学) School of Electronic and Information Engineering, Wuyi University(武夷大学电子与信息工程学院) South China Agricultural University(华南农业大学)

AI总结 本文提出MRM任务,通过在潜在空间中进行表示掩码和重建,提升分割性能,适用于多种架构和域适应基准。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11894 2026-03-17 cs.CV cs.AI cs.LG

3D-LFM: Lifting Foundation Model

3D-LFM:提升基础模型

Mosam Dabhi, Laszlo A. Jeni, Simon Lucey

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Adelaide(阿德莱德大学)

AI总结 本文提出3D-LFM,利用Transformer的排列等变性处理不同数量的3D点,提升3D结构和相机的重建能力,实现跨领域的高泛化性能。

Comments Visit the project page at https://3dlfm.github.io for links to additional media, code, and videos. The site also features a custom GPT tailored to address queries related to 3D-LFM. Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12915 2026-03-16 cs.CV cs.AI

Stake the Points: Structure-Faithful Instance Unlearning

标注点:结构忠实的实例删除

Kiseong Hong, JungKyoo Shin, Eunwoo Kim

机构 * Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出结构忠实的实例删除框架,通过引入语义锚点保持知识结构,提升图像分类、检索和人脸识别性能,实现删除与保留的平衡。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12903 2026-03-16 cs.CV

Spectral-Geometric Neural Fields for Pose-Free LiDAR View Synthesis

光谱-几何神经场用于无姿态激光雷达视角合成

Yinuo Jiang, Jun Cheng, Yiran Wang, Cheng Cheng

机构 * School of AIA, Huazhong University of Science and Technology(华中科技大学人工智能学院)

AI总结 本文提出SG-NLF框架,通过融合光谱信息与几何一致性实现无姿态激光雷达视角合成,提升重建质量和姿态精度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12078 2026-03-16 cs.CV

Node-RF: Learning Generalized Continuous Space-Time Scene Dynamics with Neural ODE-based NeRFs

Node-RF:基于神经ODE的NeRF学习通用连续时空场景动态

Hiran Sarkar, Liming Kuang, Yordanka Velikova, Benjamin Busam

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 Node-RF通过结合神经ODE与动态NeRF,实现连续时间空间动态表示,能超越观测轨迹进行泛化。利用ODE求解器学习隐式场景状态,通过微分计算传播特征嵌入,实现长距离外推。

Comments Accepted to CVPR 2026. 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05330 2026-03-16 cs.CV

Dark3R: Learning Structure from Motion in the Dark

Dark3R: 在黑暗中学习结构从运动

Andrew Y Guo, Anagh Malik, SaiKiran Tedla, Yutong Dai, Yiqian Qin, Zach Salehe, Benjamin Attal, Sotiris Nousias, Kiriakos N. Kutulakos, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学) Sony Corporation of America(美国索尼公司) Harvard University(哈佛大学) Purdue University(普渡大学)

AI总结 Dark3R通过教师-学生蒸馏适应大规模3D基础模型以应对极低光照条件,无需3D监督,仅需噪声-清洁原始图像对进行训练,实现低信噪比下的鲁棒特征匹配和相机姿态估计。

Comments CVPR 2026, Project Page: https://andrewguo.com/pub/dark3r

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01000 2026-03-16 cs.CV

Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer

让您的图像随您的动作移动!-- 隐式多对象多动作转移

Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang

机构 * Tianjin University(天津大学) University of New South Wales(新南威尔士大学) University of Electronic Science and Technology of China(电子科技大学) Hainan University(海南大学) University of Auckland(奥克兰大学)

AI总结 本文提出FlexiMMT框架,实现多对象多动作的隐式图像到视频转换,通过解耦注意力机制和改进的掩码传播机制,实现精确且高质量的多对象动作迁移。

Comments 15 pages, 11 figures, cvpr 2026, see https://ethan-li123.github.io/FlexiMMT_page/

详情

展开后加载摘要…

URL PDF HTML 收藏