arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-23 至 2026-04-23 共收录 14
2604.20358 2026-04-23 cs.CV

ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval

ConeSep: 基于锥的鲁棒噪声-反学习组合网络用于组合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Mingyu Zhang, Zhiheng Fu, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文针对组合图像检索中噪声三元组对应问题,提出ConeSep网络,解决模态抑制、负锚缺乏和反学习反作用三大挑战,通过几何保真量化、负边界学习和边界基于的目标反学习方法,提升检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20336 2026-04-23 cs.CV cs.GR

Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation

面向物体引导的人-人协同操作的稳定性驱动运动生成

Jiahao Xu, Xiaohan Yuan, Xingchen Wu, Chongyang Xu, Kun Li, Buzhen Huang

机构 * Tianjin University(天津大学) National University of Singapore(新加坡国立大学) Sichuan University(四川大学)

AI总结 本文提出一种流匹配框架,通过物体 affordance 和空间配置生成自然且有效的协同操作运动,结合对抗性交互先验和稳定性驱动模拟,提升接触精度和交互稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20291 2026-04-23 cs.CV

Efficient INT8 Single-Image Super-Resolution via Deployment-Aware Quantization and Teacher-Guided Training

高效INT8单图像超分辨率通过部署感知量化和教师引导训练

Pham Phuong Nam Nguyen, Nam Tien Le, Thi Kim Trang Vo, Nhu Tinh Anh Nguyen

机构 * University of Information Technology(信息技术大学) Ho Chi Minh City University of Technology(胡志明市技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学)

AI总结 本文提出一种部署导向的量化单图像超分辨率框架,通过三阶段训练提升质量与效率,在INT8部署下实现29.79dB PSNR和0.8634 SSIM。

Comments 10 pages, 4 figures. Accepted at the Mobile AI (MAI) 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20286 2026-04-23 cs.CV cs.AI

MambaLiteUNet: Cross-Gated Adaptive Feature Fusion for Robust Skin Lesion Segmentation

MambaLiteUNet: 跨门控自适应特征融合用于稳健的皮肤病变分割

Md Maklachur Rahman, Soon Ki Jung, Tracy Hammond

机构 * Texas A&M University(德克萨斯大学) Kyungpook National University(庆尚国立大学)

AI总结 本文提出MambaLiteUNet,通过整合Mamba状态空间模型与U-Net架构,结合三个关键模块提升局部-全局特征交互和空间细节保留,实现高精度分割。

Comments Accepted at CVPR 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20190 2026-04-23 cs.CV cs.LG

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19945 2026-04-23 cs.CV

Visual Reasoning through Tool-supervised Reinforcement Learning

通过工具监督强化学习进行视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo

机构 * Northeastern University(东北大学) Amazon AGI(亚马逊人工智能研究院)

AI总结 本文提出工具监督强化学习框架,通过简单可解释的视觉工具提升多模态大语言模型的复杂视觉推理能力,实验表明其高效且具备强大工具使用能力。

Comments Accepted to CVPR 2026 Findings. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19386 2026-04-23 cs.CV

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

Air-Know: 基于仲裁校准的知识内化鲁棒网络用于组合图像检索

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li

机构 * Shandong University(山东大学)

AI总结 针对组合图像检索中噪声三元组对应问题,Air-Know提出专家-代理-分流解耦范式,通过外部先验仲裁、专家知识内化和双流协调模块,提升鲁棒性和检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08923 2026-04-23 cs.AI

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

相同内容,不同答案:多模态大语言模型中的跨模态不一致

Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

机构 * University of Amsterdam(阿姆斯特丹大学) City of Amsterdam(阿姆斯特丹市) University of Technology Nuremberg(努尔堡技术大学)

AI总结 本文提出REST和REST+基准测试,评估多模态大语言模型的跨模态不一致性。研究发现,即使在相同语义信息下,不同模态的推理结果也不一致,且OCR错误和视觉特征影响模型性能。

Comments Accepted at CVPR 2026. Angela van Sprang and Laurens Samson contributed equally as first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01233 2026-04-23 cs.CV cs.GR cs.HC

Towards Reliable Human Evaluations in Gesture Generation: Insights from a Community-Driven State-of-the-Art Benchmark

迈向可靠的 gesture 生成人类评估:来自社区驱动的最新基准的见解

Rajmund Nagy, Hendric Voss, Thanh Hoang-Minh, Mihail Tsakov, Teodor Nikolov, Zeyi Zhang, Tenglong Ao, Sicheng Yang, Shaoli Huang, Yongkang Cheng, M. Hamza Mughal, Rishabh Dabral, Kiran Chhatre, Christian Theobalt, Libin Liu, Stefan Kopp, Rachel McDonnell, Michael Neff, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter

机构 * KTH Royal Institute of Technology(皇家理工学院) Bielefeld University(比勒菲尔德大学) University of Science – VNUHCM(越南胡志明市国家大学) Independent Researcher(独立研究者) Motorica AB(Motorica AB公司) Peking University(北京大学) Tsinghua University(清华大学) Astribot(Astribot公司) Max-Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Trinity College Dublin(都柏林大学) University of California, Davis(加州大学戴维斯分校) SEED – Electronic Arts(SEED–电子艺界) Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)

AI总结 本文通过社区驱动的基准测试,揭示了 gesture 生成中人类评估的标准化问题,指出 motion 实际和语音-手势对齐的评估结果存在争议,强调需采用解耦的评估方法以提升基准测试的准确性。

Comments Accepted to CVPR 2026, Findings Track. 23 pages, 10 figures. The last two authors made equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23733 2026-04-23 cs.CL cs.CV

AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization

AdaMMS: 为异构多模态大语言模型设计的模型融合方法

Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) School of Software Microelectronics, Peking University(软件微电子学院,北京大学) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)

AI总结 本文提出AdaMMS,一种针对异构多模态大语言模型的模型融合方法,通过映射、融合和搜索三个步骤解决异构模型融合难题,无需标注数据即可在视觉语言基准测试中超越现有方法。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20825 2026-04-23 cs.LG cs.AI cs.CV cs.DC eess.SP

FedSIR: Spectral Client Identification and Relabeling for Federated Learning with Noisy Labels

FedSIR: 基于谱分析的客户端识别与重标记在具有噪声标签的联邦学习中

Sina Gholami, Abdulmoneam Ali, Tania Haghighi, Ahmed Arafa, Minhaj Nur Alam

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 FedSIR通过谱结构分析客户端特征表示,识别并缓解噪声标签影响,采用多阶段框架提升联邦学习鲁棒性,实验表明其在噪声标签下的性能优于现有方法。

Comments Accepted at the 5th Workshop on Federated Learning for Computer Vision (FedVision), CVPR 2026. Sina Gholami and Abdulmoneam Ali contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20715 2026-04-23 cs.CV

GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

GeoRelight: 基于灵活多模态扩散变换器的联合几何重照明与重建

Yuxuan Xue, Ruofan Liang, Egor Zakharov, Timur Bagautdinov, Chen Cao, Giljoo Nam, Shunsuke Saito, Gerard Pons-Moll, Javier Romero

机构 * Codec Avatars Lab, Meta(Meta编码器动画实验室) University of Tübingen(图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学院,萨尔兰信息校园)

AI总结 本文提出GeoRelight,通过联合解决几何重建与重照明问题,利用iNOD和混合数据训练方法提升性能,优于传统顺序模型和忽略几何的系统。

Comments CVPR 2026 Highlight; Project page: https://yuxuan-xue.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20570 2026-04-23 cs.CV

Exploring Spatial Intelligence from a Generative Perspective

从生成视角探索空间智能

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen

机构 * Zhejiang University(浙江大学) State Key Laboratory of CAD & CG(计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出GSI-Bench,首个评估生成空间智能的基准,通过空间 grounded 图像编辑量化空间合规性与编辑保真度,实验表明生成训练可提升空间推理能力。

Comments Accepted by CVPR 2026. Project page: https://aim-uofa.github.io/GSI-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏