arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-11 至 2026-05-11 共收录 12
2605.08064 2026-05-11 cs.CV

Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示

Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng

机构 * Tsinghua University(清华大学) Panasonic AI Lab(松下人工智能实验室) Panasonic DX-CPS(松下DX-CPS) UC Berkeley(伯克利大学)

AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。

Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08000 2026-05-11 cs.CV

Rethinking Dense Optical Flow without Test-Time Scaling

重新思考无需测试时缩放的密集光流

Praroop Chanda, Suryansh Kumar

机构 * Visual and Spatial AI Lab(视觉与空间人工智能实验室) VCCM Section College of PVFA(VCCM学院光电工程学院) Department of ECEN(电子工程系) Department of CSCE(计算机科学与工程系) Texas A&M University(德克萨斯A&M大学)

AI总结 本文提出一种单次前向传递估计密集光流的框架,利用预训练基础表示,避免迭代细化和额外计算,通过视觉语义和几何先验替代测试时缩放,实现高效准确的光流估计。

Comments Accepted for publication at CVPR 2026; ViSCALE Workshop. Draft info: 10 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07642 2026-05-11 cs.CV

EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

EggHand:一种用于第一人称手姿态预测的多模态基础模型

Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park

机构 * DGIST, Republic of Korea(韩国忠南科学技术院)

AI总结 本文提出EggHand模型,通过结合视觉-语言-动作模型的动作解码器和第一人称视频-文本编码器,实现对第一人称视频中手姿态序列的预测,提升了在剧烈视角变化下的鲁棒性和可控性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06747 2026-05-11 cs.CV

ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation

ReCLIP++: 学习校正CLIP的偏差以实现无监督语义分割

Jingyun Wang, Guoliang Kang

机构 * Beihang University(北航大学)

AI总结 本文提出ReCLIP++,通过显式建模和校正CLIP中的偏差以提升无监督语义分割性能,设计了参考提示和位置嵌入投影来分别编码类别偏好和空间偏好偏差,并通过矩阵乘法生成偏差logit图,再通过元素级减法校正logits,最后利用Gumbel-Softmax操作生成分割掩码。

Comments Extended version of our CVPR 24 paper, accepted by IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07495 2026-05-11 cs.CV

Lightweight Unpaired Smartphone ISP Transfer with Semantic Pseudo-Pairing

轻量级无配对智能手机ISP传输与语义伪配对

Yujin Cho, Flavien Armangeon, Yanhao Li

机构 * Université Paris Saclay, ENS Paris Saclay, CNRS, Centre Borelli, France(巴黎萨克雷大学,巴黎萨克雷高等师范学院,国家科学研究中心,Borelli研究中心,法国)

AI总结 本文提出一种轻量级方法,通过语义伪配对缓解无配对数据问题,利用FGW最优传输构建伪配对,训练紧凑CNN提升颜色渲染性能,实现PSNR、SSIM和ΔE的显著提升。

Comments 13 pages, 9 figures, CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07256 2026-05-11 cs.CV

TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts

TAS-LoRA:基于LoRA专家混合的Transformer架构搜索

Jeimin Jeon, Hyunju Lee, Bumsub Ham

机构 * Yonsei University(延世大学) Articron Inc.(Articron公司) Korea Institute of Science and Technology (KIST)(韩国科学技术院)

AI总结 TAS-LoRA通过引入参数高效的LoRA技术,解决传统架构搜索中的特征坍塌问题,提升性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07149 2026-05-11 cs.CV

Real-IAD MVN: A Multi-View Normal Vector Dataset and Benchmark for High-Fidelity Industrial Anomaly Detection

Real-IAD MVN:一种多视角法向量数据集和基准,用于高保真工业异常检测

Wenbing Zhu, Jianing Liang, Linjie Cheng, Yurui Pan, Zhuhao Chen, Qingwang Yan, Yudong Cheng, Jianghui Zhang, Mingmin Chi, Bo Peng

机构 * Fudan University(复旦大学) Shanghai Ocean University(上海海洋大学) Donghua University(东华大学) Rongcheer Co., Ltd.(荣驰科技有限公司)

AI总结 本文提出Real-IAD-MVN数据集,通过多视角法向量捕捉微细几何缺陷,验证密集多视角伪3D数据在工业异常检测中的优越性能。

Comments Accepted to CVPR 2025. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07142 2026-05-11 cs.CV

AGA3DNet: Anatomy-Guided Gaussian Priors with Multi-view xLSTM for 3D Brain MRI Subtype Classification

AGA3DNet:基于解剖的高斯先验与多视角xLSTM用于3D脑MRI亚型分类

Peiyu Duan, Xueqi Guo, Sepehr Farhand, Mehmet Berk Sahin, Xinyuan Zheng, James S. Duncan, Gerardo Hermosillo Valadez, Yoshihisa Shinagawa

机构 * Yale University(耶鲁大学) Siemens Healthineers(西门子医疗) Purdue University(普渡大学)

AI总结 AGA3DNet结合解剖短语和轻量3D CNN与多视角xLSTM,通过高斯加权提供可解释的解剖引导,提升3D脑MRI亚型分类性能。

Comments CVPR CV4CLINIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07064 2026-05-11 cs.CV

Learning to Track Instance from Single Nature Language Description

从单个自然语言描述中学习实例跟踪

Yaozong Zheng, Bineng Zhong, Qihua Liang, Shuimu Zeng, Haiying Xia, Shuxiang Song

机构 * Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education Guangxi Normal University(教育区块链与智能技术重点实验室,教育部广西师范大学) University Engineering Research Center of Educational Intelligent Technology Guangxi Normal University(教育智能技术大学工程研究中心,广西师范大学) University of Southampton(南安普顿大学)

AI总结 本文提出一种自监督视觉-语言跟踪方法,通过动态令牌聚合模块提升语义对齐,无需bounding-box标注即可实现实例跟踪。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06679 2026-05-11 cs.LG

Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

打破幻觉:当积极与消极在多模态解码中相遇

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北京航空航天大学航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北京航空航天大学天门山实验室)

AI总结 本文提出PND框架,通过在解码过程中引入正负对比路径,增强视觉真实性,无需重新训练即可在POPE、MME和CHAIR数据集上取得最佳性能。

Comments Accepted by CVPR 2026 (Conference on Computer Vision and Pattern Recognition). 11 pages, 5 figures. Code available at: https://github.com/JiangYubo4399/PND

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08077 2026-05-11 cs.CV

AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding

AdaSpark: 为高效长视频理解设计的自适应稀疏性

Handong Li, Zikang Liu, Longteng Guo, Tongtian Yue, Yepeng Tang, Xinxin Zhu, Chuanyang Zheng, Ziming Wang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 AdaSpark通过自适应稀疏框架减少计算负载达57% FLOPs,保持性能并保留细粒度长程依赖,适用于小时级视频基准测试。

Comments 8 pages, CVPR2026 Accept (Highlight)

Journal ref Proceedings of the IEEE/CVF Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏