arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2605.08000 2026-05-11 cs.CV

Rethinking Dense Optical Flow without Test-Time Scaling

重新思考无需测试时缩放的密集光流

Praroop Chanda, Suryansh Kumar

机构 * Visual and Spatial AI Lab(视觉与空间人工智能实验室) VCCM Section College of PVFA(VCCM学院光电工程学院) Department of ECEN(电子工程系) Department of CSCE(计算机科学与工程系) Texas A&M University(德克萨斯A&M大学)

AI总结 本文提出一种单次前向传递估计密集光流的框架,利用预训练基础表示,避免迭代细化和额外计算,通过视觉语义和几何先验替代测试时缩放,实现高效准确的光流估计。

Comments Accepted for publication at CVPR 2026; ViSCALE Workshop. Draft info: 10 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07642 2026-05-11 cs.CV

EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

EggHand:一种用于第一人称手姿态预测的多模态基础模型

Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park

机构 * DGIST, Republic of Korea(韩国忠南科学技术院)

AI总结 本文提出EggHand模型,通过结合视觉-语言-动作模型的动作解码器和第一人称视频-文本编码器,实现对第一人称视频中手姿态序列的预测,提升了在剧烈视角变化下的鲁棒性和可控性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06747 2026-05-11 cs.CV

ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation

ReCLIP++: 学习校正CLIP的偏差以实现无监督语义分割

Jingyun Wang, Guoliang Kang

机构 * Beihang University(北航大学)

AI总结 本文提出ReCLIP++,通过显式建模和校正CLIP中的偏差以提升无监督语义分割性能,设计了参考提示和位置嵌入投影来分别编码类别偏好和空间偏好偏差,并通过矩阵乘法生成偏差logit图,再通过元素级减法校正logits,最后利用Gumbel-Softmax操作生成分割掩码。

Comments Extended version of our CVPR 24 paper, accepted by IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07495 2026-05-11 cs.CV

Lightweight Unpaired Smartphone ISP Transfer with Semantic Pseudo-Pairing

轻量级无配对智能手机ISP传输与语义伪配对

Yujin Cho, Flavien Armangeon, Yanhao Li

机构 * Université Paris Saclay, ENS Paris Saclay, CNRS, Centre Borelli, France(巴黎萨克雷大学,巴黎萨克雷高等师范学院,国家科学研究中心,Borelli研究中心,法国)

AI总结 本文提出一种轻量级方法,通过语义伪配对缓解无配对数据问题,利用FGW最优传输构建伪配对,训练紧凑CNN提升颜色渲染性能,实现PSNR、SSIM和ΔE的显著提升。

Comments 13 pages, 9 figures, CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07256 2026-05-11 cs.CV

TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts

TAS-LoRA:基于LoRA专家混合的Transformer架构搜索

Jeimin Jeon, Hyunju Lee, Bumsub Ham

机构 * Yonsei University(延世大学) Articron Inc.(Articron公司) Korea Institute of Science and Technology (KIST)(韩国科学技术院)

AI总结 TAS-LoRA通过引入参数高效的LoRA技术,解决传统架构搜索中的特征坍塌问题,提升性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07149 2026-05-11 cs.CV

Real-IAD MVN: A Multi-View Normal Vector Dataset and Benchmark for High-Fidelity Industrial Anomaly Detection

Real-IAD MVN:一种多视角法向量数据集和基准,用于高保真工业异常检测

Wenbing Zhu, Jianing Liang, Linjie Cheng, Yurui Pan, Zhuhao Chen, Qingwang Yan, Yudong Cheng, Jianghui Zhang, Mingmin Chi, Bo Peng

机构 * Fudan University(复旦大学) Shanghai Ocean University(上海海洋大学) Donghua University(东华大学) Rongcheer Co., Ltd.(荣驰科技有限公司)

AI总结 本文提出Real-IAD-MVN数据集,通过多视角法向量捕捉微细几何缺陷,验证密集多视角伪3D数据在工业异常检测中的优越性能。

Comments Accepted to CVPR 2025. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07142 2026-05-11 cs.CV

AGA3DNet: Anatomy-Guided Gaussian Priors with Multi-view xLSTM for 3D Brain MRI Subtype Classification

AGA3DNet:基于解剖的高斯先验与多视角xLSTM用于3D脑MRI亚型分类

Peiyu Duan, Xueqi Guo, Sepehr Farhand, Mehmet Berk Sahin, Xinyuan Zheng, James S. Duncan, Gerardo Hermosillo Valadez, Yoshihisa Shinagawa

机构 * Yale University(耶鲁大学) Siemens Healthineers(西门子医疗) Purdue University(普渡大学)

AI总结 AGA3DNet结合解剖短语和轻量3D CNN与多视角xLSTM,通过高斯加权提供可解释的解剖引导,提升3D脑MRI亚型分类性能。

Comments CVPR CV4CLINIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07064 2026-05-11 cs.CV

Learning to Track Instance from Single Nature Language Description

从单个自然语言描述中学习实例跟踪

Yaozong Zheng, Bineng Zhong, Qihua Liang, Shuimu Zeng, Haiying Xia, Shuxiang Song

机构 * Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education Guangxi Normal University(教育区块链与智能技术重点实验室,教育部广西师范大学) University Engineering Research Center of Educational Intelligent Technology Guangxi Normal University(教育智能技术大学工程研究中心,广西师范大学) University of Southampton(南安普顿大学)

AI总结 本文提出一种自监督视觉-语言跟踪方法,通过动态令牌聚合模块提升语义对齐,无需bounding-box标注即可实现实例跟踪。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06679 2026-05-11 cs.LG

Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

打破幻觉:当积极与消极在多模态解码中相遇

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北京航空航天大学航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北京航空航天大学天门山实验室)

AI总结 本文提出PND框架,通过在解码过程中引入正负对比路径,增强视觉真实性,无需重新训练即可在POPE、MME和CHAIR数据集上取得最佳性能。

Comments Accepted by CVPR 2026 (Conference on Computer Vision and Pattern Recognition). 11 pages, 5 figures. Code available at: https://github.com/JiangYubo4399/PND

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08077 2026-05-11 cs.CV

AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding

AdaSpark: 为高效长视频理解设计的自适应稀疏性

Handong Li, Zikang Liu, Longteng Guo, Tongtian Yue, Yepeng Tang, Xinxin Zhu, Chuanyang Zheng, Ziming Wang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 AdaSpark通过自适应稀疏框架减少计算负载达57% FLOPs,保持性能并保留细粒度长程依赖,适用于小时级视频基准测试。

Comments 8 pages, CVPR2026 Accept (Highlight)

Journal ref Proceedings of the IEEE/CVF Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06664 2026-05-08 cs.CV cs.AI

BAMI: Training-Free Bias Mitigation in GUI Grounding

BAMI:无需训练的GUI定位偏差缓解

Borui Zhang, Bo Zhang, Bo Wang, Wenzhao Zheng, Yuhao Cheng, Liang Tang, Yiqiang Yan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University, China(清华大学,中国) Lenovo Research, China(联想研究院,中国)

AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06572 2026-05-08 cs.CV cs.NA math.NA

Solving Minimal Problems Without Matrix Inversion Using FFT-Based Interpolation

通过FFT插值解决最小问题而不进行矩阵求逆

Haidong Wu, Snehal Bhayani, Janne Heikkilä

机构 * Center for Machine Vision and Signal Analysis(机器视觉与信号分析中心) University of Oulu(奥卢大学)

AI总结 本文提出一种基于采样且无需矩阵求逆的方法,利用稀疏隐变量结果ants构建求解器,通过逆快速傅里叶变换插值高效重建行列式多项式,从而在数值稳定性和运行时间上提供传统Gröbner基和结果ants方法的实用替代方案。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06214 2026-05-08 cs.CV

Differentiable Adaptive 4D Structured Illumination for Joint Capture of Shape and Reflectance

可微适应性4D结构照明用于形状和反光的联合捕获

Huakeng Ding, Yaowen Chen, Kun Zhou, Hongzhi Wu

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)

AI总结 本文提出一种可微框架,通过统一的空间-角结构光和单相机,高效获取物体形状和反光的高质联合数据,采用基于直方图的像素级概率模型减少深度不确定性。

Comments Accepted to CVPR 2026. 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06092 2026-05-08 cs.CV

Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning

通过上下文提示和噪声学习提升自监督跟踪

Yaozong Zheng, Qihua Liang, Bineng Zhong, Shuimu Zeng, Yuanliang Xue, Ning Li, Shuxiang Song

机构 * Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education Guangxi Normal University(教育区块链与智能技术重点实验室,教育部广西师范大学) University Engineering Research Center of Educational Intelligent Technology Guangxi Normal University(教育智能技术大学工程研究中心,广西师范大学) University of Southampton(南安普顿大学) Xi’an Research Institute of High Technology(西安高科技研究所)

AI总结 本文提出一种新的自监督跟踪框架,通过联合利用细粒度语义提示和上下文噪声,提升模型在无标签视频中学习鲁棒跟踪表示的能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05014 2026-05-08 cs.CV

CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

CARD: 一种用于复杂道路地形密集3D重建的多模态汽车数据集

Gasser Elazab, Frank Neuhaus, Tilman Koß, Malte Splietker, Aditya Date, Michael Unterreiner, Maximilian Jansen, Olaf Hellwich

机构 * CARIAD SE(CARIAD公司) Technische Universität Berlin(柏林技术大学) Vision & Robotics GmbH(视觉与机器人技术有限公司)

AI总结 CARD数据集通过提供连续序列中的近密3D地面真实信息,解决了现有数据集在复杂道路地形下深度估计和补全的不足,支持更精确的几何和感知任务评估。

Comments Accepted at CVPR 2026 (Highlight). Project page: https://card.content.cariad.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07819 2026-05-08 cs.CV cs.LG

Fusion Complexity Inversion: Why Simpler Cross View Modules Outperform SSMs and Cross View Attention Transformers for Pasture Biomass Regression

融合复杂性倒置:为何更简单的跨视图模块在牧草生物量回归中优于SSM和跨视图注意力变换器

Mridankan Mandal

机构 * Department of Information Technology(信息科技系) Indian Institute of Information Technology, Allahabad Prayagraj(印度阿姆利达德普信息科技学院)

AI总结 本文研究了在稀少农业数据下,简单跨视图模块在牧草生物量回归中的优越性,发现模型复杂度与性能呈反比关系,提出应优先考虑模型基础架构质量而非融合复杂度。

Comments Accepted to CVPR: Vision for Agriculture Workshop 2026 (Withdrawn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11016 2026-05-08 cs.CV cs.AI

SoccerMaster: A Vision Foundation Model for Soccer Understanding

SoccerMaster: 一种用于足球理解的视觉基础模型

Haolin Yang, Jiayuan Rao, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出SoccerMaster,一种统一的足球视觉理解模型,通过多任务预训练统一处理从细粒度感知到高层语义推理的多种任务,实验表明其在多种下游任务中表现优异。

Comments Accepted by CVPR 2026 (Oral); Project Page: https://haolinyang-hlyang.github.io/SoccerMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05889 2026-05-08 cs.CV cs.AI cs.LG cs.NA math.NA

DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation

DBMSolver: 一种无需训练的扩散桥采样器用于高质量图像到图像翻译

Sankarshana Venugopal, Mohammad Mostafavi, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

AI总结 DBMSolver通过指数积分器利用DBM底层SDE和ODE的半线性结构,实现高效的一阶和二阶解,减少5倍采样次数并提升图像质量,适用于多种图像任务。

Comments Accepted to CVPR 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05590 2026-05-08 cs.CV

Uncertainty-Guided Edge Learning for Deep Image Regression in Remote Sensing

不确定性引导的边缘学习用于遥感中的深度图像回归

Anh Vu Nguyen, Dino Sejdinovic, Tat-Jun Chin

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

AI总结 本文提出一种不确定性引导的边缘学习算法,用于遥感中的深度图像回归,通过深度beta回归提高边缘设备上的训练效率。

Comments AI4Space @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05510 2026-05-08 cs.CV

The First Controllable Bokeh Rendering Challenge at NTIRE 2026

NTIRE 2026首个可控制的光斑渲染挑战

Tim Seizinger, Florin-Alexandru Vasluianu, Jeffrey Chen, Zhuyun Zhou, Zongwei Wu, Radu Timofte, Dafeng Zhang, Yipeng Lin, Qi Yan, Junhao Chen, Yang Yang, Divyavardhan Singh, Hariom Thacker, Hammad Mohammad, Aanchal Maurya, Kishor Upla, Kiran Raja, Wei Zhou, Hongyu Huang, Yujin Cho, Grigory Malivenko, Jiachen Tu, Yaokun Shi, Guoyi Xu, Yaoxin Jiang, Jiajia Liu

机构 * NTIRE 2026

AI总结 本文介绍了NTIRE 2026首个可控制的光斑渲染挑战的结果,展示了最有效的提交方法,8支队伍在最终测试阶段提交了有效解决方案,所有提交均在未见过的图像上进行评估,重点是人物和复杂细致的主体。

Comments Challenge report paper from NTIRE Workshop at CVPR 2026

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05390 2026-05-08 cs.CV

LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World

LAMP:面向度量3D世界的多摄像头人体跟踪

Nan Yang, Julian Straub, Fan Zhang, Richard Newcombe, Jakob Engel, Lingni Ma

机构 * Meta Reality Labs Research(Meta现实实验室)

AI总结 LAMP提出一种新颖简单框架,通过早期解耦观察者与目标运动,解决多摄像头视角下3D人体跟踪问题,实现动态视角下的高效跟踪。

Comments CVPR 2026. Project page: https://facebookresearch.github.io/LAMP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05328 2026-05-08 cs.CV cs.RO

Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shift

Query2Uncertainty: 3D目标检测中分布偏移下的鲁棒不确定性量化与校准

Till Beemelmanns, Alexey Nekrasov, Stefan Vilceanu, Jonas Steinhaus, Timo Woopen, Bastian Leibe, Lutz Eckstein

机构 * Institute for Automotive Engineering, RWTH Aachen(汽车工程研究所,亚琛RWTH大学) Computer Vision Institute, RWTH Aachen(计算机视觉研究所,亚琛RWTH大学)

AI总结 本文提出一种密度感知校准方法,结合后验校准器与DETR风格3D目标检测器的潜在对象查询特征密度,提升分布偏移场景下的不确定性估计与校准性能。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04282 2026-05-08 cs.LG

Hardware-Aware Neural Feature Extraction for Resource-Constrained Devices

面向资源受限设备的神经特征提取:考虑硬件的神经特征提取

Francesco Tosini, Simone Pedroni, Christian Veronesi, Pietro Bartoli, Andrea Giudici, Marco Paracchini, Marco Marcon, Diana Trojaniello

机构 * Department of Electronics, Information and Bioengineering (DEIB), Politecnico di Milano(电子、信息与生物工程系(DEIB),米兰理工学院) Smart Eyewear Lab, EssilorLuxottica(智能眼镜实验室,EssilorLuxottica)

AI总结 本文提出Gideon,一种面向资源受限设备的神经特征提取器,结合关系知识蒸馏和可微神经架构搜索,在内存和运算约束下提升INT8鲁棒性与量化抗性,实现高效部署。

Comments This paper has been accepted for publication at the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026. \c{opyright}IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01657 2026-05-05 cs.CV

Act2See: Emergent Active Visual Perception for Video Reasoning

Act2See:面向视频推理的涌现式主动视觉感知

Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01638 2026-05-05 cs.CV

Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection

Omni-Fake:面向社交媒体的统一多模态深度伪造检测基准测试

Tianxiao Li, Zhenglin Huang, Haiquan Wen, Yiwei He, Xinze Li, Bingyu Zhu, Wuhui Duan, Congang Chen, Zeyu Fu, Yi Dong, Baoyuan Wu, Jason Li, Guangliang Cheng

机构 * University of Liverpool(利物浦大学) University of Exeter(埃克塞特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Omni-Fake多模态深度伪造检测基准,包含大规模数据集和分布外基准,支持联合检测-定位-解释协议,并提出基于强化学习的多模态检测器,提升检测准确性和可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01498 2026-05-05 cs.CV

Towards Visual Query Localization in the 3D World

面向3D世界的视觉查询定位

Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang

机构 * Wuhan University(武汉大学) AutoLab, SAI, Shanghai Jiao Tong University(AutoLab、SAI、上海交通大学) Anyverse Dynamics University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文首次提出3D多模态视觉查询定位基准3DVQL,包含2002个序列和17万帧数据,通过点云、RGB图像和深度图像多模态数据提升研究灵活性,并提出LaF算法提升性能。

Comments Accepted to CVPR 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01468 2026-05-05 cs.CV cs.AI

Decision Boundary-aware Generation for Long-tailed Learning

面向长尾学习的决策边界感知生成

Jiacheng Yang, Ruichi Zhang, Chikai Shang, Mengke Li, Xinyi Shang, Junlong Gao, Yonggang Zhang, Yang Lu

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(中国教育部多媒体可信感知与高效计算重点实验室) Xiamen University(厦门大学) College of Computer Science and Software Engineering(计算机科学与软件工程学院) Shenzhen University(深圳大学) Department of Statistical Science(统计科学系) University College London(伦敦大学学院) Division of Arts and Machine Creativity(艺术与机器创造力 division) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出DBG框架,通过生成边界附近样本提升表示学习,缓解长尾数据分布不均问题,提升尾类和整体准确率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏