arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2605.10717 2026-05-12 cs.LG cs.CV

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

异方差扩散用于多智能体轨迹建模

Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息学院,CSIC-UPC)

AI总结 本文提出U2Diffine模型,通过异方差不确定性估计提升多智能体轨迹补全与预测性能,结合Taylor近似和RankNN实现高效推理与误差概率评估,优于现有方法。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:2503.18589 (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10523 2026-05-12 cs.CV

Improving Human Image Animation via Semantic Representation Alignment

通过语义表示对齐提升人类图像动画

Chang Liu, Mengting Chen, Yixuan Huang, Haoning Wu, Chen Ju, Shuai Xiao, Jinsong Lan, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院,中国) Alibaba Group, China(阿里巴巴集团,中国)

AI总结 本文提出SemanticREPA方法,通过结构和ID对齐提升人类动画质量,增强动作连续性和一致性。

Comments Accepted by CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10349 2026-05-12 cs.CV cs.AI cs.LG

Portable Active Learning for Object Detection

便携式主动学习用于目标检测

Rashi Sharma, Justin Timothy C. Bersamin, Karthikk Subramanian

机构 * Panasonic R&D Center Singapore(松下研发中心新加坡) Nanyang Technological University(南洋理工大学)

AI总结 本文提出便携式主动学习框架,通过结合类别实例不确定性和图像级多样性,提升目标检测的标注效率和准确性,适用于实际应用场景。

Comments CVPR 2026(highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10204 2026-05-12 cs.CV

3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects

3DReflecNet:一个大规模数据集,用于反射、透明和低纹理物体的3D重建

Zhicheng Liang, Haoyi Yu, Boyan Li, Dayou Zhang, Zijian Cao, Tianyi Gong, Junhua Liu, Shuguang Cui, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学) University of Southern California(南加州大学)

AI总结 本文提出3DReflecNet数据集,包含超过700万张多视角图像,用于评估和推动针对反射、透明和低纹理物体的3D视觉方法,揭示现有方法在复杂材料下的局限性。

Comments This paper has been accepted by CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10190 2026-05-12 cs.CV

DetRefiner: Model-Agnostic Detection Refinement with Feature Fusion Transformer

DetRefiner:基于特征融合变换器的模型无关检测细化

Soichiro Okazaki, Tatsuya Sasaki, Hiroki Ohashi

机构 * Hitachi, Ltd. Research and Development Group(日立株式会社研究开发集团)

AI总结 DetRefiner通过融合全局和局部特征提升开放词汇检测性能,无需依赖基础模型内部特征或重新训练,有效提升多个数据集上的检测精度。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07429 2026-05-12 cs.CV

Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework

通过扩散框架实现逼真且高效的bokeh渲染

Linxiao Shi, Siming Zheng, Zerong Wang, Hao Zhang, Jinwei Chen, Bo Li, Shifeng Chen, Peng-Tao Jiang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo BlueImage实验室,vivo移动通信有限公司) Shenzhen University of Advanced Technology(深圳大学)

AI总结 本文提出MagicBokeh框架,通过替代训练策略和聚焦感知的掩码注意力机制,联合优化bokeh渲染与超分辨率,提升可控性和视觉保真度,并引入降质感知深度模块以提高低质量输入的深度估计准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06720 2026-05-12 cs.CV

Exploring 6D Object Pose Estimation with Deformation

探索变形物体的6D姿态估计

Zhiqiang Liu, Rui Song, Duanmu Chuangqi, Jiaojiao Li, David Ferstl, Yinlin Hu

机构 * State Key Laboratory of ISN, Xidian University(西安电子科技大学信息与通信系统国家重点实验室) MagicLeap

AI总结 本文提出DeSOPE数据集,用于研究变形物体的6D姿态估计,通过高精度3D扫描和半自动标注流程,评估多种姿态方法在变形情况下的性能下降问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11566 2026-05-12 cs.CV

R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection

R4Det:用于高性能3D目标检测的4D雷达-摄像头融合

Zhongyu Xia, Yousen Tang, Yongtao Wang, Zhifeng Wang, Weijun Qin

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) EBTech Co. Ltd(EBTech公司)

AI总结 R4Det通过全景深度融合模块提升深度估计,设计变形门控时间融合模块以不依赖车辆姿态,结合实例引导动态细化模块,实现更准确的3D目标检测。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06949 2026-05-12 cs.CV

Can We Go Beyond Visual Features? Neural Tissue Relation Modeling for Relational Graph Analysis in Non-Melanoma Skin Histology

我们能否超越视觉特征?面向非黑色素瘤皮肤组织病理学的神经组织关系建模

Shravan Venkatraman, Muthu Subash Kavitha, Joe Dhanith P R, V Manikandarajan, Jia Wu

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) School of Information and Data Sciences(信息与数据科学学院) Vellore Institute of Technology(维洛雷理工学院) Loughborough University(洛桑大学) MD Anderson Cancer Center, The University of Texas(MD安德森癌症中心,德克萨斯大学)

AI总结 本文提出神经组织关系建模(NTRM),通过引入组织级图神经网络,改进皮肤病理学图像分割,提升对组织间关系的建模能力,在非黑色素瘤皮肤癌分割数据集上取得更优性能。

Comments CVPR 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23332 2026-05-12 cs.CV

UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes

UniGeoSeg:面向地理场景开放世界分割的统一方法

Shuo Ni, Di Wang, He Chen, Haonan Guo, Ning Zhang, Jing Zhang

机构 * Beijing Institute of Technology(北京理工大学) Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出UniGeoSeg框架,通过任务感知文本增强、潜在知识记忆和渐进训练策略,实现多任务学习,展现先进性能和零样本泛化能力。

Comments Datasets and source code were released at https://github.com/MiliLab/UniGeoSeg ; Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09802 2026-05-12 cs.CV cs.AI cs.LG

CrossVL: Complexity-Aware Feature Routing and Paired Curriculum for Cross-View Vision-Language Detection

CrossVL: 用于跨视角视觉语言检测的复杂度感知特征路由与配对课程学习

Zhipeng Liu, Chunbo Luo

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

AI总结 本文提出CrossVL框架,结合复杂度感知路径聚合和配对课程学习,提升跨视角视觉语言模型的检测性能,实验显示其在MAVREC数据集上提升了aerial mAP并缩小了地面与空中视角的性能差距。

Comments Accepted to CVPR 2026. Code available at https://github.com/1nyourlife/Crossvl_cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09703 2026-05-12 cs.CV

MOTOR-Bench: A Real-world Dataset and Multi-agent Framework for Zero-shot Human Mental State Understanding

MOTOR-Bench:一个现实世界数据集和多智能体框架,用于零样本人类心理状态理解

Xiaoyu Yuan, Niklas Heikkala, Tiina Törmänen, Hanna Järvenoja, Guoying Zhao, Haoyu Chen

机构 * University of Oulu(奥卢大学)

AI总结 本文提出MOTOR-Bench,通过现实世界数据集和多智能体框架,解决零样本人类心理状态理解问题,展示了多智能体框架在行为、认知和情绪预测上的优越性能。

Comments Accepted by CVPR 2026 workshop AI4RWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09662 2026-05-12 cs.CV

BEA-GS: BEyond RAdiance Supervision in 3DGS for Precise Object Extraction

BEA-GS:超越辐射监督的3DGS精确物体提取

Alessio Mazzucchelli, Maria Naranjo-Almeida, Jorge Bustos-Sanchez, Mariella Dimiccoli, Francesc Moreno-Noguer, Jordi Sanchez-Riera, Adrian Penate-Sanchez

机构 * Arquimea Research Center(阿奎米亚研究中心) Institut de Robòtica i Informàtica Industrial (CSIC-UPC)(机器人与信息技术研究所(CSIC-UPC)) Universidad de las Palmas de Gran Canaria (IUSIANI)(Gran Canaria大学(IUSIANI))

AI总结 BEA-GS通过引入两种新损失函数改进3DGS,实现更精确的物体边界分割,优于现有12种方法。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09622 2026-05-12 cs.CV cs.AI

Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

任意到任意的3D扩散模型与知识转移:放射治疗计划研究

Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao

机构 * UC Santa Cruz(加州大学圣克ruz分校) Siemens Healthineers(西门子医疗) University of Washington(华盛顿大学)

AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。

Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09477 2026-05-12 cs.CV cs.AI

Outlier-Robust Diffusion Solvers for Inverse Problems

具有鲁棒性的扩散求解器用于逆问题

Yang Zheng, Jiahua Liu, Tongyao Pang, Wen Li, Zhaoqiang Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Yau Mathematical Sciences Center, Tsinghua University(清华大学尤太数学科学中心)

AI总结 本文提出一种鲁棒扩散求解器,通过噪声估计和Huber损失构建迭代加权最小二乘目标,以解决逆问题中的异常值问题,并在多个图像数据集上验证了其有效性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05831 2026-05-12 cs.CV

Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media

统一科学交流:跨科学媒体的细粒度对应

Megha Mariam K. M, Vineeth N. Balasubramanian, C. V. Jawahar

机构 * IIIT Hyderabad(IIIT海得拉尔学院) Microsoft Research India & IIT Hyderabad(微软研究院印度分部及IIIT海得拉尔学院)

AI总结 本文提出MCD数据集,通过整合科研论文、演示视频、解释视频和幻灯片,评估不同模型在发现跨格式细粒度对应关系中的能力,揭示了视觉语言模型和嵌入模型的优缺点。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12812 2026-05-12 cs.AI

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解

Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00918 2026-05-12 cs.CV cs.AI

Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

通过内在自信心奖励改进文本到图像生成

Seungwook Kim, Minsu Cho

机构 * POSTECH(POSTECH大学) RLWRLD(RLWRLD实验室) GenGenAI(GenGenAI研究院)

AI总结 本文提出SOLACE框架,通过模型自身输出的重建误差生成自信心信号,用于强化学习,提升生成内容的组成、文本渲染和文本图像对齐能力。

Comments 22 pages, accepted to CVPR 2026. Project page https://wookiekim.github.io/SOLACE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09090 2026-05-12 cs.CV cs.AI

Investigating Anisotropy in Visual Grounding under Controlled Counterfactual Perturbations

探究在可控反事实扰动下的视觉语义对齐中的各向异性

Gabriele Lombardo, Luigi Maiorana, Liliana Lo Presti, Marco La Cascia

机构 * Department of Engineering(工程系)

AI总结 本文研究了在可控反事实扰动下视觉语义对齐中的各向异性影响,通过对比两种不同嵌入几何的模型发现,余弦相似度与近似行为无显著关联,表明各向异性不足以解释反事实错误。

Comments To be published in the proceedings of the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08874 2026-05-12 cs.CV

Semantic Alignment in Hyperbolic Space for Open-Vocabulary Semantic Segmentation

超几何空间中的语义对齐用于开放词汇语义分割

Hoang M. Truong, Hai Nguyen-Truong, Dang Huynh

机构 * Fulbright University Vietnam(富布赖特大学越南分校)

AI总结 本文提出HyRo框架,通过解耦超几何空间中的层次和语义对齐,提升开放词汇语义分割性能。

Comments Accepted to the PVUW Workshop at CVPR 2026. Project page: https://tmhoanggg.github.io/HyRo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08841 2026-05-12 cs.CV

Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models

基于 illusion 意识的视觉预处理与反 illusion 提示的经典 illusion 理解在视觉-语言模型中的应用

Junli Zha, Jiahui Wang, Xinkai Lu, Jinbo Wang

机构 * SF Technology Co., Ltd.(SF技术有限公司)

AI总结 本文提出无需训练的框架,通过图像预处理、反 illusion 提示工程和多票集成策略,解决视觉-语言模型对视觉错觉的感知与记忆冲突,实现90.48%和98.41%的准确率。

Comments Accepted at CVPR 2026 Workshop on 5th DataCV Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08663 2026-05-12 cs.CV

CAST: Channel-Aware Spatial Transfer Learning with Pseudo-Image Radar for Sign Language Recognition

CAST:基于伪图像雷达的通道感知空间迁移学习用于手语识别

Md. Shakhoyat Rahman Shujon, Sheikh Md. Galib Mahim, Md. Milon Islam, Md Rezwanul Haque, Md Rabiul Islam, Hamdi Altaheri, Fakhri Karray

机构 * Department of Computer Science and Engineering, Khulna University of Engineering & Technology(电子与技术大学计算机科学与工程系) Department of Electrical and Computer Engineering, University of Waterloo(滑铁库大学电子与计算机工程系) Department of Electrical and Computer Engineering, Texas A&M University(德克萨斯A&M大学电子与计算机工程系) College of Applied Computer Science, King Saud University(沙特王后大学应用计算机科学学院) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学机器学习系)

AI总结 本文提出CAST双流架构,利用通道感知空间迁移学习解决仅使用60~GHz雷达范围-时间图(RTM)的孤立手语识别挑战,通过结合物理感知架构和预训练视觉主干,提升手语识别性能,实验表明其在五折交叉验证下达到80.5%的Top-1准确率,比最佳单模型基线提升3.3%。

Comments Accepted for the Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), MSLR Workshop @ CVPR 2026 in Denver (Colorado, USA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08589 2026-05-12 cs.CV

S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domain

S2FT:稀疏谱域中的参数高效微调

Baoquan Zhang, Zhehao Yu, Lisai Zhang, Kenghong Lin, Tianran Chen, Yuxi Sun, Yunming Ye, Yao He

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ShenZhen SiFar Co., Ltd.(深圳思法科技有限公司) Bilibili. Inc(哔哩哔哩公司) Shenzhen University(深圳大学)

AI总结 本文提出S2FT方法,通过在稀疏谱域中微调少量频谱系数,解决传统频谱微调中频谱不稀疏的问题,实验表明其仅使用0.08%的训练参数即可取得优异性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03276 2026-05-12 cs.CV

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

VEBench: 多模态大模型在真实世界视频编辑中的基准测试

Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) CRCV, University of Central Florida(中央佛罗里达大学CRCV)

AI总结 VEBench通过高质量视频和人工验证问题对多模态大模型在视频编辑中的知识理解和操作推理能力进行评估,揭示当前模型与人类水平间的显著差距。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21164 2026-05-12 cs.AI

Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometry Problem Solving

简洁几何描述作为桥梁:释放LLM在平面几何问题求解中的潜力

Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang

机构 * Beihang University(北航大学)

AI总结 本文提出通过训练多模态大语言模型解释器生成几何描述,再利用通用LLM进行推理,以解决平面几何问题。通过设计CDL匹配奖励机制,提升生成几何描述的效率,并在新构建的Formalgeo7k-Rec-CoT数据集上验证了方法的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13547 2026-05-12 cs.CV

Turbo-GS: Accelerating 3D Gaussian Fitting for High-Quality Radiance Fields

Turbo-GS: 加速3D高斯拟合以实现高质量辐射场

Ankit Dhiman, Tao Lu, R Srinath, Emre Arslan, Angela Xing, Yuanbo Xiangli, R Venkatesh Babu, Srinath Sridhar

机构 * Indian Institute of Science(印度科学研究院) Brown University(布朗大学) Cornell University(康奈尔大学) Samsung R&D Institute India - Bangalore(三星印度研发中心-班加罗尔)

AI总结 本文提出Turbo-GS方法,通过减少计算开销和提升学习效率加速3D高斯拟合,实现4K分辨率快速拟合并保持高质量视图渲染。

Comments Accepted to CVPR 2026. Project page: https://ivl.cs.brown.edu/research/turbo-gs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08210 2026-05-12 cs.CV

Harmonized Feature Conditioning and Frequency-Prompt Personalization for Multi-Rater Medical Segmentation

谐化特征条件与频率提示个性化用于多评分者医学分割

Sanaz Karimijafarbigloo, Armin Khosravi, Alireza Kheyrkhah, Reza Azad, Mauricio Reyes, Dorit Merhof

机构 * Faculty of Informatics and Data Science, University of Regensburg(信息学院与数据科学学院,莱比锡大学) Sharif University of Technology(谢赫·伊斯兰大学) Iran University of Science and Technology(伊朗科学技术大学) ARTORG Center for Biomedical Research, University of Bern(伯尔尼大学生物医学研究中心) Department of Radiation Oncology, University Hospital Bern, University of Bern(伯尔尼大学放射肿瘤科,伯尔尼大学) Fraunhofer Institute for Digital Medicine MEVIS, Bremen(弗劳恩霍夫数字医学研究所MEVIS,不莱梅)

AI总结 本文提出谐化概率框架,通过自适应特征条件和频域个性化分离成像伪影与标注者差异,提升多评分者医学分割的准确性和可解释性。

Comments Accepted in main CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08191 2026-05-12 cs.CV cs.AI

A Robust Out-of-Distribution Detection Framework via Synergistic Smoothing

通过协同平滑实现稳健的分布外检测框架

Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio

机构 * Imperial College London(伦敦帝国学院) Zeroth Research(Zeroth研究)

AI总结 本文提出ROSS框架,通过基线分数的不稳定性区分分布内和分布外样本,实现对对抗攻击的强鲁棒性,实验表明其在多个数据集上表现优异。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08064 2026-05-11 cs.CV

Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示

Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng

机构 * Tsinghua University(清华大学) Panasonic AI Lab(松下人工智能实验室) Panasonic DX-CPS(松下DX-CPS) UC Berkeley(伯克利大学)

AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。

Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D

详情

展开后加载摘要…

URL PDF HTML 收藏