arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11868
2605.31124 2026-06-01 cs.CV

QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer

QVGGT: 训练后量化的视觉几何基础Transformer

Zhizhen Pan, Hesong Wang, Huan Wang

机构 * Westlake University(西湖大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 针对VGGT模型参数量大、部署受限的问题,提出QVGGT量化框架,通过选择性混合精度、令牌滤波与任务感知尺度搜索,实现近无损W4A16量化,显著降低内存和加速推理。

Comments Accepted by CVPR 2026. Project page: https://ddsacu.github.io/QVGGT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31115 2026-06-01 cs.CV

Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

Polyphony: 基于扩散的双手动作分割,采用交替视觉Transformer和语义条件

Hao Zheng, Hu Wang, Tiantian Zheng, Prajjwal Bhattarai, Tuka Alhanai

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出Polyphony三阶段方法,通过交替训练双手视觉Transformer、语义特征条件化和扩散分割,解决双手动作分割中的手间依赖、视觉不对称和语义模糊问题,在多个数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30987 2026-06-01 cs.CV

Benchmarking Single-Step Inpainting Methods for Multi-Object 3D Gaussian Splatting Scenes

多对象3D高斯泼溅场景的单步修复方法基准测试

Finn Dröge, Cecilia Curreli, Abhishek Saroha, Daniel Cremers

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 针对3D高斯泼溅场景中的对象移除与修复任务,比较了2D修复器在3D一致性上的表现,发现基于重建的修复器优于生成扩散模型,且从头初始化场景比微调现有场景效果更好,同时引入了一个带真实数据的新多对象场景。

Comments Accepted as an extended abstract to the CVEU Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30639 2026-06-01 cs.CV cs.AI cs.RO

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

PInVerify:面向主动实例验证的离线具身基准

Yuhang Jiang

机构 * University of Trento(特伦托大学)

AI总结 提出主动实例验证任务,构建离线具身基准PInVerify,通过多视角导航和细粒度属性匹配评估具身智能体,并基于多模态大语言模型建立基线。

Comments Accepted as a poster at the Foundation Models Meet Embodied Agents (FMEA) Workshop, CVPR 2026. 44 pages including appendix. Code: https://github.com/Avalon-S/PInVerify

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26262 2026-06-01 cs.CV

Semantic Foam: Unifying Spatial and Semantic Scene Decomposition

Semantic Foam:统一空间与语义场景分解

Amr Sharafeldin, Shrisudhan Govindarajan, Thomas Walker, Aryan Mikaeili, Daniel Rebain, Kwang Moo Yi, Andrea Tagliasacchi

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Toronto(多伦多大学) Wayve Technologies(Wayve技术公司) University of British Columbia(不列颠哥伦比亚大学) University of Edinburgh(爱丁堡大学)

AI总结 提出Semantic Foam,通过扩展Radiant Foam表示,结合Voronoi网格的空间分解和显式语义特征场,实现高质量、一致性的语义分割。

Comments 15 pages, 10 figures, Accepted to CVPR 2026 (Highlight) , Project page: http://semanticfoam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19394 2026-06-01 cs.CV

BackSplit: The Importance of Sub-dividing the Background in Biomedical Lesion Segmentation

BackSplit:在生物医学病灶分割中细分背景的重要性

Rachit Saluja, Asli Cihangir, Ruining Deng, Johannes C. Paetzold, Fengbei Liu, Mert R. Sabuncu

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔医学院)

AI总结 提出BackSplit方法,通过将背景细分为多个子类(如组织、器官)进行训练,在不增加推理成本的情况下显著提升小病灶分割性能,并从信息论角度证明其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08255 2026-06-01 cs.LG cs.AI cs.CR

SHIELD: Secure Hypernetworks for Incremental Expansion Learning Defense

SHIELD: 用于增量扩展学习防御的安全超网络

Patryk Krukowski, Łukasz Gorczyca, Piotr Helm, Kamil Książek, Przemysław Spurek

机构 * Jagiellonian University, Faculty of Mathematics and Computer Science(杰洛内维大学数学与计算机科学学院) Jagiellonian University, Doctoral School of Exact and Natural Sciences(杰洛内维大学精确与自然科学研究博士学院) Akces NCBR IDEAS Research Institute(IDEAS研究所)

AI总结 提出一种结合区间边界传播(IBP)与超网络的框架SHIELD,通过生成任务特定参数和区间混合训练策略,实现可认证鲁棒的持续学习,在保持可扩展性的同时达到最优平均准确率。

Comments Accepted to CVPR 2026 (Findings track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30347 2026-05-29 cs.CV cs.GR

NeuROK: Generative 4D Neural Object Kinematics

NeuROK:生成式4D神经物体运动学

Chen Geng, Guangzhao He, Yue Gao, Yunzhi Zhang, Shangzhe Wu, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Cambridge(剑桥大学) Cornell University(康奈尔大学)

AI总结 提出基于Transformer的编码器-解码器模型NeuROK,通过学习物体潜在运动学参数化,实现从静态3D物体生成逼真的4D动态变形,克服了传统方法对预定义物理模型和特定类别的依赖。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30342 2026-05-29 cs.CV cs.RO

Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field

基于各向异性可见性场的不确定性驱动的3D高斯溅射主动建图

Shangjie Xue, Jesse Dill, Dhruv Ahuja, Frank Dellaert, Panagiotis Tsiotras, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出GAVIS框架,通过各向异性可见性场量化3DGS的不确定性,并基于最大信息增益实现主动建图,在精度和效率上显著优于现有方法。

Comments Accepted to CVPR 2026. Project page https://gatech-rl2.github.io/GAVIS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30339 2026-05-29 cs.CV cs.MM cs.SD eess.AS

Benchmarking Single-Factor Physical Video-to-Audio Generation

单因素物理视频到音频生成的基准测试

Tingle Li, Siddharth Gururani, Kevin J. Shih, Gantavya Bhatt, Sang-gil Lee, Zhifeng Kong, Arushi Goel, Gopala Anumanchipalli, Ming-Yu Liu

机构 * UC Berkeley(伯克利大学) NVIDIA(英伟达) University of Washington(华盛顿大学)

AI总结 提出FlatSounds基准,通过控制反事实对和单视频模式测试评估视频到音频模型的物理推理能力,发现模型依赖文本描述而非视觉流,且物理准确性与时序对齐存在权衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30311 2026-05-29 cs.CV cs.AI

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

Archon:面向整体数字人生成的统一多模态模型

Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Google(谷歌) Google DeepMind(谷歌DeepMind)

AI总结 提出Archon,一个完全预训练的以人为中心的统一多模态模型,通过模态特定分词器、语义视频重参数化和“模态思维”策略,实现文本、音频、动作和视觉等七种模态的整体数字人生成。

Comments Accepted to CVPR 2026. Project Page: https://zju3dv.github.io/archon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30310 2026-05-29 cs.CV cs.AI cs.GR

City-Mesh3R: Simulation-Ready City-Scale 3D Mesh Reconstruction from Multi-View Images

City-Mesh3R:面向仿真就绪的城市级多视图三维网格重建

Sayan Paul, Sourav Ghosh, Siddharth Katageri, Soumyadip Maity, Sanjana Sinha, Brojeshwar Bhowmick

机构 * Visual Computing & Embodied AI Lab, TCS Research(视觉计算与具身人工智能实验室,TCS研究)

AI总结 提出City-Mesh3R框架,通过分治策略从大规模无序图像集合端到端重建水密表面网格,解决城市尺度重建中几何不完整、表面不规则及计算复杂性问题。

Comments Accepted to the USM3D Workshop Proceedings at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 as an Oral Presentation. Project page: https://citymesh3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30307 2026-05-29 cs.CV

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30231 2026-05-29 cs.CV cs.AI

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

超越3D VQA:将3D空间先验注入视觉-语言模型以增强几何推理

Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao

机构 * FAIR at Meta(Meta的FAIR)

AI总结 提出GASP框架,通过将几何先验注入LLM的Transformer层,利用对比损失和深度一致性监督训练,显著提升VLM的3D空间推理能力,在多个基准上取得大幅提升。

Comments CVPR 2026. Project page: https://danielchyeh.github.io/GASP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30010 2026-05-29 cs.CV

EarlyTom: Early Token Compression Completes Fast Video Understanding

EarlyTom: 早期令牌压缩实现快速视频理解

Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Alibaba Cloud Computing(阿里云计算)

AI总结 针对视频大语言模型中视觉编码阶段效率低下的问题,提出EarlyTom无训练令牌压缩框架,通过在视觉编码器内部进行早期压缩,显著降低首令牌延迟并提升吞吐量。

Comments Accepted by CVPR 2026. 16 pages, 8 figures, 8 tables. Project page: https://viridisgreen.github.io/EarlyTom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29726 2026-05-29 cs.CV

SLAD : Shared LoRA Adapters for Task Specific Distillation

SLAD:用于任务特定蒸馏的共享LoRA适配器

Reda Bensaid, Yassir Bendou, Vincent Gripon, François Leduc-Primeau

机构 * IMT Atlantique(IMT阿登蒂克) Polytechnique Montréal(蒙特利尔理工学院)

AI总结 提出SLAD方法,通过共享低秩适配器参数对齐教师和学生模型的特征表示,实现高效的知识蒸馏,在多个分类和分割数据集上达到最先进性能。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29705 2026-05-29 cs.AI

BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices

BitTP:面向边缘设备的轻量级轨迹预测模型与BitLLM

Mincheol Kang, Hyunjin Lim, Bomin Kang, Daehee Park

机构 * KAIST, Republic of Korea(韩国釜山国立大学) DGIST, Republic of Korea(韩国国立庆北科学技术院)

AI总结 提出BitTP,通过将LLM轨迹预测器转换为1.58比特轻量架构,在保持或提升预测质量的同时大幅降低内存和计算需求,实现边缘设备部署。

Comments Camera-ready version. Accepted as a findings paper at CVPR 2026. 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29602 2026-05-29 cs.CV

CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning

CogniVerse: 用认知反思与几何推理革新多模态检索增强生成

Xiang Fang, Wanlong Fang, Changshuo Wang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院)

AI总结 提出CogniVerse框架,通过认知反思模块、基于黎曼流形对齐的多模态检索模块和最优传输层次生成模块,解决多模态检索增强生成中的噪声检索、跨模态语义错位和生成不连贯问题。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29954 2026-05-29 cs.CV

Detecting Unknown Objects via Energy-based Separation for Open World Object Detection

基于能量分离的未知物体检测用于开放世界目标检测

Jun-Woo Heo, Keonhee Park, Gyeong-Moon Park

机构 * Korea University, South Korea(韩国大学) Seoul National University, South Korea(首尔国立大学)

AI总结 提出DEUS框架,通过等角紧框架子空间未知分离和基于能量的已知区分损失,解决开放世界目标检测中未知物体检测和类别遗忘问题。

Comments 8 pages, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23085 2026-05-29 cs.AI

When Models Learn to Ask Why: Adaptive Causal Reasoning for Trustworthy Medical Vision-Language Models

当模型学会问为什么:面向可信医疗视觉语言模型的自适应因果推理

Jianxin Lin, Chunzheng Zhu, Peter J. Kneuertz, Yunfei Bai, Yuan Xue

机构 * The Ohio State University(俄亥俄州立大学) Hunan University(湖南大学) Amazon(亚马逊)

AI总结 提出MedCausalX框架,通过因果推理链、自适应反射架构和轨迹级因果校正,解决医疗VLM中的虚假相关和推理不一致问题,显著提升诊断一致性和减少幻觉。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04314 2026-05-29 cs.CV cs.AI

MOO: A Multi-view Oriented Observations Dataset for Viewpoint Analysis in Cattle Re-Identification

MOO:用于牛个体重识别视角分析的多视角观测数据集

William Grolleau, Achraf Chaouch, Astrid Sabourin, Guillaume Lapouge, Catherine Achard

机构 * Universite Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Sorbonne University, CNRS, ISIR(索邦大学,CNRS,ISIR)

AI总结 提出大规模合成多视角观测数据集MOO,通过128个均匀采样视角的1000头牛图像,量化视角变化对重识别的影响,并验证合成几何先验在真实场景中的迁移性。

Comments 6 pages, 3 figures, accepted to the CVPR 2026 Workshop on Computer Vision for Animal Behavior Tracking and Modeling (CV4Animals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05149 2026-05-29 cs.CV

Multi-Scale Local Speculative Decoding for Image Generation

多尺度局部推测解码用于图像生成

Elia Peruzzo, Guillaume Sautière, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 提出多尺度局部推测解码(MuLo-SD)框架,通过低分辨率草稿模型与高分辨率目标模型结合、局部拒绝与重采样机制,加速自回归图像生成,实现高达5倍加速并保持语义对齐和感知质量。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21311 2026-05-29 cs.LG

Learning to Solve PDEs on Neural Shape Representations

在神经形状表示上学习求解偏微分方程

Lilian Welschinger, Yilin Liu, Zican Wang, Niloy Mitra

机构 * University College London(伦敦大学学院) Adobe Research(Adobe研究)

AI总结 提出一种无网格公式,学习基于神经局部形状属性的局部更新算子,直接在神经表示上求解表面偏微分方程,无需显式网格或逐实例优化,且保持可微性。

Comments Accepted at CVPR 2026. Project page: https://welschinger.github.io/Learning-to-Solve-PDEs-on-Neural-Shape-Representations/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29575 2026-05-29 cs.CV

Optimizing Latent Representations for Robust Building Damage Assessment Onboard Earth Observation Satellites

优化潜在表示以实现地球观测卫星上稳健的建筑物损坏评估

Thomas Goudemant, Benjamin Francesconi

AI总结 提出一种基于AI的星上系统,通过编码预灾图像为紧凑潜在表示并与灾后图像在轨比较,实现建筑物损坏的定位与分类,减少下行数据量并提高响应速度。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW 2026), Jun 2026, Denver, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29325 2026-05-29 cs.CV

Multi-Stage VLM Pipeline for Zero-Shot Traffic Accident Understanding

用于零样本交通事故理解的多阶段VLM流水线

Fumiya Tatematsu, Fumihiko Takahashi

机构 * GO Drive Inc(GO Drive公司)

AI总结 提出一个三阶段VLM流水线,在冻结的Qwen3-VL-32B-Instruct和235B MoE模型上实现零样本交通事故预测,通过9:1融合和车辆检测对齐赢得CVPR 2026 ACCIDENT挑战赛。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 13. Code: https://github.com/fuumin621/cvpr2026-accident-1st-place-solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29318 2026-05-29 cs.GR cs.CV

FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodes

FreeForm: 基于粒子蒙皮特征模态的降阶可变形仿真

Donglai Xiang, Vismay Modi, Rishit Dagli, Ty Trusty, Gilles Daviet, Anka He Chen, Nicholas Sharp, David I. W. Levin

机构 * NVIDIA University of Toronto(多伦多大学)

AI总结 提出一种基于再生核粒子法的无网格降阶超弹性物体仿真方法,通过求解弹性能量Hessian矩阵的广义特征系统构建降阶蒙皮权重,实现40倍训练加速并降低仿真误差。

Comments CVPR 2026, project website: https://research.nvidia.com/labs/sil/projects/freeform/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29136 2026-05-29 cs.CV cs.LG

Eulerian Gaussian Splatting using Hashed Probability Pyramids

使用哈希概率金字塔的欧拉高斯溅射

Mia Gaia Polansky, George Kopanas, Stephan Garbin, Todd Zickler, Dor Verbin

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

AI总结 提出一种基于概率溅射的辐射场框架,用梯度优化的体积概率密度替代启发式操作,通过多尺度哈希网格实现端到端优化,在mip-NeRF 360上达到SOTA重建质量并保持3DGS渲染速度。

Comments CVPR 2026. Project Page: https://euleriansplatting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29088 2026-05-29 cs.CV

A Deep Learning Iterative Framework for Sentinel-1 Stripmap Enhancement Based on Azimuth Doppler Decomposition

基于方位向多普勒分解的哨兵一号条带图增强深度学习迭代框架

Juan Francisco Amieva, Christian Ayala, Roberto Del Prete, Mikel Galar

机构 * Tracasa Instrumental S.L.(Tracasa仪器有限公司) European Space Agency(欧洲航天局) Public University of Navarre(纳瓦拉公共大学)

AI总结 提出一种基于方位子孔径分解的自监督增强框架,利用子孔径与全孔径图像之间的物理一致性生成训练数据,通过单/多帧学习和迭代推理逐步提升图像质量,在哨兵一号条带模式数据上优于MERLIN方法。

Comments Accepted at the AI4Space Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17176 2026-05-29 eess.SY cs.AI cs.SY math.OC

Intent-aligned Autonomous Spacecraft Guidance via Reasoning Models

通过推理模型实现意图对齐的自主航天器制导

Yuji Takubo, Simone D'Amico

机构 * Stanford University(斯坦福大学)

AI总结 提出一种通过行为序列和航点约束将高层推理与安全轨迹优化相结合的意图对齐航天器制导框架,在近距离操作场景中实现了超过90%的SCP收敛率,并比启发式决策高出1.5倍的满足顶级意图优先性能标准的轨迹生成率。

Comments Accepted for Computer Vision and Pattern Recognition Conference (CVPR) 2026, AI4Space Workshop (4-page Short paper). 9 pages, 3 figures (including supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27758 2026-05-29 cs.CV

RHO: Robust Holistic OSM-Based Metric Cross-View Geo-Localization

RHO: 基于OSM的鲁棒整体度量跨视角地理定位

Junwei Zheng, Ruize Dai, Ruiping Liu, Zichao Zeng, Yufan Chen, Fangjinhua Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工大学) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院) UCL(伦敦大学学院)

AI总结 提出RHO模型,利用全景图和OpenStreetMap进行度量跨视角地理定位,通过Split-Undistort-Merge模块处理全景畸变和Position-Orientation Fusion机制提升定位精度,在CV-RHO数据集上相比基线方法性能提升高达20%。

Comments Accepted by CVPR 2026. Project page: https://github.com/InSAI-Lab/RHO

详情

展开后加载摘要…

URL PDF HTML 收藏