arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.15271 2026-03-17 cs.CV

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15206 2026-03-17 cs.CL cs.CV

Efficient Document Parsing via Parallel Token Prediction

通过并行标记预测实现高效的文档解析

Lei Li, Ze Zhao, Meng Li, Zhongwang Lun, Yi Yuan, Xingjing Lu, Zheng Wei, Jiang Bian, Zang Li

机构 * Platform and Content Group, Tencent(腾讯平台与内容组) Renmin University of China(中国人民大学)

AI总结 本文提出并行标记预测方法,通过在输入序列中插入可学习标记并设计训练目标,使VLM在文档解析中实现并行解码,提升解析速度并减少模型幻觉。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15185 2026-03-17 cs.RO cs.AI cs.CV

What Matters for Scalable and Robust Learning in End-to-End Driving Planners?

在端到端驾驶规划器中,可扩展性和鲁棒性学习中什么重要?

David Holtz, Niklas Hanselmann, Simon Doll, Marius Cordts, Bernt Schiele

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Max-Planck-Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC)

AI总结 本文研究了端到端驾驶规划器中可扩展性和鲁棒性学习的关键因素,提出BevAD架构在Bench2Drive基准上达到72.7%的成功率,展示了纯模仿学习的数据扩展能力。

Comments To be published in CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15169 2026-03-17 cs.RO

ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation

ForceVLA2:利用力-位置控制与力感知实现接触密集 manipulation

Yang Li, Zhaxizhuoma, Hongru Jiang, Junjie Xia, Hongquan Zhang, Jinda Du, Yunsong Zhou, Jia Zeng, Ce Hao, Jieji Ren, Qiaojun Yu, Cewu Lu, Yu Qiao, Jiangmiao Pang

AI总结 ForceVLA2通过力感知和混合力-位置控制提升接触密集 manipulation的稳定性与精度,实验显示其在五类任务中成功率提升48%和35%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15167 2026-03-17 cs.CV

Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding

基于记忆反馈的问题引导视觉压缩用于长期视频理解

Sosuke Yamao, Natsuki Miyahara, Yuankai Qi, Shun Takeuchi

机构 * Fujitsu Research(富士通研究实验室) Macquarie University(麦考瑞大学)

AI总结 本文提出QViC-MF框架,通过问题引导的多模态选择性注意力和记忆反馈提升长期视频理解性能,在多个基准测试中取得显著提升。

Comments Accepted to CVPR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15039 2026-03-17 cs.CV

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14885 2026-03-17 cs.CV

SpiralDiff: Spiral Diffusion with LoRA for RGB-to-RAW Conversion Across Cameras

SpiralDiff: 基于LoRA的Spiral扩散用于跨相机的RGB到RAW转换

Huanjing Yue, Shangbin Xie, Cong Cao, Qian Wu, Lei Zhang, Lei Zhao, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) State key laboratory of Smart Power Distribution Equipment and System, Tianjin University(天津大学智能电力分配设备与系统国家重点实验室)

AI总结 SpiralDiff通过信号依赖噪声加权策略和CamLoRA模块,提升跨相机RGB到RAW转换的重建质量及下游任务性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14880 2026-03-17 cs.CV

RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation

RealVLG-R1: 一个大规模真实世界视觉-语言接地基准,用于机器人感知与操作

Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

AI总结 本文提出RealVLG框架,结合RealVLG-11B数据集和RealVLG-R1模型,统一了真实世界视觉-语言接地与抓取任务,支持零样本感知与操作,提供全面的数据与评估平台。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14819 2026-03-17 cs.CV cs.AI

RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models

RAZOR:面向视觉变换器和扩散模型的比率感知层编辑以实现针对性遗忘

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

AI总结 RAZOR通过比率感知机制实现视觉变换器和扩散模型的针对性遗忘,通过多层和多头编辑提升模型安全性与合规性,实现高效且稳定的遗忘更新。

Comments 18 pages, 6 figures, 8 tables, accepted to the CVPR 2026 and to appear in the Findings Track Proceedings of IEEE/CVF Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03726 2026-03-17 cs.CV

QD-PCQA: Quality-Aware Domain Adaptation for Point Cloud Quality Assessment

QD-PCQA: 为点云质量评估的质量感知领域适应

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin

AI总结 本文提出QD-PCQA框架,通过Rank-weighted Conditional Alignment和Quality-guided Feature Augmentation策略提升点云质量评估的泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20501 2026-03-17 cs.CV

Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models

探索并弥合几何-交互线索以实现视觉基础模型中的可及性推理

Qing Zhang, Xuesong Li, Jing Zhang

AI总结 本文探讨了视觉基础模型中几何感知与交互感知对可及性推理的互补作用,通过融合DINO的几何原型与Flux的交互地图,实现了与弱监督方法相当的可及性估计。

Comments 11 pages, 12 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11782 2026-03-17 cs.CV

MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator

MatAnyone 2:通过学习的质量评估器扩展视频磨边

Peiqing Yang, Shangchen Zhou, Kai Hao, Qingyi Tao

AI总结 本文提出学习质量评估器MQE,用于无地面真实情况下评估alpha磨边的语义和边界质量,通过在线反馈和离线数据筛选构建大规模真实世界视频磨边数据集VMReal,实现高质量视频磨边。

Comments Accepted to CVPR 2026. Project page: https://pq-yang.github.io/projects/MatAnyone2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18706 2026-03-17 cs.CV

CoD: A Diffusion Foundation Model for Image Compression

CoD:一种面向图像压缩的扩散基础模型

Zhaoyang Jia, Zihan Zheng, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Houqiang Li, Yan Lu

AI总结 本文提出CoD,一种面向图像压缩的扩散基础模型,通过端到端优化提升压缩效率和生成质量,在超低比特率下实现SOTA结果,同时降低训练成本并提供新研究视角。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04673 2026-03-17 cs.AI cs.CV

Watch and Learn: Learning to Use Computers from Online Videos

观看并学习:从在线视频中学习使用计算机

Chan Hee Song, Yiwen Song, Palash Goyal, Yu Su, Oriana Riva, Hamid Palangi, Tomas Pfister

AI总结 本文提出Watch & Learn框架,通过大规模互联网视频生成高质量UI轨迹,提升计算机使用代理的任务规划能力,在OSWorld和WindowsAgentArena上取得显著成效。

Comments CVPR 2026; Project page: https://chanh.ee/wandl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07685 2026-03-17 cs.CV cs.AI cs.LG

Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought

增强推理的多模态链式推理

Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa

AI总结 本文提出RED方法,通过KL约束奖励最大化提升多模态链式推理的准确性和忠实度,实验表明其在多个基准和模型上显著优于传统方法。

Comments Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22636 2026-03-17 cs.CV

Precise Object and Effect Removal with Adaptive Target-Aware Attention

精确的对象和效果移除与自适应目标感知注意力

Jixin Zhao, Zhouxia Wang, Peiqing Yang, Shangchen Zhou

AI总结 本文提出ObjectClear框架,通过自适应目标感知注意力机制分离前景移除与背景重建,提升对象及其效果的精确移除与背景保真度,同时构建OBER数据集用于训练和评估。

Comments Accepted to CVPR 2026. Project page: https://zjx0101.github.io/projects/ObjectClear/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18328 2026-03-17 cs.CV cs.AI

Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantised Code

通过填补任意量化代码实现脑部MRI的虚拟全栈扫描

Yicheng Wu, Tao Song, Zhonghua Wu, Jin Ye, Zongyuan Ge, Wenjia Bai, Zhaolin Chen, Jianfei Cai

AI总结 本文提出CodeBrain框架,通过区域级全栈代码预测解决MRI模态缺失问题,提升数据完整性和临床实用性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05264 2026-03-17 cs.CV cs.AI

Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation

迈向3D人体姿态估计中多模态学习的平衡

Mengshi Qi, Jiaxuan Peng, Xianlin Zhang, Huadong Ma

AI总结 本文提出一种平衡多模态学习方法,利用RGB、LiDAR、毫米波和WiFi数据,通过Shapley值算法评估模态贡献并解决模态不平衡问题,提升复杂环境下3D姿态估计性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14772 2026-03-17 cs.CV

Zero-Shot Reconstruction of Animatable 3D Avatars with Cloth Dynamics from a Single Image

从单张图像零样本重建可动画的3D人像并包含布料动态

Joohyun Kwon, Geonhee Sim, Gyeongsik Moon

AI总结 本文提出DynaAvatar框架,通过单张图像重建具有运动依赖布料动态的可动画3D人像,利用Transformer架构和知识迁移策略提升布料动态建模能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14741 2026-03-17 cs.CV

PHAC: Promptable Human Amodal Completion

PHAC: 可提示的人形不可见区域补全

Seung Young Noh, Ju Yong Chang

AI总结 本文提出PHAC任务,通过满足可见外观约束和多用户提示完成遮挡人像,使用ControlNet模块编码提示信号并微调交叉注意力块以提升提示对齐性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14726 2026-03-17 cs.CV

Enhancing Hands in 3D Whole-Body Pose Estimation with Conditional Hands Modulator

通过条件手模块增强3D全身姿态估计中的手部

Gyeongsik Moon

AI总结 本文提出Hand4Whole++框架,结合预训练全身和手部姿态估计器,通过条件手模块提升手部姿态准确性与全身姿态一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14684 2026-03-17 cs.CV

E2EGS: Event-to-Edge Gaussian Splatting for Pose-Free 3D Reconstruction

E2EGS:基于事件的边缘高斯点云化用于无姿态3D重建

Yunsoo Kim, Changki Sung, Dasol Hong, Hyun Myung

AI总结 E2EGS通过利用事件流中的边缘信息,提出无姿态3D重建框架,提升动态场景下的重建质量和轨迹精度。

Comments 10 pages, 6 figures, accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14297 2026-03-17 cs.CV

RL-ScanIQA: Reinforcement-Learned Scanpaths for Blind 360°Image Quality Assessment

RL-ScanIQA: 基于强化学习的盲360°图像质量评估扫描路径

Yujia Wang, Yuyan Li, Jiuming Liu, Fang-Lue Zhang, Xinhu Zheng, Neil. A Dodgson

AI总结 本文提出RL-ScanIQA框架,通过强化学习优化扫描路径策略和质量评估器,结合多级奖励和跨数据集鲁棒性提升方法,实现盲360°图像质量评估的端到端优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14238 2026-03-17 cs.LG cs.MM

Domain-Skewed Federated Learning with Feature Decoupling and Calibration

领域偏移联邦学习与特征解耦与校准

Huan Wang, Jun Shen, Jun Yan, Guansong Pang

AI总结 本文提出F^2DC方法,通过解耦和校准领域偏移特征,提升多领域联邦学习中模型的一致性和泛化能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14176 2026-03-17 cs.CV

BluRef: Unsupervised Image Deblurring with Dense-Matching References

BluRef: 无监督图像去模糊与密集匹配参考

Bang-Dang Pham, Anh Tran, Cuong Pham, Minh Hoai

AI总结 本文提出一种无监督图像去模糊方法,利用简单数据收集流程生成伪真实数据,无需配对数据即可提升去模糊效果,适用于不同场景和设备。

Comments Accepted to CVPR 2026. Project page: https://qualcomm-ai-research.github.io/BluRef/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14153 2026-03-17 cs.CV

Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories

Garments2Look:用于高保真服装级虚拟试穿的多参考数据集

Junyao Hu, Zhongwei Cheng, Waikeung Wong, Xingxing Zou

AI总结 本文提出Garments2Look数据集,用于高保真的服装级虚拟试穿,包含8万对多件服装到一套搭配的样本,涵盖40大类和300+细分类别,通过合成流程提升数据质量和任务难度,验证现有方法在完整服装试穿和层叠推断上的不足。

Comments CVPR 2026; Project Page: https://artmesciencelab.github.io/Garments2Look

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14001 2026-03-17 cs.CV

PhyGaP: Physically-Grounded Gaussians with Polarization Cues

PhyGaP:基于极化线索的物理 grounded 高斯分布

Jiale Wu, Xiaoyang Bai, Zongqi He, Weiwei Xu, Yifan Peng

AI总结 PhyGaP利用极化线索改进3D高斯分布,通过极化延迟渲染和网格映射技术实现高精度反射分解和逼真光照重映射,实验表明其在反射3D物体重建和逆渲染方面表现优异。

Comments The paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11618 2026-03-17 cs.CV cs.LG

Shape-of-You: Fused Gromov-Wasserstein Optimal Transport for Semantic Correspondence in-the-Wild

Shape-of-You: 基于融合Gromov-Wasserstein最优传输的语义对应研究

Jiin Im, Sisung Liu, Je Hyeong Hong

AI总结 本文提出Shape-of-You框架,通过融合Gromov-Wasserstein优化传输解决语义对应问题,利用3D基础模型提升几何结构一致性,通过软目标损失增强鲁棒性,在SPair-71k和AP-10k数据集上取得新突破。

Comments Accepted at CVPR 2026. Supplementary material included after references. 18 pages, 11 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏