arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-05 至 2026-03-05 共收录 21
2603.04291 2026-03-05 cs.CV cs.AI

CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video

CubeComposer: 从视角视频生成空间-时间自回归4K 360°视频

Lingen Li, Guangzhi Wang, Xiaoyu Li, Zhaoyang Zhang, Qi Dou, Jinwei Gu, Tianfan Xue, Ying Shan

机构 * The Chinese University of Hong Kong(香港中文大学) ARC Lab, Tencent PCG Project lead(腾讯PCG项目负责人)

AI总结 CubeComposer通过空间-时间自回归扩散模型实现4K分辨率360°视频生成,提升VR沉浸体验

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04265 2026-03-05 cs.CV

ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos

ViterbiPlanNet: 通过可微Viterbi注入过程性知识以在教学视频中进行规划

Luigi Seminara, Davide Moltisanti, Antonino Furnari

机构 * University of Catania(卡塔尼亚大学) University of Bath(巴斯大学)

AI总结 ViterbiPlanNet通过可微Viterbi层整合过程性知识,实现高效的教学视频规划,提升样本效率和鲁棒性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04254 2026-03-05 cs.CV

EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding

EmbodiedSplat: 在线前馈语义3DGS用于开放词汇3D场景理解

Seungjun Lee, Zihan Wang, Yunsong Wang, Gim Hee Lee

机构 * National University of Singapore(新加坡国立大学)

AI总结 EmbodiedSplat通过在线前馈3DGS实现开放词汇3D场景理解,结合CLIP编码和3D U-Net提升语义重建效率与泛化能力。

Comments CVPR 2026, Project Page: https://0nandon.github.io/EmbodiedSplat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04090 2026-03-05 cs.CV cs.GR cs.HC

EgoPoseFormer v2: Accurate Egocentric Human Motion Estimation for AR/VR

EgoPoseFormer v2:面向AR/VR的精准自体中心人体运动估计

Zhenyu Li, Sai Kumar Dwivedi, Filip Maric, Carlos Chacon, Nadine Bertsch, Filippo Arcadu, Tomas Hodan, Michael Ramamonjisoa, Peter Wonka, Amy Zhao, Robin Kips, Cem Keskin, Anastasia Tkach, Chenhongyi Yang

机构 * Meta KAUST Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

AI总结 EgoPoseFormer v2通过Transformer模型和自动标注系统,在AR/VR中实现更准确的自体中心人体运动估计,准确率提升12.2%-19.4%,时间抖动降低22.2%-51.7%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04002 2026-03-05 cs.CV cs.AI

Discriminative Perception via Anchored Description for Reasoning Segmentation

通过锚定描述实现的判别感知用于推理分割

Tao Yang, Qing Zhou, Yanliang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

AI总结 本文提出DPAD方法,通过生成描述性标题来增强推理分割的判别能力,提升推理链的聚焦性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03967 2026-03-05 cs.CV

UniRain: Unified Image Deraining with RAG-based Dataset Distillation and Multi-objective Reweighted Optimization

UniRain: 基于RAG的数据蒸馏和多目标重加权优化的统一图像去雨

Qianfeng Yang, Qiyuan Guan, Xiang Chen, Jiyu Jin, Guiyue Jin, Jiangxin Dong

机构 * Dalian Polytechnic University(大连理工大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 UniRain通过基于RAG的数据蒸馏和多目标重加权优化,实现统一图像去雨,有效应对不同雨损场景。

Comments Accepted by CVPR 2026; Project Page: https://github.com/QianfengY/UniRain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03960 2026-03-05 cs.RO cs.CV

Structural Action Transformer for 3D Dexterous Manipulation

结构动作变换器用于3D灵巧操作

Xiaohan Lei, Min Wang, Bohong Weng, Wengang Zhou, Houqiang Li

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

AI总结 本文提出结构动作变换器,通过结构化视角解决高自由度机械手的跨身体技能转移问题,实现更高效的灵巧操作。

Comments Accepted by CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03907 2026-03-05 cs.CV

Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks

细粒度图像审美评估:从相对排名学习判别分数

Zhichao Yang, Jianjie Wang, Zhixianhe Zhang, Pangu Xie, Xiangfei Sheng, Pengfei Chen, Leida Li

机构 * School of Artificial Intelligence(人工智能学院) State Key Laboratory of EMIM(电磁信息学国家重点实验室)

AI总结 本文提出FGAesthetics数据库和FGAesQ框架,通过细粒度排名学习提升图像审美评估的判别能力。

Comments The paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03857 2026-03-05 cs.CV

DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models

DeepScan: 一种无需训练的框架,用于大视觉-语言模型中的视觉引导推理

Yangfu Li, Hongjian Zhan, Jiawei Chen, Yuning Gong, Qi Liu, Yue Lu

机构 * East China Normal University(东华大学) Sichuan University(四川大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 DeepScan是一种无需训练的框架,通过层次扫描、聚焦和证据增强推理提升大视觉-语言模型在视觉任务中的表现。

Comments 18 pages 17 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03827 2026-03-05 cs.MM

Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition

通过层次语义表示进行进化多模态推理以实现意图识别

Qianrui Zhou, Hua Xu, Yunjin Gu, Yifan Wang, Songze Li, Hanlei Zhang

AI总结 HIER通过层次语义表示与进化推理提升多模态意图识别性能,实现更准确的意图推断。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03792 2026-03-05 cs.CV cs.LG

TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion Acceleration

TAP:一种用于无训练扩散加速的令牌自适应预测框架

Haowei Zhu, Tingxuan Huang, Xing Wang, Tianyu Zhao, Jiexi Wang, Weifeng Chen, Xurui Peng, Fangmin Chen, Junhai Yong, Bin Wang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 TAP通过为每个令牌自适应选择预测器,实现无训练的扩散模型加速,提升生成效率并减少感知质量损失。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03657 2026-03-05 cs.CV cs.AI

InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models

InEdit-Bench:智能图像编辑模型中间逻辑路径的基准测试

Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao

机构 * State Key Laboratory of Optical Field Manipulation Science and Technology, Institute of Optics and Electronics, Chinese Academy of Sciences(光学场操控科学与技术国家重点实验室,光学电子研究所,中国科学院) National Laboratory on Adaptive Optics(自适应光学国家实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 InEdit-Bench通过评估图像编辑模型在中间逻辑路径推理中的表现,揭示了现有模型在动态推理和多步骤演变建模方面的不足,推动更智能的多模态生成模型发展。

Comments CVPR findings. Project page: https://github.com/SZStrong1/InEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03615 2026-03-05 cs.CV

Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression

视差对齐所有内容:一种用于分布式多视图图像压缩的 OmniParallax 注意机制

Haotian Zhang, Feiyue Long, Yixin Yu, Jian Xue, Haocheng Tang, Tongda Xu, Zhenning Shi, Yan Wang, Siwei Ma, Jiaqi Zhang

机构 * The National Engineering Laboratory for Video Technology, School of Computer Science, Peking University(国家视频技术工程实验室,计算机科学学院,北京大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

AI总结 ParaHydra通过OmniParallax注意机制和多信息融合模块,实现了分布式多视图图像压缩的高效编码与解码,显著提升压缩效率并降低计算开销

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03101 2026-03-05 cs.CV cs.AI

MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detection

MoECLIP:面向零样本异常检测的补丁专业化专家

Jun Yeong Park, JunYoung Seo, Minji Kang, Yu Rang Park

机构 * Yonsei University(延世大学)

AI总结 MoECLIP通过补丁专业化专家架构提升零样本异常检测性能,采用动态路由和正交特征分离技术,实现更高效的异常检测。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17807 2026-03-05 cs.CV

VidEoMT: Your ViT is Secretly Also a Video Segmentation Model

VidEoMT:你的ViT其实也暗中是视频分割模型

Narges Norouzi, Idil Esen Zulfikar, Niccolò Cavagnero, Tommie Kerssies, Bastian Leibe, Gijs Dubbelman, Daan de Geus

机构 * Eindhoven University of Technology(埃因霍温理工大学) RWTH Aachen University(亚琛工业大学)

AI总结 VidEoMT通过轻量级查询传播和融合策略,实现无需专用跟踪模块的高效视频分割,速度提升5-10倍,精度与传统方法相当。

Comments CVPR 2026. Code: https://www.tue-mps.org/videomt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22235 2026-03-05 cs.AI

Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation

通过执行反馈强化学习训练高阶调度器以实现长周期GUI自动化

Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文提出CES多代理框架,通过训练高阶调度器解决GUI代理在长周期任务中的责任耦合和状态管理问题,提升任务规划与执行效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19524 2026-03-05 cs.CV cs.MA

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11538 2026-03-05 cs.CV

Reinforcing Video Reasoning Segmentation to Think Before It Segments

强化视频推理分割以在分割前思考

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu

AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。

Comments 12 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08492 2026-03-05 cs.CV

D2Dewarp: Dual Dimensions Geometric Representation Learning Based Document Image Dewarping

D2Dewarp: 基于双维度几何表示学习的文档图像去畸变

Heng Li, Xiangping Wu, Qingcai Chen

机构 * Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) PengCheng Laboratory(鹏城实验室)

AI总结 D2Dewarp通过双维度几何表示学习提升文档图像去畸变效果,提出细粒度变形感知模型和自动标注方法,构建新数据集并验证方法有效性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07510 2026-03-05 cs.CV quant-ph

Schrödinger's Camera: First Steps Towards a Quantum-Based Privacy Preserving Camera

薛定谔的相机:迈向基于量子的隐私保护相机的第一步

Hannah Kirkland, Sanjeev J. Koppal

AI总结 本文提出了一种基于量子态的隐私保护图像存储方法,并利用双深度Q学习算法实现对图像匿名化的控制,展示了在量子基础上平衡隐私与效用的可行性。

Journal ref 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 18-27

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03564 2026-03-05 cs.CV

Modeling Cross-vision Synergy for Unified Large Vision Model

跨视觉协同的统一大视觉模型建模

Shengqiong Wu, Lanhu Wu, Mingyang Bao, Wenhao Xu, Hanwang Zhang, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 PolyV通过统一架构和协同训练方法,实现了跨视觉模态的协同推理,显著提升了多模态视觉任务的性能。

Comments 21 pages, 9 figures, 16 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏