arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-13 至 2026-03-13 共收录 24
2603.12267 2026-03-13 cs.CV

EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation

EVATok: 适应性长度视频分块化以实现高效的视觉自回归生成

Tianwei Xiong, Jun Hao Liew, Zilong Huang, Zhijie Lin, Jiashi Feng, Xihui Liu

AI总结 EVATok通过自适应分块器提升视频重建和自回归生成的效率与质量,实现令牌使用量减少24.4%。

Comments Accepted by CVPR 2026. Project page: https://silentview.github.io/EVATok/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12254 2026-03-13 cs.CV

Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

先关注再注意:通过自回归注视实现高效的可扩展视频理解

Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Boyi Li, Jan Kautz, Song Han, David M. Chan, Pavlo Molchanov, Trevor Darrell, Hongxu Yin

机构 * UC Berkeley(伯克利大学) MIT(麻省理工学院) Clarifai(Clarifai公司) NVIDIA(英伟达公司)

AI总结 AutoGaze通过自回归选择视频中的关键块,减少冗余并提升处理效率,使大语言模型能处理长视频并取得更优表现。

Comments CVPR 2026. Project page: https://autogaze.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12240 2026-03-13 cs.CV cs.LG

BiGain: Unified Token Compression for Joint Generation and Classification

BiGain:联合生成与分类的统一标记压缩

Jiacheng Liu, Shengkun Tang, Jiacheng Cui, Dongkuan Xu, Zhiqiang Shen

机构 * VILA Lab, MBZUAI(MBZUAI视觉实验室) North Carolina State University(北卡罗来纳州立大学)

AI总结 BiGain通过频率分离技术,实现生成与分类的统一标记压缩,提升扩散模型的加速性能和分类准确率,同时保持生成质量。

Comments CVPR 2026. Code: https://github.com/Greenoso/BiGain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12217 2026-03-13 cs.CV

Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

现实世界点跟踪中的验证者引导伪标签方法

Görkay Aydemir, Fatma Güney, Weidi Xie

机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) KUIS AI Center(KUIS人工智能中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12193 2026-03-13 cs.RO cs.CV

SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics

SaPaVe:迈向视觉-语言-动作模型中的主动感知与操作

Mengzhen Liu, Enshen Zhou, Cheng Chi, Yi Han, Shanyu Rong, Liming Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学) School of Software, Beihang University(软件学院,北航) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 SaPaVe通过解耦相机与操作动作,结合自下而上训练策略,实现高效且可推广的主动感知与操作,在现实任务中成功率达31.25%。

Comments Accepted to CVPR 2026. See project page at https://lmzpai.github.io/SaPaVe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12138 2026-03-13 cs.CV

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

HATS: 为GUI代理的硬度感知轨迹合成

Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

AI总结 HATS通过硬度感知轨迹合成框架,解决GUI代理训练中语义模糊性问题,提升任务执行鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12083 2026-03-13 cs.CV cs.RO eess.IV physics.optics

Towards Universal Computational Aberration Correction in Photographic Cameras: A Comprehensive Benchmark Analysis

面向摄影相机通用计算畸变校正的综合基准分析

Xiaolong Qian, Qi Jiang, Yao Gao, Lei Sun, Zhonghua Yi, Kailun Yang, Luc Van Gool, Kaiwei Wang

AI总结 本文提出UniCAC基准,通过自动光学设计构建,评估24种图像修复和CAC算法,识别影响性能的关键因素,为摄影相机通用计算畸变校正提供基础研究支持。

Comments Accepted to CVPR 2026. Benchmarks, codes, and Zemax files will be available at https://github.com/XiaolongQian/UniCAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10929 2026-03-13 cs.CV cs.RO

Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment

持续模仿学习与多模态潜在回放及渐进调整

Fanqi Yu, Matteo Tiezzi, Tommaso Apicella, Cigdem Beyan, Vittorio Murino

AI总结 本文提出了一种持续模仿学习方法,通过多模态潜在空间回放和渐进特征调整机制,在现实约束下实现持续策略优化,提升了在LIBERO基准上的性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11676 2026-03-13 cs.NE cs.AI

Stable Spike: Dual Consistency Optimization via Bitwise AND Operations for Spiking Neural Networks

稳定尖峰:通过位运算的双一致性优化用于脉冲神经网络

Yongqi Ding, Kunshan Yang, Linze Li, Yiyang Zhang, Mengmeng Jing, Lin Zuo

AI总结 本文提出通过位运算的双一致性优化方法,提升脉冲神经网络在超低延迟下的对象识别性能,准确率提升达8.33%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11675 2026-03-13 cs.CV

PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

PROMO: 可提示的高效高保真虚拟试衣

Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu

AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11605 2026-03-13 cs.CV

LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

LaMoGen:通过LLM引导的符号推理实现语言到动作生成

Junkun Jiang, Ho Yin Au, Jingyu Xiang, Jie Chen

机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)

AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。

Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11521 2026-03-13 cs.CV cs.AI

EReCu: Pseudo-label Evolution Fusion and Refinement with Multi-Cue Learning for Unsupervised Camouflage Detection

EReCu: 多线索学习下的伪标签演化融合与精炼用于无监督伪装检测

Shuo Jiang, Gaojia Zhang, Min Tan, Yufei Yin, Gang Pan

AI总结 EReCu提出了一种统一的无监督伪装检测框架,通过多线索学习提升伪标签可靠性与特征保真度,结合原生感知模块、伪标签演化融合和局部精炼,实现高精度的伪装检测。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11492 2026-03-13 cs.CV cs.AI

SPEGC: Continual Test-Time Adaptation via Semantic-Prompt-Enhanced Graph Clustering for Medical Image Segmentation

SPEGC:通过语义提示增强图聚类实现持续测试时间适应用于医学图像分割

Xiaogang Du, Jiawei Zhang, Tongfei Liu, Tao Lei, Yingbo Wang

AI总结 SPEGC通过语义提示增强图聚类方法,提升医学图像分割中持续测试时间适应的鲁棒性和性能。

Comments Accepted to CVPR 2026. 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11439 2026-03-13 cs.CV

Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning

Stay in your Lane: 角色特定查询与重叠抑制损失用于密集视频描述

Seung Hyup Baek, Jimin Lee, Hyeongkeun Lee, Jae Won Cho

机构 * Konkuk University(韩国康 kuk 大学) Sejong University(世宗大学) KAIST(韩国科学技术院)

AI总结 本文提出角色特定查询与重叠抑制损失,用于解决密集视频描述中的多任务干扰和时间冗余问题,通过分离定位与描述任务并增强语义一致性,提升描述精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11174 2026-03-13 cs.CV

GGPT: Geometry Grounded Point Transformer

GGPT:基于几何的点变换

Yutong Chen, Yiming Wang, Xucong Zhang, Sergey Prokudin, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学)

AI总结 GGPT通过引入几何引导的点变换,结合密集前馈预测与显式几何约束,实现了更准确且一致的3D重建,提升了细粒度结构恢复和无纹理区域填补能力。

Comments CVPR 2026, Project website: https://chenyutongthu.github.io/research/ggpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11106 2026-03-13 cs.CV cs.RO

RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation

RC-NF:基于机器人条件的归一化流用于机器人操作中的实时异常检测

Shijie Zhou, Bin Zhu, Jiarui Yang, Xiangyu Zhao, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Singapore Management University(新加坡国立大学)

AI总结 RC-NF通过实时监控机器人状态和物体运动轨迹,提升VLA系统在动态环境中的鲁棒性和适应性,实现异常检测与干预。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10354 2026-03-13 cs.CV

StyleGallery: Training-free and Semantic-aware Personalized Style Transfer from Arbitrary Image References

StyleGallery: 无需训练且语义感知的任意图像参考个性化风格迁移

Boyu He, Yunfan Ye, Chang Liu, Weishang Wu, Fang Liu, Zhiping Cai

AI总结 StyleGallery通过语义感知和无需训练的框架,实现任意图像参考的个性化风格迁移,提升内容保留与风格化平衡能力。

Comments 18 pages, 23 figures, Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04848 2026-03-13 cs.RO

Hyperbolic Multiview Pretraining for Robotic Manipulation

双曲多视角预训练用于机器人操作

Jin Yang, Ping Wei, Yixin Chen, Nanning Zheng

AI总结 本文提出HyperMVP,一种基于双曲空间的多视角自监督预训练框架,通过GeoLink编码器学习结构化嵌入,提升机器人操作任务的性能。

Comments This paper was submitted to CVPR 2026 and was recommended for Findings, but the authors have withdrawn it and are currently adding more content to submit it elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01685 2026-03-13 cs.CV

FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters

FastLightGen: 用更少的步骤和参数实现快速轻量视频生成

Shitong Shao, Yufei Gu, Zeke Xie

AI总结 FastLightGen通过同时压缩模型大小和推理步骤,实现快速轻量视频生成,实验表明其在受限预算下达到最优视觉质量并超越现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20299 2026-03-13 cs.RO cs.AI cs.CV

KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System

KnowVal: 一种知识增强且价值引导的自动驾驶系统

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) University of California, Merced(加州大学默塞德分校)

AI总结 KnowVal通过整合开放世界感知与知识检索,构建驾驶知识图谱并训练价值模型,实现价值对齐的自动驾驶系统,提升了规划性能并降低了碰撞率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11851 2026-03-13 cs.CV cs.CR

Defending Unauthorized Model Merging via Dual-Stage Weight Protection

通过双阶段权重保护防御未经授权的模型合并

Wei-Jia Chen, Min-Yen Tsai, Cheng-Yi Lee, Chia-Mu Yu

机构 * National Yang Ming Chiao Tung University Academia Sinica

AI总结 MergeGuard通过双阶段权重保护框架,有效防御未经授权的模型合并,减少合并模型准确性达90%,同时保持受保护模型性能损失低于1.5%。

Comments Accepted at CVPR 2026, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14894 2026-03-13 cs.CV

Enhancing accuracy of uncertainty estimation in appearance-based gaze tracking with probabilistic evaluation and calibration

通过概率评估和校准提升基于外观的注视跟踪中不确定性估计的准确性

Qiaojie Zheng, Jiucai Zhang, Xiaoli Zhang

AI总结 本文提出了一种基于概率评估和校准的方法,用于提升基于外观的注视跟踪中不确定性估计的准确性,通过引入严格评价指标和修正策略来减少模型偏差并提高性能。

Comments 9 pages, 7 figures, 2 tables, to appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏