arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2603.10929 2026-03-13 cs.CV cs.RO

Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment

持续模仿学习与多模态潜在回放及渐进调整

Fanqi Yu, Matteo Tiezzi, Tommaso Apicella, Cigdem Beyan, Vittorio Murino

AI总结 本文提出了一种持续模仿学习方法,通过多模态潜在空间回放和渐进特征调整机制,在现实约束下实现持续策略优化,提升了在LIBERO基准上的性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11676 2026-03-13 cs.NE cs.AI

Stable Spike: Dual Consistency Optimization via Bitwise AND Operations for Spiking Neural Networks

稳定尖峰:通过位运算的双一致性优化用于脉冲神经网络

Yongqi Ding, Kunshan Yang, Linze Li, Yiyang Zhang, Mengmeng Jing, Lin Zuo

AI总结 本文提出通过位运算的双一致性优化方法,提升脉冲神经网络在超低延迟下的对象识别性能,准确率提升达8.33%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11675 2026-03-13 cs.CV

PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

PROMO: 可提示的高效高保真虚拟试衣

Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu

AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11605 2026-03-13 cs.CV

LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

LaMoGen:通过LLM引导的符号推理实现语言到动作生成

Junkun Jiang, Ho Yin Au, Jingyu Xiang, Jie Chen

机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)

AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。

Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11521 2026-03-13 cs.CV cs.AI

EReCu: Pseudo-label Evolution Fusion and Refinement with Multi-Cue Learning for Unsupervised Camouflage Detection

EReCu: 多线索学习下的伪标签演化融合与精炼用于无监督伪装检测

Shuo Jiang, Gaojia Zhang, Min Tan, Yufei Yin, Gang Pan

AI总结 EReCu提出了一种统一的无监督伪装检测框架,通过多线索学习提升伪标签可靠性与特征保真度,结合原生感知模块、伪标签演化融合和局部精炼,实现高精度的伪装检测。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11492 2026-03-13 cs.CV cs.AI

SPEGC: Continual Test-Time Adaptation via Semantic-Prompt-Enhanced Graph Clustering for Medical Image Segmentation

SPEGC:通过语义提示增强图聚类实现持续测试时间适应用于医学图像分割

Xiaogang Du, Jiawei Zhang, Tongfei Liu, Tao Lei, Yingbo Wang

AI总结 SPEGC通过语义提示增强图聚类方法,提升医学图像分割中持续测试时间适应的鲁棒性和性能。

Comments Accepted to CVPR 2026. 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11439 2026-03-13 cs.CV

Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning

Stay in your Lane: 角色特定查询与重叠抑制损失用于密集视频描述

Seung Hyup Baek, Jimin Lee, Hyeongkeun Lee, Jae Won Cho

机构 * Konkuk University(韩国康 kuk 大学) Sejong University(世宗大学) KAIST(韩国科学技术院)

AI总结 本文提出角色特定查询与重叠抑制损失,用于解决密集视频描述中的多任务干扰和时间冗余问题,通过分离定位与描述任务并增强语义一致性,提升描述精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11174 2026-03-13 cs.CV

GGPT: Geometry Grounded Point Transformer

GGPT:基于几何的点变换

Yutong Chen, Yiming Wang, Xucong Zhang, Sergey Prokudin, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学)

AI总结 GGPT通过引入几何引导的点变换,结合密集前馈预测与显式几何约束,实现了更准确且一致的3D重建,提升了细粒度结构恢复和无纹理区域填补能力。

Comments CVPR 2026, Project website: https://chenyutongthu.github.io/research/ggpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11106 2026-03-13 cs.CV cs.RO

RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation

RC-NF:基于机器人条件的归一化流用于机器人操作中的实时异常检测

Shijie Zhou, Bin Zhu, Jiarui Yang, Xiangyu Zhao, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Singapore Management University(新加坡国立大学)

AI总结 RC-NF通过实时监控机器人状态和物体运动轨迹,提升VLA系统在动态环境中的鲁棒性和适应性,实现异常检测与干预。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10354 2026-03-13 cs.CV

StyleGallery: Training-free and Semantic-aware Personalized Style Transfer from Arbitrary Image References

StyleGallery: 无需训练且语义感知的任意图像参考个性化风格迁移

Boyu He, Yunfan Ye, Chang Liu, Weishang Wu, Fang Liu, Zhiping Cai

AI总结 StyleGallery通过语义感知和无需训练的框架,实现任意图像参考的个性化风格迁移,提升内容保留与风格化平衡能力。

Comments 18 pages, 23 figures, Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04848 2026-03-13 cs.RO

Hyperbolic Multiview Pretraining for Robotic Manipulation

双曲多视角预训练用于机器人操作

Jin Yang, Ping Wei, Yixin Chen, Nanning Zheng

AI总结 本文提出HyperMVP,一种基于双曲空间的多视角自监督预训练框架,通过GeoLink编码器学习结构化嵌入,提升机器人操作任务的性能。

Comments This paper was submitted to CVPR 2026 and was recommended for Findings, but the authors have withdrawn it and are currently adding more content to submit it elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01685 2026-03-13 cs.CV

FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters

FastLightGen: 用更少的步骤和参数实现快速轻量视频生成

Shitong Shao, Yufei Gu, Zeke Xie

AI总结 FastLightGen通过同时压缩模型大小和推理步骤,实现快速轻量视频生成,实验表明其在受限预算下达到最优视觉质量并超越现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20299 2026-03-13 cs.RO cs.AI cs.CV

KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System

KnowVal: 一种知识增强且价值引导的自动驾驶系统

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) University of California, Merced(加州大学默塞德分校)

AI总结 KnowVal通过整合开放世界感知与知识检索,构建驾驶知识图谱并训练价值模型,实现价值对齐的自动驾驶系统,提升了规划性能并降低了碰撞率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11851 2026-03-13 cs.CV cs.CR

Defending Unauthorized Model Merging via Dual-Stage Weight Protection

通过双阶段权重保护防御未经授权的模型合并

Wei-Jia Chen, Min-Yen Tsai, Cheng-Yi Lee, Chia-Mu Yu

机构 * National Yang Ming Chiao Tung University Academia Sinica

AI总结 MergeGuard通过双阶段权重保护框架,有效防御未经授权的模型合并,减少合并模型准确性达90%,同时保持受保护模型性能损失低于1.5%。

Comments Accepted at CVPR 2026, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14894 2026-03-13 cs.CV

Enhancing accuracy of uncertainty estimation in appearance-based gaze tracking with probabilistic evaluation and calibration

通过概率评估和校准提升基于外观的注视跟踪中不确定性估计的准确性

Qiaojie Zheng, Jiucai Zhang, Xiaoli Zhang

AI总结 本文提出了一种基于概率评估和校准的方法,用于提升基于外观的注视跟踪中不确定性估计的准确性,通过引入严格评价指标和修正策略来减少模型偏差并提高性能。

Comments 9 pages, 7 figures, 2 tables, to appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07789 2026-03-12 cs.CV

SGI: Structured 2D Gaussians for Efficient and Compact Large Image Representation

SGI:结构化二维高斯用于高效且紧凑的大图像表示

Zixuan Pan, Kaiyuan Tang, Jun Xia, Yifan Qin, Lin Gu, Chaoli Wang, Jianxu Chen, Yiyu Shi

机构 * University of Notre Dame(诺丁汉大学) Tohoku University(东洋大学) Leibniz-Institut für Analytische Wissenschaften – ISAS – e.V.(莱比锡分析科学研究所 – ISAS – e.V.)

AI总结 SGI通过结构化二维高斯方法实现高效且紧凑的大图像表示,实现高达7.5倍的压缩和1.6倍的优化速度,同时保持图像保真度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03281 2026-03-12 cs.CV cs.LG

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

CFG-Ctrl: 基于控制的分类器自由扩散引导

Hanyang Wang, Yiyang Liu, Jiawei Chi, Fangfu Liu, Ran Xue, Yueqi Duan

AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。

Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10872 2026-03-12 cs.CV

Bilevel Layer-Positioning LoRA for Real Image Dehazing

双层层位定位LoRA用于真实图像去雾

Yan Zhang, Long Ma, Yuxin Feng, Zhe Huang, Fan Zhou, Zhuo Su

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) National Engineering Research Center of Digital Life(数字生活国家工程研究中心) Dalian University of Technology(大连理工大学) Xidian University(西安电子科技大学)

AI总结 本文提出双层层位定位LoRA方法,通过文本引导损失和自动层搜索提升真实图像去雾的适应性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10780 2026-03-12 cs.CV

Guiding Diffusion Models with Semantically Degraded Conditions

通过语义退化条件引导扩散模型

Shilong Han, Yuming Zhang, Hongxia Wang

机构 * College of Science, National University of Defense Technology(国防科技大学理学院)

AI总结 通过语义退化条件引导扩散模型,提升文本图像对齐与组合准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10597 2026-03-12 cs.RO cs.AI

Recover to Predict: Progressive Retrospective Learning for Variable-Length Trajectory Prediction

恢复以预测:渐进性回顾学习用于可变长度轨迹预测

Hao Zhou, Lu Qi, Jason Li, Jie Zhang, Yi Liu, Xu Yang, Mingyu Fan, Fei Luo

机构 * Great Bay University(大湾大学) Tsinghua SIGS(清华大学SIGS) Wuhan University(武汉大学) NTU(国立科技大学) Donghua University(东华大学) CASIA(中国科学院自动化研究所)

AI总结 本文提出渐进回顾框架和滚动起始训练策略,用于解决可变长度轨迹预测中的信息缺口问题,提升预测准确性。

Comments Paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10583 2026-03-12 cs.CV

Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

属性作为检索:模型无关的AI生成图像属性

Hongsong Wang, Renxi Cheng, Chaolei Han, Jie Gui

AI总结 本文提出了一种模型无关的AI生成图像归因方法LIDA,通过实例检索问题解决深度伪造检测和图像归因的挑战。

Comments To appear in CVPR 2026, Code is at https://github.com/hongsong-wang/LIDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10538 2026-03-12 cs.CV

DSFlash: Comprehensive Panoptic Scene Graph Generation in Realtime

DSFlash:实时生成全景场景图

Julian Lorenz, Vladyslav Kovganko, Elias Kohout, Mrunmai Phatak, Daniel Kienzle, Rainer Lienhart

机构 * University of Augsburg(奥格斯堡大学)

AI总结 DSFlash是一种低延迟、资源高效的实时全景场景图生成模型,能够以高帧率处理视频流并提供更丰富的上下文信息。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10526 2026-03-12 cs.CV

Sparse Task Vector Mixup with Hypernetworks for Efficient Knowledge Transfer in Whole-Slide Image Prognosis

通过超网络实现的稀疏任务向量混合用于全滑片图像预后中的高效知识转移

Pei Liu, Xiangxiang Zeng, Tengfei Ma, Yucheng Xing, Xuanbai Ren, Yiping Liu

AI总结 STEPH通过超网络实现稀疏任务向量混合,提升全滑片图像预后中的知识转移效率

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10470 2026-03-12 cs.CV

Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression

用反事实对抗幻觉:基于扩散引导的扰动用于LVLM幻觉抑制

Hamidreza Dastmalchi, Aijun An, Ali Cheraghian, Hamed Barzamini

机构 * York University(约克大学) Macquarie University(麦考瑞大学) Northern Illinois University(北伊利诺伊大学)

AI总结 CIPHER通过反事实图像扰动减少LVLM中的视觉幻觉,提升模型忠实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10341 2026-03-12 cs.LG cs.AI

Federated Active Learning Under Extreme Non-IID and Global Class Imbalance

极端非独立同分布与全局类别不平衡下的联邦主动学习

Chen-Chen Zong, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 FairFAL通过自适应类别公平机制,在极端非IID和全局类别不平衡环境下提升联邦主动学习性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09771 2026-03-12 cs.CV cs.AI

Ego: Embedding-Guided Personalization of Vision-Language Models

Ego:基于嵌入的视觉-语言模型个性化

Soroush Seifi, Simon Gardier, Vaggelis Dorovatas, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

AI总结 本文提出了一种基于模型内部机制的高效视觉-语言模型个性化方法,通过提取目标概念的视觉标记实现个性化描述与记忆。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18867 2026-03-12 cs.CV

Similarity-as-Evidence: Calibrating Overconfident VLMs for Interpretable and Label-Efficient Medical Active Learning

相似性作为证据:校准过度自信的视觉语言模型以实现可解释且标注高效的医学主动学习

Zhuofan Xie, Zishan Lin, Jinliang Lin, Jie Qi, Shaohua Hong, Shuo Li

机构 * School of Electronic Technology and Engineering, Xiamen University, Xiamen, China(厦门大学电子技术与工程学院,厦门,中国) School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院,厦门,中国) School of Engineering, Case Western Reserve University, Cleveland, USA(凯斯西储大学工程学院,克利夫兰,美国)

AI总结 SaE框架通过引入相似性证据头校准视觉语言模型,以提高医学主动学习的可解释性和标注效率。

Comments Accepted to CVPR 2026 (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏