arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2602.23229 2026-02-27 cs.CV

Large Multimodal Models as General In-Context Classifiers

大多模态模型作为通用上下文分类器

Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci

AI总结 本文提出CIRCLE方法,通过伪标签迭代优化,使LMM在开放世界分类中超越VLM,展示LMM作为统一分类器的潜力。

Comments CVPR Findings 2026. Project website at https://circle-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23120 2026-02-27 cs.CV

TriLite: Efficient Weakly Supervised Object Localization with Universal Visual Features and Tri-Region Disentanglement

TriLite: 基于通用视觉特征和三区域解耦的高效弱监督物体定位

Arian Sabaghi, José Oramas

机构 * University of Antwerp(安特卫普大学) sqIRL/IDLab imec Antwerp(Antwerp imec)

AI总结 TriLite通过自监督学习和三区域解耦实现高效弱监督物体定位,无需端到端训练,参数更高效且训练更简单。

Comments This paper consists of 8 pages including 6 figures. Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22917 2026-02-27 cs.CV

Towards Multimodal Domain Generalization with Few Labels

迈向少标签多模态领域泛化的研究

Hongzhao Li, Hao Dong, Hualei Wan, Shupan Li, Mingliang Xu, Muhammad Haris Khan

机构 * Zhengzhou University(郑州大学) ETH Zürich(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克智能系统研究所)

AI总结 本文提出SSMDG框架,通过三个关键组件实现少标签多模态领域泛化,提升跨模态鲁棒性和领域不变性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22862 2026-02-27 cs.RO cs.CV

GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion

GraspLDP: 通过潜在扩散实现通用抓取策略

Enda Xiang, Haoxiang Ma, Xinzhu Ma, Zicheng Liu, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院)

AI总结 GraspLDP通过引入潜在扩散框架和抓取先验知识,提升了抓取策略的精度和泛化能力,实验表明其在动态抓取任务中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22819 2026-02-27 cs.CV

Face Time Traveller : Travel Through Ages Without Losing Identity

面容时间旅行者:无需丢失身份即可穿越年龄

Purbayan Kar, Ayush Ghadiya, Vishal Chudasama, Pankaj Wasnik, C. V. Jawahar

机构 * Sony Research India(索尼印度研究实验室) IIIT Hyderabad(Hyderabad 研究学院)

AI总结 FaceTT通过基于扩散的框架实现高保真身份一致的年龄变换,引入了Face-Attribute-Aware Prompt Refinement策略、无调优的Angular Inversion方法和自适应注意力控制机制,提升了年龄变换的精度和稳定性。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22727 2026-02-27 cs.CV

HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models

HulluEdit: 单次通过证据一致子空间编辑用于缓解大视觉-语言模型中的幻觉

Yangguang Lin, Quan Fang, Yufei Li, Jiachen Sun, Junyu Gao, Jitao Sang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Jiaotong University(北京交通大学)

AI总结 HulluEdit通过单次通过的正交子空间编辑方法,有效缓解大视觉-语言模型中的幻觉问题,实现了最先进的幻觉减少效果。

Comments accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22716 2026-02-27 cs.CV cs.AI

SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

SoPE: 基于球坐标的位置嵌入:增强3D大视觉-语言模型的空间感知

Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen

机构 * University of Macau(澳门大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

AI总结 SoPE通过基于球坐标的位置嵌入提升3D LVLMs的空间感知能力,结合多尺度频率混合策略,增强几何表示的一致性和表达性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20903 2026-02-27 cs.CV

TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering

TextPecker: 通过奖励结构异常量化提升视觉文本渲染

Hanshen Zhu, Yuliang Liu, Xuecheng Wu, An-Lan Wang, Hao Feng, Dingkang Yang, Chao Feng, Can Huang, Jingqun Tang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) ByteDance(字节跳动)

AI总结 TextPecker通过结构异常感知强化学习策略提升视觉文本渲染的结构忠实度和语义对齐度。

Comments Accepted by CVPR 2026; Code: https://github.com/CIawevy/TextPecker

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18897 2026-02-27 cs.CV

Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs

超越标签:基于推理增强的LMMs的无词汇细粒度识别

Dmitry Demidov, Zaigham Zaheer, Zongyan Han, Omkar Thawakar, Rao Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 FiNDR通过推理增强的LMMs实现无词汇细粒度识别,提出三步流程生成候选标签、过滤排名并构建轻量级分类器,取得显著性能提升。

Journal ref CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10981 2026-02-27 cs.CV

CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models

无需CLIP、无需标签的无监督概念瓶颈模型

Fawaz Sammani, Jonas Fischer, Nikos Deligiannis

机构 * Max-Planck-Institut für Informatik(马克斯·普朗克研究所) ETRO Department, Vrije Universiteit Brussel(自由大学布鲁塞尔分校ETRO部门)

AI总结 无需CLIP和标签的无监督概念瓶颈模型,通过无监督方式推导线性分类器,提升图像分类和零样本描述性能。

Comments CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22620 2026-02-27 cs.CV

Coded-E2LF: Coded Aperture Light Field Imaging from Events

编码的E2LF:从事件中获取4D光场

Tomoya Tsuchida, Keita Takahashi, Chihiro Tsutake, Toshiaki Fujii, Hajime Nagahara

机构 * Nagoya University, Japan(名古屋大学,日本) Osaka University, Japan(大阪大学,日本)

AI总结 本文提出Coded-E2LF方法,通过编码孔径和事件-only相机实现4D光场的像素级精确重建,首次证明仅使用事件数据即可获得高精度光场。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22594 2026-02-27 cs.CV

Causal Motion Diffusion Models for Autoregressive Motion Generation

因果运动扩散模型用于自回归运动生成

Qing Yu, Akihisa Watanabe, Kent Fujiwara

机构 * LY Corporation(LY公司) Waseda University(早稻田大学)

AI总结 本文提出因果运动扩散模型,通过因果扩散变换器实现高质量运动生成,提升语义保真度与时间平滑度,同时减少推理延迟。

Comments Accepted to CVPR 2026, Project website: https://yu1ut.com/CMDM-HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22376 2026-02-27 cs.CV cs.AI

AeroDGS: Physically Consistent Dynamic Gaussian Splatting for Single-Sequence Aerial 4D Reconstruction

AeroDGS:基于物理的动态高斯点溅技术用于单序列航空4D重建

Hanyang Liu, Rongjun Qin

AI总结 AeroDGS通过物理引导的4D高斯点溅技术,解决单目无人机视频中动态物体的4D重建问题,提升重建精度与稳定性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22142 2026-02-26 cs.CV

WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs

WeaveTime: 从早期帧中流式传输以形成涌现记忆在视频LLMs中

Yulin Zhang, Cheng Shi, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算科学与数据科学学院)

AI总结 WeaveTime通过引入时间重建目标和动态关注缓存,提升视频LLMs在流式场景中的时间感知能力,减少延迟并提高准确性。

Comments Accepted at CVPR 2026 (preview; camera-ready in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22140 2026-02-26 eess.IV cs.CV

Lumosaic: Hyperspectral Video via Active Illumination and Coded-Exposure Pixels

Lumosaic:通过主动照明和编码曝光像素实现高光谱视频

Dhruv Verma, Andrew Qiu, Roberto Rangel, Ayandev Barman, Hao Yang, Chenjia Hu, Fengqi Zhang, Roman Genov, David B. Lindell, Kiriakos N. Kutulakos, Alex Mariakakis

机构 * Department of Computer Science, University of Toronto, Canada(计算机科学系,多伦多大学) Department of Electrical & Computer Engineering, University of Toronto, Canada(电气与计算机工程系,多伦多大学)

AI总结 Lumosaic通过主动照明和编码曝光像素技术,实现高光谱视频的实时捕捉与高保真重建。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22059 2026-02-26 cs.CV cs.AI

NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training

NESTOR:基于嵌套MOE的神经算子用于大规模PDE预训练

Dengdi Sun, Xiaoya Zhou, Xiao Wang, Hao Si, Wanli Lyu, Jin Tang, Bin Luo

机构 * School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) School of Computer Science and Technology, Anhui University, Hefei, China(计算机科学与技术学院,安徽大学,合肥,中国)

AI总结 NESTOR提出基于嵌套MOE框架的神经算子,通过全局与局部依赖性捕捉提升大规模PDE预训练的泛化能力与迁移性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21963 2026-02-26 cs.CV

Global-Aware Edge Prioritization for Pose Graph Initialization

全局感知的边缘优先级化用于姿态图初始化

Tong Wei, Giorgos Tolias, Jiri Matas, Daniel Barath

机构 * Visual Recognition Group, FEE, Czech Technical University in Prague(捷克技术大学布拉格分校视觉识别组) Computer Vision and Geometry Group, ETH Zurich(苏黎世联邦理工学院计算机视觉与几何组) HUN-REN SZTAKI(匈牙利-人匈牙利科学院)

AI总结 本文提出一种全局感知的边缘优先级化方法,通过图神经网络预测边可靠性,结合多最小生成树构建姿态图,提升稀疏和高速场景下的重建精度。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21929 2026-02-26 cs.CV

Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文

JiaKui Hu, Jialun Liu, Liying Yang, Xinliang Zhang, Kaiwen Li, Shuang Zeng, Yuanwei Li, Haibin Huang, Chi Zhang, Yanye Lu

机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) TeleAI MUST

AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21864 2026-02-26 cs.CV cs.AI cs.CL cs.GR

DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs

DynamicGTR: 利用图拓扑表示偏好提升视觉语言模型在图问答中的能力

Yanbin Wei, Jiangyue Yan, Chun Kang, Yang Chen, Hua Liu, James Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beihang University(北京航空航天大学)

AI总结 DynamicGTR通过动态选择最优图拓扑表示,提升视觉语言模型在图问答中的零样本性能及跨任务迁移能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21779 2026-02-26 cs.CV cs.AI

Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models

超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准

Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Cheng Yuan, Jiaowei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Peking University(北京大学) Fudan University(复旦大学)

AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。

Comments 16 pages, 9 figures. Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21754 2026-02-26 cs.CV

LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibration

LiREC-Net:一种无需目标且基于学习的激光雷达、RGB和事件校准网络

Aditya Ranjan Dash, Ramy Battrawy, René Schuster, Didier Stricker

机构 * RPTU – University Kaiserslautern-Landau(莱茵-威斯法伦大学(科布伦茨-劳埃希恩)) DFKI – German Research Center for Artificial Intelligence(德国人工智能研究中心)

AI总结 LiREC-Net是一种基于学习的多传感器校准网络,通过统一框架联合校准激光雷达、RGB和事件数据,提升多传感器融合的精度和效率。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20871 2026-02-26 cs.RO

GeCo-SRT: Geometry-aware Continual Adaptation for Robotic Cross-Task Sim-to-Real Transfer

GeCo-SRT: 基于几何的持续适应用于机器人跨任务仿真到现实迁移

Wenbo Yu, Wenke Xia, Weitao Zhang, Di Hu

机构 * Beijing Forestry University(北京林业大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部)

AI总结 GeCo-SRT通过几何感知的持续适应方法,实现跨任务仿真到现实迁移的高效和有效适应,提升新任务性能并提高数据效率。

Comments Accepted By CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01552 2026-02-26 cs.CV

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

面向变化的视觉令牌丢弃以加速更大的视觉-语言模型

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

机构 * Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Zhejiang University(浙江大学)

AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。

Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01085 2026-02-26 cs.CV cs.AI

Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection

学习关键要素:通过相对误差驱动的样本选择进行优先概念学习

Shivam Chandhok, Qian Yang, Oscar Manas, Kanishk Jain, Leonid Sigal, Aishwarya Agrawal

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) University of British Columbia(不列颠哥伦比亚大学) Université de Montréal(蒙特利尔大学) Vector Institute for AI(人工智能矢量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 PROGRESS通过相对误差驱动的样本选择,实现高效视觉-语言模型的指令微调,减少数据和计算需求,提升学习效率和泛化能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21698 2026-02-26 cs.CV

E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought

E-comIQ-ZH: 一种用于评估电子商务海报细粒度的对齐人类数据集和基准

Meiqi Sun, Mingyu Li, Junxiong Zhu

机构 * Taobao & Tmall Group, Alibaba Group(淘宝与天猫集团、阿里巴巴集团)

AI总结 E-comIQ-ZH提出了一种针对中文电子商务海报生成的对齐人类评估框架,通过构建多维评分数据集和专家校准的链式推理模型,实现了细粒度的自动化评估。

Comments 21pages, 19figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21461 2026-02-26 cs.CL

VecGlypher: Unified Vector Glyph Generation with Language Models

VecGlypher: 一种基于语言模型的统一向量图形单元生成方法

Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han

机构 * Meta AI

AI总结 VecGlypher通过多模态语言模型直接生成高质量向量图形,无需位图中间步骤,显著提升字体创建效率和可编辑性。

Comments Accepted to CVPR'26. Project page: https://xk-huang.github.io/VecGlypher/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21341 2026-02-26 cs.CV cs.AI

Scaling View Synthesis Transformers

视图合成变换器的扩展

Evan Kim, Hyunwoo Ryu, Thomas W. Mitchel, Vincent Sitzmann

机构 * MIT(麻省理工学院) Adobe(Adobe公司)

AI总结 本文提出了一种可扩展的视图合成模型,通过系统研究扩展规律,实现了计算最优的NVS模型,并在减少训练计算的情况下超越了现有最先进方法。

Comments Project page: https://www.evn.kim/research/svsm

Journal ref Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20685 2026-02-26 cs.CV

RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space

RAYNOVA:在射线空间中实现尺度-时间自回归世界建模

Yichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu, Jiezhi Yang, Eric Higgins, Ryan Brigden, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition UC Berkeley(加州大学伯克利分校)

AI总结 RAYNOVA通过双因果自回归框架实现尺度-时间自回归世界建模,在驾驶场景中实现多视角视频生成,具有更高的吞吐量和可控性。

Comments Accepted by CVPR 2026; Project website: https://raynova-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18858 2026-02-26 cs.LG cs.AI cs.CV

Hyperbolic Busemann Neural Networks

双曲Busemann神经网络

Ziheng Chen, Bernhard Schölkopf, Nicu Sebe

机构 * University of Trento(特伦托大学) MPI-IS(马克斯·普朗克研究所)

AI总结 本文提出双曲Busemann神经网络,通过Busemann函数将MLR和FC层提升到双曲空间,提升图像分类、基因序列学习等任务的有效性和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏