arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-02-26 至 2026-02-26 共收录 17
2602.22142 2026-02-26 cs.CV

WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs

WeaveTime: 从早期帧中流式传输以形成涌现记忆在视频LLMs中

Yulin Zhang, Cheng Shi, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算科学与数据科学学院)

AI总结 WeaveTime通过引入时间重建目标和动态关注缓存,提升视频LLMs在流式场景中的时间感知能力,减少延迟并提高准确性。

Comments Accepted at CVPR 2026 (preview; camera-ready in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22140 2026-02-26 eess.IV cs.CV

Lumosaic: Hyperspectral Video via Active Illumination and Coded-Exposure Pixels

Lumosaic:通过主动照明和编码曝光像素实现高光谱视频

Dhruv Verma, Andrew Qiu, Roberto Rangel, Ayandev Barman, Hao Yang, Chenjia Hu, Fengqi Zhang, Roman Genov, David B. Lindell, Kiriakos N. Kutulakos, Alex Mariakakis

机构 * Department of Computer Science, University of Toronto, Canada(计算机科学系,多伦多大学) Department of Electrical & Computer Engineering, University of Toronto, Canada(电气与计算机工程系,多伦多大学)

AI总结 Lumosaic通过主动照明和编码曝光像素技术,实现高光谱视频的实时捕捉与高保真重建。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22059 2026-02-26 cs.CV cs.AI

NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training

NESTOR:基于嵌套MOE的神经算子用于大规模PDE预训练

Dengdi Sun, Xiaoya Zhou, Xiao Wang, Hao Si, Wanli Lyu, Jin Tang, Bin Luo

机构 * School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) School of Computer Science and Technology, Anhui University, Hefei, China(计算机科学与技术学院,安徽大学,合肥,中国)

AI总结 NESTOR提出基于嵌套MOE框架的神经算子,通过全局与局部依赖性捕捉提升大规模PDE预训练的泛化能力与迁移性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21963 2026-02-26 cs.CV

Global-Aware Edge Prioritization for Pose Graph Initialization

全局感知的边缘优先级化用于姿态图初始化

Tong Wei, Giorgos Tolias, Jiri Matas, Daniel Barath

机构 * Visual Recognition Group, FEE, Czech Technical University in Prague(捷克技术大学布拉格分校视觉识别组) Computer Vision and Geometry Group, ETH Zurich(苏黎世联邦理工学院计算机视觉与几何组) HUN-REN SZTAKI(匈牙利-人匈牙利科学院)

AI总结 本文提出一种全局感知的边缘优先级化方法,通过图神经网络预测边可靠性,结合多最小生成树构建姿态图,提升稀疏和高速场景下的重建精度。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21929 2026-02-26 cs.CV

Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文

JiaKui Hu, Jialun Liu, Liying Yang, Xinliang Zhang, Kaiwen Li, Shuang Zeng, Yuanwei Li, Haibin Huang, Chi Zhang, Yanye Lu

机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) TeleAI MUST

AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21864 2026-02-26 cs.CV cs.AI cs.CL cs.GR

DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs

DynamicGTR: 利用图拓扑表示偏好提升视觉语言模型在图问答中的能力

Yanbin Wei, Jiangyue Yan, Chun Kang, Yang Chen, Hua Liu, James Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beihang University(北京航空航天大学)

AI总结 DynamicGTR通过动态选择最优图拓扑表示,提升视觉语言模型在图问答中的零样本性能及跨任务迁移能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21779 2026-02-26 cs.CV cs.AI

Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models

超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准

Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Cheng Yuan, Jiaowei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Peking University(北京大学) Fudan University(复旦大学)

AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。

Comments 16 pages, 9 figures. Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21754 2026-02-26 cs.CV

LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibration

LiREC-Net:一种无需目标且基于学习的激光雷达、RGB和事件校准网络

Aditya Ranjan Dash, Ramy Battrawy, René Schuster, Didier Stricker

机构 * RPTU – University Kaiserslautern-Landau(莱茵-威斯法伦大学(科布伦茨-劳埃希恩)) DFKI – German Research Center for Artificial Intelligence(德国人工智能研究中心)

AI总结 LiREC-Net是一种基于学习的多传感器校准网络,通过统一框架联合校准激光雷达、RGB和事件数据,提升多传感器融合的精度和效率。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20871 2026-02-26 cs.RO

GeCo-SRT: Geometry-aware Continual Adaptation for Robotic Cross-Task Sim-to-Real Transfer

GeCo-SRT: 基于几何的持续适应用于机器人跨任务仿真到现实迁移

Wenbo Yu, Wenke Xia, Weitao Zhang, Di Hu

机构 * Beijing Forestry University(北京林业大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部)

AI总结 GeCo-SRT通过几何感知的持续适应方法,实现跨任务仿真到现实迁移的高效和有效适应,提升新任务性能并提高数据效率。

Comments Accepted By CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01552 2026-02-26 cs.CV

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

面向变化的视觉令牌丢弃以加速更大的视觉-语言模型

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

机构 * Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Zhejiang University(浙江大学)

AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。

Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01085 2026-02-26 cs.CV cs.AI

Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection

学习关键要素:通过相对误差驱动的样本选择进行优先概念学习

Shivam Chandhok, Qian Yang, Oscar Manas, Kanishk Jain, Leonid Sigal, Aishwarya Agrawal

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) University of British Columbia(不列颠哥伦比亚大学) Université de Montréal(蒙特利尔大学) Vector Institute for AI(人工智能矢量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 PROGRESS通过相对误差驱动的样本选择,实现高效视觉-语言模型的指令微调,减少数据和计算需求,提升学习效率和泛化能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21698 2026-02-26 cs.CV

E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought

E-comIQ-ZH: 一种用于评估电子商务海报细粒度的对齐人类数据集和基准

Meiqi Sun, Mingyu Li, Junxiong Zhu

机构 * Taobao & Tmall Group, Alibaba Group(淘宝与天猫集团、阿里巴巴集团)

AI总结 E-comIQ-ZH提出了一种针对中文电子商务海报生成的对齐人类评估框架,通过构建多维评分数据集和专家校准的链式推理模型,实现了细粒度的自动化评估。

Comments 21pages, 19figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21461 2026-02-26 cs.CL

VecGlypher: Unified Vector Glyph Generation with Language Models

VecGlypher: 一种基于语言模型的统一向量图形单元生成方法

Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han

机构 * Meta AI

AI总结 VecGlypher通过多模态语言模型直接生成高质量向量图形,无需位图中间步骤,显著提升字体创建效率和可编辑性。

Comments Accepted to CVPR'26. Project page: https://xk-huang.github.io/VecGlypher/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21341 2026-02-26 cs.CV cs.AI

Scaling View Synthesis Transformers

视图合成变换器的扩展

Evan Kim, Hyunwoo Ryu, Thomas W. Mitchel, Vincent Sitzmann

机构 * MIT(麻省理工学院) Adobe(Adobe公司)

AI总结 本文提出了一种可扩展的视图合成模型,通过系统研究扩展规律,实现了计算最优的NVS模型,并在减少训练计算的情况下超越了现有最先进方法。

Comments Project page: https://www.evn.kim/research/svsm

Journal ref Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20685 2026-02-26 cs.CV

RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space

RAYNOVA:在射线空间中实现尺度-时间自回归世界建模

Yichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu, Jiezhi Yang, Eric Higgins, Ryan Brigden, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition UC Berkeley(加州大学伯克利分校)

AI总结 RAYNOVA通过双因果自回归框架实现尺度-时间自回归世界建模,在驾驶场景中实现多视角视频生成,具有更高的吞吐量和可控性。

Comments Accepted by CVPR 2026; Project website: https://raynova-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18858 2026-02-26 cs.LG cs.AI cs.CV

Hyperbolic Busemann Neural Networks

双曲Busemann神经网络

Ziheng Chen, Bernhard Schölkopf, Nicu Sebe

机构 * University of Trento(特伦托大学) MPI-IS(马克斯·普朗克研究所)

AI总结 本文提出双曲Busemann神经网络,通过Busemann函数将MLR和FC层提升到双曲空间,提升图像分类、基因序列学习等任务的有效性和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15487 2026-02-26 cs.LG cs.CV

NTK-Guided Implicit Neural Teaching

NTK引导的隐式神经教学

Chen Zhang, Wei Zuo, Bingyang Cheng, Yikun Wang, Wei-Bin Kou, Yik Chung WU, Ngai Wong

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出NTK引导的隐式神经教学方法,通过动态选择坐标加速训练,显著减少训练时间并保持表示质量。

Comments CVPR 2026 (18 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏