arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-14 至 2026-04-14 共收录 70
2604.11792 2026-04-14 cs.CV

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

LottieGPT:为自回归生成设计向量动画的标记化

Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。

Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11711 2026-04-14 cs.CV

Seeing Through the Tool: A Controlled Benchmark for Occlusion Robustness in Foundation Segmentation Models

透过工具看见:面向基础分割模型遮挡鲁棒性的受控基准

Nhan Ho, Luu Le, Thanh-Huy Nguyen, Thien Nguyen, Xiaofeng Liu, Ulas Bagci

机构 * Stony Brook University(石溪大学) AIMA Research Lab(AIMA研究实验室) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) Northwestern University(西北大学)

AI总结 本文提出OccSAM-Bench基准,评估分割模型在合成手术遮挡下的性能,揭示两种模型类型:遮挡意识模型和遮挡无关模型,强调临床需求驱动的模型选择。

Comments Accepted at CV4Clinic, CVPR 2026. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11668 2026-04-14 cs.CV

UNIGEOCLIP: Unified Geospatial Contrastive Learning

UNIGEOCLIP:统一地理对比学习

Guillaume Astruc, Eduard Trulls, Jan Hosang, Loic Landrieu, Paul-Edouard Sarlin

机构 * LASTIG, Univ Gustave Eiffel, IGN, ENSG, France(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理林业信息研究所,法国国家地理科学学院,法国) Google, Switzerland(谷歌,瑞士) CNES, France(法国国家空间研究中心,法国) LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris, Marne-la-Vallée, France(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科桥梁学院,巴黎理工学院,马恩拉瓦莱,法国)

AI总结 UNIGEOCLIP通过统一嵌入空间对五种地理模态进行联合对齐,提升多模态地理数据的对比学习性能,优于单一模态模型和坐标基线。

Journal ref CVPR 2026 EarthVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11637 2026-04-14 cs.CV

STS-Mixer: Spatio-Temporal-Spectral Mixer for 4D Point Cloud Video Understanding

STS-Mixer:用于4D点云视频理解的时空频混合器

Wenhao Li, Xueying Jiang, Gongjie Zhang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出STS-Mixer框架,通过将4D点云视频转换为图谱信号,结合时空与频域信息,提升对4D点云视频的几何结构和时间动态的理解。

Comments Accepted by CVPR 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11585 2026-04-14 cs.CV cs.RO

GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth

GeomPrompt:用于在缺失和退化深度下的RGB-D语义分割的几何提示学习

Krishna Jaganathan, Patricio Vela

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 GeomPrompt通过从RGB生成任务驱动的几何提示,提升RGB-D语义分割在缺失和退化深度下的性能,同时比单目深度估计器更高效。

Comments Accepted to the CVPR 2026 URVIS Workshop. Project page: https://geomprompt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11579 2026-04-14 cs.CV

Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions

透过触觉:基于触觉驱动的材料区域视觉定位

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

AI总结 本文提出通过密集跨模态特征交互学习局部视觉-触觉对齐,生成触觉条件下的材料分割热图,提升材料区域视觉定位的鲁棒性和多样性。

Comments CVPR 2026. Project page: https://mm.kaist.ac.kr/projects/SeeingThroughTouch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11576 2026-04-14 cs.CV

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

微调如你预训练:提升视觉语言模型零样本对抗鲁棒性

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Xi’an Jiaotong University(西安交通大学) University of Oxford(牛津大学)

AI总结 本文提出AdvFLYP方法,通过遵循CLIP预训练过程的训练配方,利用网络上收集的图像-文本对生成对抗样本,并通过对比损失匹配文本,提升视觉语言模型的零样本对抗鲁棒性。

Comments Accepted to CVPR Findings Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11487 2026-04-14 cs.CV

NTIRE 2026 Challenge on Robust AI-Generated Image Detection in the Wild

2026年NTIRE挑战赛:野外鲁棒AI生成图像检测挑战

Aleksandr Gushchin, Khaled Abud, Ekaterina Shumitskaya, Artem Filippov, Georgii Bychkov, Sergey Lavrushkin, Mikhail Erofeev, Anastasia Antsiferova, Changsheng Chen, Shunquan Tan, Radu Timofte, Dmitry Vatolin, Chuanbiao Song, Zijian Yu, Hao Tan, Jun Lan, Zhiqiang Yang, Yongwei Tang, Zhiqiang Wu, Jia Wen Seow, Hong Vin Koay, Haodong Ren, Feng Xu, Shuai Chen, Ruiyang Xia, Qi Zhang, Yaowen Xu, Zhaofan Zou, Hao Sun, Dagong Lu, Mufeng Yao, Xinlei Xu, Fei Wu, Fengjun Guo, Cong Luo, Hardik Sharma, Aashish Negi, Prateek Shaily, Jayant Kumar, Sachin Chaudhary, Akshay Dudhane, Praful Hambarde, Amit Shukla, Zhilin Tu, Fengpeng Li, Jiamin Zhang, Jianwei Fei, Kemou Li, Haiwei Wu, Bilel Benjdira, Anas M. Ali, Wadii Boulila, Chenfan Qu, Junchi Li

AI总结 本文介绍了2026年NTIRE挑战赛,旨在开发能区分真实图像与生成图像的模型,针对实际场景中的图像变换(如裁剪、缩放、压缩、模糊)提升检测鲁棒性。

Comments CVPR 2026 NTIRE Workshop Paper, Robust AI-Generated Image Detection Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11355 2026-04-14 cs.CV

LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalization

LEADER: 学习可靠的局部到全局对应关系用于LiDAR重定位

Jianshi Wu, Minghang Zhu, Dunqiang Liu, Wen Li, Sheng Ao, Siqi Shen, Chenglu Wen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建省城市智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算教育部重点实验室,厦门大学信息学院) School of Engineering Mathematics and Technology, University of Bristol(布里斯托大学工程数学与技术学院)

AI总结 本文提出LEADER框架,通过几何编码器提升描述性,采用截断相对可靠性损失减少不可靠预测影响,实验表明在Oxford RobotCar和NCLT数据集上性能优于现有方法。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11230 2026-04-14 cs.CV

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: AI Flash Portrait (Track 3)

NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:AI闪光人像(第三赛道)

Ya-nan Guan, Shaonan Zhang, Hang Guo, Yawen Wang, Xinying Fan, Tianqu Zhuang, Jie Liang, Hui Zeng, Guanyi Qin, Lishen Qu, Tao Dai, Shu-Tao Xia, Lei Zhang, Radu Timofte, Bin Chen, Yuanbo Zhou, Hongwei Wang, Qinquan Gao, Tong Tong, Yanxin Qian, Lizhao You, Jingru Cong, Lei Xiong, Shuyuan Zhu, Zhi-Qiang Zhong, Kan Lv, Yang Yang, Kailing Tang, Minjian Zhang, Zhipei Lei, Zhe Xu, Liwen Zhang, Dingyong Gou, Yanlin Wu, Cong Li, Xiaohui Cui, Jiajia Liu, Guoyi Xu, Yaoxin Jiang, Yaokun Shi, Jiachen Tu, Liqing Wang, Shihang Li, Bo Zhang, Biao Wang, Haiming Xu, Xiang Long, Xurui Liao, Yanqiao Zhai, Haozhe Li, Shijun Shi, Jiangning Zhang, Yong Liu, Kai Hu, Jing Xu, Xianfang Zeng, Yuyang Liu, Minchen Wei

AI总结 本文提出NTIRE 2026第三次RAIM挑战,聚焦AI闪光人像赛道,旨在解决低光照条件下人像修复的噪声抑制、细节保留与光照颜色还原平衡问题,提供包含800组真实低光照人像数据的评估数据集和基准代码。

Comments Accepted to CVPR 2026 Workshop. Includes supplementary material as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11162 2026-04-14 cs.CV

Boxes2Pixels: Learning Defect Segmentation from Noisy SAM Masks

Boxes2Pixels: 从噪声SAM掩码中学习缺陷分割

Camile Lendering, Erkut Akdag, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 本文提出Boxes2Pixels框架,通过将SAM视为噪声教师,利用分层解码器和在线自修正机制提升缺陷分割精度,实现在工业表面中提升mIoU和IoU指标。

Comments Accepted for presentation at the AI4RWC Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11156 2026-04-14 cs.CV

rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training

rPPG-VQA:一种用于无监督rPPG训练的视频质量评估框架

Tianyang Dai, Ming Chang, Yan Chen, Yang Hu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出rPPG-VQA框架,通过信号级和场景级分析评估视频对rPPG模型训练的适用性,结合双分支架构和两阶段自适应采样策略提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11144 2026-04-14 cs.CV cs.CL cs.MM

Hierarchical Textual Knowledge for Enhanced Image Clustering

层次化文本知识用于增强图像聚类

Yijie Zhong, Yunfan Gao, Weipeng Jiang, Haofen Wang

机构 * Tongji University(同济大学) Huawei Technologies Ltd.(华为技术有限公司)

AI总结 本文提出KEC方法,通过大语言模型构建层次化概念-属性知识,提升图像聚类的准确性与鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28287 2026-04-14 cs.CV

TerraSky3D: Multi-View Reconstructions of European Landmarks in 4K

TerraSky3D:欧洲地标多视角4K三维重建

Mattia D'Urso, Yuxi Hu, Christian Sormann, Mattia Rossi, Friedrich Fraundorfer

机构 * Graz University of Technology(格拉茨技术大学) Sony(索尼)

AI总结 TerraSky3D提供高分辨率的欧洲地标多视角三维重建数据集,包含5万张图像,涵盖地面、空中和混合场景,旨在为3D重建算法提供挑战性训练和评估数据。

Comments Accepted at 3DMV (CVPR Workshop 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27494 2026-04-14 cs.CV cs.AI

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型

Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12221 2026-04-14 cs.CV

A Two-Stage Dual-Modality Model for Facial Emotional Expression Recognition

一种两阶段双模态模型用于面部情绪表达识别

Jiajun Sun, Zhe Gao

机构 * Shanghai Normal University(上海师范大学)

AI总结 本文提出一种两阶段双模态模型,通过预训练DINOv2编码器提取鲁棒视觉特征,并结合Wav2Vec 2.0音频特征进行融合,提升面部情绪识别性能。

Comments Camera-ready version. 14 pages, 5 figures in total: 8 pages main text with 4 figures, 3 pages references, and 3 pages appendix with 1 figure. Accepted at the 10th ABAW Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20563 2026-04-14 cs.CV cs.AI cs.LG cs.RO

LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Driving

LEAD:最小化学习者-专家不对称性以实现端到端驾驶

Long Nguyen, Micha Fauth, Bernhard Jaeger, Daniel Dauner, Maximilian Igl, Andreas Geiger, Kashyap Chitta

机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) NVIDIA Research(英伟达研究院) KE:SAI

AI总结 本文研究了仿真中专家示范与学生观测不一致对模仿学习的影响,提出TransFuser v6在CARLA等基准中取得新突破,提升驾驶性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01390 2026-04-14 cs.CV

FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution

FRAMER:基于扩散先验的频率对齐自蒸馏与自适应调制的现实世界图像超分辨率

Seungho Choi, Jeahun Sung, Jihyong Oh

AI总结 FRAMER通过利用扩散先验,采用频率对齐自蒸馏和自适应调制方法,提升现实世界图像超分辨率的PSNR/SSIM及感知指标。

Comments CVPR 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/FRAMER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22736 2026-04-14 eess.IV cs.AI cs.CV cs.LG physics.med-ph stat.ML

PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problems

PnP-CM:一致性模型作为逆问题的即插即用先验

Merve Gülle, Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

机构 * University of Minnesota(明尼苏达大学)

AI总结 本文提出PnP-CM,将一致性模型视为先验的近端算子,用于解决多种逆问题,通过改进的ADMM框架和噪声扰动,在低NFE情况下实现高质量重建。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02387 2026-04-14 cs.AI

VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

VS-Bench:评估多智能体环境中视觉语言模型的战略能力

Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Mo Guang, Kaiwen Long, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang

机构 * EE, Tsinghua University(清华大学电子工程系) SIGS, Tsinghua University(清华大学深圳国际研究生院) Li Auto Inc.(理想汽车) IIIS, Tsinghua University(清华大学交叉信息研究院)

AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。

Comments Published at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17012 2026-04-14 cs.CV cs.AI

SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

SpatialScore:迈向空间智能的综合评估

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。

Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17574 2026-04-14 cs.CV cs.AI

HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解

Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)

AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。

Comments Accepted as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14456 2026-04-14 cs.CV

TetraSphere: A Neural Descriptor for O(3)-Invariant Point Cloud Analysis

TetraSphere:一种用于O(3)不变点云分析的神经描述符

Pavlo Melnyk, Andreas Robinson, Michael Felsberg, Mårten Wadenbäck

机构 * Computer Vision Laboratory, Department of Electrical Engineering, Linköping University(林雪平大学电气工程系计算机视觉实验室)

AI总结 本文提出TetraSphere,一种基于可旋转3D球神经元和向量神经元的O(3)不变描述符,通过端到端训练提升点云旋转不变性,在ScanObjectNN和ModelNet40上取得新突破。

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10772 2026-04-14 cs.CV

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑

Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

机构 * The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10643 2026-04-14 cs.CV

LogitDynamics: Reliable ViT Error Detection from Layerwise Logit Trajectories

LogitDynamics:从层间Logit轨迹可靠检测ViT错误

Ido Beigelman, Moti Freiman

机构 * Technion - Israel Institute of Technology(以色列理工学院)

AI总结 本文提出通过层间Logit轨迹分析可靠检测ViT模型错误,利用轻量线性头提取特征预测错误指示器,提升AUCPR并增强跨数据集泛化能力。

Comments Accepted to the HOW 2026 workshop at CVPR 2026; 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10591 2026-04-14 cs.CV cs.AI

GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing

GeoMeld:迈向遥感领域语义引导的基模模型

Maram Hasan, Md Aminur Hossain, Savitra Roy, Souparna Bhowmik, Ayush V. Patel, Mainak Singha, Subhasis Chaudhuri, Muhammad Haris Khan, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Space Applications Centre, ISRO(印度空间研究组织空间应用中心) University of Trento(特伦托大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出GeoMeld数据集,通过语义引导的监督方法,结合多模态对齐,提升遥感领域基模模型的性能和鲁棒性。

Comments Accepted at CVPR Workshop 2026; 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10582 2026-04-14 cs.CV

TAPNext++: What's Next for Tracking Any Point (TAP)?

TAPNext++: 追踪任意点(TAP)的下一步

Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) German Aerospace Center (DLR)(德国航空航天中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Chandar Research Lab(钱达尔研究实验室) Polytechnique Montréal(蒙特利尔综合理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Technical University Munich (TUM)(慕尼黑工业大学)

AI总结 TAPNext++通过训练长序列和引入重检指标提升追踪性能,在保持低内存计算开销的同时实现更长序列的追踪。

Comments 8 pages, will be publised at CVPR Findings 2026, Website https://tap-next-plus-plus.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10573 2026-04-14 cs.CV

Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images

从未标注的多视角图像中学习3D表示以提升空间智能

Bo Zhou, Qiuxia Lai, Zeren Sun, Xiangbo Shu, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Communication University of China(中国传媒大学)

AI总结 本文提出UniSplat框架,通过双掩码策略、高斯溅射策略和姿态条件重校准机制,解决未标注多视角图像中3D表示学习的几何诱导弱、外观细节不足和几何语义不一致问题,实现鲁棒且通用的3D表示。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10551 2026-04-14 cs.CV

NTIRE 2026 Challenge on Short-form UGC Video Restoration in the Wild with Generative Models: Datasets, Methods and Results

2026年NTIRE挑战赛:基于生成模型的野生短形式UGC视频修复挑战:数据集、方法与结果

Xin Li, Jiachao Gong, Xijun Wang, Shiyao Xiong, Bingchen Li, Suhang Yao, Chao Zhou, Zhibo Chen, Radu Timofte, Yuxiang Chen, Shibo Yin, Yilian Zhong, Yushun Fang, Xilei Zhu, Yahui Wang, Chen Lu, Meisong Zheng, Xiaoxu Chen, Jing Yang, Zhaokun Hu, Jiahui Liu, Ying Chen, Haoran Bai, Sibin Deng, Shengxi Li, Mai Xu, Junyang Chen, Hao Chen, Xinzhe Zhu, Fengkai Zhang, Long Sun, Yixing Yang, Xindong Zhang, Jiangxin Dong, Jinshan Pan, Jiyuan Zhang, Shuai Liu, Yibin Huang, Xiaotao Wang, Lei Lei, Zhirui Liu, Shinan Chen, Shang-Quan Sun, Wenqi Ren, Jingyi Xu, Zihong Chen, Zhuoya Zou, Xiuhao Qiu, Jingyu Ma, Huiyuan Fu, Kun Liu, Huadong Ma, Dehao Feng, Zhijie Ma, Boqi Zhang, Jiawei Shi, Hao Kang, Yixin Yang, Yeying Jin, Xu Cheng, Yuxuan Jiang, Chengxi Zeng, Tianhao Peng, Fan Zhang, David Bull, Yanan Xing, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yaokun Shi, Wei Zhou, Linfeng Li, Hang Song, Qi Xu, Kun Yuan, Yizhen Shao, Yulin Ren

AI总结 本文介绍了2026年NTIRE挑战赛,旨在建立强大的基准以修复复杂现实降质下的短形式UGC视频,特别关注基于生成模型的S-UGC视频修复。挑战赛包含合成和真实视频数据,涵盖数据集、方法和结果。

Comments Accepted by CVPR 2026 workshop; NTIRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10546 2026-04-14 cs.CV

Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression

可微向量量化用于生成图像压缩的率-失真优化

Shiyin Jiang, Wei Long, Minghao Han, Zhenghao Chen, Ce Zhu, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) The University of Newcastle, Australia(澳大利亚纽卡斯尔大学)

AI总结 本文提出RDVQ框架,通过可微松弛代码本分布实现端到端率-失真优化,结合自回归熵模型实现准确的熵建模和测试时率控制,在极低比特率下取得优异性能。

Comments Accepted for publication at CVPR 2026 as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏