arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2601.06394 2026-05-01 cs.CV cs.AI

Context Matters: Peer-Aware Student Behavioral Engagement Measurement via VLM Action Parsing and LLM Sequence Classification

语境至关重要:通过VLM动作解析和LLM序列分类进行同伴感知的学生行为参与度测量

Ahmed Abdelkawy, Ahmed Elsayed, Asem Ali, Aly Farag, Thomas Tretter, Michael McIntyre

机构 * University of Louisville(路易斯维尔大学)

AI总结 本文提出一种三阶段框架,通过VLM动作识别和LLM序列分类,结合课堂语境中的同伴行为,有效测量学生参与度。

Comments accepted to the Computer Vision for Education (CV4Edu) workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10267 2026-05-01 cs.CV

Long-LRM++: Preserving Fine Details in Feed-Forward Wide-Coverage Reconstruction

Long-LRM++:在前馈宽覆盖重建中保留细节

Chen Ziwen, Hao Tan, Peng Wang, Zexiang Xu, Li Fuxin

机构 * Adobe Research(Adobe研究院) Tripo AI(Tripo人工智能) Hillbot(Hillbot公司) Oregon State University(俄勒冈州立大学)

AI总结 Long-LRM++通过半显式场景表示与轻量解码器,在保持LaCT渲染质量的同时实现实时14FPS的A100 GPU性能,且能扩展至64输入视角,并在ScanNetv2上优于直接从高斯生成深度预测。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings (CVPRF), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02671 2026-05-01 cs.CV

Test-Time Distillation for Continual Model Adaptation

测试时蒸馏用于持续模型适应

Xiao Chen, Jiazhen Huang, Zhiming Liu, Qinting Jiang, Fanding Huang, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shenzhen Technology University(深圳技术大学)

AI总结 本文提出CoDiRe框架,通过动态融合VLM和目标模型预测构建鲁棒教师,利用MSP缓解熵偏见,通过最优传输对齐预测,实现稳定持续适应,优于现有方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26920 2026-04-30 cs.CV

Color-Encoded Illumination for High-Speed Volumetric Scene Reconstruction

彩色编码照明用于高速体素场景重建

David Novikov, Eilon Vaknin, Narek Tumanyan, Mark Sheinin

机构 * Weizmann Institute of Science(魏茨曼科学研究院)

AI总结 本文提出一种无需修改相机硬件的高速体素重建方法,通过快速序列彩色照明实现多视角同时捕获,利用动态高斯点扩散技术解码时空信息,实现实时体素场景重建。

Comments accepted to IEEE CVPR 2026 as a highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26820 2026-04-30 cs.CV

Bridge: Basis-Driven Causal Inference Marries VFMs for Domain Generalization

桥接:基于基础的因果推断融合视觉基础模型以实现领域泛化

Mingbo Hong, Feng Liu, Caroline Gevaert, George Vosselman, Hao Cheng

机构 * University of Twente(代尔夫特理工大学) Drexel University(德雷塞尔大学)

AI总结 本文提出Bridge框架,通过因果推断与视觉基础模型结合,解决领域泛化中因分布差异导致的性能下降问题,通过学习低秩基并过滤冗余信息提升检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26772 2026-04-30 cs.CV

TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection

通过补丁标记利用视觉基础模型特征进行AI生成图像检测

Ahmed Abdullah, Nikolas Ebert, Oliver Wasenmüller

机构 * Mannheim University of Applied Sciences(曼海姆应用科学大学)

AI总结 本文通过评估多种视觉基础模型家族,提出利用可调注意池化(TAP)改进分类器头,提升AI生成图像检测性能,发现最佳模型在准确率上超越CLIP超过12%。

Comments This paper has been accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26678 2026-04-30 cs.CV

Hearing the Room Through the Shape of the Drum: Modal-Guided Sound Recovery from Multi-Point Surface Vibrations

通过鼓声感知房间:基于模态的多点表面振动声恢复

Shai Bagon, Matan Kichler, Mark Sheinin

机构 * Weizmann Institute of Science(魏茨曼科学研究院)

AI总结 本文提出基于模态的声恢复方法,通过多点表面振动信号融合,提升对复杂固态物体声源的恢复能力,优于传统单点振动测量和多信号融合方法。

Comments Oral presentation at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10959 2026-04-30 cs.CV

StereoSpace: Depth-Free Synthesis of Stereo Geometry via End-to-End Diffusion in a Canonical Space

StereoSpace:通过端到端扩散在规范空间中实现无深度的立体几何合成

Tjark Behrens, Anton Obukhov, Bingxin Ke, Fabio Tosi, Matteo Poggi, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) University of Bologna(博洛尼亚大学) HUAWEI Bayer Lab(华为贝加尔实验室)

AI总结 StereoSpace通过端到端扩散模型在规范空间中实现无深度的立体几何合成,采用视角条件化方法,无需显式深度或变形,通过端到端生成对应关系和填补遮挡区域,提升立体生成的清晰度和鲁棒性。

Comments CVPR 2026 Findings. Project page: https://hf.co/spaces/prs-eth/stereospace

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02314 2026-04-30 cs.CV cs.AI

MAGIC: Few-Shot Mask-Guided Anomaly Inpainting with Prompt Perturbation, Spatially Adaptive Guidance, and Context Awareness

MAGIC: 少样本掩码引导的异常修复与提示扰动、空间自适应引导和上下文意识

JaeHyuck Choi, MinJun Kim, Je Hyeong Hong

机构 * Department of AI Semiconductor Engineering, Hanyang University, Seoul, Korea(汉阳大学人工智能半导体工程系) Department of Electronic Engineering, Hanyang University, Seoul, Korea(汉阳大学电子工程系)

AI总结 MAGIC通过引入提示扰动、空间自适应引导和上下文意识,解决少样本异常生成中的样本多样性问题,提升下游任务的鲁棒性。

Comments Accepted at CVPR 2026 Findings. Supplementary material included after references. 47 pages, 47 figures, 28 tables. Code : https://github.com/SpatialAILab/MAGIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26496 2026-04-30 cs.CV

Robust Alignment: Harmonizing Clean Accuracy and Adversarial Robustness in Adversarial Training

鲁棒对齐:在对抗训练中协调干净准确率与对抗鲁棒性

Yanyun Wang, Qingqing Ye, Li Liu, Zi Liang, Haibo Hu

机构 * HK PolyU(香港 polyu) HKUST (GZ)(香港科技大学(广州))

AI总结 本文提出鲁棒对齐作为对抗训练的新目标,通过减少边界样本扰动强度和域内插一致性对抗正则化,有效协调模型的准确率与鲁棒性,实验验证其在多个数据集上的优越性。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPR'26 Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26488 2026-04-30 cs.CV cs.LG

Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners

从动态3D场景中提取像素特征的线性上下文学习器

Nikita Araslanov, Martin Sundermeyer, Hidenobu Matsuki, David Joseph Tan, Federico Tombari

机构 * Google(谷歌) TU Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 本文提出LILA框架,通过线性上下文学习从视频中提取精确像素特征,解决动态场景中像素级表示问题,应用于视频目标分割、表面法线估计和语义分割等任务。

Comments To appear at CVPR 2026 (oral). Project website: https://lila-pixels.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26409 2026-04-30 cs.CV

Sparsity as a Key: Unlocking New Insights from Latent Structures for Out-of-Distribution Detection

稀疏性作为关键:从潜在结构中解锁新的见解用于分布外检测

Ahyoung Oh, Wonseok Shin, Songkuk Kim

机构 * School of Integrated Technology, BK21 Graduate Program in Intelligent Semiconductor Technology(整合技术学院,智能半导体技术BK21研究生项目)

AI总结 本文首次将稀疏自编码器应用于ViT的[CLS]令牌进行分布外检测,通过Top-k SAE解构密集特征,揭示了分布内数据的类激活模式,并提出基于核心能量剖面差异的评分函数,实现了在多个基准上的强性能。

Comments 8 pages, 6 figures, supplementary material included, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26365 2026-04-30 cs.CV cs.LG

Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models

超越固定公式:用于高效扩散模型的数据驱动线性预测器

Zhirong Shen, Rui Huang, Jiacheng Liu, Chang Zou, Peiliang Cai, Shikang Zheng, Zhengyi Shi, Liang Feng, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Shandong University(山东大学) Xiamen University(厦门大学) Fudan University(复旦大学)

AI总结 本文提出L2P数据驱动缓存框架,通过学习每时间步的权重替代固定系数,有效降低扩散模型采样成本,实现4.55倍FLOPs减少和4.15倍延迟加速。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26321 2026-04-30 cs.CV

Motion-Driven Multi-Object Tracking of Model Organisms in Space Science Experiments

空间科学实验中模型生物的运动驱动多目标跟踪

Jianing You, Han Wang, Kang Liu, Jiale Ding, Fengjie Chu, Zihan Guo, Shengyang Li

机构 * Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) School of Space Exploration, University of Chinese Academy of Sciences(中国科学院大学空间探索学院)

AI总结 本文提出ART-Track框架,通过多模型运动估计、运动状态驱动关联和不确定性自适应融合,有效解决空间实验中生物多目标跟踪的挑战,提升轨迹稳定性与身份保持性。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26250 2026-04-30 cs.CV

Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning

超越捷径:通过定性推理缓解冻结VLM中的视觉错觉

Hao Guo, Fei Wang, Junjie Chen, Yiqi Nie, Jiaqi Zhao, Qiankun Li, Subin Huang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥国家科学中心) Anhui Polytechnic University(安徽理工大学) Hefei University of Technology(合肥工业大学) Anhui University(安徽大学) IGS, Imperial College London(帝国理工学院伦敦分校)

AI总结 本文提出SQI框架,通过定性约束提升冻结VLM的视觉 grounding,解决视觉错觉问题,实验显示在DataCV 2026挑战中表现优异,提升准确率并提供更好的可解释性。

Comments 4 pages, 2 figures, and 1 table. This is a methodology paper for the DataCV 2026 Challenge (CVPR Workshops), Task 1, where our method ranked 2nd

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25530 2026-04-30 cs.CV cs.AI

The Surprising Effectiveness of Canonical Knowledge Distillation for Semantic Segmentation

经典知识蒸馏在语义分割中的意外有效性

Muhammad Ali, Kevin Alexander Laube, Madan Ravi Ganesh, Lukas Schott, Niclas Popp, Thomas Brox

机构 * University of Freiburg(弗赖堡大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Aleph Alpha Research(Aleph Alpha研究) University of Tübingen(图宾根大学)

AI总结 研究发现经典知识蒸馏在语义分割中表现优异,通过匹配计算量,传统logit和特征蒸馏方法优于最新专用方法,且扩展训练下达到SOTA性能。

Comments Presented at Efficient Computer Vision (ECV) Workshop, CVPR 2026. 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24169 2026-04-30 cs.CV

PointTransformerX: Portable and Efficient 3D Point Cloud Processing without Sparse Algorithms

PointTransformerX:无需稀疏算法的便携式和高效3D点云处理

Laurenz Reichardt, Nikolas Ebert, Oliver Wasenmüller

机构 * Mannheim University of Applied Sciences(曼海姆应用科学大学)

AI总结 PointTransformerX采用全PyTorch原生的视觉Transformer架构,无需定制CUDA运算符,通过3D-GS-RoPE实现高效的3D空间关系编码,提升3D点云处理的准确性和效率,同时在ScanNet上达到98.7%的准确率,参数更少,速度更快,内存更小。

Comments This paper has been accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12807 2026-04-30 cs.CV cs.AI

Rethinking Satellite Image Restoration for Onboard AI: A Lightweight Learning-Based Approach

重新思考卫星图像恢复用于机载AI:一种轻量级学习方法

Adrien Dorise, Marjorie Bellizzi, Omar Hlimi

机构 * Institut de Recherche Technologique Saint Exupéry(圣艾克苏佩里技术研究院) Centre national d’études spatiales(国家空间科学中心)

AI总结 本文提出ConvBEERS模型,通过轻量级残差卷积网络实现卫星图像恢复,在模拟数据和真实影像上均取得PSNR提升和目标检测性能提升,验证了其在空间系统中的可行性。

Comments Accepted at AI4SPACE@CVPR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20340 2026-04-30 cs.CV

The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection

细节决定成败:通过关键帧驱动的细节注入增强视频虚拟试衣

Qingdong He, Xueqin Chen, Yanjie Pan, Peng Tang, Pengcheng Xu, Zhenye Gan, Chengjie Wang, Xiaobin Hu, Jiangning Zhang, Yabiao Wang

机构 * Tencent Youtu Lab(腾讯优图实验室) TU Delft(代尔夫特理工大学) Fudan University(复旦大学) Western University(西部大学)

AI总结 本文提出KeyTailor框架和ViT-HD数据集,通过关键帧驱动的细节注入策略提升视频虚拟试衣的服装真实性和背景完整性,实验表明其在动态和静态场景中表现更优。

Comments Accepted by CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20032 2026-04-30 cs.CV

Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

告诉模型该看哪里:通过视觉引导注意力缓解大语言模型的幻觉

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科技东南学院) Zhongguancun Laboratory(中关村实验室)

AI总结 本文提出视觉引导注意力(VGA),通过构建精确的视觉基础并引导模型关注相关区域,缓解大语言模型在视觉任务中的幻觉问题,且无需额外训练。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13285 2026-04-30 cs.CV

SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design

SkyReels-Text: 精细可控字体文本编辑用于海报设计

Yunjie Yu, Jingchen Wu, Junchen Zhu, Chunze Lin, Guibin Chen

机构 * Skywork AI

AI总结 本文提出SkyReels-Text,一种可精细控制字体的文本编辑框架,支持多区域文本同时编辑,保留非编辑区域的视觉效果,无需字体标签或测试时微调,实现高质量字体控制。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24867 2026-04-30 cs.CV cs.AI

Time Blindness: Why Video-Language Models Can't See What Humans Can?

时间盲:为什么视频语言模型无法看到人类能看见的东西?

Ujjwal Upadhyay, Mukul Ranjan, Zhiqiang Shen, Mohamed Elhoseiny

机构 * KAUST(卡士大学) VILA Lab, MBZUAI(VILA实验室,MBZUAI)

AI总结 研究揭示视频语言模型在处理纯时间序列信息时的局限性,提出SpookyBench基准测试,显示人类在识别时间序列中的形状、文本和模式上准确率高达98%,而最先进的VLMs却无法做到,指出模型过度依赖空间特征而非时间线索。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25642 2026-04-29 cs.CV cs.AI

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

预填充阶段干预用于缓解大视觉-语言模型中的幻觉

Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences(上海先进研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PTI方法,在预填充阶段干预KV缓存以减少幻觉,通过模态感知方向修正错误表示,提升模型可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17070 2026-04-29 cs.CV

NTIRE 2026 Rip Current Detection and Segmentation (RipDetSeg) Challenge Report

2026年NTIRE RipDetSeg挑战报告

Andrei Dumitriu, Aakash Ralhan, Florin Miron, Florin Tatui, Radu Tudor Ionescu, Radu Timofte, Abdullah Naeem, Anav Katwal, Ayon Dey, Md Tamjidul Hoque, Asuka Shin, Hiroto Shirono, Kosuke Shigematsu, Gaurav Mahesh, Anjana Nanditha, Jiji CV, Akbarali Vakhitov, Sang-Chul Lee, Xinger Li, Chun'an Yu, Junhao Chen, Yang Yang, Gundluri Yuvateja Reddy, Harshitha Palaram, Gejalakshmi N, Jeevitha S, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yaokun Shi, Amitabh Tripathi, Modugumudi Mahesh, Santosh Kumar Vipparthi, Subrahmanyam Murala

机构 * University of Bucharest, Romania(布加勒斯特大学,罗马尼亚)

AI总结 本报告介绍了NTIRE 2026 RipDetSeg挑战,旨在通过图像自动识别险滩流。挑战基于RipVIS基准,评估检测与分割性能,数据集覆盖10多个国家,包含4种相机方向和多样的海滩与海况,最终有159名参与者提交了9份有效结果。

Comments Challenge report paper from NTIRE Workshop at CVPR 2026

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09923 2026-04-29 cs.CV

Splatent: Splatting Diffusion Latents for Novel View Synthesis

Splatent: 基于扩散模型的潜在空间光场表示用于新视角合成

Or Hirschorn, Omer Sela, Inbar Huberman-Spiegelglas, Netalee Efrat, Eli Alshan, Ianir Ideses, Frederic Devernay, Yochai Zvik, Lior Fritz

机构 * Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

AI总结 Splatent通过多视图注意力机制在2D中恢复细节,提升VAE潜在空间光场重建质量,实现高精度稀疏视角3D重建。

Comments CVPR 2026. Project's webpage at https://orhir.github.io/Splatent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03043 2026-04-29 cs.CV

OneThinker: All-in-one Reasoning Model for Image and Video

OneThinker:面向图像和视频的统一推理模型

Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan Home(美团家)

AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。

Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25466 2026-04-29 cs.CV

Generalizable Human Gaussian Splatting via Multi-view Semantic Consistency

基于多视角语义一致性的通用人体高斯点云生成

Jingi Kim, Wonjun Kim

机构 * Konkuk University(韩国 Konkuk 大学)

AI总结 本文提出基于多视角语义一致性的方法,通过预测深度图和跨视角注意力机制,解决多视角输入下人体3D高斯点云定位不一致问题,提升渲染质量。

Comments 10 pages, 8 figures, CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25329 2026-04-29 cs.RO

ProDrive: Proactive Planning for Autonomous Driving via Ego-Environment Co-Evolution

ProDrive:通过自我环境共演实现自动驾驶的前瞻性规划

Chuyao Fu, Shengzhe Gan, Zhuoli Ouyang, Yuhan Rui, Xiaowei Chi, Sirui Han, Jiankun Wang, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 ProDrive通过自我环境共演实现自动驾驶前瞻性规划,结合查询导向的轨迹规划器和鸟瞰图世界模型,提升安全性和规划效率。

Comments Accepted to CVPR 2026 GigaBrain Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25276 2026-04-29 cs.CV

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

OmniVTG:一种大规模数据集和开放世界视频时间定位的训练范式

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Central Media Technology Institute, Huawei Technologies Ltd.(华为技术有限公司中央媒体技术研究所) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究所)

AI总结 本文提出OmniVTG数据集和Self-Correction Chain-of-Thought训练范式,通过语义覆盖迭代扩展管道构建大规模数据集,并利用多模态大语言模型的密集描述能力提升视频时间定位性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏