arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 325
2606.26740 2026-07-14 cs.CV 版本更新

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

LiveEdit:迈向基于扩散的实时流式视频编辑

Xinyu Wang, Chongbo Zhao, Fangneng Zhan, Yue Ma

机构 * THU(清华大学) HKUST(香港科技大学)

AI总结 提出一种因果逐帧编辑的流式视频框架,通过三阶段蒸馏将双向模型能力迁移至单向流式编辑器,结合AR掩码缓存实现12.66 FPS的实时编辑,并保持背景稳定。

Comments Accepted by ECCV 2026, Project page: https://live-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26515 2026-07-14 cs.CV 版本更新

Forget, Anticipate and Adapt: Test Time Training for Long Videos

遗忘、预期与适应:长视频的测试时训练

Rajat Modi, Sebastian Noel, Xin Liang, Yogesh Singh Rawat

机构 * University of Central Florida(中佛罗里达大学)

AI总结 提出帧遗忘网络(FFN),通过仅处理滑动窗口中的三帧并定义惊奇度量自适应调整窗口,实现长视频的高效测试时训练。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18757 2026-07-14 cs.CV 版本更新

Driving Like Yourself: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving

驾驶千面:一个闭环个性化端到端自动驾驶的基准

Xiaoru Dong, Ruiqin Li, Xiao Han, Zhenxuan Wu, Jiamin Wang, Jian Chen, Qi Jiang, SM Yiu, Xinge Zhu, Yuexin Ma

机构 * The University of Hong Kong(香港大学) ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出Person2Drive平台,通过个性化数据集、评价指标和框架,解决自动驾驶个性化难题,实现细粒度分析与有效个性化。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26599 2026-07-14 cs.CV 版本更新

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

VGGRPO:迈向世界一致的视频生成的4D潜在奖励

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore Gazulla

机构 * Google(谷歌) University of Oxford(牛津大学) CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) University of Copenhagen(哥本哈根大学)

AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。

Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17665 2026-07-14 cs.CV 版本更新

OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents

OpenEarthAgent:一个用于工具增强地理空间代理的统一框架

Akashah Shabbir, Muhammad Umer Sheikh, Muhammad Akhtar Munir, Hiyam Debary, Mustansar Fiaz, Muhammad Zaigham Zaheer, Paolo Fraccaro, Fahad Shahbaz Khan, Muhammad Haris Khan, Xiao Xiang Zhu, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) IBM Research(IBM研究院) Linköping University(林霍姆斯大学) Technical University Munich(慕尼黑技术大学) Australian National University(澳大利亚国立大学)

AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。

Comments Accepted at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16112 2026-07-14 cs.CV 版本更新

AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs

AutoV:面向视觉提示检索的损失导向排名用于大视觉-语言模型

Yuan Zhang, Chun-Kai Fan, Sicheng Yu, Junwen Pan, Tao Huang, Ming Lu, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoV通过损失导向的提示检索提升大视觉-语言模型在图像理解等任务中的性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13132 2026-07-14 cs.CV 版本更新

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21095 2026-07-14 cs.CV 版本更新

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

UniRec-0.1B:具有1亿参数的统一文本和公式识别

Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 研究旨在实现文本和公式的统一识别,提出含1亿参数的UniRec-0.1B模型。通过构建大规模数据集,应对层次结构变异性和语义纠缠等挑战,引入分层监督训练和语义解耦分词器。实验证明该模型优于同类,且速度大幅提升,有效且高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23086 2026-07-13 cs.LG cs.CV 版本更新

Policy-based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards

基于策略的自回归图像模型实例和分布级奖励调优

Orhun Bugra Baran, Melih Kandemir, Ramazan Gokberk Cinbis

机构 * Middle East Technical University (METU)(中东部技术大学) University of Southern Denmark(南部丹麦大学)

AI总结 本文提出一种轻量级强化学习框架,通过将基于标记的自回归合成视为马尔可夫决策过程,结合分布级LOO-FID奖励和实例级CLIP/HPSv2奖励,提升图像生成的质量和多样性。

Comments Accepted at the European Conference on Computer Vision (ECCV), 2026. This version includes the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05711 2026-07-13 cs.CV 版本更新

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

任何到完整:提示深度任何物以完成深度估计的一阶段

Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, Desheng Zhang

机构 * Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学) JD Logistics(京东物流) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 Any2Full提出一种单阶段深度完成框架,通过尺度提示适应预训练MDE模型,提升鲁棒性和效率,优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18822 2026-07-13 cs.CV 版本更新

Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations

鲁棒的自监督跨模态超分辨率对抗真实世界错位观测

Xiaoyu Dong, Jiahuan Li, Ziteng Cui, Naoto Yokoya

机构 * The Univsrsity of Tokyo(东京大学) RIKEN AIP(理化学研究所)

AI总结 RobSelf通过自监督方法实现鲁棒的跨模态超分辨率,通过误对齐感知的特征翻译和内容感知的参考滤波器提升性能和效率。

Comments ECCV 2026. Supp: https://drive.google.com/file/d/1fqTYuSY7Qp7PFHiHViZs7y6lz6Bws7ws/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13907 2026-07-13 cs.CV 版本更新

White Aggregation and Restoration for Few-shot 3D Point Cloud Semantic Segmentation

用于少样本3D点云语义分割的白色聚合与恢复

Jiyun Im, SuBeen Lee, Miso Lee, Jae-Pil Heo

机构 * Sungkyunkwan University(全州大学)

AI总结 研究少样本3D点云语义分割,针对现有方法问题,提出基于注意力机制的白色聚合与恢复模块(WARM),解决分布差距,生成有效原型,在多个数据集上取得良好性能,证明其在确定性原型生成中的有效性。

Comments Accepted to ECCV 2026. 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01204 2026-07-10 cs.CV cs.AI cs.GR cs.LG 版本更新

Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction

基于神经谐波纹理的高质量基于原始体的神经重建

Jorge Condor, Nicolas Moenne-Loccoz, Merlin Nimier-David, Piotr Didyk, Zan Gojcic, Qi Wu

机构 * NVIDIA(英伟达) Università della Svizzera italiana(瑞士意大利语区大学)

AI总结 本文提出神经谐波纹理,通过虚拟框架锚定潜在特征向量,实现高效实时视图合成,融合原始体与神经场方法,提升高频细节建模能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01388 2026-07-10 cs.CV 版本更新

LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

LESV: 语言嵌入稀疏体素融合用于开放词汇3D场景理解

Fusang Wang, Nathan Piasco, Moussab Bennehar, Luis Roldão, Dzmitry Tsishkou, Fabien Moutarde

机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) CAOR, Mines Paris-PSL, France(法国巴黎高科矿业学院CAOR实验室)

AI总结 本文提出LESV框架,通过稀疏体素 rasterization 解决3D场景理解中空间和语义模糊问题,利用AM-RADIO实现密集对齐,提升细粒度查询性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12478 2026-07-10 cs.CV cs.LG 版本更新

Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化

Rujie Wu, Haozhe Zhao, Hai Ci, Yizhou Wang

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11117 2026-07-10 cs.CV 版本更新

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-07-10 cs.CV 版本更新

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20644 2026-07-10 cs.CV 版本更新

Vision-Language Memory for Spatial Reasoning

用于空间推理的视觉语言记忆

Zuntao Liu, Yi Du, Taimeng Fu, Shaoshu Su, Cherie Ho, Chen Wang

AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。

Comments Accepted to European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19422 2026-07-10 cs.CV 版本更新

LlamaSeg: Image Segmentation via Autoregressive Mask Generation

LlamaSeg:通过自回归掩码生成进行图像分割

Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Tsinghua University(清华大学) Shenzhen University(深圳大学) Meituan(美团) Division of AMC and Department of ECE, HKUST(HKUST AMC 分部和电子工程系)

AI总结 LlamaSeg是通过自然语言指令统一图像分割任务的视觉自回归框架,将分割视为视觉生成,编码掩码为视觉令牌。引入数据标注管道和SA-OVRS数据集,能基于文本提示定位对象并生成掩码,实验显示其在分割基准上表现出色。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19238 2026-07-09 cs.CV 版本更新

Allo{SR}$^2$: Rectifying One-Step Super-Resolution to Stay Real via Allomorphic Generative Flows

Allo{SR}$^2$: 通过全形生成流纠正一步超分辨率以保持真实

Zihan Wang, Xudong Huang, Junbo Qiao, Wei Li, Jie Hu, Xinghao Chen, Shaohui Lin

机构 * East China Normal University Huawei Noah's Ark Lab(华东师范大学华为诺亚实验室)

AI总结 本文提出Allo{SR}$^2$,通过全形生成流纠正一步超分辨率轨迹,以维持高保真生成现实。方法利用SNR引导轨迹初始化和FATC确保稳定路径,同时通过ATM策略减少分布差异,实验证明其在真实世界超分辨率中表现优异。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16446 2026-07-09 cs.CV 版本更新

Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline

统一去除雨滴和反射:一个新的基准和一个新流程

Xingyu Liu, Zewei He, Yu Chen, Chunyu Zhu, Zixuan Chen, Xing Luo, Zhe-Ming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空航天学院) Huanjiang Laboratory(浣江实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出统一去除雨滴和反射的任务,并构建了新的基准数据集,同时提出基于扩散的新型框架DiffUR³,有效去除两种退化,实验表明在基准和真实场景中表现优异。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07831 2026-07-09 cs.CR cs.CL cs.CV 版本更新

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Junxian Duan, Huaibo Huang, Jie Cao, Ran He

机构 * SAIS, UCAS(中国科学院大学人工智能学院) SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。

Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05249 2026-07-09 cs.CV 版本更新

RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes

RL-AWB: 基于深度强化学习的低光夜间场景自动白平衡校正

Yuan-Kang Lee, Kuan-Lin Chen, Chia-Che Chang, Yu-Lun Liu

机构 * MediaTek Inc.(联发科技股份有限公司) National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 本文提出RL-AWB框架,结合统计方法与深度强化学习解决低光环境下色彩恒常性问题,通过统计算法与强化学习动态优化参数,提升低光和明亮场景的泛化能力。

Comments ECCV 2026. Project page: https://ntuneillee.github.io/research/rl-awb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25739 2026-07-09 cs.CV 版本更新

MegaFlow: Zero-Shot Large Displacement Optical Flow

MegaFlow:零样本大位移光流

Dingxi Zhang, Fangjinhua Wang, Marc Pollefeys, Haofei Xu

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft(微软) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心)

AI总结 MegaFlow通过预训练视觉先验解决大位移零样本光流问题,利用全局Vision Transformer实现全局匹配,结合轻量迭代优化提升精度,实验显示其在多个光流基准和长距离点跟踪任务中表现优异。

Comments [ECCV 2026] Project Page: https://kristen-z.github.io/projects/megaflow Code: https://github.com/cvg/megaflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04547 2026-07-09 cs.LG cs.CV 版本更新

Activation Quantization of Vision Encoders Needs Prefixing Registers

视觉编码器的激活量化需要前缀寄存器

Seunghyeon Kim, Taesun Yeom, Jinho Kim, Wonpyo Park, Kyuyeun Kim, Jaeho Lee

机构 * POSTECH Dankook University(Dankook 大学) Google(谷歌)

AI总结 本文提出RegCache算法,通过引入前缀标记减少视觉编码器中的异常值,提升低比特量化模型性能,尤其在极低比特情况下效果显著。

Comments Accepted to ECCV 2026. Code: https://github.com/spbob0418/RegCache

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15685 2026-07-09 cs.MM cs.AI cs.CV cs.SD 版本更新

DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

DASH:动态音频驱动的语义分块以实现高效的多模态令牌压缩

Bingzhou Li, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

AI总结 DASH通过动态音频驱动的语义分块方法,有效压缩多模态令牌,提升推理效率,优于传统固定窗口分块和注意力剪枝方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21556 2026-07-09 cs.CV 版本更新

ECHO: Ego-Centric modeling of Human-Object interactions

ECHO:人类-物体交互的以自我为中心建模

Ilya A. Petrov, Vladimir Guzov, Riccardo Marin, Emre Aksan, Xu Chen, Daniel Cremers, Thabo Beeler, Gerard Pons-Moll

AI总结 ECHO首次提出统一框架,通过头和手腕追踪联合恢复人体姿态、物体运动和接触动力学,解决稀疏信号下的人类-物体交互建模难题。

Comments Accepted at ECCV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09385 2026-07-09 cs.CV 版本更新

EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation

EventVGGT:探索跨模态蒸馏以实现一致的基于事件的深度估计

Yinrui Ren, Jinjing Zhu, Kanghao Chen, Zhuoxiao Li, Jing Ou, Zidong Cao, Tongyan Hua, Peilun Shi, Yingchun Fu, Wufan Zhao, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(珠海)) CUHK(香港中文大学) SCNU(华南师范大学)

AI总结 EventVGGT通过跨模态蒸馏实现一致的基于事件的深度估计,有效提升深度预测精度和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏