arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 552
2607.03960 2026-07-07 cs.CV 新提交

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

奖励闪电:通过同源偏好蒸馏实现快速视频生成

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Kai Yu, Peng Zhang, Tianxiang Zheng, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

AI总结 研究视频扩散模型中同时进行偏好对齐和蒸馏加速的挑战,提出统一框架Reward Lightning,利用同源原理在共享表示中对齐和加速模型,介绍潜在奖励模型和同源偏好蒸馏,实验证明其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03899 2026-07-07 cs.CV 新提交

DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models

DICT:用于扩散模型条件图像生成的数据注入和对比轨迹细化

Chunnan Shang, Xin Zhang, Zhizhong Wang, Hongwei Wang

机构 * Zhejiang University(浙江大学)

AI总结 针对条件图像生成,提出DICT方法。通过数据注入将噪声扰动条件信号融入早期去噪阶段,结合对比轨迹细化,在统一扩散框架下提升生成质量,且无需引入任务相关架构,跨任务转移效果好。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03891 2026-07-07 cs.CV 新提交

BAT3R: Bootstrapping Articulated 3D Reconstruction from 2D Image Collections

BAT3R:从二维图像集合中自训练关节式三维重建

Jakub Zadrozny, Oisin Mac Aodha, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学)

AI总结 研究从单张图像进行关节物体3D重建,利用未标注2D图像集和单个绑定规范网格,提出训练框架,通过拟合网格到预测点图迭代估计关节和相机姿态,提升模型性能。

Comments Accepted to ECCV 2026. Project page: https://jakubzadrozny.github.io/bat3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03855 2026-07-07 cs.CV 新提交

PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur

PRISM3D:极端运动模糊下物理一致场景建模的概率细化与鲁棒初始化

Gopi Raju Matta, Reddypalli Trisha, Vemunuri Divya Madhuri, Kaushik Mitra

机构 * Computational Imaging Lab, Dept. of Electrical Engineering, IIT Madras(印度理工学院马德拉斯分校电气工程系计算成像实验室)

AI总结 研究从极端运动模糊图像进行盲3D场景重建问题,提出PRISM3D框架,用鲁棒初始化策略结合概率物理方法,还介绍多模态扩展PRISM3D-E及基准,实验表明其达新的最优性能。

Comments Accepted to ECCV-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03825 2026-07-07 cs.CV cs.AI 新提交

Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

Q-TriM:用于视听问答的问题引导三模态注意力

SungHun Kim, SeungJun Baek

机构 * Dept. of Computer Science and Engineering(计算机科学与工程系)

AI总结 研究视听问答问题,提出Q-TriM以浅并行方式进行多模态融合,引入基于文本的视频和音频注意力操作框架,避免深度堆叠融合的问题,在三个基准测试中达最优性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03822 2026-07-07 cs.CV 新提交

FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction

FDR-Occ:用于全光谱3D占用预测的因子分解密集路由

Dubing Chen, Huan Zheng, Tianyi Yan, Yucheng Zhou, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学物联网与智慧城市国家重点实验室、计算机与信息科学系) Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法里智能驾驶有限公司) Geely Automobile Research Institute (Ningbo) Co., Ltd.(吉利汽车研究院(宁波)有限公司)

AI总结 研究基于视觉的3D占用预测,将视图变换抽象为无约束二分路由并提出因子分解密集路由(FDR),引入分辨率-上下文解耦架构,实验表明该框架性能优,在未校准设置中结构稳健性强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03817 2026-07-07 cs.CV 新提交

Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection

全局逻辑与局部搜索:用于可验证工业异常检测的双流多模态上下文学习

Runzhi Deng, Yundi Hu, Yiming Zhong, Zhao Wang, Xixi Liu, Hongsong Wang, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Southeast University(东南大学)

AI总结 针对工业异常检测难题,提出无训练框架GLLS,利用视觉逻辑图谱组织参考和规范,结合全局逻辑流与细粒度动作流,实验表明其优于基线且决策可追溯

Comments Accepted by ECCV 2026. 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03771 2026-07-07 cs.CV 新提交

City-Level 3D Surface Reconstruction with Viewpoint Orientation Partitioning and Scene Completion

基于视点方向划分和场景补全的城市级三维表面重建

Liang Han, Wenyuan Zhang, Junsheng Zhou, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

AI总结 针对多视图三维表面重建难题,提出基于视点方向的场景划分方法,确保相似方向视图共同参与以精确估计深度,并行计算更均衡,还提出检测修复点云缺失区域策略,提升大规模场景重建质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03770 2026-07-07 cs.CV cs.AI cs.LG 新提交

Self-Improving Diffusion Classifiers with Minority Preference Optimization

通过少数偏好优化实现自我改进的扩散分类器

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

机构 * Korea University(韩国大学) Kook Min University(国民大学) Kyung Hee University(庆熙大学)

AI总结 研究发现扩散分类器感知偏向多数区域,提出MiPO方法,利用少数偏好奖励微调预训练扩散模型,无需额外图像数据等,经实验验证可缓解偏差并提升零样本扩散分类性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03765 2026-07-07 cs.CV 新提交

Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors

通过具有法线先验的高置信度深度传播,使用高斯点云进行稀疏视图曲面重建

Liang Han, Bangcai Wei, Junsheng Zhou, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) China Telecom(中国电信) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

AI总结 研究稀疏视图的3D重建难题,提出基于3D高斯点云的方法,用法线引导深度传播扩展深度信息,引入异常深度边缘感知正则化处理深度不连续,实验表明该方法优于现有技术。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03644 2026-07-07 cs.CV cs.AI 新提交

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

月光石:用于月球遥感的多模态基础模型及基准

Ayush Prasad, Swarnalee Mazumder

机构 * Space and Earth Observation Centre, Finnish Meteorological Institute(芬兰气象研究所空间与地球观测中心) German Climate Computing Centre(德国气候计算中心)

AI总结 针对月球多模态遥感数据分散且无评估机器学习基准的问题,引入月光石基准。贡献包括构建全球月球预训练数据集,提出MG-MAE模型,创建涵盖多任务的基准,其预训练特征在各任务中表现出色。

Comments Accepted for publication in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03595 2026-07-07 cs.CV cs.AI cs.RO 新提交

Token-Based Affordance Grounding with Large Vision-Language Models

基于令牌的大型视觉语言模型的可供性基础

Seung Il Lee, Qinqian Lei, Daguang Xu, Dong Yang, Robby T. Tan, Yixin Chen, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达)

AI总结 研究旨在解决现有视觉语言模型在行动定位上的问题,提出TokAG零样本可供性基础框架,利用令牌级语义空间信号定位相关区域,引入空间感知令牌选择机制,在多基准测试中优于先前方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03461 2026-07-07 cs.CV cs.LG 新提交

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03277 2026-07-07 cs.CV 新提交

Defending from GeoLocalization through Adversarial Road Trips

通过对抗性公路旅行抵御地理定位

Niccolò Niccoli, Federico Becattini, Lorenzo Seidenari

机构 * University of Florence(佛罗伦萨大学) University of Siena(锡耶纳大学)

AI总结 研究基于检索的图像地理定位技术隐私安全问题,提出公路旅行攻击(RTA),将对抗过程视为找最优干扰路径,用束搜索算法构造错误位置序列,能在黑盒设置中实现高可迁移攻击。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03110 2026-07-07 cs.CV 新提交

ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion

ExpoMotion:用于多曝光融合的大规模基准和豪斯霍尔德投影网络

Yao Liu, Lishen Qu, Shihao Zhou, Jie Liang, Hui Zeng, Yabin Peng, Huipeng Lin, Lei Zhang, Jufeng Yang

机构 * Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开大学国际研究院(深圳·福田)) Pengcheng Laboratory(鹏城实验室) College of Computer Science, Nankai University(南开大学计算机科学学院) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 针对多曝光融合中运动重影及高质量动态基准稀缺问题,提出ExpoMotion基准,含多样序列和图像及高保真真值。还提出豪斯霍尔德正交投影网络,通过变换解耦多帧对齐,实验验证了其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03069 2026-07-07 cs.CV 新提交

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03043 2026-07-07 cs.CV 新提交

Natural Language Camera Movement Understanding

自然语言相机运动理解

Yuwen Tan, Joey Huang, Jin Huang, Haoxiang Li, Boqing Gong

机构 * Boston University(波士顿大学) Pixocial Technology(皮克索西尔科技公司)

AI总结 研究自然语言相机运动理解问题,指出现有视觉语言模型在此任务上的不足。核心方法是建立分类法、基准和训练集。主要贡献是微调的VLM - 8B在基准测试中性能优于Gemini 3.1 Pro。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02963 2026-07-07 cs.CV cs.AI cs.MM 新提交

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

用于全模态密集视频字幕的并行自回归解码

Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究密集视频字幕生成,提出并行自回归框架,利用事件间弱局部依赖重组因果依赖图,引入全局规划和事件分解并行解码机制,提升效率与字幕性能。

Comments ECCV 2026. Project website: https://github.com/showlab/PadCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02959 2026-07-07 cs.CV cs.LG 新提交

Incentivizing Vision Language Models to Search for Long Video Question Answering

激励视觉语言模型进行长视频问答搜索

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究将长视频问答从被动单流程感知任务转变为多轮检索过程,核心方法是自然语言驱动搜索及强化学习后训练,贡献是提升长视频理解基准测试分数。

Comments To appear at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02908 2026-07-07 cs.CV 新提交

Holo-Captioning: Toward the Text Equivalent of 3D Scenes

全息字幕:迈向3D场景的文本等效物

Kun-Yu Lin, Chengke Bu, Zhenguo Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Frontier Robotics(前沿机器人)

AI总结 研究提出全息字幕任务,先将其定义为生成结构化文本描述,开发字幕引擎及大规模基准,在此基础上提出HoloScribe模型,还给出评估指标和测试集,该模型性能超现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02907 2026-07-07 cs.CV cs.CL 新提交

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维

Peiming Li, Yifan Wang, Xiaotian Zhang, Zhiyuan Hu, Shiyu Li, Zheng Wei, Yang Tang

机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02886 2026-07-07 cs.CV cs.AI cs.LG 新提交

SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness

SPLIT:通过空间补丁级不连贯性和时间粗糙度进行无训练的人工智能生成和部分编辑视频检测

Jongyeop Hyun, Hyounghun Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程系)

AI总结 研究提出无训练检测器SPLIT,利用冻结视觉编码器的补丁令牌检测全生成和部分编辑视频。通过计算两步时间粗糙度和局部空间运动不连贯性两个互补信号,经融合及伽马校正提升检测性能,还提出服务对齐评估协议。

Comments ECCV 2026 (32 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02829 2026-07-07 cs.LG 新提交

Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction

更少令牌,更优预测:用于高效天气预报的稀疏残差路由

Janet Wang, Yunbei Zhang, Lin Zhao, Xi Xiao, Jihun Hamm, Xiao Wang

机构 * Tulane University(杜兰大学) Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Oak Ridge National Laboratory(橡树岭国家实验室)

AI总结 研究针对现有基于ViT的天气预报模型计算冗余问题,提出无参数插件路由模块Sparse-Reslim,通过稀疏令牌处理兼顾固定网格要求,提升预报精度并大幅降低成本。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02799 2026-07-07 cs.CV 新提交

Conversational Human Audio-visual Talking Dialogue Generation

对话式人类视听对话生成

Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Earth Science & Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, Heriot-Watt University(赫瑞瓦特大学计算机科学系) School of Computer Science, Northumbria University(诺森比亚大学计算机科学学院) College of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学广东省智能信息处理重点实验室) School of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

AI总结 提出CHAT框架,统一大语言模型和说话人脸模型,通过交互音频和面部行为细化模块,从单一文本提示生成多样、配对且相互响应的语音-面部对话片段,优于现有方法,合成数据集可作预训练数据。

Comments Accepted to ECCV 2026 as a main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02712 2026-07-07 cs.CV 新提交

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

归一化物体坐标空间中用于生成视图合成的全局姿态控制

Zhibing Li, Amogh Gupta, Behnoosh Parsa, Dan Casas

机构 * The Chinese University of Hong Kong(香港中文大学) Amazon(亚马逊)

AI总结 针对现有生成模型在目标视图全局控制上的不足,提出在归一化物体坐标空间中精确相机控制的新方法,以单张或少量无姿态图像为输入,将视图合成视为图像编辑问题,提升了视图生成质量和保真度。

Comments Accepted to ECCV 2026. Project page https://lizb6626.github.io/GlobalNVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02643 2026-07-07 cs.CV 新提交

BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models

BiSLW:用于生成扩散模型的双谱潜在水印

Aryan Pandit

机构 * PDPM Indian Institute of Information Technology, Jabalpur(印度信息技术学院(贾巴尔普尔))

AI总结 研究针对扩散生成模型易被非法使用且缺乏可靠溯源方法的问题,提出BiSLW框架,利用潜在空间频率结构在互补谱带嵌入身份信号,平衡感知保真度与鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02593 2026-07-07 cs.CV cs.CL 新提交

Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

多模态大语言模型知识蒸馏的令牌级响应视觉注意力引导

Jaehyun Jang, Eunseop Yoon, Hee Suk Yoon, SooHwan Eom, Mark A. Hasegawa-Johnson, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究多模态大语言模型知识蒸馏,挑战传统依赖,发现下游性能与响应视觉注意力相似度强相关。提出令牌级响应视觉注意力引导方法,通过自适应加权散度,有效引导学生模型,实验证明其性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01983 2026-07-07 cs.CV cs.LG 新提交

Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment

基于双判别器扩散对齐的开放天气鲁棒3D检测

Shuyao Li, Chuanxing Geng, Heyang Sun, Qiang Zhou, Jingjing Gu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(工业和信息化部模式分析与机器智能重点实验室)

AI总结 提出双判别器引导扩散对齐(DCDA)框架,通过4D雷达条件扩散过程恢复退化LiDAR特征,无需显式天气建模,在未见天气类型和强度下实现鲁棒3D检测。

Comments 18 pages, 6 figures, 8 tables. ECCV 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01885 2026-07-07 cs.CV 新提交

Diversity-aware View Partitioning for Scalable VGGT

面向可扩展VGGT的多样性感知视图划分

Jinsoo Park, Donggyu Choi, Ahyun Seo, Minsu Cho, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) KAIST(韩国科学技术院) RLWRLD

AI总结 针对VGGT在大量视图下注意力计算成本高且冗余视图降低性能的问题,提出基于视觉差异和空间分散的图划分方法,将视图组织为多样性感知的平衡块,减少冗余注意力交互,提升相机位姿估计、多视图深度预测和3D重建性能。

Comments 34 pages, 11 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏