arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 552
2607.16280 2026-07-21 cs.CV 新提交

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

3D FaceShell:作为视觉语言模型防御机制的3D人脸头像属性转移

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对VLM可从3D人脸渲染图像提取敏感属性的隐私挑战,提出3D FaceShell框架,通过可学习高斯壳产生扰动,在保持面部外观的同时引导VLM语义解释,实验证明其能有效提高属性注入和不匹配率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15868 2026-07-20 cs.CV cs.AI cs.GR cs.HC cs.RO 新提交

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

EgoExoMoCap:分布式自我-外部人体运动捕捉

Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo

机构 * Meta Reality Labs(元现实实验室) ETH Zürich(苏黎世联邦理工学院)

AI总结 针对头戴式设备人体运动捕捉,提出EgoExoMoCap分布式框架,联合自我与外部中心多模态信号,利用头部等跟踪信号及DINOv3特征,能在复杂场景中稳健重建运动,突破了两种范式孤立的局限。

Comments Accepted by ECCV 2026, Project page and code: https://siplab.org/projects/EgoExoMoCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15806 2026-07-20 cs.CV 新提交

HybridSim: A Physics-Learning Hybrid Digital Twin for mmWave Human Sensing

HybridSim:用于毫米波人体感知的物理学习混合数字孪生

Weitao Xiong, Tianyu Liu, Peng Li, Kok Chung Chua, Toa Chean Khim, Pu Wang, Hongfei Xue

机构 * Xiamen University Malaysia(厦门大学马来西亚分校) The Hong Kong University of Science and Technology(香港科技大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 研究针对毫米波雷达信号模拟成本高问题,提出HybridSim混合模拟器,用三平面和图卷积网络等提取人体特征、稳定优化,通过逆渲染等建模信号路径,实验显示其能有效增强特定地点数据,提升人体感知任务表现。

Comments Accepted to ECCV 2026. Project Page: https://weitao-xiong.github.io/HybridSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15699 2026-07-20 cs.CV 新提交

GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking

GoStop:基于强化学习的事件驱动特征跟踪中的自适应时间聚合

Youngho Kim, Hoonhee Cho, Jae-Young Kang, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 研究基于事件相机的特征跟踪问题,提出用强化学习框架自适应控制事件累积过程,训练智能体依运动线索决策,引入新数据集评估,集成该框架到现有方法可提升性能,在动态运动下更具鲁棒性且平衡跟踪精度与效率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15652 2026-07-20 cs.CV 新提交

CSS-BA: Gate-Guided Column Space Search for Bundle Adjustment

CSS-BA:用于光束法平差的门控列空间搜索

Ayano Kaneda, Takafumi Taketomi, Shugo Yamaguchi, Shigeo Morishima

机构 * Waseda University(早稻田大学) CyberAgent, Inc.(株式会社CyberAgent)

AI总结 针对低视差和近旋转情况下传统BA法病态问题,提出门控引导的CSS-BA,通过结合CSS和几何感知门控稳定舒尔-LM更新,所有参数保留在优化中,仅限制更新方向,实验显示其优化稳定、姿态精度提高且校准有竞争力。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15491 2026-07-20 cs.CV 新提交

Trajectory-aware Cross-view Geo-localization with Sequential Observations

基于序列观测的轨迹感知跨视角地理定位

Tianyi Gao, Jiayu Lin, Danielle Beaulieu, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 研究跨视角地理定位,提出TrajLoc统一框架处理视频片段和路线描述,利用视觉与语言语义相互强化匹配,还提出TrajMod模块,实验显示该框架在视频和文本地理定位上比现有方法有显著优势。

Comments Accepted to ECCV 2026. Project Page: https://humblegamer.github.io/trajloc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14976 2026-07-17 cs.CV 新提交

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

从带草稿到无草稿:通过特权蒸馏和快速植入实现一步视频对象移除

Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

AI总结 研究视频对象移除问题,提出D2DF框架,通过特权蒸馏和自引导快速植入模块,将教师模型多步细化能力提炼到学生模型,实现一步视频对象移除,在质量和效率上优于传统及多步生成方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14927 2026-07-17 cs.CV 新提交

TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization

TanGO:通过切线空间引导和优化实现免训练3D编辑

Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo, Hyeonseo Yun, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Chung-Ang University(中央大学)

AI总结 研究针对3D生成模型免训练编辑存在语义伪影的问题,提出TanGO框架,通过在切线空间自适应逐令牌引导,制定最优控制规则并确定控制信号强度,减少结构伪影,性能优于现有基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14737 2026-07-17 cs.CV cs.LG 新提交

GeoDetect: Geometric Adversarial Detection for VLPs

GeoDetect:用于视觉语言预训练模型的几何对抗检测

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

AI总结 研究视觉语言预训练模型易受对抗攻击问题,基于其嵌入空间几何结构特点,提出GeoDetect方法,利用几何分数识别对抗样本,经综合评估,该方法能可靠检测多种VLP架构及威胁设置下的对抗样本,提升模型安全性与可靠性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14560 2026-07-17 cs.CV 新提交

Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection

打破长增量3D目标检测中的模型遗忘循环

Peisheng Qian, Jie Xu, Xulei Yang, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Institute for Infocomm Research, A*STAR(资讯通信研究院,新加坡科技研究局)

AI总结 针对长增量3D目标检测中模型易遗忘问题,提出LDMR框架,通过监测训练检查点的类检测质量,驱动类人阶段内回顾和场景感知跨阶段记忆进化机制,有效减轻模型遗忘,性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14334 2026-07-17 cs.CV 新提交

MixCompress: Mixture of Experts for Variable Rate Learned Image Compression

MixCompress:用于可变速率学习图像压缩的专家混合模型

Calvin-Khang Ta, Praneet Singh, Tong Shao, Peng Yin

机构 * Dolby Laboratories(杜比实验室)

AI总结 研究针对学习图像压缩中为各率失真点存独立模型的问题,提出MixCompress框架,用稀疏门控专家混合路由减轻梯度冲突,引入深度混合扩展动态扩模型容量,结合条件辅助变换,有效提升性能,建立新的帕累托前沿。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13504 2026-07-16 cs.CV 新提交

DP-BOA: Dirichlet-Process Birth-or-Assign for On-the-Fly Category Discovery

DP-BOA:用于实时类别发现的狄利克雷过程出生或分配

Peiyan Gu, Zixin Teng, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

AI总结 研究实时类别发现问题,提出基于在线狄利克雷过程高斯混合模型的DP-BOA框架,通过比较后验预测证据决定样本归属并在线更新统计,在标准OCD基准测试中性能优异,新类别发现能力强且已知类精度有竞争力。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13456 2026-07-16 cs.CV cs.CG cs.GR 新提交

TreeSRNF: Square-Root Normal Fields for Generative Modelling of the Geometric and Structural Variability in Tree-like 3D Objects

TreeSRNF:用于树状3D对象几何和结构变异性生成建模的平方根法向场

Tahmina Khanam, Hamid Laga, Mohammed Bennamoun, Guanjin Wang, Ferdous Sohel, Farid Boussaid, Anuj Srivastava

机构 * Murdoch University(莫道克大学) University of Western Australia(西澳大利亚大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 该研究针对树状3D对象几何与结构变异性问题,将平方根法向场表示推广到此类对象,构建黎曼树状空间及度量,开发相关算法,可计算统计摘要并合成新对象,性能显著优于现有技术。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13421 2026-07-16 cs.CV cs.AI 新提交

ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding

ScanFocus:一种用于时空视频定位的从粗到细框架

Kai Chen, Ming Dai, Wenxuan Cheng, Wankou Yang

机构 * Southeast University(东南大学)

AI总结 研究时空视频定位问题,提出ScanFocus从粗到细框架,利用统一融合编码器和轻量级模块生成粗略提议,再用语义引导时间聚合器恢复细节,实验表明该方法性能优于以往方法。

Comments this paper has already been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13365 2026-07-16 cs.CV 新提交

DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation

DiffGI:用于高保真薄壳3D生成的可微几何图像

Eungjune Shim, Hansol Lee, Eunjung Ju

机构 * CLO Virtual Fashion Inc.(CLO虚拟时尚公司)

AI总结 DiffGI针对现有3D生成模型问题,提出端到端3D到2D映射框架,用连续函数取代二进制图,引入可微算法,训练相关模型,在薄壳3D生成中实现高保真、高精度,减少计算资源需求。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13336 2026-07-16 cs.CV cs.CR cs.LG 新提交

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization

深入探讨统一视频保护在图像到视频和基于微调的定制方面的时间挑战

Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

机构 * The University of Sydney(悉尼大学) University of Melbourne(墨尔本大学) City University of Hong Kong(香港城市大学) Wuhan University(武汉大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 研究针对基于扩散模型的视频定制引发的隐私等保护问题,提出TC-UAP方法,通过优化身份级多帧UAP并引入相关时间建模和损失,使其在时间上一致且鲁棒,在多种视频定制及攻击下实现强身份保护。

Comments This work provides a basis for the ECCV 2026 LifeGenIP Challenge on Unlearnable Videos against Diffusion-based Customization. Challenge page: https://lifegenip.cc/competition. Evaluation code: ECCV26_LifeGenIP_starting_kit" target="_blank" rel="noopener">https://github.com/tmllab/ECCV26_LifeGenIP_starting_kit. Project page: https://saythe17.github.io/TC-UAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13265 2026-07-16 cs.CV 新提交

Differentiable Polarized Path Tracing

可微偏振路径追踪

Pramod Rao, Jérémy Riviere, Xilong Zhou, Abhijeet Ghosh, Abhimitra Meka, Thabo Beeler, Marc Habermann, Christian Theobalt, Delio Vicini

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔兰信息学园区) VIA Research Center(VIA研究中心) Google(谷歌)

AI总结 研究逆渲染问题,提出偏振感知的可微路径追踪方法,通过路径重放和局部缓存组合估计无偏梯度,能在复杂场景中高效稳定优化材质和光照参数,拓宽基于物理的逆渲染适用性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12789 2026-07-15 cs.LG cs.CV 新提交

AVQ-Attention: Adaptive Vector-Quantized Attention

AVQ注意力:自适应向量量化注意力

Winfried van den dool, Patrick Forré, Amir Habibian, Yuki M. Asano, Max Welling

机构 * QUVA Lab, University of Amsterdam(QUVA实验室,阿姆斯特丹大学) AMLab, Informatics Institute, University of Amsterdam(AMLab,阿姆斯特丹大学信息学院) AI4Science Lab, University of Amsterdam(AI4Science实验室,阿姆斯特丹大学) Korteweg-de Vries Institute for Mathematics, University of Amsterdam(科特韦格 - 德弗里斯数学研究所,阿姆斯特丹大学) Qualcomm AI Research(高通人工智能研究公司) FunAI Lab, University of Technology Nuremberg(FunAI实验室,纽伦堡工业大学)

AI总结 研究针对Transformer模型注意力机制计算瓶颈,提出自适应向量量化(AVQ)注意力,基于注意力重要性分配码本容量,前向传播识别重要代码并用子码字细化,开发相关实现,保持\(\mathcal{O}(MN)\)复杂度,提升精度-效率权衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12774 2026-07-15 cs.CV cs.AI 新提交

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

第11届ABAW挑战赛中的HSEmotion团队:多任务学习与矛盾/犹豫视频识别

Aleksei Bakin, Andrey V. Savchenko

机构 * Central University(中央大学) Sber AI Lab(Sber人工智能实验室) HSE University(俄罗斯高等经济研究大学)

AI总结 在第11届ABAW挑战赛中,团队用冻结轻量级面部提取器等方法进行多任务学习,在s - Aff - Wild2数据集上超ConvNeXt基线;扩展视听管道用于矛盾/犹豫视频识别,在BAH数据集上提升性能,无需微调重型骨干,展示了轻量级融合的优势。

Comments to be submitted to ABAW-11 workshop of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12539 2026-07-15 cs.CV 新提交

DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models

DiTailed:在文本-图像到图像流匹配模型中确保视觉对象一致性

Francesco Taioli, Daniel Coelho, Iaroslav Melekhov, Roberto Alcover-Couso, Jose Miguel Grande Saiz, Virginia Fernandez Arguedas, Artur Bekasov

机构 * Amazon(亚马逊) Faculty(学院)

AI总结 研究文本引导图像编辑中生成模型视觉对象一致性问题,提出ABO-Edit数据集,发现图像编辑整流流模型条件嵌入空间特性,进而提出FlowMirror无参数辅助损失,无需架构改变提升了生成质量。

Comments Accepted to ECCV 2026. Project page: https://francescotaioli.github.io/DiTailed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12419 2026-07-15 cs.CV 新提交

DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection

DeGuNet:用于高效激光雷达-相机3D检测的深度引导超紧凑骨干网络

Haifa Zhang, Yijing Wang, Peixi Peng, Zhiqiang Zuo

机构 * Tianjin University(天津大学) Peking University(北京大学)

AI总结 研究针对自动驾驶中激光雷达与相机融合检测依赖2D预训练骨干网络的问题,提出DeGuNet,通过稀疏感知机制有效对齐图像与激光雷达深度,实验证明其能消除架构冗余,提升效率并提高mAP,建立参数高效多模态3D感知新范式。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12375 2026-07-15 cs.CV cs.AI eess.IV 新提交

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

IQA-T1:基于工具的图像质量评估视觉证据推理

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12297 2026-07-15 cs.CV 新提交

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

MobileSAM2:用于空间智能的轻量级图像分割模型

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学) SparcAI Inc.(SparcAI公司)

AI总结 研究旨在使SAM2更适用于移动设备,提出超图知识蒸馏方法HyperKD,由时间和粒度超图知识蒸馏构成,能有效建模转移知识。还推出MobileSAM2家族,经实验验证其在多基准测试及具身AI任务上有良好泛化性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12176 2026-07-15 cs.CV 新提交

A Calibrated Multimodal Ensemble for Ambivalence/Hesitancy Recognition: System Description and Private-Test Submission Strategy

用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))

AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。

Comments 8 pages, 1 figure, ECCV workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12042 2026-07-15 cs.CV cs.LG 新提交

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

SymbOmni:通过符号概念学习进化智能全能模型

Jinxiu Liu, Jianru Li, Tanqing Kuang, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * South China University of Technology(华南理工大学) Westlake University(西湖大学) Johns Hopkins University(约翰·霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对视觉生成模型无法累积学习与自主进化的问题,提出SymbOmni智能全能模型,通过符号概念学习和归纳-转导循环运行,经言语反向传播训练。实验验证其在多方面性能优越,能有效降低令牌消耗并实现持续学习。

Comments ECCV 2026 (49 pages, 10 figures, project page: https://spherelab.ai/symbomni)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11862 2026-07-14 cs.CV cs.AI 新提交

Evidence-Backed Video Question Answering

有证据支持的视频问答

Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) Brown University, Providence, RI, USA(布朗大学)

AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11798 2026-07-14 cs.CV cs.AI 新提交

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

StoryTeller:用于长格式音频描述的免训练叙事接地

Seung Hyun Hahm, Minh T. Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

AI总结 研究针对长格式音频描述问题,提出免训练的StoryTeller框架。它通过维护叙事记忆跨场景传递信息,仅用原始视频和标题,经语义过滤等确保信息准确。引入StoryAD-QA基准测试,实验证明该框架显著提升了叙事相关能力。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏