arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-27 至 2026-08-27 共收录 16
2608.25864 2026-08-27 cs.RO 新提交

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

MA-VLA:用于协作与组合泛化的多臂视觉-语言-动作模型

Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin, Changxing Xia, Heng Zhou, Talas Fu, Enshen Zhou, Ruimao Zhang, Zhenfei Yin, Huchuan Lu, Lijun Wang

机构 * Dalian University of Technology(大连理工大学) University of Oxford(牛津大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beihang University(北京航空航天大学)

AI总结 MA-VLA通过将协作行为分解为原子提示并引入Arm Shuffle训练方法,解决了多臂VLA模型的协作泛化问题,在未见过的协作模式下表现优于现有模型。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25736 2026-08-27 cs.CV 新提交

Moving Beyond More Views: Redundancy-Aware Ego-Exo Fusion for Proficiency Estimation

超越更多视角:面向熟练度估计的冗余感知自我-外部视角融合

Xu Dong, Wanqing Li, Anthony Adeyemi-Ejeye, Andrew Gilbert

机构 * University of Surrey(萨里大学) University of Wollongong(卧龙岗大学)

AI总结 该研究针对EgoExo熟练度估计中多视角冗余与过拟合问题,提出AdaMVS与VIB-GB模块,在EgoExo-4D等数据集上取得新SOTA结果。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25734 2026-08-27 cs.CV 新提交

InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control

InteractGesture:用于连续流协同语音手势控制的渐进式分块引导

Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

机构 * Meta University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对现有协同语音手势生成模型缺乏单关节细粒度空间可控性的问题,提出模型无关的推理时方法InteractGesture,通过渐进式分块引导解决分块依赖问题,在BEAT2数据集上实现多关节空间控制提升。

Comments ECCV 2026 Workshop - Interactive Social Avatars

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25692 2026-08-27 cs.CV 新提交

CloSeR: Unified Relational Distillation from Closed-Set Teachers for Category Discovery

CloSeR:来自闭集教师的用于类别发现的统一关系蒸馏

Yuanpei Liu, Zhenqi He, Jialu Tang, Kai Han

机构 * The University of Hong Kong(香港大学)

AI总结 提出即插即用框架CloSeR,通过闭集关系知识注入与统一关系蒸馏,提升广义类别发现性能,在六个基准上用DINO和DINOv2主干达到SOTA

Comments Accepted as a conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25418 2026-08-27 cs.CV 新提交

Bootstrapping a 4D LiDAR Annotation Tool from Video Foundation Models

基于视频基础模型引导的4D激光雷达标注工具

Jihun Kim, Hyun-Kurl Jang, Hyemin Yang, Jinnyeong Yang, Hyeokjun Kweon, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学)

AI总结 研究针对4D激光雷达标注成本高、难扩展的问题,提出LiDAR-SAM2框架,借助SAM2自动生成标注,大幅降低3D/4D场景理解的标注负担。

Comments ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25157 2026-08-27 cs.CV cs.MM cs.SD 新提交

What Do Audio-Visual Synchronization Metrics Actually Measure?

视听同步指标究竟测量什么?

Jai Kumar Sharma, Peeyush Tapadiya

机构 * Virginia Tech(弗吉尼亚理工大学) Accenture(埃森哲公司)

AI总结 该研究审计了AV-Align等4种视听同步指标,发现它们在不同任务上各有优劣且一致性差,建议以含置信区间的指标类别细分形式报告视听同步结果。

Comments Accepted at the ECCV 2026 Workshop on Generative AI for Audio-Visual Content Creation (Gen4AVC), poster presentation; non-archival workshop. 7 pages (4-page main text + references + 2-page appendix), 3 figures, 8 tables. Project page: this https URL (https://jaishrm07.github.io/avsync-reliability-card/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12176 2026-08-27 cs.CV 版本更新

HEDGE: A Calibrated Ensemble for A/H Recognition

用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))

AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。

Comments 8 pages, 1 figure, ECCV workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00369 2026-08-27 cs.CV 版本更新

SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions

SFDATrack: 恶劣天气条件下的广义无源域自适应跟踪

Siyuan Yao, Ziqi Wang, Ruiqi Yu, Junqi Huang, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

AI总结 提出SFDATrack,一种仅利用目标域恶劣天气样本的无源域自适应跟踪器,通过双交互Mamba骨干和超球原型投影实现鲁棒状态估计,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26236 2026-08-27 eess.IV cs.CV eess.SP 版本更新

Rendering Novel Views of MRI Using 3D Gaussian Splatting

使用3D高斯泼溅渲染MRI的新视图

Robin Y. Park, Mark C. Eid, Rhydian Windsor, Amir Jamaludin, Ana I.L. Namburete, João F. Henriques, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) Oxford Machine Learning in NeuroImaging Lab, University of Oxford(牛津大学神经影像学机器学习实验室)

AI总结 通过3D高斯泼溅从稀疏各向异性MRI重建体积并采样与目标解剖对齐的平面,生成更优的放射学分级视图,相比原始扫描和体素插值方法提高了椎管狭窄分级准确性。

Comments Spotlight at AI4M3D workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26687 2026-08-27 cs.CV 版本更新

DeCoFlow: Structural Decomposition of Normalizing Flows for Continual Anomaly Detection

DeCoFlow: 用于持续异常检测的归一化流结构分解

Hun Im, Jungi Lee, Subeen Cha, Pilsung Kang

机构 * Seoul National University(首尔国立大学)

AI总结 针对工业环境中新产品类别顺序到达且无法访问旧数据的持续异常检测问题,提出DeCoFlow方法,通过将子网络分解为冻结通用基和任务特定低秩适配器来隔离参数更新,并引入任务特定对齐、辅助耦合层和尾感知损失,在MVTec-AD和VisA数据集上达到最先进性能且零遗忘。

Comments Accepted to ECCV 2026. Code available at this https URL (https://github.com/crimama/DeCoFlow)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11521 2026-08-27 cs.LG cs.CV 版本更新

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-08-27 cs.CV cs.AI cs.LG 版本更新

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments 38 pages, 22 figures, ECCV 2026, Project page: this https URL (https://dohunlee1.github.io/MemoryV2V)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06228 2026-08-27 cs.CV 版本更新

Low-Latency Event-Based Object Detection with Spatially-Sparse Linear Attention

低延迟基于事件的对象检测与空间稀疏线性注意力

Haiqing Hao, Zhipeng Sui, Rong Zou, Zijia Dai, Nikola Zubić, Davide Scaramuzza, Wenhui Wang

机构 * Tsinghua University(清华大学) University of Zurich(苏黎世大学) ShanghaiTech University(上海交通大学)

AI总结 本文提出SSLA,一种空间稀疏线性注意力机制,用于提升基于事件的目标检测效率与精度,实现低延迟性能。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21256 2026-08-27 cs.CV 版本更新

LaGen: Towards Autoregressive LiDAR Scene Generation

LaGen:迈向自主驾驶的自回归激光雷达场景生成

Sizhuo Zhou, Xiaosong Jia, Fanrui Zhang, Junjie Li, Juyong Zhang, Yukang Feng, Jianwen Sun, Songbur Wong, Junqi You, Junchi Yan

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出LaGen,首个支持长时交互生成的自回归框架,能基于单帧输入生成高保真4D激光雷达场景,并通过场景解耦和噪声调节模块提升生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-08-27 cs.AI 版本更新

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: this https URL (https://weihaotan.github.io/StarDojo)

详情

展开后加载摘要…

URL PDF HTML 收藏