arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-27 至 2026-08-27 共收录 7
2608.25864 2026-08-27 cs.RO 新提交

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

MA-VLA:用于协作与组合泛化的多臂视觉-语言-动作模型

Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin, Changxing Xia, Heng Zhou, Talas Fu, Enshen Zhou, Ruimao Zhang, Zhenfei Yin, Huchuan Lu, Lijun Wang

机构 * Dalian University of Technology(大连理工大学) University of Oxford(牛津大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beihang University(北京航空航天大学)

AI总结 MA-VLA通过将协作行为分解为原子提示并引入Arm Shuffle训练方法,解决了多臂VLA模型的协作泛化问题,在未见过的协作模式下表现优于现有模型。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25736 2026-08-27 cs.CV 新提交

Moving Beyond More Views: Redundancy-Aware Ego-Exo Fusion for Proficiency Estimation

超越更多视角:面向熟练度估计的冗余感知自我-外部视角融合

Xu Dong, Wanqing Li, Anthony Adeyemi-Ejeye, Andrew Gilbert

机构 * University of Surrey(萨里大学) University of Wollongong(卧龙岗大学)

AI总结 该研究针对EgoExo熟练度估计中多视角冗余与过拟合问题,提出AdaMVS与VIB-GB模块,在EgoExo-4D等数据集上取得新SOTA结果。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25734 2026-08-27 cs.CV 新提交

InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control

InteractGesture:用于连续流协同语音手势控制的渐进式分块引导

Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

机构 * Meta University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对现有协同语音手势生成模型缺乏单关节细粒度空间可控性的问题,提出模型无关的推理时方法InteractGesture,通过渐进式分块引导解决分块依赖问题,在BEAT2数据集上实现多关节空间控制提升。

Comments ECCV 2026 Workshop - Interactive Social Avatars

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25692 2026-08-27 cs.CV 新提交

CloSeR: Unified Relational Distillation from Closed-Set Teachers for Category Discovery

CloSeR:来自闭集教师的用于类别发现的统一关系蒸馏

Yuanpei Liu, Zhenqi He, Jialu Tang, Kai Han

机构 * The University of Hong Kong(香港大学)

AI总结 提出即插即用框架CloSeR,通过闭集关系知识注入与统一关系蒸馏,提升广义类别发现性能,在六个基准上用DINO和DINOv2主干达到SOTA

Comments Accepted as a conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25418 2026-08-27 cs.CV 新提交

Bootstrapping a 4D LiDAR Annotation Tool from Video Foundation Models

基于视频基础模型引导的4D激光雷达标注工具

Jihun Kim, Hyun-Kurl Jang, Hyemin Yang, Jinnyeong Yang, Hyeokjun Kweon, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学)

AI总结 研究针对4D激光雷达标注成本高、难扩展的问题,提出LiDAR-SAM2框架,借助SAM2自动生成标注,大幅降低3D/4D场景理解的标注负担。

Comments ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25157 2026-08-27 cs.CV cs.MM cs.SD 新提交

What Do Audio-Visual Synchronization Metrics Actually Measure?

视听同步指标究竟测量什么?

Jai Kumar Sharma, Peeyush Tapadiya

机构 * Virginia Tech(弗吉尼亚理工大学) Accenture(埃森哲公司)

AI总结 该研究审计了AV-Align等4种视听同步指标,发现它们在不同任务上各有优劣且一致性差,建议以含置信区间的指标类别细分形式报告视听同步结果。

Comments Accepted at the ECCV 2026 Workshop on Generative AI for Audio-Visual Content Creation (Gen4AVC), poster presentation; non-archival workshop. 7 pages (4-page main text + references + 2-page appendix), 3 figures, 8 tables. Project page: this https URL (https://jaishrm07.github.io/avsync-reliability-card/)

详情

展开后加载摘要…

URL PDF HTML 收藏