arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-28 至 2026-07-28 共收录 9
2607.24064 2026-07-28 cs.CV cs.AI 新提交

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23917 2026-07-28 cs.CV 新提交

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

凝视到文本生成:超越人类注意力的分类解码

Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

机构 * Stony Brook University(纽约州立大学石溪分校) Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。

Comments To appear in European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23605 2026-07-28 cs.AI 新提交

Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning

用于视觉语言模型智能体强化学习的统一评论家混合优势估计

Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny

机构 * KAUST(沙特阿卜杜拉国王科技大学)

AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23373 2026-07-28 cs.CV 新提交

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) Technical University of Iasi(雅西技术大学) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23046 2026-07-28 cs.CV 新提交

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

用于高分辨率多模态大语言模型中高效视觉令牌剪枝的结构化冗余建模

Jouwon Song, Woohyeong Kim, Kyeongbo Kong

机构 * LG Electronics(LG电子) Pusan National University(釜山国立大学)

AI总结 针对高分辨率多模态大语言模型视觉令牌爆炸致延迟瓶颈问题,提出单向前向剪枝器SFPruner,通过语义引导岭杠杆方案和基于排名的方向掩码两个互补机制,在单次前向传递中实现冗余感知重要性选择,有效减少令牌选择时间并保持性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22931 2026-07-28 cs.LG cs.CV 新提交

Spectral-Aware Analytic Class-Incremental Learning for Long-Tailed Distributions

用于长尾分布的频谱感知分析类增量学习

Quyen Tran, Hai Nguyen, Quan Dao, Zhuowei Li, Nam Le, Trung Le, Dimitris Metaxas

AI总结 研究针对长尾分布的类增量学习问题,提出几何频谱校正(GSR)框架,将其视为频谱正则化问题,构造频谱扰动矩阵有选择地增大尾部类坍缩特征值,实验表明该方法在计算效率和鲁棒泛化间取得更好权衡,达新最优水平。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-07-28 cs.CV 新提交

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22919 2026-07-28 cs.CV cs.AI 新提交

Controlling Embedding Spaces with Text-Conditioned Transformations

通过文本条件变换控制嵌入空间

Joseph Fioresi, Fabian Caba Heilbron, Pankaj Nathani, Mubarak Shah, Kushal Kafle

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) Adobe Research(Adobe研究院)

AI总结 研究提出文本条件变换视觉嵌入,通过自然语言描述属性类别,网络生成仿射变换强调指定属性,能同时学习多属性,可在推理时访问,为控制嵌入空间提供统一高效框架,在多任务中展现近零推理成本的最优性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22674 2026-07-28 cs.GR cs.CV cs.HC 新提交

Text-based Tactile Graphics Generation for the Visually Impaired

为视障人士生成基于文本的触觉图形

Ruihan Gao, Joonghyuk Shin, Ava Pun, Jaesik Park, Wenzhen Yuan, Jun-Yan Zhu

AI总结 研究为视障人士开发基于文本生成触觉图形的集成系统,引入制作感知技术,能联合生成多种元素,经评估和用户研究,结果优于基线,拓宽了生成式AI对视障群体及其他人的可及性。

Comments ECCV 2026, Project webpage: https://ruihangao.github.io/Text2TactileGraphics/

详情

展开后加载摘要…

URL PDF HTML 收藏