arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-24 至 2026-07-24 共收录 9
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21592 2026-07-24 cs.CV 新提交

Unified Video Dense Prediction from Disjoint Data

从不相交数据进行统一视频密集预测

Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee

机构 * Adobe Research(Adobe 研究院) Cornell University(康奈尔大学)

AI总结 研究旨在解决现有任务特定注释分散问题,提出统一视频模型UniD,从不相交特定领域数据集联合预测八个密集场景属性。通过简单蒸馏步骤,利用预训练扩散模型视觉先验弥合领域差距,性能优于特定任务专家和多任务基线,泛化能力强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21485 2026-07-24 cs.CV 新提交

Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation

用于高效高保真表示的循环正弦隐式神经表示

Hyunmin Cho, Jaejun Yoo, Kyong Hwan Jin

机构 * Department of Electrical Engineering, Korea University(韩国大学电气工程系) Graduate School of Artificial Intelligence, UNIST(蔚山国立科学技术院人工智能研究生院)

AI总结 研究将正弦循环用于INRs谐波频谱丰富,通过共享正弦块迭代优化潜在表示,经实验验证其频谱行为,在图像和3D表示任务中表现出色,能以少参数和步骤实现高保真,还可迁移至多种相关任务。

Comments Accepted to ECCV 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21371 2026-07-24 cs.CV cs.AI 新提交

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

DINOde:用于开放词汇语义分割的连续视觉-文本对齐

Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh, Kuk-Jin Yoon

机构 * Multimodal Intelligence and Perception Lab., DGIST(多模态智能与感知实验室,大邱庆北科学技术院) Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

AI总结 研究针对开放词汇语义分割中视觉与文本对齐问题,提出基于ODE的DINOde框架,通过语义文本流和全局上下文流、速度切向投影等组件,连续对齐视觉与文本,实验证明该方法优于现有方法,性能达领先水平。

Comments Accepted to ECCV 2026. 27 pages, 8 figures, and 10 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21155 2026-07-24 cs.CV cs.AI 新提交

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21118 2026-07-24 cs.CV 新提交

The Second LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results

第二届LoViF 2026真实世界一体化图像恢复挑战赛:方法与结果

Xiang Chen, Hao Li, Jiangxin Dong, Jinshan Pan, Xin Li, Hongbo Ding, Junpeng Jiang, Xingyu Qiu, Yilian Zhong, Yuxiang Chen, Shibo Yin, Zixuan Huang, Yushun Fang, Xilei Zhu, Yahui Wang, Chen Lu, Xiaodong Zhou, Qingyue Cao, Changwei Gong, Jingyun Liu, Xingchen Yi, Hansen Shi, Ruiyi Liu, Jirui Xie, Tao Liu, Wenzhuo Ma, Hongzhen Li, Yongyong Chen, Zheng Zhou, Jingyong Su, Jie Liu, Haijin Zeng, Cheng Li, Peishuai Zha, Ziyi Wang, Jian Tang, Yan Chen, Long Bao, Heng Sun, Jiyuan Zhang, Shuai Liu, Wei Ding, Chengjun Guo, Yibin Huang, Xiaotao Wang, Dongqing Zou, Lei Lei, Xiaofeng Wang, Xiao Liu, Yulin Wu, Yuhan Zhao, Shurui Peng, Chao Ren, Yu-Kai Wang, Kosuke Shigematsu, Asuka Shin, Rong-Lin Jian, Cheng-Jun Kang, Jin-Hui Jiang, Jialin Zhou, Kuo Yuan, Songyu Zhang, E B Benson, Ashfaq Hussain, Pruthvikanth AC, Qirui Chen, Jinyuan Chen, Jun Zhang, Xu Zhang, Xuhui Cao, Jiaqi Ma, Laibin Chang, Yuchun Miao, Yichu Xu, Yuanzhi Yao, Shi Chen, Yuning Cui, Huan Zhang, Lefei Zhang, Saeed Ahmad, Ik Hyun Lee, Jun Young Park, Ji Hwan Yoon, Shangquan Sun, Behrooz Nobahar-Moghanlou, Majid Edalatjou, Karim Shahi-Niyar, Ruibo Zhang, Dexiang Hong, Xinyan Liu, Shengeng Tang, Weidong Chen

AI总结 第二届LoViF 2026真实世界一体化图像恢复挑战赛为评估模型在多种退化条件下的性能提供基准,吸引众多参与者。报告全面分析提交方案与结果,揭示有效策略,为真实世界低级别视觉研究建立新基准。

Comments ECCV 2026 Workshops; https://lowlevelcv.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20984 2026-07-24 cs.CV 新提交

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

用于不确定性感知文本到视频检索的分布对齐桥

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)

AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20660 2026-07-24 cs.CV 新提交

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

Axolotl3D:用于精确3D形状完成的统一框架

Anita Hu, Maria Shugrina

机构 * NVIDIA(英伟达)

AI总结 针对3D生成模型在多场景适用性有限及缺乏统一框架的问题,提出Axolotl3D模型,它基于多种模态条件设定,利用点云和相机参数,通过统一训练策略实现精确3D形状完成,实验验证其在多方面性能出色。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20511 2026-07-24 cs.AI 新提交

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏