arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

至 收录 4771
2608.06901 2026-08-10 cs.CV cs.LG 新提交

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Kookmin University(国民大学)

AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏
2608.06613 2026-08-10 cs.CV cs.AI 新提交

Do 3D Medical Foundation Models See Through MRI Artifacts? A Controlled Study of Representation Robustness

三维医学基础模型能看穿MRI伪影吗?一项关于表示鲁棒性的对照研究

Julia Anna Mielcarz, Daniel Klaaby, Mostafa Mehdipour Ghazi

机构 * Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心)

AI总结 本文对照评估五种三维医学基础模型的表示鲁棒性,发现其鲁棒性与模型及伪影类型相关,部分模型对伪影更敏感,仅靠大规模预训练无法保证伪影不变性,需部署前评估鲁棒性。

Comments Accepted at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D)

URL PDF HTML 收藏
2608.05844 2026-08-10 cs.CV 版本更新

Curia-MAE: Multi-Modal Multi-Anatomy MAE Pre-Training for 3D Medical Image Segmentation

Curia-MAE:面向3D医学图像分割的多模态多解剖区域掩码自编码器预训练方法

Théo Danielou, Antoine Saporta, Léo Alberge, Corentin Dancette

机构 * Raidium(雷迪厄姆)

AI总结 本文提出Curia-MAE,通过改进MAE预训练目标,在30万张CT和MRI图像上预训练的多模态多解剖区域模型,可提升冻结编码器下的3D医学图像分割性能,尤其适用于标注数据稀缺的病灶任务。

Comments Accepted at ECCV 2026 Workshop AI4M3D

URL PDF HTML 收藏
2608.05145 2026-08-10 cs.CV cs.MM cs.SD 交叉投稿

Objects as Audio-Visual Modal Sound Fields

作为视听模态声场的物体

Zisen Shao, Zihao Wei, Derong Jin, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 本文针对现有碰撞声建模方法成本高或需大量数据的问题,提出AV-MSF表示,结合3D高斯溅射与模态参数实现少样本重建,在真实数据集上达最优渲染性能,还支持接触定位等下游应用。

Comments ECCV 2026, Project page: https://zisenshao.github.io/AV-MSF/

URL PDF HTML 收藏
2607.06918 2026-08-10 cs.CV cs.AI cs.LG 版本更新

LoCA: Spatially-Aware Low-Rank Convolutional Adaptation of Vision Foundation Models

LoCA:视觉基础模型的空间感知低秩卷积自适应

Sojung An, Junha Lee, Sujeong You, Nam Ik Cho, Donghyun Kim

机构 * Korea University(韩国大学) Korea Institute of Industrial Technology(韩国产业技术研究院) Seoul National University(首尔国立大学)

AI总结 研究针对视觉基础模型自适应的挑战,提出低秩卷积自适应框架 LoCA,通过解耦通道与空间自适应,引入低秩通道自适应并优化空间基,在多视觉任务中保留预训练空间先验且性能优异。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2606.22589 2026-08-10 cs.LG 版本更新

Training-free Task Classification for Multi-Task Model Merging

无需训练的多任务模型合并中的任务分类

Jungyong Son, Jinwook Jung, Sungyong Baik

机构 * Department of Artificial Intelligence(人工智能系) Department of Data Science(数据科学系)

AI总结 提出SiM方法,通过SVD低秩流形近似和投影残差实现无需训练和任务ID的任务路由,提升多任务模型合并性能。

Comments ECCV 2026

URL PDF HTML 收藏
2605.31589 2026-08-10 cs.CV 版本更新

Recognizing Co-Speech Gestures in-the-Wild

识别野外伴随语音的手势

Sindhu B Hegde, K R Prajwal, Andrew Zisserman

机构 * Visual Geometry Group, Dept. of Engineering Science, University of Oxford(视觉几何组,工程科学系,牛津大学)

AI总结 针对当前多模态模型难以捕捉语义性伴随手势的问题,构建了首个大规模基准数据集GRW,用于训练视频模型进行手势语义分类、对应词汇识别和时序定位。

Journal ref European Conference on Computer Vision (ECCV), 2026

URL PDF HTML 收藏
2608.06142 2026-08-07 cs.CV 新提交

Learning visual representations for compositional analysis of artworks and photographs

面向艺术品与照片的组合分析学习视觉表征

Fatemeh Behrad, Tinne Tuytelaars, Johan Wagemans

机构 * KU Leuven University(KU Leuven大学(荷语鲁汶大学))

AI总结 该研究对比了受人类启发的构图分析方法与微调基础模型两种范式,在三类任务上评估性能,发现前者冻结编码器时具竞争力且可解释,后者微调后性能更优但可解释性与泛化性下降。

Comments ECCV workshops 2026

URL PDF HTML 收藏
2608.05626 2026-08-07 cs.CV 新提交

Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping

通过SDR融合与增益图逆色调映射实现双输出多曝光HDR重建

Jinho Kim, Jinwoo Kim, Seon Joo Kim

机构 * Yonsei University(延世大学)

AI总结 该研究提出DOME-HDR框架,通过LoRA适配的潜在扩散模型与双交叉注意力融合模块生成SDR,结合HPGM网络预测增益图实现多曝光HDR重建,在多个数据集上达到最优性能。

Comments Accepted to ECCV 2026

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.05424 2026-08-07 cs.CV cs.LG 新提交

Invisible Shortcuts: Why Vision Encoders Know Your Camera

隐形捷径:视觉编码器为何了解你的相机

Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos, Noa Garcia, Giorgos Tolias

AI总结 该研究发现视觉编码器会利用像素级隐形元数据痕迹形成捷径,元数据-语义关联越强模型敏感性越高,提出的缓解策略可降低敏感性并提升分布外泛化能力。

Comments ECCV 2026

URL PDF HTML 收藏
2608.05260 2026-08-07 cs.CV 新提交

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

一段文本胜过千条标题:重新思考视觉-语言检索的文本监督

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。

Comments Accepted at the MUCG workshop, ECCV 2026

URL PDF HTML 收藏
2603.23647 2026-08-07 cs.CV cs.AI cs.LG 版本更新

λSplit: Self-Supervised Content-Aware Spectral Unmixing for Fluorescence Microscopy

λSplit: 用于荧光显微镜的自监督内容感知光谱解混

Federico Carrara, Talley Lambert, Mehdi Seifi, Florian Jug

机构 * Fondazione Human Technopole(人类技术极地基金会) Harvard Medical School(哈佛医学院) Università Campus Bio-Medico(生物医学大学校园)

AI总结 提出λSplit,一种基于物理信息的深度生成模型,通过分层变分自编码器学习浓度图的条件分布,结合可微分光谱混合器实现最先进的光谱解混和隐式噪声去除。

Comments 14 pages, 25 pages supplement, 16 figures total, 14 tables total. Accepted at ECCV 2026

URL PDF HTML 收藏
2603.08652 2026-08-07 cs.AI 版本更新

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

URL PDF HTML 收藏
2608.05149 2026-08-06 cs.CV 新提交

CoCo-IR: Contextual Composed Image Retrieval

CoCo-IR:上下文组合图像检索

Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) OpenAI

AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。

Comments ECCV 2026

URL PDF HTML 收藏
2608.04995 2026-08-06 cs.CV 新提交

Promptable Animal Pose Tracking Across Species

可跨物种提示式动物姿态跟踪

Le Li, Daniela Ivanova, Nicolas Pugeault

AI总结 针对动物姿态跟踪的跨物种泛化与精度问题,提出有监督、无监督两种基于视觉基础模型的方法,在APTv2和TigDog数据集上实现了精度与泛化性的平衡,为动物保护应用提供实用方案。

Comments Accepted for presentation at the ECCV 2026 Workshop on CV4Ecology

URL PDF HTML 收藏
2608.04865 2026-08-06 cs.CV 新提交

Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen

超越帧的烹饪:厨房中的立体事件相机数据集

Chengming Feng, Hesam Araghi, Liming Zheng, Julien Dupeyroux, Xucong Zhang, Jan van Gemert, Nergis Tömen

机构 * Delft University of Technology(代尔夫特理工大学) STMicroelectronics(意法半导体)

AI总结 本文推出EventKitchen数据集,以第一人称视角从10名参与者在13个厨房中收集5.5小时的烹饪相关多传感器数据,训练基线模型完成动作识别等任务,为神经形态视觉提供新基准。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2608.04642 2026-08-06 cs.CV 新提交

YOLO-PVC: 2D-to-3D Consolidation of Slice-wise Detections for Volumetric Liver Tumor Localization in MRI

YOLO-PVC:用于MRI中体积肝肿瘤定位的切片式检测的2D到3D整合方法

Talha Waqas, Mounir Lahlouh, Kawther Taibouni, Mahnoor Waqas, Salar Ahmed, Sébastien Mulé, Yasmina Leroul-Chenoune

机构 * ESME Research Lab(ESME研究实验室) Université Paris-Est Créteil(巴黎东部克雷泰伊大学) LRE EPITA(EPITA LRE实验室) Institute of Space Technology(空间技术研究所) Henri Mondor University Hospital(亨利·蒙多大学医院)

AI总结 针对切片式2D目标检测器在体积数据中预测碎片化不稳定的问题,提出YOLO-PVC框架,通过几何整合提升肝脏肿瘤定位的3D IoU至0.710,优于多种基线方法。

Comments 14 pages, 2 figures, 4 tables. Accepted at AI4M3D Workshop, ECCV 2026 (Spotlight)

URL PDF HTML 收藏
2608.04483 2026-08-06 cs.CV 新提交

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝

Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

机构 * Maum AI Inc.(Maum AI公司)

AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。

Comments Accepted to ECCV 2026 workshop, UniWorld

URL PDF HTML 收藏
2608.04210 2026-08-06 cs.CV 新提交

PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images

PADFormer:基于稀疏视角图像的姿态无关异常检测

Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang

机构 * Amazon(亚马逊) Simon Fraser University(西蒙菲莎大学) Northeastern University(东北大学)

AI总结 针对现有姿态无关异常检测方法依赖3D重建的缺陷,提出PADFormer模型,利用ViT结合跨视图掩码重建等机制,在PAD基准及FSAD任务上实现最优性能,兼具效率与泛化性。

Comments Accepted to ECCV 2026 (oral)

URL PDF HTML 收藏
2608.03147 2026-08-06 cs.CV 版本更新

CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation

CROSS:用于遥感指称分割的级联蒸馏与双约束 grounding

Tingzhang Luo, Ruizhong Liu, Yichao Liu, Cheng Fan, Yu Liu, Jianyuan Guo

AI总结 针对遥感指称分割中架构弱耦合与语义偏差问题,本文提出CROSS范式,通过LGCD与PSCL实现性能突破,成为RRSIS的稳健新方案。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026. 20 pages, 6 figures, and 5 tables. Tingzhang Luo and Ruizhong Liu contributed equally. Jianyuan Guo is the corresponding author. Project page: https://clarence-cv.github.io/CROSS/

URL PDF HTML 收藏
2607.12000 2026-08-06 cs.CV 版本更新

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

URL PDF HTML 收藏
2607.00684 2026-08-06 cs.LG 版本更新

AdaBoosting Text Prompts for Vision-Language Models

AdaBoosting 文本提示用于视觉-语言模型

Seokhee Jin, Changhwan Sung, Sunung Mun, Hoyoung Kim, Jungseul Ok

机构 * KT Corporation(KT公司) Pohang University of Science and Technology (POSTECH)(浦项科技大学) National AI Research Lab(国家人工智能研究实验室)

AI总结 提出文本提示提升(TPB)框架,通过AdaBoost策略将每个文本提示分类器视为弱学习器,顺序集成以聚焦难分类样本,提升少样本分类精度并实现跨模型迁移。

Comments Accepted to ECCV 2026 Spotlight

URL PDF HTML 收藏
2603.21194 2026-08-06 cs.CR cs.AI 版本更新

Is Monitoring Enough? Strategic Agent Selection For Stealthy Attack in Multi-Agent Discussions

监控足够吗?多智能体讨论中的隐蔽攻击策略性代理选择

Qiuchi Xiang, Haoxuan Qu, Hossein Rahmani, Jun Liu

机构 * Lancaster University, United Kingdom(兰卡斯特大学,英国)

AI总结 研究多智能体讨论中的隐蔽攻击问题,提出针对监控场景的攻击方法,证明持续监控无法完全消除对抗风险。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2603.17430 2026-08-06 cs.RO 版本更新

SafeLand: Safe Autonomous Landing in Unknown Environments with Bayesian Semantic Mapping

SafeLand: 在未知环境中使用贝叶斯语义映射实现安全自主着陆

Markus Gross, Andreas Greiner, Sai Bharadhwaj Matha, Felix Soest, Daniel Cremers, Henri Meeß

机构 * Fraunhofer IVI Autonomous Aerial Systems(弗劳恩霍夫IVI自主航空系统) TU Munich Computer Vision Group(慕尼黑工业大学计算机视觉组) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 本文提出SafeLand系统,通过深度学习语义分割构建在线语义地面地图,结合贝叶斯概率过滤和行为树实现安全自主着陆,通过200次模拟和60次实地测试,展示零误报的人类检测率和亚秒响应延迟。

Journal ref ECCV 2026 Workshops

URL PDF HTML 收藏
2511.17354 2026-08-06 cs.CV 版本更新

DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture

DSeq-JEPA:判别性序列联合嵌入预测架构

Xiangteng He, Shunsuke Sakai, Shivam Chandhok, Sara Beery, Kun Yuan, Nicolas Padoy, Tatsuhito Hasegawa, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) University of Fukui(福井大学) Massachusetts Institute of Technology(麻省理工学院) University of Strasbourg(斯特拉斯堡大学)

AI总结 DSeq-JEPA通过判别性顺序处理与JEPA目标结合,提升视觉表征的判别性和泛化能力,在多个任务中表现优于I-JEPA变体。

Comments Accepted to ECCV 2026. Project page: https://dseqjepa-project.com

URL PDF HTML 收藏
2506.18266 2026-08-06 cs.CV 版本更新

YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos

YouTube-Occ:从YouTube视频学习室内3D语义占据预测

Haoming Chen, Lichen Yuan, TianFang Sun, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学)

AI总结 针对室内3D语义占据预测数据稀缺的问题,提出YouTube-Occ框架,通过自动化数据流水线与双对齐预训练策略,在NYUv2等基准上实现性能提升,代码数据将公开。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2608.03407 2026-08-05 cs.CV cs.AI cs.LG 新提交

Distilled Roads: Generalisable Road Network Extraction Across Sensors, Resolutions, and Region

蒸馏路网:跨传感器、分辨率和区域的通用路网提取

Sanayya, Rakshith Sathish, Ashwathi Nambiar

AI总结 本研究提出结合跨分辨率知识蒸馏、多传感器训练与拓扑感知监督的框架,构建出泛化性强、效率高的路网提取模型,在公开基准上性能优于现有最优方法。

Comments Accepted at ECCV 2026 workshop - TerraBytes II

URL PDF HTML 收藏
2608.03323 2026-08-05 cs.CV 新提交

PolyLayout: Multi-room Manhattan Layout Estimation

PolyLayout:多房间曼哈顿布局估计

Gustav Hanning, Shaohui Liu, Rémi Pautrat, Marc Pollefeys, Kalle Åström, Viktor Larsson

AI总结 针对现有多房间布局估计方法泛化差、未利用建筑结构的问题,提出 PolyLayout 方法,通过联合优化跨房间的曼哈顿 3D 多边形,在新基准上实现了优于现有方法的准确性与鲁棒性。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏