arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-25 至 2026-08-25 共收录 28
2608.22619 2026-08-25 eess.IV cs.CV cs.LG 新提交

GET: Generative Embedding Translation for Medical Image Segmentation

GET:用于医学图像分割的生成式嵌入翻译

Md Maklachur Rahman, Md Hasan Al Banna, Saraf Anjum, Mahmudul Hasan, Tracy Hammond

AI总结 该研究提出GET框架,基于Stable Diffusion VAE的冻结潜在空间实现医学图像分割,在多数据集上优于各类基线,参数更少且域偏移下性能提升显著。

Comments Accepted at ECCV 2026 - BioImage Computing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23549 2026-08-25 cs.CV 新提交

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

FixAnything:基于视频生成先验的3D一致性渲染优化

Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。

Comments Appearing in ECCV 2026. Project page: this https URL (https://fix-anything.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23503 2026-08-25 cs.CV 新提交

Action-Aligned Retrieval with Pairwise Multimodal Reranking for Text-Based Person Anomaly Search

用于基于文本的人员异常搜索的动作对齐检索与成对多模态重排序

Thanh-Khoi Nguyen, Thanh-Nhan Vo, Trong-Thuan Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市国家大学科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学)

AI总结 针对基于文本的人员异常搜索中现有方法的局限,提出ActPair三阶段由粗到细框架,结合动作对齐检索与成对多模态重排序,在PAB测试集取得最优结果且可有效迁移至新数据集。

Comments Accepted to the AI City workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23173 2026-08-25 cs.CV 新提交

BenthicFlow: Generating Extensible Underwater Environments via Flow Matching

BenthicFlow:基于流匹配生成可扩展水下环境

Joaquín Figueira, Camile Lendering, Manfred Gonzalez-Hernandez, Giacomo D'Amicantonio, Erkut Akdag, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 BenthicFlow是基于条件流匹配的统一框架,可联合生成对齐纹理与深度图,实现无需单独拼接模型的可扩展水下RGBD场景,实验证实其能生成匹配目标分布的大型3D海底环境。

Comments Accepted to ECCV 2026 in the 2nd Workshop on Marine Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23142 2026-08-25 cs.CV 新提交

How Merge-Tolerant Are Vision Transformers for Wheat Phenotyping?

视觉Transformer对小麦表型分析的合并容忍度有多高?

Simon Ravé, Pejman Rasti, David Rousseau

AI总结 该研究针对小麦表型分析任务,系统基准测试了ToMe和互相对合并的合并容忍度,发现分类对合并容忍度高,检测和分割受多种因素限制,部署价值需在目标运行时分析。

Comments Accepted to the CVPPA workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23012 2026-08-25 cs.CV 新提交

Misanthrope: A Privacy-Preserving Keypoint Detector

Misanthrope:一种隐私保护型关键点检测器

Francesco Vultaggio, Predrag Djindjic, Markus Gerke, Sebastian Tschiatschek, Phillipp Fanta-Jende

机构 * Austrian Institute of Technology(奥地利技术研究所) Technical University of Braunschweig(布伦瑞克工业大学) University of Vienna(维也纳大学)

AI总结 本研究提出新型隐私保护关键点检测器Misanthrope,通过自蒸馏训练避免在人体上检测关键点以从源头缓解逆攻击,其图像匹配性能与最优方法相当,在人体干扰的挑战性场景及2021图像匹配挑战测试集上表现更优。

Comments Accepted to Privacy preserving Visual Localization (PPVLM) workshop at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22861 2026-08-25 cs.CV 新提交

Following Motion for Sequential Modeling in Video Frame Interpolation

视频帧插值中用于序列建模的跟随运动方法

Jaehyun Park, Nam Ik Cho

机构 * IPAI, Seoul National University(首尔国立大学 IPAI)

AI总结 针对SSMs预定义扫描顺序难以建模VFI动态运动轨迹的问题,提出MGMVFI模型,通过运动引导序列化与上下文合成等组件实现SOTA性能,为视频插值序列建模开辟新方向。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22858 2026-08-25 cs.LG cs.CV 新提交

Mapping the Concept Landscape: Structural Perception of Global Distributions for Transparent Data Pruning

概念图谱绘制:面向透明数据剪枝的全局分布结构感知

Dongyue Wu, Tao Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Ant Group(蚂蚁集团) Chinese Academy of Sciences(中国科学院)

AI总结 该研究提出Mapping the Concept Landscape框架,以样本级图刻画语义概念全局分布,开发贪心概念覆盖最大化算法,实现更优数据剪枝效率并提供可解释的审计轨迹。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22740 2026-08-25 cs.CV 新提交

Seeing the Unseen: Semantic-in-Gaussian for Sparse-View 3D Generalization

看见不可见:用于稀疏视图三维泛化的高斯语义嵌入方法

Zeyang Bai, Yunpeng Wang, Yunbiao Wang, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学全球未来技术研究院)

AI总结 本文提出新型通用三维高斯溅射框架SeeU,通过跨视图熵感知模块与条件高斯变换器优化高斯估计,在稀疏视图场景下提升新视图合成的渲染质量与结构完整性,外推设置下PSNR较SOTA方法提升2.44 dB。

Comments Accepted at the ECCV 2026 Workshop on 3DWM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22723 2026-08-25 cs.CV 新提交

LoViF 2026 The First Challenge on Unified Removal of Raindrops and Reflections: Methods and Results

LoViF 2026:首届雨滴与反射联合去除挑战赛:方法与结果

Zewei He, Xi Tong, Yu Chen, Xingyu Liu, Xin Li, Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou, Minmin Yi, Chuanrui Zhang, Liwen Zhang, Yeongjin Jeong, Hyunjin Cho, Jiwon Lee, Minsang Kim, Jae Woong Soh, Jin-Hui Jiang, Rong-Lin Jian, Chih-Chung Hsu, Youngjin Oh, Junhyeong Kwon, Junyoung Park, Jae Hyun Park, Sung Ju Lee, Nam Ik Cho, Vishwajeet Shukla, Himanshu Baurai, Zhiqi Zhang, Kui Jiang, Zhaocheng Yu, Runzhe Li, Dawei Fan, Hao Li, Zhanshuo Zhang, Fan Ji, Jiangmeng Li, Xiongxin Tang, Fanjiang Xu, Shangquan Sun, Anh-Kiet Duong, Petra Gomez-Krämer, Jean-Michel Carozza, Ruibo Zhang, Dexiang Hong, Xinyan Liu, Shengeng Tang, Weidong Chen, Tzu-Hsuan Weng, Min-Te Sun

AI总结 该论文回顾了首届LoViF 2026雨滴与反射联合去除挑战赛,该赛针对自动驾驶雨天雨滴-反射复合退化问题,吸引149人参赛、12份有效提交,基于RDRF数据集评估,分析方法结果并提供研究见解。

Comments ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22500 2026-08-25 cs.CV 新提交

Learning Sample-wise Rank-aware Interpolation Weights for Composed Visual Data Retrieval

面向组合视觉数据检索的逐样本感知插值权重学习

Boseung Jeong, Taegyu Park, Donghyeon Kwon, Hyunsouk Cho, Suha Kwak

机构 * AI Center, Samsung Electronics(三星电子AI中心) POSTECH(浦项科技大学) Ajou University(明知大学)

AI总结 针对组合视觉数据检索中基于MLLM方法延迟高的问题,提出SRAIN框架,通过批量排名感知权重估计和合成难负样本的内存库,实现低延迟且性能优异的检索。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22193 2026-08-25 cs.CV 新提交

SAM3Dual: A 3rd Place Solution to the MOSEv2 Track, 8th LSVOS Challenge

SAM3Dual:第8届大规模视频对象分割(LSVOS)挑战赛MOSEv2赛道的第3名解决方案

JeongRae Kim, Chaehyun Kim, Changwon Lim

机构 * Chung-Ang University(中央大学)

AI总结 该研究提出SAM3Dual作为第8届LSVOS挑战赛MOSEv2赛道第3名方案,通过无训练推理扩展SAM 3,划分时序内存分支并融合,获J&F分数64.37,实现高效长期VOS性能。

Comments 3rd place solution to the MOSEv2 Track of the 8th LSVOS Challenge at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21893 2026-08-25 cs.CV cs.AI 新提交

A Scalable Vector Graphics Latent Space

可缩放矢量图形隐空间

Leonardo Zini, Elia Frigieri, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)

AI总结 本文提出SLS(SVG隐空间),一种基于Transformer的自编码器,学习SVG路径的稠密可逆隐表示,可降低下游任务FLOPs超150倍,为矢量图形研究提供通用隐空间基础。

Comments Accepted at The 19th European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21828 2026-08-25 cs.CV 新提交

Towards Alias-Free 4D Gaussian Representations with Motion-Aware Filtering

面向无混叠的4D高斯表示:结合运动感知滤波

Ankit Dhiman, Kunal A Kathare, Pranav Vignesh, Lokesh R Boregowda, Venkatesh Babu Radhakrishnan

机构 * Indian Institute of Science(印度科学学院) Samsung R&D Institute India - Bangalore(三星印度班加罗尔研发研究院)

AI总结 针对动态场景4D表示的混叠问题,提出运动感知3D平滑滤波器,适配各类4D表示,在标准数据集上性能优于现有最优方法。

Comments Accepted to ECCV 2026. Project Page: this https URL (https://maaf-4dgs.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21713 2026-08-25 cs.CV cs.CL cs.LG 新提交

The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation

计划而非解码器:诊断与修复推理增强型文本到图像生成中的组合式失败

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究针对推理增强型文本到图像生成的组合式失败,发现问题源于规划器而非解码器,通过编辑计划(如重写几何结构)可显著提升生成质量,还发布了相关评估协议及数据。

Comments 15 pages, 7 figures. Accepted at ECCV 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21486 2026-08-25 cs.CV 新提交

EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

EXPL-FR:基于视觉-语言对齐的人脸识别模型解释方法

Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫应用研究促进协会图形数据处理研究所) TU Darmstadt(达姆施塔特工业大学)

AI总结 EXPL-FR是一种基于视觉-语言对齐的人脸识别模型解释方法,通过轻量适配器在FR嵌入空间内生成语义特征,支持多粒度解释,可实现无标签的属性级审计与模型性能排名。

Comments Accepted at the ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21447 2026-08-25 cs.CV 新提交

BIMScript: Material-Aware Structured Scene Programs for BIM Ingestion

BIMScript:用于BIM导入的材料感知结构化场景程序

Prakash Kondibhau Naikade, Thomas B. Moeslund, Andreas Møgelmose

机构 * Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

AI总结 本文提出BIMScript,通过扩展布局语言属性、优化解码方案、改进粒度处理,实现合成扫描数据到BIM工具的端到端自动导入,且支持大语言模型驱动的可持续性推理。

Comments Project Page: see this https URL (https://bimscriptworld.github.io/BIMScript/); to be published in ECCV 2026 TwinWorld Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21425 2026-08-25 cs.CV cs.AI 新提交

Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation

对齐人类感知:用于视频生成的校准分布奖励学习

Nai-Xin Zhai, Weihua Cheng, Dexu Yu, Yikai Gu, Hanwen Du, Junchen Fu, Chenxi Huang, Yingwei Song, Liyuan Lillian Ma, Yang Ran, Youhua Li, Yongxin Ni

AI总结 本文针对视频生成中奖励信号不可靠、偏好维度权衡丢失、KL散度难捕捉偏好全局结构的问题,提出统一偏好感知学习框架,通过精英过滤、分布建模与Wasserstein对齐改进,提升了奖励可靠性与视频感知一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18292 2026-08-25 cs.RO cs.CV 版本更新

GuideFetch: A Task Coordination Framework for Concurrent Navigation and Object Retrieval in Assistive Robot Dogs

GuideFetch:用于辅助机器狗并发导航与物体检索的任务协调框架

Qian Yin, Ruiping Liu, Kunyu Peng, Jianxiang Man, Isik Baran Sandan, Junwei Zheng, Yufan Chen, Di Wen, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学)

AI总结 针对异构辅助机器狗的导航与物体检索并发任务,提出GuideFetch协调框架,通过LLM规划与状态验证提升执行效率,并行执行可缩短41.3%平均总完成时间。

Comments Accepted to the 1st Workshop on Multimodal Digital Agents (MDA) at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15404 2026-08-25 cs.CV 版本更新

CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations

CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会

Yusuf Meric Karadag, Gulay Oklan, Seref Baris Cagliyan, Umut Ozdemir, Emre Akbas

AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。

Comments Accepted to the Explainable Computer Vision (eXCV) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19514 2026-08-25 cs.LG 版本更新

Do Sheaf Neural Networks Use Holonomy? A Measure--Intervene--Control Study

层神经网络是否使用和乐性?一项测量-干预-控制研究

Ankit Grover, Rémi Bourgerie

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

AI总结 以层神经网络为测试平台,对训练后的三角循环积进行与基无关测量,通过神经层传播等方法区分几何变化等,在不同实验设置下观察其效果,研究层神经网络是否使用和乐性及相关特性。

Comments Accepted as an extended abstract at Geometric Intelligence @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05176 2026-08-25 cs.CV 版本更新

FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection

FSDC-DETR:面向小目标检测的频域-空域协同DETR

Aiwen Liu, Chengguang Zhu, Gang Wang, Dandan Zhu, Haodong Lin, Yan Wang, Huiyu Zhou, Zhengyi Pan

机构 * Micro-Intelligence(微智感知) East China Normal University(华东师范大学) University of Leicester(莱斯特大学) Chongqing Normal University(重庆师范大学)

AI总结 针对现有检测器易丢失小目标高频分量的问题,提出频域-空域协同DETR框架,通过双分支融合、交互机制与动态下采样实现小目标检测性能显著提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02486 2026-08-25 cs.CV 版本更新

GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training

GeoMix: 通过全局上下文和多检测器训练实现无描述符视觉定位

Yejun Zhang, Xinjue Wang, Zihan Wang, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

AI总结 提出GeoMix框架,通过局部方向与距离嵌入、全局上下文节点和多检测器混合训练,增强几何判别性,显著提升无描述符视觉定位精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19907 2026-08-25 cs.CV 版本更新

SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation

SceneOrchestra: 通过完整工具调用轨迹生成实现高效的代理3D场景合成

Yun He, Kelin Yu, Matthias Zwicker

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 SceneOrchestra通过训练可调的 orchestration 框架优化工具调用流程,消除逐步审查循环,提升效率和输出质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-08-25 cs.CV 版本更新

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Accepted by ECCV 2026. Project Page: this https URL (https://yunhe24.github.io/langdrivectrl/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01844 2026-08-25 cs.CV 版本更新

FaCT-GS: Fast and Scalable CT Reconstruction with Gaussian Splatting

FaCT-GS:基于高斯点撒的快速可扩展CT重建

Pawel Tomasz Pieta, Rasmus Juul Pedersen, Sina Borgi, Jakob Sauer Jørgensen, Jens Wenzel Andreasen, Vedrana Andersen Dahl

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 本文提出FaCT-GS框架,通过优化体素化和光栅化流程,实现快速且可扩展的CT重建,比现有方法快4-13倍,适用于不同投影尺寸。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29902 2026-08-25 cs.AI 版本更新

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14659 2026-08-25 cs.CV cs.AI 版本更新

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Accepted to ECCV 2026; Project website: this https URL (https://visioncoach.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏