Seek to Segment: Active Perception for Panoramic Referring Segmentation
寻求分割:全景指代分割的主动感知
机构 * Fudan University(复旦大学)
AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。
Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
寻求分割:全景指代分割的主动感知
机构 * Fudan University(复旦大学)
AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。
Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/
基于训练无关的概念定位实现对抗印刷体攻击的鲁棒性
机构 * University of Virginia(弗吉尼亚大学)
AI总结 提出一种无需训练的可解释性方法,通过分析注意力头对词汇和语义的编码差异,定位并干预ViT中的词汇偏置电路,从而在不额外训练的情况下显著提升对印刷体攻击的鲁棒性。
Comments 15 pages main text, provisionally accepted to ECCV 2026
GeoMix: 通过全局上下文和多检测器训练实现无描述符视觉定位
机构 * Aalto University(阿尔托大学) ; Tampere University(坦佩雷大学) ; University of Oulu(奥卢大学)
AI总结 提出GeoMix框架,通过局部方向与距离嵌入、全局上下文节点和多检测器混合训练,增强几何判别性,显著提升无描述符视觉定位精度。
Comments ECCV 2026
对抗文本噪声与冗余:熵感知的密集视觉令牌剪枝
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 提出熵感知密集剪枝(EADP)框架,通过熵过滤文本噪声并利用子模最大化选择令牌,在严格预算下保留细粒度视觉线索,提升VLM精度-效率权衡。
Comments Accepted to ECCV 2026
面向解译的云去除:基于观测锚定残差流与地理上下文对齐
机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) ; Shanghai Ai Lab(上海人工智能实验室) ; Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地球科学与工程学院)
AI总结 提出GACR框架,通过观测锚定残差流(OAR-Flow)将云去除重构为物理残差反演,结合地理上下文先验对齐(GCPA)保持语义结构,在六个数据集和十二个下游任务中验证了重建质量和下游精度提升。
Comments accepted by ECCV 2026
小波引导的语义信号补偿用于无反转图像编辑
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
AI总结 针对无反转图像编辑中全局属性编辑不足的问题,提出基于小波的频率感知语义补偿策略,在生成早期增强有效信号,提升全局编辑能力同时保持背景保真度。
Comments Accepted to ECCV 2026
学习光谱和偏振线索用于一对多模态新视角合成
机构 * MEDIA Lab(媒体实验室) ; University of Padova(帕多瓦大学) ; Sony EUISPC(索尼欧洲影像处理中心) ; Sony Semiconductor Solutions Europe(索尼半导体解决方案欧洲分公司)
AI总结 提出SPoILeR方法,通过多模态预训练学习模态间相关性,在仅RGB监督下实现未见场景的多模态新视角渲染。
Comments Accepted at ECCV 2026. Project page: https://medialab.dei.unipd.it/paper_data/SPoILeR/
当令牌压缩失效:面向鲁棒ViT分割的结构剪枝与令牌缩减在高压缩率下的对比
机构 * Temasek Laboratories, Singapore University of Technology and Design(淡马锡实验室,新加坡科技设计大学)
AI总结 本文对比了令牌压缩与结构剪枝在ViT语义分割中的表现,发现高压缩率下令牌压缩性能急剧下降,而结构剪枝更稳定,并提出先剪枝后合并的联合策略以改善精度-鲁棒性权衡。
Comments Accepted to ECCV 2026
LongEgoRefer: 长形式自我中心视频指代表达理解基准
机构 * Woven by Toyota, Japan(丰田公司,日本) ; The University of Tokyo, Japan(东京大学,日本) ; National Institute of Informatics, Japan(日本信息机构国家研究所) ; Institute of Science Tokyo, Japan(东京科学研究所,日本) ; NII LLMC, Japan(日本信息机构LLMC) ; Kyoto University, Japan(京都大学,日本)
AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。
Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer
ESC:面向可靠视觉语言模型的情感自我纠正
机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author
AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。
Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?
自动驾驶中基于LiDAR的3D物体检测的全面鲁棒性分析
机构 * Institute for TMDT, University of Wuppertal, Germany(TMDT研究所,乌尔姆大学,德国) ; IKB Faculty of Science, University of British Columbia, Canada(科学学院,不列颠哥伦比亚大学,加拿大)
AI总结 针对LiDAR-only 3D物体检测模型对抗鲁棒性研究不足的问题,提出一个综合评估框架,通过结构因子(点云密度、定位)和预测因子(误分类、定位误差、自车距离)分析,发现高容量体素检测器比支柱检测器更易受结构化坐标扰动,非锚点检测器鲁棒性差。
Comments Accepted at ECCV 2026 main
UnderOneFacade:全球立面语义分割基准数据集
机构 * Technical University of Munich(慕尼黑工业大学) ; University of Cambridge(剑桥大学) ; University of Nottingham(诺丁汉大学) ; National University of Singapore(新加坡国立大学)
AI总结 针对现有立面解析数据集地理范围窄、语义不一致的问题,提出全球最大跨国家、跨洲的3D立面基准UnderOneFacade,包含27亿标注点,评估多种模型并揭示其跨域性能下降,为鲁棒可迁移的3D分割模型提供基准。
Comments accepted by ECCV 2026
异构约束下无需训练的可控人体运动生成
机构 * Lancaster University(兰卡斯特大学) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
AI总结 提出Motion-Inference-as-Control框架,将扩散运动生成建模为随机控制问题,统一处理连续目标型和基于准则的约束,无需约束特定训练或可微性要求。
Comments ECCV 2026
NeoMap: 无需训练的单图像和视频新视角合成
机构 * Shenzhen Research Institute, The Hong Kong Polytechnic University(香港理工大学深圳研究院) ; vLAR Group, The Hong Kong Polytechnic University(香港理工大学vLAR实验室)
AI总结 提出NeoMap,一种无需训练的框架,通过收敛流形交替投影迭代优化初始噪声,从预训练视频模型中定位高保真、视角一致的新视角解,在多个基准上达到最优。
Comments ECCV 2026. Jinxi and Tianyi are co-first authors. Code and data are available at: https://github.com/vLAR-group/NeoMap
PhysMani:基于物理原理的动态物体操作3D世界模型
机构 * vLAR Group, The Hong Kong Polytechnic University(香港理工大学vLAR Group) ; Astribot
AI总结 提出PhysMani框架,结合物理原理的3D高斯世界模型与未来感知动作策略模型,通过在线优化学习无散度高斯速度场预测动态,在16个任务基准上超越基线方法。
Comments ECCV 2026. Code and data are available at: https://github.com/vLAR-group/PhysMani
SFKD: 通过多级小波频谱交互的空间-频率联合感知异质知识蒸馏
机构 * Key Laboratory for Information Science of Electromagnetic Waves, Ministry of Education, Fudan University(复旦大学电磁波信息科学教育部重点实验室) ; Discipline and Technology Center of Microwave Vision Intelligent Sensing, Fudan University(复旦大学微波视觉智能感知学科与技术中心)
AI总结 提出空间-频率联合感知异质知识蒸馏框架SFKD,利用多级离散小波变换解耦空间信息,结合双流双阶段精化模块和高斯滤波频率损失,实现异质模型间的有效知识迁移。
Comments Accepted by ECCV 2026
QWERTY: 通过查询扭曲的视频扩散变换器实现无需训练的运动控制
机构 * Department of Computer Science, Yonsei University(延世大学计算机科学系) ; Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)
AI总结 提出QWERTY框架,通过扭曲查询的语义子空间,在预训练图像到视频扩散变换器中实现无需训练的运动控制,性能接近微调方法。
Comments 37 pages, 18 figures, accepted at the European Conference on Computer Vision (ECCV) 2026
几何基础模型蒸馏用于高效月球三维重建
机构 * IRIT, University of Toulouse(图卢兹大学IRIT研究所) ; Airbus Defence and Space(空中客车防务与航天公司)
AI总结 针对硬件受限场景,通过知识蒸馏将MASt3R模型压缩7倍,保留大部分重建精度,提出SVD初始化方法提升训练稳定性,并揭示编码器类型、蒸馏策略等关键因素。
Comments Accepted to ECCV 2026, code can be accessed via https://clementinegrethen.github.io/publications/ECCV.html
C2E: 通过多教师对比知识蒸馏提升仅自我3D目标检测
机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建省城市智能感知与计算重点实验室,厦门大学) ; Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算教育部重点实验室,厦门大学) ; Zhongguancun Academy(中关村学院)
AI总结 提出C2E范式,通过多对一智能体对比知识蒸馏框架M2S,结合多级特征增强、辅助点云重建和多教师对比蒸馏,在无通信成本下提升仅自我3D检测性能,在多个数据集上验证有效性。
Comments 18 pages, 8figures
Journal ref ECCV 2026
路径级事后指令用于视觉语言导航中的语义探索
机构 * Korea University(高丽大学) ; University of Michigan(密歇根大学)
AI总结 提出Phi-Nav框架,通过事后推理将指令与智能体实际探索轨迹对齐,利用三阶段双监督循环将语义未标记的运动转化为密集训练信号,在R2R-CE和RxR-CE基准上以少量专家演示取得竞争性能。
Comments Accepted to ECCV 2026
InterCMDM:用于自回归人体交互生成的块因果扩散
机构 * LY Corporation(LY公司)
AI总结 提出InterCMDM块因果潜扩散框架,通过双流因果扩散Transformer和多重任务注意力掩码实现自回归双人交互生成,解决因果性缺失和时间漂移问题,在InterHuman和InterX上达到最优性能。
Comments Accepted to ECCV 2026, Project website: https://yu1ut.com/InterCMDM-HP/
ReQuest:基于重新思考的问题感知帧选择用于长视频问答
AI总结 提出ReQuest,一种不确定性驱动的、问题自适应的关键帧选择方法,通过轻量级选择器、重新思考路由和不确定性引导的NMS,在固定token预算下提升长视频问答准确率。
Comments Accepted at ECCV 2026
LASER: 通过视觉注意力保持与沉没抑制为LVLMs提供矫正透镜
机构 * The University of Queensland(昆士兰大学)
AI总结 针对大型视觉语言模型在长序列解码中视觉遗忘的问题,提出LASER后训练框架,通过视觉接地奖励和沉没抑制奖励调节注意力轨迹与分布,在8个基准上超越强基线。
Comments The 19th European Conference on Computer Vision (ECCV 2026)
ICDepth: 通过上下文条件化驯服视频扩散模型用于视频深度估计
机构 * The Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出ICDepth框架,利用上下文条件化(ICC)将预训练文本到视频扩散Transformer适配到视频深度估计,通过SAND-Attention确保时空对齐和SRFM注入语义分辨率先验,仅用0.8M帧训练数据即达到SOTA并展现强零样本泛化。
Comments Accepted to ECCV 2026. Project page: https://xuanhuahe.github.io/ICDepth/
增强视听视频字幕的时间与跨模态对齐
机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) ; Meituan(美团)
AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。
Comments ECCV 2026
统一全景-高斯表示用于单目4D场景合成
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究院)
AI总结 提出PanoGaussian,结合全景轨迹引导与显式动态高斯表示,解决单目视频4D场景合成中视角外区域推断不一致和动态内容建模问题。
Comments Accepted at ECCV 2026
教视觉-语言-动作模型看什么和看哪里
机构 * School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) ; National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; DiDi(滴滴出行) ; State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Cyber Science and Technology, Beihang University(北京航空航天大学网络安全科学与技术学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
AI总结 提出DriveTeach-VLA框架,通过驾驶感知视觉蒸馏和2D轨迹引导提示,教VLA模型关注驾驶相关区域,实现端到端自动驾驶轨迹预测,在NAVSIM和nuScenes上达到最优性能。
Comments The paper has been accepted by ECCV 2026
基于文本锚定信息瓶颈的域泛化
机构 * Seoul National University(首尔大学)
AI总结 提出通过语言嵌入空间作为信息瓶颈来抑制视觉表征中的虚假线索,从而提升域泛化性能,实验表明该方法达到最新最优水平。
Comments Accepted to ECCV 2026
MapDreamer: 基于航空影像条件潜扩散的车道级地图生成
机构 * Department CSAI at University of Technology Nuremberg(纽伦堡工业大学CSAI系) ; Robert Bosch GmbH(罗伯特·博世有限公司)
AI总结 提出MapDreamer,一种从单张航空影像直接生成带显式拓扑的车道级矢量地图的生成扩散模型,通过变分自编码器学习车道中心线及其拓扑的紧凑潜表示,并利用基于Transformer的潜扩散模型预测图结构,在几何和拓扑保真度上优于非生成基线。
Comments Accepted at ECCV 2026
联邦学习与知识蒸馏在点云分类中的基准测试
机构 * University of Macau(澳门大学)
AI总结 针对隐私敏感和资源受限场景,联合评估联邦学习与知识蒸馏在3D点云分类中的性能,发现极端非独立同分布标签偏移下联邦学习性能下降,蒸馏可压缩模型且避免标签泄露问题。
Comments We are pleased to announce that this paper has been accepted by the 19th European Conference on Computer Vision (ECCV 2026). We appreciate the valuable feedback from the reviewers and look forward to sharing our findings with the community