A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP
通过CLIP实现分类器无关的零样本对抗攻击检测
机构 * Technion - Israel Institute of Technology(以色列理工学院)
AI总结 提出A4D框架,利用CLIP的提示相似度分数,在完全黑盒零样本设置下检测对抗攻击,无需攻击或分类器先验知识。
Comments Accepted to ECCV 2026
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
通过CLIP实现分类器无关的零样本对抗攻击检测
机构 * Technion - Israel Institute of Technology(以色列理工学院)
AI总结 提出A4D框架,利用CLIP的提示相似度分数,在完全黑盒零样本设置下检测对抗攻击,无需攻击或分类器先验知识。
Comments Accepted to ECCV 2026
重新思考边缘上的持续异常检测:在现实工业条件下进行基准测试
机构 * University of Houston(休斯敦大学)
AI总结 针对现有持续异常检测方法在评估、比较和边缘部署约束上的不足,提出统一基准和训练无关方法DINOSaur,在多种协议下超越所有现有方法,并在边缘设备上实现快速推理和适应。
Comments Accepted to ECCV 2026
StreamGVE: 无需训练的视频编辑通过少步流式视频生成
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; ETH Zürich(苏黎世联邦理工学院) ; McMaster University(麦马斯特大学) ; Vector Institute(向量研究所) ; Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)
AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。
Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/
AirZoo: 一种用于地面几何3D视觉的统一大规模数据集
机构 * National University of Defense Technology(国防科技大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
AI总结 本文提出AirZoo数据集,通过可扩展生成流程、全面场景多样性和丰富的几何标注,解决无人机感知中复杂视角变换和环境条件的挑战,验证其在三维重建和图像检索中的有效性。
Comments ECCV 2026. Project page: https://nudt-sawlab.github.io/AirZoo/
URoPE: 在几何空间中实现通用的相对位置嵌入
机构 * Applied Intuition(应用直觉) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 URoPE扩展了RoPE,使模型能在不同视角或维度的几何空间中处理位置信息,适用于多任务如视图合成、3D检测等,提升模型在几何推理中的表现。
Comments Accepted by ECCV 2026. Code is available: https://urope-pe.github.io/
Match-Any-Events: 零样本跨大基线事件相机运动鲁棒特征匹配
机构 * Johns Hopkins University(约翰霍普金斯大学) ; ShanghaiTech University(上海科技大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Archimedes, Athena RC(Archimedes,Athena RC)
AI总结 本文提出首个零样本事件匹配模型,通过运动鲁棒且高效的注意力骨干网络和稀疏感知事件token选择,实现跨数据集大基线对应。实验显示比现有方法提升37.7%。
Comments Accepted to ECCV 2026
Journal ref Proceedings of the European Conference on Computer Vision (ECCV) 2026
面向动态环境的通用机器人操作
机构 * Huazhong University of Science and Technology(华中科技大学) ; Huawei Technologies Co. Ltd(华为技术有限公司)
AI总结 本文提出DOMINO数据集与基准,通过实验评估现有VLA模型,提出PUMA架构提升动态感知能力,实现动态任务中的高成功率。
Comments Accepted to ECCV 2026. Project Page: https://h-embodvis.github.io/DOMINO/
视频推理模型是否已准备好走向户外?
机构 * NTU Singapore(新加坡国立大学) ; Korea University(韩国大学)
AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。
Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026
SMART: 在什么情况下扩展推测树实际上是有价值的?
机构 * Singapore Management University(新加坡管理大学)
AI总结 SMART系统通过运行时树构建优化,提升生成速度,通过边际效益-成本分析,在不同硬件和批量规模下实现平均20%的额外加速。
Comments Accepted by ECCV 2026
基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下
机构 * Istituto Italiano di Tecnologia(意大利技术研究院)
AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。
Comments 29 pages, 10 figures, Accepted to ECCV 2026
E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Hunan University(湖南大学)
AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。
Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA
TORA:基于拓扑的3D形状组装表示对齐
机构 * Independent Researcher(独立研究员) ; ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(ETH人工智能中心)
AI总结 TORA通过拓扑优先的表示对齐框架,利用预训练3D编码器的关联结构提升3D形状组装的对齐效果,通过余弦匹配和CKA损失增强拓扑对齐,实现更快收敛和更高精度。
Comments Accepted to ECCV 2026
GUIDE:通过实时网络视频检索和即插即用标注解决GUI代理的领域偏见
机构 * Shanghai Jiao Tong University(上海交通大学) ; State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) ; Beijing Institute of Technology(北京理工大学)
AI总结 GUIDE通过实时网络视频检索和即插即用标注框架,解决GUI代理的领域偏见问题,通过视频语义分析和自动化标注流程提升代理对特定应用的操作流程和UI布局的理解,实验表明其在多代理系统和单模型代理中均能提升性能。
Comments Accepted to ECCV 2026. 30 pages: 15-page main paper followed by supplementary material as an appendix (Sections A-F). Project page: https://sharryXR.github.io/GUIDE/
SpectralSplats: 通过谱矩监督实现鲁棒的可微跟踪
机构 * Technion - Israel Institute of Technology(以色列理工学院) ; NVIDIA(英伟达)
AI总结 提出SpectralSplats框架,通过将优化目标从空间域转移到频率域,利用全局复正弦特征(谱矩)构建全局吸引域,解决3D高斯泼溅跟踪中因严重错位导致的梯度消失问题,并设计频率退火策略实现从全局凸性到精确空间对齐的平滑过渡。
Comments Accepted to ECCV 2026. Project page: https://avigailco.github.io/SpectralSplats/
DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Roboflow
AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。
Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/
3D高斯溅射的即插即用感知优化
机构 * Apple(苹果公司) ; Tandon School of Engineering, New York University(纽约大学坦登工程学院)
AI总结 针对3DGS依赖像素级损失导致模糊的问题,提出正则化Wasserstein损失WD-R,通过大规模人类主观实验验证其在纹理恢复和感知指标上的优势,并推广到多种框架和场景压缩任务。
Comments Accepted as a conference paper at ECCV'26. Project page: https://apple.github.io/ml-perceptual-3dgs
事件驱动视频生成
机构 * William & Mary(威廉与玛丽学院)
AI总结 提出事件驱动视频生成(EVD),通过轻量级头部预测令牌级事件活动,并利用事件门控采样在交互区域集中更新,以修正对象交互错误,提升状态持久性、空间准确性和接触稳定性。
Comments Accepted to ECCV 2026. Project webpage: https://evd-project-website.pages.dev
AR-CoPO: 利用对比策略优化对齐自回归视频生成
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; Vivix Group Limited(Vivix集团有限公司) ; HKUST(香港科技大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; CPII under InnoHK(InnoHK下的CPII)
AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。
Comments ECCV 2026
通过语义探索发现视觉提示
机构 * Sony Group Corporation(索尼集团公司) ; Pohang University of Science and Technology(浦项科技大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
AI总结 提出SEVEX算法,通过抽象思想空间和语义反馈自动探索任务级视觉提示,提升LVLM图像感知能力。
Comments Accepted to ECCV 2026, project page: https://jaechang.dev/projects/SEVEX/
GeoNVS: 基于几何的视频扩散模型用于新视角合成
机构 * KAIST, South Korea(韩国科学技术院) ; Luma AI, USA(Luma AI(美国))
AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。
Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)
EgoVITA:学习规划与验证以实现自我中心视频推理
AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。
Comments ECCV 2026
熵控流匹配
机构 * William & Mary(威廉与玛丽学院)
AI总结 提出熵控流匹配(ECFM),通过约束连续方程路径的全局熵率,避免低熵瓶颈导致的语义模式丢失,并证明其与薛定谔桥的联系及最优传输收敛性。
Comments Accepted to ECCV 2026
G2P:面向边界感知3D分割的高斯到点属性对齐
机构 * Kyungpook National University(庆北国立大学) ; Korea Electronics Technology Institute(韩国电子技术研究院) ; Adobe Research(Adobe研究院) ; Zhejiang University(浙江大学)
AI总结 提出G2P方法,通过将3D高斯泼溅的属性(如不透明度和尺度)传递到点云,解决几何特征无法区分外观相似物体的问题,实现边界感知的3D分割。
Comments Accepted to ECCV 2026. Camera-ready version
高斯置信传播网络用于深度补全
机构 * National University of Defense Technology(国防科技大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出高斯置信传播网络(GBPN),融合深度学习与概率图模型,通过动态构建马尔可夫随机场并利用高斯置信传播推断,实现高稀疏度下的鲁棒深度补全。
Comments Accepted by ECCV 2026
多任务学习的图着色方法
机构 * Stony Brook University AI Innovation Institute(石溪大学人工智能创新研究所) ; Purdue University(普渡大学)
AI总结 提出SON-GOKU调度器,通过构建梯度干扰图并应用贪心图着色将任务分组,每步仅激活一组任务,减少梯度干扰,提升多任务学习性能。
Comments ECCV 2026
PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新
机构 * KDDI Research, Inc.(KDDI研究所)
AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。
Comments Accepted to ECCV 2026
FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊
机构 * KAIST(韩国科学技术院) ; CMLab, Chung-Ang University(中央大学CMLab)
AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。
Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/
ISAC:无需训练的实例到语义注意力控制用于多实例生成
机构 * OGQ ; Seoul National University(首尔大学)
AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。
Comments Accepted to ECCV 2026
相位对齐的混合分辨率扩散Transformer旋转位置编码
机构 * Stony Brook University(石溪大学) ; UNC-Charlotte(北卡罗来纳大学夏洛特分校)
AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。
Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/
重新思考基于扩散的虚拟试穿中的服装条件:解耦,而非去噪
机构 * Handong Global University(韩东国际大学)
AI总结 针对扩散虚拟试穿中双UNet结构参数多、空间拼接全微调失效的问题,通过可视化研究揭示服装条件必须与去噪过程解耦,提出DeCo-VTON模型,以单网络架构达到双UNet水平且成本减半。
Comments Accepted at ECCV 2026. 28 pages, 9 figures, 11 tables