arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-01 至 2026-07-01 共收录 34
2606.30342 2026-07-01 cs.CV 版本更新

A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP

通过CLIP实现分类器无关的零样本对抗攻击检测

Hodaya Krakover, Meir Yossef Levi, Eyal Gofer, Guy Gilboa

机构 * Technion - Israel Institute of Technology(以色列理工学院)

AI总结 提出A4D框架,利用CLIP的提示相似度分数,在完全黑盒零样本设置下检测对抗攻击,无需攻击或分类器先验知识。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24251 2026-07-01 cs.LG cs.CV 版本更新

Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions

重新思考边缘上的持续异常检测:在现实工业条件下进行基准测试

Chad Weatherly, Sen Lin

机构 * University of Houston(休斯敦大学)

AI总结 针对现有持续异常检测方法在评估、比较和边缘部署约束上的不足,提出统一基准和训练无关方法DINOSaur,在多种协议下超越所有现有方法,并在边缘设备上实现快速推理和适应。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21466 2026-07-01 cs.CV 版本更新

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26567 2026-07-01 cs.CV 版本更新

AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision

AirZoo: 一种用于地面几何3D视觉的统一大规模数据集

Xiaoya Cheng, Rouwan Wu, Xinyi Liu, Zeyu Cui, Yan Liu, Na Zhao, Yu Liu, Maojun Zhang, Shen Yan

机构 * National University of Defense Technology(国防科技大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出AirZoo数据集,通过可扩展生成流程、全面场景多样性和丰富的几何标注,解决无人机感知中复杂视角变换和环境条件的挑战,验证其在三维重建和图像检索中的有效性。

Comments ECCV 2026. Project page: https://nudt-sawlab.github.io/AirZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18747 2026-07-01 cs.CV 版本更新

URoPE: Universal Relative Position Embedding across Geometric Spaces

URoPE: 在几何空间中实现通用的相对位置嵌入

Yichen Xie, Depu Meng, Chensheng Peng, Yihan Hu, Quentin Herau, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

AI总结 URoPE扩展了RoPE,使模型能在不同视角或维度的几何空间中处理位置信息,适用于多任务如视图合成、3D检测等,提升模型在几何推理中的表现。

Comments Accepted by ECCV 2026. Code is available: https://urope-pe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18744 2026-07-01 cs.CV 版本更新

Match-Any-Events: Zero-Shot Motion-Robust Feature Matching Across Wide Baselines for Event Cameras

Match-Any-Events: 零样本跨大基线事件相机运动鲁棒特征匹配

Ruijun Zhang, Hang Su, Kostas Daniilidis, Ziyun Wang

机构 * Johns Hopkins University(约翰霍普金斯大学) ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Archimedes, Athena RC(Archimedes,Athena RC)

AI总结 本文提出首个零样本事件匹配模型,通过运动鲁棒且高效的注意力骨干网络和稀疏感知事件token选择,实现跨数据集大基线对应。实验显示比现有方法提升37.7%。

Comments Accepted to ECCV 2026

Journal ref Proceedings of the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15620 2026-07-01 cs.CV cs.RO 版本更新

Towards Generalizable Robotic Manipulation in Dynamic Environments

面向动态环境的通用机器人操作

Heng Fang, Shangru Li, Shuhan Wang, Xuanyang Xi, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

AI总结 本文提出DOMINO数据集与基准,通过实验评估现有VLA模型,提出PUMA架构提升动态感知能力,实现动态任务中的高成功率。

Comments Accepted to ECCV 2026. Project Page: https://h-embodvis.github.io/DOMINO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10652 2026-07-01 cs.CV cs.AI 版本更新

Are Video Reasoning Models Ready to Go Outside?

视频推理模型是否已准备好走向户外?

Yangfan He, Changgyu Boo, Jaehong Yoon

机构 * NTU Singapore(新加坡国立大学) Korea University(韩国大学)

AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。

Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09731 2026-07-01 cs.DC cs.AI 版本更新

SMART: When is it Actually Worth Expanding a Speculative Tree?

SMART: 在什么情况下扩展推测树实际上是有价值的?

Lifu Wang, Pan Zhou

机构 * Singapore Management University(新加坡管理大学)

AI总结 SMART系统通过运行时树构建优化,提升生成速度,通过边际效益-成本分析,在不同硬件和批量规模下实现平均20%的额外加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09100 2026-07-01 cs.CV cs.RO 版本更新

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。

Comments 29 pages, 10 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04834 2026-07-01 cs.CV cs.MM cs.RO eess.IV 版本更新

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景

Jiajun Zhai, Hao Shi, Shangwei Guo, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hunan University(湖南大学)

AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。

Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04050 2026-07-01 cs.CV cs.LG 版本更新

TORA: Topological Representation Alignment for 3D Shape Assembly

TORA:基于拓扑的3D形状组装表示对齐

Nahyuk Lee, Zhiang Chen, Marc Pollefeys, Sunghwan Hong

机构 * Independent Researcher(独立研究员) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

AI总结 TORA通过拓扑优先的表示对齐框架,利用预训练3D编码器的关联结构提升3D形状组装的对齐效果,通过余弦匹配和CKA损失增强拓扑对齐,实现更快收敛和更高精度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26266 2026-07-01 cs.AI cs.CV 版本更新

GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation

GUIDE:通过实时网络视频检索和即插即用标注解决GUI代理的领域偏见

Rui Xie, Zhi Gao, Chenrui Shi, Zirui Shang, Lu Chen, Qing Li

机构 * Shanghai Jiao Tong University(上海交通大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) Beijing Institute of Technology(北京理工大学)

AI总结 GUIDE通过实时网络视频检索和即插即用标注框架,解决GUI代理的领域偏见问题,通过视频语义分析和自动化标注流程提升代理对特定应用的操作流程和UI布局的理解,实验表明其在多代理系统和单模型代理中均能提升性能。

Comments Accepted to ECCV 2026. 30 pages: 15-page main paper followed by supplementary material as an appendix (Sections A-F). Project page: https://sharryXR.github.io/GUIDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24036 2026-07-01 cs.CV 版本更新

SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision

SpectralSplats: 通过谱矩监督实现鲁棒的可微跟踪

Avigail Cohen Rimon, Amir Mann, Mirela Ben Chen, Or Litany

机构 * Technion - Israel Institute of Technology(以色列理工学院) NVIDIA(英伟达)

AI总结 提出SpectralSplats框架,通过将优化目标从空间域转移到频率域,利用全局复正弦特征(谱矩)构建全局吸引域,解决3D高斯泼溅跟踪中因严重错位导致的梯度消失问题,并设计频率退火策略实现从全局凸性到精确空间对齐的平滑过渡。

Comments Accepted to ECCV 2026. Project page: https://avigailco.github.io/SpectralSplats/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23297 2026-07-01 cs.CV cs.LG eess.IV 版本更新

Drop-In Perceptual Optimization for 3D Gaussian Splatting

3D高斯溅射的即插即用感知优化

Ezgi Ozyilkan, Zhiqi Chen, Oren Rippel, Jona Ballé, Kedar Tatwawadi

机构 * Apple(苹果公司) Tandon School of Engineering, New York University(纽约大学坦登工程学院)

AI总结 针对3DGS依赖像素级损失导致模糊的问题,提出正则化Wasserstein损失WD-R,通过大规模人类主观实验验证其在纹理恢复和感知指标上的优势,并推广到多种框架和场景压缩任务。

Comments Accepted as a conference paper at ECCV'26. Project page: https://apple.github.io/ml-perceptual-3dgs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13402 2026-07-01 cs.CV cs.LG 版本更新

Event-Driven Video Generation

事件驱动视频生成

Chika Maduabuchi, Jindong Wang

机构 * William & Mary(威廉与玛丽学院)

AI总结 提出事件驱动视频生成(EVD),通过轻量级头部预测令牌级事件活动,并利用事件门控采样在交互区域集中更新,以修正对象交互错误,提升状态持久性、空间准确性和接触稳定性。

Comments Accepted to ECCV 2026. Project webpage: https://evd-project-website.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16250 2026-07-01 cs.CV cs.AI 版本更新

Visual Prompt Discovery via Semantic Exploration

通过语义探索发现视觉提示

Jaechang Kim, Yotaro Shimose, Zhao Wang, Kuang-Da Wang, Jungseul Ok, Shingo Takamatsu

机构 * Sony Group Corporation(索尼集团公司) Pohang University of Science and Technology(浦项科技大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 提出SEVEX算法,通过抽象思想空间和语义反馈自动探索任务级视觉提示,提升LVLM图像感知能力。

Comments Accepted to ECCV 2026, project page: https://jaechang.dev/projects/SEVEX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18242 2026-07-01 cs.CV 版本更新

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA:学习规划与验证以实现自我中心视频推理

Yogesh Kulkarni, Pooyan Fazli

AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22265 2026-07-01 cs.LG cs.CV 版本更新

Entropy-Controlled Flow Matching

熵控流匹配

Chika Maduabuchi

机构 * William & Mary(威廉与玛丽学院)

AI总结 提出熵控流匹配(ECFM),通过约束连续方程路径的全局熵率,避免低熵瓶颈导致的语义模式丢失,并证明其与薛定谔桥的联系及最优传输收敛性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03510 2026-07-01 cs.CV 版本更新

G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation

G2P:面向边界感知3D分割的高斯到点属性对齐

Hojun Song, Chae-yeong Song, Jeong-hun Hong, Chaewon Moon, Soo Ye Kim, Yiyi Liao, Jaehyup Lee, Sang-hyo Park

机构 * Kyungpook National University(庆北国立大学) Korea Electronics Technology Institute(韩国电子技术研究院) Adobe Research(Adobe研究院) Zhejiang University(浙江大学)

AI总结 提出G2P方法,通过将3D高斯泼溅的属性(如不透明度和尺度)传递到点云,解决几何特征无法区分外观相似物体的问题,实现边界感知的3D分割。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21291 2026-07-01 cs.CV 版本更新

Gaussian Belief Propagation Network for Depth Completion

高斯置信传播网络用于深度补全

Jie Tang, Pingping Xie, Jian Li, Ping Tan

机构 * National University of Defense Technology(国防科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出高斯置信传播网络(GBPN),融合深度学习与概率图模型,通过动态构建马尔可夫随机场并利用高斯置信传播推断,实现高稀疏度下的鲁棒深度补全。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16959 2026-07-01 cs.LG cs.AI cs.NE stat.ML 版本更新

Graph Coloring for Multi-Task Learning

多任务学习的图着色方法

Santosh Patapati, Ian Noronha

机构 * Stony Brook University AI Innovation Institute(石溪大学人工智能创新研究所) Purdue University(普渡大学)

AI总结 提出SON-GOKU调度器,通过构建梯度干扰图并应用贪心图着色将任务分组,每步仅激活一组任务,减少梯度干扰,提升多任务学习性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04390 2026-07-01 cs.CV cs.AI 版本更新

FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring

FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊

Geunhyuk Youk, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。

Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20935 2026-07-01 cs.CV 版本更新

ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation

ISAC:无需训练的实例到语义注意力控制用于多实例生成

Sanghyun Jo, Wooyeol Lee, Ziseok Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19778 2026-07-01 cs.CV 版本更新

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer

相位对齐的混合分辨率扩散Transformer旋转位置编码

Haoyu Wu, Jingyi Xu, Qiaomu Miao, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。

Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18775 2026-07-01 cs.CV cs.AI 版本更新

Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise

重新思考基于扩散的虚拟试穿中的服装条件:解耦,而非去噪

Kihyun Na, Jinyoung Choi, Injung Kim

机构 * Handong Global University(韩东国际大学)

AI总结 针对扩散虚拟试穿中双UNet结构参数多、空间拼接全微调失效的问题,通过可视化研究揭示服装条件必须与去噪过程解耦,提出DeCo-VTON模型,以单网络架构达到双UNet水平且成本减半。

Comments Accepted at ECCV 2026. 28 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏