arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2606.23362 2026-06-23 cs.CR cs.CV 新提交

TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger

TooBad: 超低投毒率和不可察觉触发器的后门扩散模型

Vu Tuan Truong, Long Bao Le

机构 * INRS, University of Quebec(INRS大学)

AI总结 提出TooBad框架,通过针对扩散模型的触发器优化技术,在极低投毒率(0.5%)下实现高攻击成功率(>85%),并保持高隐蔽性和实用性。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23129 2026-06-23 cs.CV cs.LG 新提交

Spectral Gating via Damped Oscillations for Adaptive Implicit Neural Representations

基于阻尼振荡的谱门控自适应隐式神经表示

Alex Costanzino, Pierluigi Zama Ramirez, Giuseppe Lisanti, Luigi Di Stefano

机构 * University of Bologna(博洛尼亚大学) Ca’ Foscari University of Venice(威尼斯大学)

AI总结 提出将神经元激活建模为受迫阻尼谐振子的稳态响应,通过联合优化振荡器参数和网络权重,实现自适应谱门控,无需显式正则化即可从粗到细学习。

Comments Accepted at ECCV 2026. Project Page: https://alex-costanzino.github.io/fdho/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22875 2026-06-23 cs.CV 新提交

FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs

FedOT: 联邦潜扩散模型的所有权验证与泄露追踪水印

Wenlong Cheng, Yuan Gan, Yunqiu Xu, Jiaxu Miao

机构 * Northwest Normal University(西北师范大学) The University of Tokyo(东京大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学)

AI总结 提出FedOT框架,通过分块水印和潜向量变换解决联邦学习中潜扩散模型的所有权验证与恶意客户端泄露追踪问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22749 2026-06-23 cs.CV 新提交

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

RaysUp: 基于几何感知射线表示的超轻量通用特征上采样

Yuchuan Ding, Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

AI总结 提出RaysUp,一种超轻量、任务无关且VFM无关的特征上采样框架,通过几何感知射线域重建高分辨率特征图,在多种密集预测任务上以16%参数和7倍加速实现最先进性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22527 2026-06-23 cs.CV 新提交

Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories

轨迹强制:具有可控语义轨迹的结构优先生成

Merve Kocabas, Gege Gao, Bernhard Schölkopf, Andreas Geiger

机构 * University of Tübingen(图宾根大学) ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute(ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

AI总结 提出轨迹强制框架,将生成过程组织为从全局布局到细节的语义阶段,每个阶段产生可解码的潜在状态,支持局部编辑,实现结构优先的可控图像合成。

Comments Project page: https://mervekocabas.github.io/TrajectoryForcing/

Journal ref Proceedings of the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22416 2026-06-23 cs.CV 新提交

Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition

Gen2Balance:面向长尾视频动作识别的生成式平衡方法

Prajwal Gatti, Simon Jenni, Fabian Caba Heilbron, Dima Damen

机构 * University of Bristol(布里斯托大学) Adobe Research(Adobe 研究院)

AI总结 提出Gen2Balance方法,利用文本到视频生成模型将长尾训练集平衡为真实与生成视频的混合,结合两阶段训练策略缓解域偏移,在长尾基准上显著提升动作识别准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22383 2026-06-23 cs.CV cs.AI cs.LG 新提交

Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers

结构化超边适应用于视觉Transformer的参数高效微调

Edwin Kwadwo Tenagyei, Lei Wang, Ugochukwu Ejike Akpudo, Jun Zhou, Yongsheng Gao

机构 * Griffith University(格里菲斯大学) Data61/CSIRO(Data61/澳大利亚联邦科学与工业研究组织)

AI总结 提出HyperAdapter,一种基于超图的适配器架构,通过软超边路由实现结构化、组感知的适应,在参数预算下优于现有PEFT方法。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22378 2026-06-23 cs.CV 新提交

Following the Flow: Advection-Consistent Modeling for Event-based Small Object Detection

跟随流动:面向事件相机小目标检测的平流一致性建模

Wen Guo, Fulong Cai, Wuzhou Quan

机构 * School of Information and Electronic Engineering, Shandong Technology and Business University(山东工商学院信息与电子工程学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 针对事件相机小目标检测中稀疏异步测量和噪声干扰导致预测碎片化的问题,提出物理引导的平流一致性建模框架PACT,通过沿估计速度场传播特征并施加轨迹级一致性约束,保留弱事件响应,在基准数据集上IoU提升20.72%,准确率提升15.03%。

Comments Accepted at ECCV 2026. Code: https://github.com/fulongcai/PACT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22285 2026-06-23 cs.CV 新提交

Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT-Quantization Embedding

基于多级差异特征与统一DCT-量化嵌入的高效文档篡改定位

Mohamed Dhouib, Ye Zhu, Sonia Vanier, Aymen Shabou

机构 * LIX, École Polytechnique, IP Paris, France(LIX,巴黎综合理工学院,IP Paris,法国) DataLab Groupe, Crédit Agricole S.A., France(DataLab集团,法国农业信贷银行,法国)

AI总结 提出DiffNet,通过多级差异变换和轻量级DCT-量化联合嵌入,在跨域和人工篡改定位上性能提升约30%,吞吐量提高7倍。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22197 2026-06-23 cs.CV 新提交

Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation

Multi4D: 通过多级竞争分配实现高保真动态高斯泼溅

Rui Wang, Quentin Lohmeyer, Siyu Tang, Mirko Meboldt

机构 * ETH Zürich(苏黎世联邦理工学院)

AI总结 提出Multi4D框架,通过三级竞争分配(静态结构、持久动态几何、瞬态外观)解决动态高斯泼溅中运动一致性与视觉保真度的矛盾,实现高保真渲染和实时性能。

Comments Accepted by ECCV 2026, project page:https://batfacewayne.github.io/Multi4D.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21956 2026-06-23 cs.CV 新提交

Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation

基于注意力先验引导知识蒸馏的增强去噪粗到细红外小目标检测

Houzhang Fang, Ruixuan Huang, Qiuhuan Chen, Xiaolin Wang, Yi Chang, Luxin Yan

机构 * Xidian University(西安电子科技大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 提出一种粗到细的红外小目标检测框架ECFNet,通过粗阶段的区域二分类网络和去噪辅助训练抑制背景,细阶段的轻量检测器与注意力先验知识蒸馏提升精度,在三个数据集上优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21910 2026-06-23 cs.CV 新提交

Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution

保真度与感知感知的局部隐式注意力用于任意尺度图像超分辨率

Yu-Syuan Xu, Hao-Lun Sun, Hao-Wei Chen, Hsien-Kai Kuo, Chun-Yi Lee

机构 * National Taiwan University(国立台湾大学) MediaTek Inc.(联发科技股份有限公司)

AI总结 提出FPLIA框架,通过融合保真度导向特征与扩散管道,结合FPAM和FPSM模块,在任意尺度超分辨率中实现高感知真实度与重建精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21705 2026-06-23 cs.CV 新提交

Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space

结构评估用于理解和指导离散令牌空间中的数据集蒸馏

Yue Cao, Jianyang Gu, Vyacheslav Kungurtsev, Yu Hu, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia(不列颠哥伦比亚大学) The Ohio State University(俄亥俄州立大学) Czech Technical University in Prague(布拉格捷克理工大学) TerraSense Analytics(TerraSense Analytics公司)

AI总结 本文通过离散视觉分词器分析令牌组成结构,提出结构评分衡量令牌组合充分性,发现平衡的令牌组成提升蒸馏数据集性能,并指导扩散模型的数据集蒸馏。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21373 2026-06-23 cs.CV cs.RO 新提交

FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction

FLM-Occ: 前向似然最大化用于高效室内占据预测

Guangcheng Chen, Lihuang Fang, Huaqi Tao, Yicheng He, Li He, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Key Laboratory of Robotics and Computer Vision(深圳市机器人视觉与感知重点实验室)

AI总结 针对现有方法在空区域产生虚假基元的问题,提出前向似然最大化框架,将占据预测建模为体素分布估计,通过最大化真实占据体素的似然来训练网络,实现高效准确的室内占据预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21216 2026-06-23 cs.RO 新提交

A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world

来自预训练ViT的每补丁标量实现现实世界快速移动导航

Steeven Janny, Leonid Antsfeld, Christian Wolf

机构 * NaverLabs Europe(NaverLabs欧洲)

AI总结 通过大规模真实世界导航实验,研究预训练视觉编码器在机器人导航中的关键组件,提出异构多教师蒸馏和瓶颈策略,发现可解释特征与可供性关联,并证明仅用RGB训练非最优。

Comments European Conference on Computer Vision -- ECCV 2026

Journal ref European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21135 2026-06-23 cs.CV cs.GR cs.RO 新提交

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion

Odoriko: 一种形状感知的多模态人体运动扩散框架

Dongseok Shim, Julian Tanke, Kengo Uchida, Christian Simon, Koichi Saito, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

AI总结 提出首个统一的多模态运动生成框架Odoriko,通过扩散模型将主体生物形态信息融入运动合成,支持文本、音乐、视频输入,并在形态缺失时联合估计与生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21108 2026-06-23 cs.CV 新提交

SARIF: Segment Anything for Robust Image Forensics

SARIF: 用于鲁棒图像鉴别的 Segment Anything

Dong-Hyun Moon, Ju-Hyeon Nam, Sang-Chul Lee

机构 * Department of Electrical and Computer Engineering, Inha University(仁荷大学电气与计算机工程系)

AI总结 提出SARIF框架,利用Segment Anything Model的提示架构和泛化能力,通过反馈引导掩码解码器和双编码器设计提取伪造痕迹,实现自动伪造定位,在跨数据集和图像退化下表现鲁棒。

Comments Accepted to ECCV 2026. Equal contribution: Dong-Hyun Moon and Ju-Hyeon Nam. Corresponding author: Sang-Chul Lee. Code: https://github.com/Inha-CVAI/SARIF_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20774 2026-06-23 cs.CV cs.AI cs.RO 新提交

TriMotion: Modality-Agnostic Camera Control for Video Generation

TriMotion: 模态无关的摄像机控制用于视频生成

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng

机构 * GIST(光州科学技术院) Huawei Noah's Ark Lab(华为诺亚方舟实验室) Yonsei University(延世大学) Imperial College London(伦敦帝国理工学院)

AI总结 提出TriMotion框架,通过将视频、姿态和文本输入映射到共享运动嵌入空间,实现模态无关的摄像机控制视频生成,并引入潜在运动一致性目标,无需像素级解码即可准确跟随目标轨迹。

Comments ECCV Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20937 2026-06-23 cs.LG 版本更新

Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs

面向高效视频大语言模型的sink-token感知剪枝:用于细粒度视频理解

Kibum Kim, Jiwan Kim, Kyle Min, Yueqi Wang, Jinyoung Moon, Julian McAuley, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) Oracle University of California, San Diego(加州大学圣地亚哥分校) Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)

AI总结 本文提出Sink-Token-aware Pruning方法,通过识别并抑制semantically uninformative tokens,提升细粒度视频理解性能,在多种基准测试中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24551 2026-06-23 cs.CV 版本更新

PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation

PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成

Yuanhao Cai, Kunpeng Li, Menglin Jia, Jialiang Wang, Junzhe Sun, Feng Liang, Weifeng Chen, Felix Juefei-Xu, Chu Wang, Ali Thabet, Xiaoliang Dai, Xuan Ju, Alan Yuille, Ji Hou

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰霍普金斯大学) Meta BizAI(Meta商业人工智能)

AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21445 2026-06-23 cs.RO 版本更新

VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies

VLA 知道自己的极限:机器人策略的自适应执行视界

Haoxuan Wang, Gengyu Zhang, Yan Yan, Ramana Rao Kompella, Gaowen Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Cisco Research(思科研究)

AI总结 针对流式视觉-语言-动作模型中执行视界影响性能的问题,提出 AutoHorizon 方法,通过分析注意力权重动态估计每块动作的执行视界,提升机器人操作任务性能。

Comments ECCV 2026. Project page at https://hatchetproject.github.io/autohorizon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16192 2026-06-23 cs.CV 版本更新

360Anything: Geometry-Free Lifting of Images and Videos to 360°

360Anything: 图像和视频的无几何约束360°生成

Ziyi Wu, Daniel Watson, Andrea Tagliasacchi, David J. Fleet, Marcus A. Brubaker, Saurabh Saxena

机构 * Google DeepMind(谷歌DeepMind) Simon Fraser University(西蒙弗雷泽大学) University of Toronto(多伦多大学)

AI总结 提出无几何约束框架360Anything,基于预训练扩散Transformer,以数据驱动方式学习透视到等距柱状投影映射,无需相机元数据,实现图像和视频到360°全景的高质量生成,并引入循环潜在编码消除拼接伪影。

Comments ECCV 2026. Project page: https://360anything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22087 2026-06-23 cs.CV 版本更新

Streaming Dense Voxel Representations for 3D Occupancy Prediction

用于3D占用预测的流式密集体素表示

Seokha Moon, Janghyun Baek, Yujin Jeong, Daewon Chae, Giseop Kim, Jungbeom Lee, Jinkyu Kim, Sunwook Choi

机构 * 1 Korea University 2 TU Darmstadt \& hessian.AI 3 University of Michigan 4 DGIST 5 NAVER LABS

AI总结 提出StreamOcc框架,通过两种聚合策略解决密集体素流式处理中的扭曲和动态对象退化问题,在实时约束下实现SOTA性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18313 2026-06-23 cs.CV 版本更新

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM:全知驾驶导航世界模型

Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) PhiGent National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Wuhan University(武汉大学)

AI总结 提出OmniNWM全知全景导航世界模型,在统一概率框架下处理状态、动作和奖励三个维度,实现多模态全景视频生成、零样本轨迹控制及内在奖励机制,在生成保真度和控制精度上达到SOTA。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26113 2026-06-23 cs.CV cs.AI 版本更新

EgoExo-Con: Exploring View-Invariant Video Temporal Understanding

EgoExo-Con: 探索视角不变视频时间理解

Minjoon Jung, Junbin Xiao, Junghyun Kim, Byoung-Tak Zhang, Angela Yao

机构 * Seoul National University(首尔国立大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 提出EgoExo-Con基准测试,评估视频大模型在不同视角下的时间理解一致性,并设计View-GRPO强化学习框架提升跨视角一致性。

Comments Accepted to ECCV 2026; project page at https://minjoong507.github.io/projects/EgoExo-Con/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12191 2026-06-23 cs.LG cs.CV 版本更新

HEM: a margin-based loss for visual categorisation tasks

HEM:一种用于视觉分类任务的基于边界的损失函数

Michael W. Spratling, Heiko H. Schütt

机构 * Department of Behavioural and Cognitive Sciences(行为与认知科学系)

AI总结 提出高错误边际(HEM)损失,一种改进的基于边界的损失函数,在多种视觉任务(如未知类拒绝、对抗鲁棒性、不平衡学习、持续学习和语义分割)上优于交叉熵损失,且与专门损失相比具有竞争力。

Comments Code: https://codeberg.org/mwspratling/HEMLoss

Journal ref European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20563 2026-06-19 cs.CV 新提交

JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

JanusMesh: 通过跨空间去噪实现快速零样本3D视觉错觉生成

Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 提出一种无需训练的快速框架,通过跨空间双分支去噪和视图条件纹理合成,在3-5分钟内生成高真实感双语义3D视觉错觉,优于现有方法。

Comments ECCV 2026. Project page: https://siang1105.github.io/JanusMesh.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20110 2026-06-19 cs.CV 新提交

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model

FrozenDrive: 零样本文本引导驾驶场景生成与数据增强的无参数冻结扩散模型

Yuhwan Jeong, Hyeonseong Kim, Daehyun We, Seonkyu Song, Jinnyeong Yang, Hyun-Kurl Jang, Youngho Yoon, Kuk-Jin Yoon

机构 * KAIST, Visual Intelligence Lab(韩国科学技术院视觉智能实验室)

AI总结 提出FrozenDrive框架,利用冻结的预训练扩散模型,通过知识保留的时空注意力实现多视图一致性和时间连贯性,无需微调即可生成恶劣天气下的驾驶场景,提升自动驾驶模型鲁棒性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20103 2026-06-19 cs.CV 新提交

Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration

3D高斯溅射中保持几何结构的LiDAR-相机外参标定

Kyoleen Kwak, Daeho Kim, Jeong Woon Lee, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

AI总结 针对LiDAR-相机标定中跨模态特征稀缺问题,提出通过多视图LiDAR深度监督和阻止光度梯度更新高斯空间参数来保持3DGS代理的度量几何,提升标定精度。

Comments Accepted to ECCV 2026. 15 pages (excluding references), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏