arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2606.24333 2026-06-24 cs.CV 新提交

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学)

AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24297 2026-06-24 cs.CV 新提交

Training-free Cross-domain Few-shot Segmentation via Robust Semantic Representation and Matching

基于鲁棒语义表示与匹配的无训练跨域小样本分割

Sujun Sun, Mingwu Ren, Haofeng Zhang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进工程机械智能制造国家重点实验室)

AI总结 提出无训练框架,利用DINOv3编码器和三个核心模块(语义感知特征融合、自适应支持增强、混合原型匹配)实现跨域小样本分割,无需训练或微调,在四个目标域数据集上达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24296 2026-06-24 cs.CV 新提交

Hierarchical Spatial and Channel Aggregation for Cross-domain Few-shot Segmentation

跨域小样本分割的分层空间与通道聚合

Sujun Sun, Mingwu Ren, Haofeng Zhang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进工程机械智能制造国家重点实验室)

AI总结 提出双分层聚合网络(DHANet),通过分层空间聚合(HSA)和分层通道聚合(HCA)模块分别缓解语义过对齐和属性过对齐,并引入在线概率语义库(OPSB)增强支持信息,在四个目标域数据集上取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24165 2026-06-24 cs.CV 新提交

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

多模态大语言模型中基于谱演化引导的令牌剪枝

Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) The University of Queensland(昆士兰大学) Singapore Management University(新加坡管理大学) The University of Southern Queensland(南昆士兰大学)

AI总结 提出跨层谱演化(CLSE)框架,通过频域分析令牌表示在Transformer层间的演化来评估重要性,实现无训练剪枝,在保持性能的同时减少计算开销。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24156 2026-06-24 cs.CV 新提交

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

利用先验校正的令牌缩减加速多模态大语言模型

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

AI总结 提出PriorTR方法,通过分离任务条件注意力与模型先验注意力,在单次前向传播中估计先验并校正令牌重要性,实现无训练令牌缩减,提升多模态大语言模型效率与准确性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24144 2026-06-24 cs.CV 新提交

Geometry-Aware Style Transfer in 3D Gaussian Splatting

3D高斯泼溅中的几何感知风格迁移

Min Hyeok Bang, Jun Hyeong Kim, Seung-Wook Kim, Se-Ho Lee

机构 * Department of Computer Science and Artificial Intelligence/Center for Advanced Image Information Technology, Jeonbuk National University(全北国立大学计算机科学与人工智能系/高级图像信息技术中心) Division of Electronic and Communication Engineering, Pukyong National University(釜庆国立大学电子与通信工程系)

AI总结 提出一种几何感知风格迁移框架,通过解耦优化交替更新颜色和几何参数,并利用几何感知对比特征匹配(GCFM)将风格图像的结构特征迁移到高斯基元,实现外观与几何结构的同步迁移。

Comments 14 pages, 7 figures, accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24101 2026-06-24 cs.RO cs.CV 新提交

NavWM: A Unified Navigation World Model for Foresight-Driven Planning

NavWM:一种用于前瞻性规划的统一导航世界模型

Yanghong Mei, Longteng Guo, Ming-Ming Yu, Guiyu Zhao, Xingjian He, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 提出NavWM统一导航世界模型,通过潜在世界令牌提取几何与语义先验,结合锚点多模态轨迹预测框架生成多样化动作空间,利用视觉前瞻评估最优路径,在多种机器人数据集上显著提升未来状态生成与零样本导航成功率。

Comments 13 pages, 5 figures, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24072 2026-06-24 cs.CV 新提交

Fabric Image Demoiréing Benchmark from Synthesis to Restoration

织物图像去摩尔纹基准:从合成到恢复

Pengchao Wei, Xiaojie Guo

机构 * Tianjin University(天津大学)

AI总结 提出首个织物图像去摩尔纹基准,通过物理合成框架构建大规模数据集,并定制基线模型,解决织物摩尔纹因宽带半周期特性导致的去噪难题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23950 2026-06-24 cs.CV 新提交

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

DivRL: 解耦自相似性奖励用于多样化主题驱动生成

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

机构 * KAUST(阿卜杜拉国王科技大学)

AI总结 提出DivRL框架,通过解耦视觉特征中的负自相似性度量(nSSM)和视觉语义匹配(VSM),采用“探索-抑制”策略联合优化身份一致性与结构多样性,解决主题驱动生成中的身份-多样性悖论。

Comments Accepted to ECCV 2026. Project page: https://qianwangx.github.io/DivRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23917 2026-06-24 cs.CV 新提交

Trustworthy Image Authentication using Forensic Knowledge Graphs

使用取证知识图谱的可信图像认证

Tai D. Nguyen, Matthew C. Stamm

机构 * Drexel University(德雷塞尔大学)

AI总结 提出取证知识图谱(FKG)框架,通过结构化取证证据提取与推理实现可解释的图像伪造检测,优于现有检测器和视觉语言模型。

Comments Accepted and Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23872 2026-06-24 cs.LG cs.AI 新提交

MGI: Member vs Generated Inference

MGI:成员与生成推断

Bihe Zhao, Michel Meintz, Juangui Xu, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

AI总结 针对生成模型输出与训练样本难以区分的问题,提出MGI任务,并设计数据断路器(DCB)方法,结合自编码器和潜在生成器的互补信号,有效区分训练成员与生成样本。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22424 2026-06-24 cs.CV 新提交

FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation

FlowDec:用于鲁棒连续视觉-语言导航的时间条件流去污染器

Yufei Zhang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州))

AI总结 提出FlowDec,一种针对LM-based VLN-CE的图像恢复框架,通过混合时间条件策略和动作质心引导滤波,在导航精度和生成延迟上超越现有去污染方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22314 2026-06-24 cs.LG cs.AI cs.CV 新提交

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

扩散积分梯度:用于灵活特征归因的可控路径生成

Soyeon Kim, Kyowoon Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) Ajou University(亚洲大学) INEEJI Corp.(INEEJI公司)

AI总结 提出扩散积分梯度(DiffIG),通过扩散模型生成路径并嵌入用户引导,实现灵活可控的特征归因,在定量和定性上优于现有方法。

Comments 44 pages, 22 figures, 10 tables. Accepted to ECCV 2026; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22220 2026-06-24 cs.CV cs.AI cs.LG 新提交

MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learning

MultiMem: 多模态对比学习中的记忆化测量与缓解

Wenhao Wang, Franziska Boenisch, Michael Backes, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

AI总结 提出首个多模态对比学习记忆化度量MultiMem,发现跨模态语义错位是主要驱动因素,文本模态影响最大,并通过跨模态增强有效降低记忆化并提升性能。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20189 2026-06-24 cs.CV cs.AI cs.RO 新提交

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training

HilDA:利用扩散的分层蒸馏推进自监督LiDAR预训练

Maciej Wozniak, Jesper Ericsson, Hariprasath Govindarajan, Truls Nyberg, Thomas Gustafsson, Patric Jensfelt, Olov Andersson

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Linköping University(林雪平大学) TRATON AB(TRATON公司) Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司)

AI总结 提出HilDA框架,通过分层蒸馏(多层蒸馏和全局上下文蒸馏)结合时间占用扩散目标,自监督预训练LiDAR骨干网络,在3D检测、场景流和语义占用预测任务上达到最先进水平。

Comments Accepted to ECCV 2026. Maciej and Jesper contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12218 2026-06-24 cs.CV 版本更新

Learning Ego-Centric BEV Representations from a Perspective-Privileged View: Cross-View Supervision for Online HD Map Construction

从视角优先视角学习自主视角BEV表示:用于在线HD地图构建的跨视角监督

Daniel Lengerer, Mathias Pechinger, Klaus Bogenberger, Carsten Markgraf

机构 * Technical University of Applied Sciences Augsburg, Germany(应用技术大学阿格堡学院,德国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

AI总结 本文提出跨视角监督方法,通过将几何和拓扑先验从视角优先的俯视视角转移到基于摄像头的BEV编码器,提升自主视角BEV表示的一致性,实验显示在nuScenes数据集上取得显著提升。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21945 2026-06-24 cs.CV 版本更新

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D:通过桥接2D先验和3D一致性的生成式非完整3D建模

Junwei Zhou, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

AI总结 提出GENA3D框架,结合2D生成先验与3D几何推理,在部分遮挡下生成完整且几何一致的3D物体,优于现有方法。

Comments Paper accepted by ECCV 2026. Project page: https://colezwhy.github.io/gena3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10931 2026-06-24 cs.CV 版本更新

M4-SAR: A Multi-Resolution, Multi-Polarization, Multi-Scene, Multi-Source Dataset and Benchmark for optical-SAR Object Detection

M4-SAR:面向光学-SAR目标检测的多分辨率、多极化、多场景、多源数据集与基准

Chao Wang, Wei Lu, Xiang Li, Jian Yang, Lei Luo

机构 * Nanjing University of Science and Technology(南京理工大学) Anhui University(安徽大学) Nankai University(南开大学)

AI总结 针对光学与SAR图像融合检测缺乏大规模标准化数据集的问题,构建了包含112,174对对齐图像和近百万标注实例的M4-SAR数据集,并提出端到端融合检测框架E2E-OSDet,实验表明融合可提升mAP 5.7%。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21029 2026-06-24 cs.CV 版本更新

FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation

FlowerDance: MeanFlow实现高效精细的3D舞蹈生成

Kaixing Yang, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jun He, Hongyan Liu

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

AI总结 提出FlowerDance,结合MeanFlow与物理一致性约束,以少量采样步骤生成高质量舞蹈,并采用BiMamba骨干和通道级跨模态融合实现高效非自回归生成,支持运动编辑,在AIST++和FineDance上达到最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18037 2026-06-24 cs.CV 版本更新

Hybrid Event Frame Sensors: Modeling, Calibration, and Simulation

混合事件帧传感器:建模、标定与仿真

Yunfan Lu, Nico Messikommer, Xiaogang Xu, Liming Chen, Yuhan Chen, Nikola Zubic, Davide Scaramuzza, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(人工智能 thrust,香港科技大学(广州)) RPG, University of Zurich(RPG,苏黎世大学) CUHK(香港中文大学) AlpsenTek(阿尔卑斯电子技术)

AI总结 提出首个统一统计成像噪声模型,联合描述APS和EVS像素噪声,开发标定流程估计参数,并构建H-ESIM仿真器生成含真实噪声的RAW帧和事件。

Comments 20 pages, 7 figures, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14001 2026-06-24 cs.CV cs.AI cs.LG 版本更新

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

MOCHA: 多模态对象感知的跨架构对齐

Elena Camuffo, Francesco Barbato, Mete Ozay, Simone Milani, Umberto Michieli

机构 * University of Padova(帕多瓦大学)

AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。

Comments 18 pages main paper, 10 pages supplementary material

Journal ref Proceedings of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17338 2026-06-24 cs.CV cs.AI 版本更新

Render-FM: Feedforward Model for Real-time Photorealistic Volumetric Rendering

Render-FM: 用于实时逼真体积渲染的前馈模型

Zhongpai Gao, Benjamin Planche, Meng Zheng, Anwesa Choudhuri, Van Nguyen Nguyen, Terrence Chen, Ziyan Wu

机构 * United Imaging Intelligence(联合影像智能)

AI总结 提出Render-FM前馈模型,直接从CT体积回归6D高斯溅射参数,实现2.8秒实时渲染,速度提升500倍,并引入解剖引导初始化提升医学图像渲染质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23200 2026-06-23 eess.IV cs.CV 新提交

NGPS: Structure-Preserving Self-Supervised Denoising via Neighbor-Guided Patch Sampling

NGPS:基于邻域引导的补丁采样的结构保持自监督去噪

Jaehyun Cho, YoungJoon Yoo

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) SNUAILAB

AI总结 提出NGPS框架,通过邻域引导的补丁采样在局部错位下构建自监督去噪目标,无需显式配准,在CT和MRI上提升保真度和结构敏感指标。

Comments The 19th European Conference on Computer Vision: ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23679 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交

Semantic Browsing: Controllable Diversity for Image Generation

语义浏览:图像生成的可控多样性

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。

Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23634 2026-06-23 cs.CV 新提交

Pose Anything Anywhere:Model-free Object Poses from Arbitrary References

Pose Anything Anywhere: 任意参考图像下的无模型物体姿态估计

Hongli Xu, Jiaqi Hu, Junwen Huang, Boyang Zhong, Peter KT Yu, Nassir Navab, Benjamin Busam, Slobodan Ilic

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Siemens AG(西门子股份公司) XYZ Robotics ROBOX

AI总结 提出PANY,一种统一的无模型框架,通过多视图变换器学习视图一致几何和跨视图对齐,支持单/稀疏参考视图和RGB-D输入,在YCB-V和LM-O上分别提升姿态精度12%和20%以上。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23557 2026-06-23 cs.CV 新提交

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

基于全局地图与局部视图的多视角3D推理的密集奖励

Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) KRAFTON, Republic of Korea(韩国KRAFTON公司)

AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23539 2026-06-23 cs.CV 新提交

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

LightSTAR: 通过视觉自适应精炼的轻量级选择实现高效视觉文档检索

Tongkun Guan, Haocheng Wang, Wei Shen, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院教育部人工智能重点实验室)

AI总结 提出LightSTAR框架,通过免LLM的视觉选择快速筛选候选页,再经视觉自适应语义精炼进行细粒度匹配,在保持高检索精度的同时大幅降低延迟。

Comments Accpeted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23486 2026-06-23 cs.CV 新提交

From Reconstruction to Decision: A Post-Encoder Plug-in Adapter for Curvilinear Segmentation

从重建到决策:面向曲线分割的后编码器即插即用适配器

Qin Lei, Jiang Zhong, Xin Xiao, Yuming Yang, Hao Wu

机构 * Center for Big Data and Intelligent Medicine, The First Affiliated Hospital of Chongqing Medical University(重庆医科大学附属第一医院大数据与智能医学中心) Key Laboratory of Digital Health and Intelligent Medicine, Chongqing Municipal Health Commission(重庆市卫生健康委员会数字健康与智能医学重点实验室) Chongqing Translational Medicine Center(重庆市转化医学中心) College of Computer Science, Chongqing University(重庆大学计算机学院)

AI总结 提出PEPA轻量级后编码器适配器,通过目标条件蛇形上采样和自适应可微阈值化解决曲线分割中的重建与决策瓶颈,在冻结编码器基础上提升拓扑连通性。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23455 2026-06-23 cs.CV 新提交

MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing

MeGAS: 用于热物理场景编辑的热力学动态高斯泼溅

Zesong Yang, Yuanhang Lei, Liyuan Cui, Yihang Chen, Jiaer Huang, Boming Zhao, Peter Yichen Chen, Hujun Bao, Zhaopeng Cui

机构 * State Key Laboratory of CAD\&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) University of British Columbia(不列颠哥伦比亚大学)

AI总结 提出MeGAS框架,将热力学相变动力学融入3D高斯泼溅,通过温度属性、热对流-扩散求解器和MPM动力学实现热物理现象的物理真实合成,并采用拓扑自适应渲染策略处理极端变形。

Comments Accepted by ECCV 2026. Project page: http://zju3dv.github.io/MeGAS

详情

展开后加载摘要…

URL PDF HTML 收藏