arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4771
2607.20511 2026-07-24 cs.AI 新提交

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13318 2026-07-24 cs.CV 版本更新

Reflecting Process Expertise in Procedural Material Generation

在程序材质生成中反映过程专业知识

Kunal Gupta, Gaurav Joshi, Yen-Ru Chen, Seemandhar Jain, Ishit Mehta, Manmohan Chandraker

机构 * University of California San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 研究聚焦程序材质生成,核心方法是将其作为检索时的过程推理,利用专家演示、教程视频等提取轨迹并合成材质图。主要贡献是生成的材质编辑少、更符合专业策略,且相比先前系统有更好的生成和编辑性能。

Comments Accepted to ECCV 2026. Project page: https://materialapprentice.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07033 2026-07-24 cs.CV cs.AI 版本更新

AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning

AnchorPrune:用于视觉令牌剪枝的相关性锚定上下文扩展

Kyuan Oh, Bumsoo Kim

机构 * Chung-Ang University(崇实大学)

AI总结 研究针对大型视觉语言模型推理成本高、视觉令牌冗余问题,提出无需训练的AnchorPrune框架,通过构建相关性锚点并扩展,自适应确定锚点大小,分配预算恢复上下文,提升了模型的准确率与效率,尤其在严重压缩下效果显著。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05148 2026-07-24 cs.CV 版本更新

Fully Rotation-Equivariant Spectral-Spatial Learning for Multispectral Object Detection

面向多光谱目标检测的完全旋转等变光谱-空间学习

Peng Zhang, Tingfa Xu, Shuaihao Han, Jianan Li

机构 * Beijing Institute of Technology(北京理工大学)

AI总结 针对现有多光谱检测器的三类局限,提出FressDet框架,通过三个互补组件实现任意平面旋转下的可靠光谱-空间融合,在参数量减少93%的情况下取得SOTA性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31533 2026-07-24 cs.CV 版本更新

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL:语言驱动的多视图网格几何实体定位

Kartik Bali, Roland Aydin

机构 * Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

AI总结 提出MV-GEL框架,通过语言查询定位网格上的细粒度几何实体,利用视角选择模块GELviews优先选择可观察性高的视角,结合VLM分割和光线投射提升定位精度。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12935 2026-07-24 cs.CV 版本更新

Task Alignment: A Simple Proxy for Practical Model Merging Across Diverse Vision Tasks

任务对齐:一种简单的有效代理,用于计算机视觉中的模型融合

Pau de Jorge, César Roberto de Souza, Björn Michele, Mert Bülent Sarıyıldız, Philippe Weinzaepfel, Florent Perronnin, Diane Larlus, Yannis Kalantidis

机构 * NAVER LABS Europe(NAVER欧洲实验室)

AI总结 本文提出任务对齐代理,解决多任务视觉模型中模型融合的超参数选择问题,提升模型融合在复杂场景中的实用性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09168 2026-07-24 cs.CV 版本更新

ELT: Elastic Looped Transformers for Visual Generation

ELT:弹性循环变换器用于视觉生成

Sahil Goyal, Swayam Agrawal, Gautham Govind Anil, Prateek Jain, Sujoy Paul, Aditya Kusupati

AI总结 ELT通过共享权重的循环变换块实现高效视觉生成,采用Intra-Loop Self Distillation提升训练效率,实现动态平衡计算成本与生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20509 2026-07-24 cs.CV 版本更新

Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time

从时间维度上统一研究相机陷阱物种识别的启示与开放问题

Sooyoung Jeon, Hongjie Tian, Lemeng Wang, Zheda Mai, Vidhi Bakshi, Jiacheng Hou, Ping Zhang, Arpita Chowdhury, Jianyang Gu, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学)

AI总结 本文通过统一研究相机陷阱物种识别的时间变化,揭示了生态实践中维持可靠识别的挑战,提出了一种真实场景的基准测试,并发现生物基础模型在多个站点表现不佳,适应性困难,以及类不平衡和时间偏移是主要因素。

Comments The first three authors contribute equally. Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20357 2026-07-23 cs.CV 新提交

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

少看,快思考:多模态大语言模型的联合令牌-计算适配

Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji

机构 * Purdue University(普渡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达)

AI总结 针对多模态大语言模型推理成本高的问题,提出SmartVL框架,通过视觉侧令牌控制器和LLM侧计算控制器联合控制视觉令牌数量和模型计算能力,实验证明该框架优于先前方法,实现更好的精度-效率平衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-07-23 cs.RO cs.CV 新提交

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: https://dpt2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19886 2026-07-23 cs.CV 新提交

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) Monash University(莫纳什大学)

AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19826 2026-07-23 cs.CV 新提交

MoAKE: Toward Unified All-in-One Action Quality Assessment via Mixture of Action Knowledge Experts

MoAKE:通过动作知识专家混合实现统一的一体化动作质量评估

Huangbiao Xu, Huanqi Wu, Xiao Ke, Jiaxin Cai, Junyi Wu, Jinglin Xu

机构 * College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) Fuzhou University(福州大学) Engineering Research Center of Big Data Intelligence, Ministry of Education(教育部大数据智能工程研究中心) School of Intelligence Science and Technology, University of Science and Technology Beijing(北京科技大学智能科学与技术学院) University of Science and Technology Beijing(北京科技大学)

AI总结 研究一体化动作质量评估难题,提出MoAKE框架,通过学习互补专家、定制原型及建模时间动态来减轻知识转移,在多数据集实验中显著优于现有方法,实现了零/少样本评估下的一致泛化。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19765 2026-07-23 cs.CV 新提交

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

扩展用于多视图全景分割的大视图合成模型

Kwonyoung Ryu, In-Jae Lee, Jonghyun Jin, Hyunjee Lee, Jongmin Lee, Jaesik Park

机构 * POSTECH(浦项科技大学) POSCO DX(浦项制铁DX公司) Chung-Ang University(中央大学) Seoul National University(首尔国立大学)

AI总结 研究将大视图合成模型从外观渲染扩展到3D场景理解,提出复用冻结模型传播全景标签的分割管道,无需3D重建和特定训练,在ScanNet和Replica数据集上实验,分割质量佳且新视图合成表现优。

Comments Accepted to ECCV 2026. 31 pages, 7 figures, 9 tables. Project page: https://kwonyoung9120.github.io/PanopticLVSM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19384 2026-07-23 cs.LG 新提交

SUM: Unified Geometric Surgery on Spatio-Temporal Adaptation Vectors for Federated Class Incremental Learning

SUM:用于联邦类增量学习的时空适应向量统一几何手术

Jaeik Kim, Jaeyoung Do

机构 * AIDAS Lab(AIDAS实验室) IPAI ECE, Seoul National University(首尔国立大学电子与计算机工程系)

AI总结 针对联邦类增量学习中时空干扰致灾难性遗忘问题,本文提出SUM框架,将其视为统一多任务学习,在聚合时对适应向量做几何手术,减轻客户端干扰与跨任务干扰,实验显示该方法在多基准测试中效果显著提升。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21618 2026-07-23 cs.CV 版本更新

4DGS360: 360° Gaussian Reconstruction of Dynamic Objects from a Single Video

4DGS360:从单个视频中进行动态物体的360度高斯重建

Jae Won Jang, Yeonjin Chang, Wonsik Shin, Juhwan Cho, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

AI总结 本文提出4DGS360框架,通过3D原生初始化解决动态物体360度重建中的几何模糊问题,结合优化实现一致的4D重建,并引入iPhone360基准测试集验证方法有效性。

Comments Accepted to ECCV 2026. Project page: https://jaewon040.github.io/4dgs360/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05865 2026-07-23 cs.CV cs.AI cs.CR 版本更新

CGCE: Classifier-Guided Concept Erasure in Generative Models

CGCE:生成模型中的分类器引导概念擦除

Viet Nguyen, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究针对生成模型不安全内容生成的问题,提出分类器引导概念擦除(CGCE)框架。该框架用轻量级分类器检测并细化不良概念提示,仅在推理时修改不安全嵌入,能防止有害内容生成,在安全性和性能间取得平衡,实验验证其有效性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19171 2026-07-22 cs.CV 新提交

Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding

点阶梯调优:用于3D点云理解的参数高效分层适配

Junlin Chang, Longhao Zou, Rui Li

机构 * Beihang University(北京航空航天大学) Pengcheng Laboratory(鹏城实验室)

AI总结 研究针对3D点云理解中微调预训练主干参数效率低的问题,提出点阶梯调优框架PLT,通过构建分层网络、融合局部与全局特征、生成动态提示等进行参数高效分层适配,实验表明其以极少参数达最优性能。

Comments Accepted to ECCV 2026. Code: https://github.com/JunLinChang/ECCV2026-PLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19100 2026-07-22 cs.CV 新提交

FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility

FlexiAvatar:任意身体可见性下的统一3D高斯人体头像

Yihalem Yimolal Tiruneh, Muhammad Salman Ali, Uyoung Jeong, Muneeb A. Khan, MD Khalequzzaman Chowdhury Sayem, Allanur Bayramgeldiyev, Binod Bhattarai, Seungryul Baek

机构 * UNIST(韩国蔚山科学技术院) University of Aberdeen(阿伯丁大学) University College London(伦敦大学学院) Fogsphere(雾球公司)

AI总结 研究从单目视频重建3D人体头像问题,提出FlexiAvatar框架,结合遮挡鲁棒跟踪与特定部分残差细化捕捉细节,用扩散方法处理不可见区域,实验表明其重建质量高,还能减少运行时和内存开销。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19036 2026-07-22 cs.CV cs.AI 新提交

CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement

CoGoal3D:基于3D感知融合与优化的协作式3D目标检测

Zhihao Yang, Zhiyu Xiang, Peng Xu, Tianyu Pu, Kai Wang, Eryun Liu, Dongping Zhang, Yong Ding

机构 * Zhejiang University(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) China Jiliang University(中国计量大学)

AI总结 针对V2X协作目标检测中3D检测效果不佳的问题,提出CoGoal3D框架,通过两阶段管道提取和优化3D特征,设计融合模块与辅助任务,还提出数据增强策略,在多数据集上取得新的最优性能。

Comments Accepted to ECCV 2026. 17 pages, 8 figures, 6 tables. Code: https://github.com/Megalo-f/CoGoal3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19032 2026-07-22 cs.CV 新提交

IMMoE: Incomplete Multi-View Anomaly Detection via Mixture of View Experts Fusion

IMMoE:通过视图专家融合进行不完整多视图异常检测

Lei Hu

机构 * South China University of Technology(华南理工大学)

AI总结 研究不完整多视图异常检测问题,提出IMMoE方法,含多视图专家融合与局部异常增强编码器两个关键模块,通过自动生成数据集,在RIMAD和Real-IAD数据集上取得领先性能,提升了像素级和图像级指标。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19027 2026-07-22 cs.CV 新提交

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

缓解零样本视频时刻检索中的模态和语言风格差距

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。

Comments ECCV 2026 (* These authors contributed equally.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18863 2026-07-22 cs.CV 新提交

Reliability-Aware 3D Geometric Injection for Universal Person Re-identification

用于通用行人重识别的可靠性感知3D几何注入

Bohan Su, Jiashuo Wang, Fangyi Liu, Mang Ye

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(武汉大学计算机学院多媒体软件国家工程研究中心)

AI总结 针对通用行人重识别问题,提出UniGeo框架,通过一致性感知可靠性门和双流残差融合,将3D信息处理解耦,投影单目3D参数补偿结构,以残差形式引入3D先验并过滤噪声,提升了挑战性场景性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18801 2026-07-22 cs.CV 新提交

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

ZeroSplat:3D高斯点云渲染中的广义指代分割

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) China University of Geosciences(中国地质大学)

AI总结 针对现有指代3D高斯点云渲染方法局限,提出ZeroSplat框架,通过多视图几何约束将2D视觉语言模型先验提升至3D空间,无需额外特征存储,在广义和单目标场景中显著优于现有方法,且效率高。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18763 2026-07-22 cs.CV 新提交

Posterior Samplings are Missing Modalities Generators for Medical Image Translation

后验采样是医学图像翻译中缺失模态的生成器

Jonghun Kim

机构 * Sungkyunkwan University(成均馆大学)

AI总结 针对医学图像因时间和协议限制存在缺失模态的问题,提出统一框架,将缺失模态生成视为联合分布下的线性逆问题,通过后验采样及流匹配模型解决,在多数据集实验中性能优于基线,下游肿瘤分割表现更好。

Comments ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26615 2026-07-22 cs.CV eess.IV 版本更新

TaskTok: Delving into Task Tokens for Task-driven Image Restoration

TaskTok: 深入探究任务驱动图像恢复中的任务令牌

Hongjae Lee, Sojung Kang, Jaeseong Yu, Seung-Won Jung

机构 * Korea University(高丽大学)

AI总结 提出TaskTok框架,通过可学习的令牌开关和轻量级令牌细化模块选择性恢复任务相关令牌,在提升下游任务性能的同时保持高计算效率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11704 2026-07-22 cs.CV 版本更新

ScaleMoGen: Autoregressive Next-Scale Prediction for Human Motion Generation

ScaleMoGen:基于人类动作生成的自回归多尺度预测

Inwoo Hwang, Hojun Jang, Bing Zhou, Jian Wang, Young Min Kim, Chuan Guo

机构 * Seoul National University(首尔国立大学) Snap Inc.(Snap公司) Meta Reality Labs(Meta现实实验室)

AI总结 ScaleMoGen提出了一种多尺度自回归框架,通过自回归预测生成动作,实现了更精细的动作生成,同时在HumanML3D和SnapMoGen数据集上取得最佳性能。

Comments Accepted to ECCV 2026. Project page: https://inwoohwang.me/ScaleMoGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15280 2026-07-22 cs.CV cs.AI 版本更新

Why Do Vision Language Models Struggle To Recognize Human Emotions?

为什么视觉语言模型难以识别人类情绪?

Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara, Steven McDonagh

机构 * The University of Edinburgh, UK(爱丁堡大学)

AI总结 本文探讨视觉语言模型在识别人类情绪上的不足,指出面部表情识别任务的连续性和动态性导致模型存在连续性和时间信息处理的漏洞,提出改进采样策略和多阶段上下文增强方法以提升情绪识别能力。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18142 2026-07-21 cs.CV cs.AI cs.CL cs.MA 新提交

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测

Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Griffith University(格里菲斯大学)

AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17790 2026-07-21 cs.CV cs.AI 新提交

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

ReViV:从单目自我中心视频中重建4D中的观看者和视图

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学) Microsoft(微软)

AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。

Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable

详情

展开后加载摘要…

URL PDF HTML 收藏