arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

至 收录 4771
2608.09497 2026-08-11 cs.CV 新提交

SwissCrop25: A National Multi-Year Benchmark for Operational Crop Mapping

SwissCrop25:用于业务化作物制图的国家级多年基准数据集

Thomas Lauber, Mehmet Ozgur Turkoglu, Sélène Ledain, Helge Aasen

机构 * Agroscope(阿格罗斯普(瑞士农业研究机构))

AI总结 本研究推出覆盖2019-2025年7个生长季的国家级作物制图基准SwissCrop25,通过留一法年份交叉验证协议测试三类模型,发现领域特定模型表现更优,TSViT整体性能最佳,还揭示了年际分布偏移及季内模型性能权衡等关键结论。

Comments Accepted at the ECCV 2026 Workshop TerraBytes II. To appear in the workshop proceedings

URL PDF HTML 收藏
2608.09493 2026-08-11 cs.CV 新提交

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

URL PDF HTML 收藏
2608.09474 2026-08-11 cs.CV 新提交

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索

Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai, Son Nguyen Minh Le, Khang Le Minh, Hoang Vo, Minh-Chi Phung, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息技术大学) Ho Chi Minh city University of Science(胡志明市科学大学)

AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

URL PDF HTML 收藏
2608.09388 2026-08-11 cs.CV 新提交

Efficient Human-Contact Representation for Human-Scene Interaction

面向人-场景交互的高效人体接触表示

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

机构 * AIOZ University of Liverpool(利物浦大学) NTHU(国立清华大学)

AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。

Comments Accepted in ECCV 2026 Workshops

URL PDF HTML 收藏
2608.08963 2026-08-11 cs.CV cs.AI cs.LG 新提交

Fourier Self-Supervision for Fine-Grained Generalized Category Discovery

用于细粒度广义类别发现的傅里叶自监督学习

Sarah Rastegar, Mina Ghadimi Atigh, Pascal Mettes, Yuki M. Asano, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) University of Technology Nuremberg(纽伦堡工业大学)

AI总结 提出傅里叶自监督学习,通过双频率过滤策略优化特征空间,在多细粒度数据集上实现优于现有方法的广义类别发现性能。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.08904 2026-08-11 cs.CV cs.AI cs.LG 新提交

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

URL PDF HTML 收藏
2608.08840 2026-08-11 cs.CV 新提交

SLAP: Selective Local Vision-Language Alignment for Fish Re-Identification via Partial Optimal Transport

SLAP:基于部分最优传输的鱼类重识别选择性局部视觉-语言对齐

Cigdem Beyan, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen

机构 * University of Verona(维罗纳大学) Institute of Marine Research(海洋研究所) University of Agder(阿格德大学)

AI总结 针对鱼类重识别中全局对齐易引入噪声的问题,提出基于POT的选择性局部视觉-语言对齐框架,在多数据集上实现优于CLIP类方法的性能,泛化性良好。

Comments This is the author version prior to incorporating the camera-ready comments. The final version will be included in the Proceedings of the European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2608.08749 2026-08-11 cs.RO 新提交

OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies

OnEvoMemory:通过机器人在线试跑演化预训练机器人策略的记忆机制

Zhongxi Chen, Shenqi Zong

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 针对现有机器人记忆机制依赖外部模型的问题,提出OnEvoMemory价值引导记忆模块,结合离线初始化与在线试跑优化记忆选择,提升了基础VLA策略在长时程机器人操作中的性能。

Comments 6 pages, 1 figure. Accepted as a poster at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

URL PDF HTML 收藏
2608.08727 2026-08-11 cs.CV cs.AI 新提交

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

TomaMMU:用于番茄叶片病害的综合多模态理解基准

Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

机构 * FPT University(FPT大学) Korea University(高丽大学)

AI总结 本研究推出用于番茄叶片病害多模态理解的TomaMMU数据集及TomaBench基准,评估14种VLMs时发现其细粒度识别等存在差距,微调后MCQ准确率达96.09%,为相关研究提供了方向。

Comments Accepted at ECCV CVPPA Workshop

URL PDF HTML 收藏
2608.08631 2026-08-11 cs.LG cs.SY eess.SY 新提交

Trajectory Design and Budgeted Querying for Digital Twin Calibration

数字孪生校准的轨迹设计与预算查询

Vladyslava Spitkovska, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

AI总结 该研究针对数字孪生校准中交互数据采集成本高的问题,提出耦合强化学习控制器、循环参数估计器与预算查询策略的框架,在倒立摆、水上世界任务中验证了其低误差性能,推动将轨迹设计与查询分配作为校准的显式变量。

Comments Accepted at the CDEL 2026 workshop at ECCV 2026 (non-archival)

URL PDF HTML 收藏
2608.08519 2026-08-11 cs.CV 新提交

eBIRD: Event-based Intensity Image Reconstruction Using Controllable Diffusion Models

eBIRD:基于可控扩散模型的事件驱动强度图像重建

Ignacio Bugueno-Cordova, Fabian Valderrama, Rodrigo Verschae

机构 * Institute of Engineering Sciences, Universidad de O’Higgins(奥伊金斯大学工程科学学院) The Iniciativa de Datos e Inteligencia Artificial, University of Chile(智利大学数据与人工智能倡议)

AI总结 本研究提出eBIRD框架,结合DDPM与ControlNet实现事件引导强度图像重建,在N-MNIST和RGBE-Gaze数据集上验证了通用与专用扩散学习策略的效果,表明可控扩散模型是该任务的有前景方法。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

URL PDF HTML 收藏
2608.08309 2026-08-11 cs.CV cs.AI cs.LG 新提交

Three Necessary Principles for Self-Supervised Visual Representation Learning

自监督视觉表征学习的三条必要原则

Nikos Giakoumoglou, Paschalis Giakoumoglou, Tania Stathaki

机构 * Imperial College London(帝国理工学院) CERTH, ITI(CERTH ITI)

AI总结 该研究提出自监督视觉表征学习的三条必要原则,通过理论证明与受控实验分析各原则的作用,表明主流自监督方法可纳入统一框架,且任意两个原则无法替代第三个。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026) Workshops

URL PDF HTML 收藏
2608.07984 2026-08-11 cs.CV 新提交

AgriField-40K: Adapting Vision Models to Agriculture With Efficient Continual Pretraining

AgriField-40K:通过高效持续预训练使视觉模型适配农业场景

Vasileios Tzouras, Paraskevas Pegios, Lazaros Nalpantidis

机构 * Technical University of Denmark (DTU)(丹麦技术大学(DTU)) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

AI总结 针对农业计算机视觉依赖昂贵标注与模型适配成本高的问题,构建含17种公开资源的AgriField-40K数据集,提出参数高效的AgriMAE方法,可少用9倍可训练参数实现与全微调相当甚至更优的下游性能,为农业视觉持续预训练提供实用资源。

Comments Accepted at the Computer Vision in Plant Phenotyping and Agriculture (CVPPA) Workshop at the European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2608.07948 2026-08-11 cs.CV 新提交

SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model

SynVAR:在视觉自回归模型中协同空间与语义对齐

Zhennan Chen, Tianxing Shi, Pengcheng Xu, Kepan Nan, Qian Wang, Zili Yi, Jian Yang, Ying Tai

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Western University(西安大略大学) JIUTIAN Research, CMCC, China(中国移动通信集团九天研究)

AI总结 本文提出首个专为视觉自回归模型(VAR)定制的无训练增强框架SynVAR,通过空间-语义协同控制策略及三个关键组件抑制误差,显著提升了VAR的复杂场景建模能力。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

URL PDF HTML 收藏
2608.07600 2026-08-11 cs.RO eess.IV 新提交

AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion

AdaDexGrasp:基于3D视觉-触觉表示融合的自适应灵巧抓取

Xirui Liang, Jiaqi Liang, Jingkai Xu, Yuran Wang, Ruochong Li, Yuanpei Chen, Masayoshi Tomizuka, Wei Zhan, Ruihai Wu

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对机器人抓取难以复刻人类视觉-触觉融合自适应能力的问题,提出AdaDexGrasp视觉-触觉融合抓取框架,通过3D表示融合实现接触感知抓取生成与优化,实验验证其提升了抓取成功率与泛化性。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2608.02762 2026-08-11 cs.CV 版本更新

Oh Deer, How Should I Handle This? Seasonal Priors for Selective Wildlife Annotation and Classification

哦,鹿啊,我该如何应对?用于选择性野生动物标注与分类的季节先验

Hugo Markoff, Christoph Praschl, Anton Hjalte Jørgensen, Christian Emil Mogensen, Mathias Bech Skadhauge, Sara Beery, Michael Ørsted, David C. Schedl

机构 * Aalborg University(奥尔堡大学) University of Applied Sciences Upper Austria(上奥地利应用科学大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究针对航拍野生动物分类的标签不可靠问题,以马鹿雄性识别为对象,利用季节先验结合多模态数据提升标注与分类效果,提出的方法可指导标注协议设计和模态加权。

Comments Accepted at the ECCV 2026 Workshop on Computer Vision for Ecology (CV4Ecology), archival proceedings track. 17 pages, 4 figures, 4 tables

URL PDF HTML 收藏
2607.18695 2026-08-11 cs.CV cs.AI cs.LG eess.IV 版本更新

Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models

属性应来自图像,而非类名:视觉语言模型的分布条件属性选择

Gautam Rajendrakumar Gare, Jia Shi, Zhiqiu Lin, Deepak Pathak, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究视觉语言模型可解释零样本分类,指出基于类名的描述符视觉证据不足。提出从目标图像集选属性的方法,该方法提升了准确率,性能优于CoOp,用时短,所选属性还能描述数据分布,是一种有效的分布条件属性选择策略。

Comments Accepted at the PFATCV Workshop, ECCV 2026. Project page: https://ggare-cmu.github.io/AttributeSelect/

URL PDF HTML 收藏
2601.10168 2026-08-11 cs.CV cs.AI cs.RO 版本更新

RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

RAG-3DSG: 通过重拍引导的检索增强生成增强3D场景图

Yue Chang, Rufeng Chen, Zhaofan Zhang, Yi Chen, Yifan Tian, Sihong Xie

AI总结 RAG-3DSG通过重拍引导的不确定性估计缓解3D场景图中的语义不一致问题,利用对象级检索增强生成方法提升机器人任务中的场景表示可靠性。

Comments Accepted by ECCV

URL PDF HTML 收藏
2512.20070 2026-08-11 cs.CV eess.IV 版本更新

Progressive Learned Image Compression for Machine Perception

逐步学习图像压缩用于机器感知

Jungwoo Kim, Jun-Hyuk Kim, Jong-Seok Lee

机构 * Yonsei University(延世大学) Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出PICM-Net,一种基于三平面编码的逐步学习图像压缩算法,通过自适应解码控制器提升机器感知任务的适应性和性能。

Comments Accepted at ECCV 2026 Workshop on Low-Level Vision Frontiers

URL PDF HTML 收藏
2510.00506 2026-08-11 cs.CV 版本更新

Affordance-Guided Diffusion Prior for 3D Hand Reconstruction

用于3D手部重建的可负担性引导扩散先验

Naru Suzuki, Takehiko Ohkawa, Tatsuro Banno, Jihyun Lee, Ryosuke Furuta, Yoichi Sato

AI总结 研究在手部大量被遮挡时3D手部姿势重建问题;核心方法是用基于扩散的生成模型,由视觉语言模型推断的可负担性描述引导;主要贡献是显著提升手部姿势估计准确性,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://narusuzuki.github.io/projects/26-affhandgen/

URL PDF HTML 收藏
2506.12885 2026-08-11 cs.CV eess.IV 版本更新

$T^{3}S$: Think in Thermal Time for Generalizable Crop Mapping from Satellite Image Time Series

$T^{3}S$:基于热时间的卫星图像时间序列通用作物映射方法

Mehmet Ozgur Turkoglu, Selene Ledain, Thomas Lauber, Jeffrey Zweidler, Helge Aasen

机构 * Earth Observation of Agroecosystems Team, Agroscope, Switzerland(农业生态系统观测团队,阿格罗科学研究所,瑞士) ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)

AI总结 研究针对卫星图像时间序列作物分类泛化能力不足等问题,提出基于热时间的$T^3S$方法,通过累积生长度日重新索引观测,在多个数据集上评估,该方法在跨年度和跨区域作物分类上优于基线,提升了多项性能。

Comments Camera-ready version for the ECCV CVPPA workshop

URL PDF HTML 收藏
2407.11802 2026-08-11 cs.CV cs.AI

Discriminative and Consistent Representation Distillation

Nikos Giakoumoglou, Tania Stathaki

机构 * Imperial College London(伦敦帝国学院)

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026) Workshops

URL PDF HTML 收藏
2311.16445 2026-08-11 cs.CV

CLAP: Isolating Content from Style through Contrastive Learning with Augmented Prompts

Yichao Cai, Yuhang Liu, Zhen Zhang, Javen Qinfeng Shi

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) University of Adelaide(阿德莱德大学)

Comments Accepted as a conference paper at ECCV 2024; v7: Minor corrections to the adversarial robustness results and corresponding text. Conclusions unchanged

URL PDF HTML 收藏
2308.04553 2026-08-11 cs.CV cs.LG 版本更新

From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition

从假到真:基于平衡合成图像的预训练以防止图像识别中的虚假相关性

Maan Qraitem, Kate Saenko, Bryan A. Plummer

AI总结 针对图像识别模型易受虚假相关性影响的问题,提出从假到真(FFR)两步训练流程,先在平衡合成数据预训练,再用真实数据微调,在三个数据集上使最差组准确率较SOTA提升最高20%

Comments Accepted at ECCV 2024

URL PDF HTML 收藏
2608.07361 2026-08-10 cs.RO cs.CV 新提交

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

驾驶视觉-语言-动作模型中规划 token 的深度探测与剪枝

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 本文针对驾驶 VLA 模型的规划 token,通过探测其 32 个解码器层的信号并剪枝部分层,在误差小幅增加下实现 1.33 倍解码器加速,验证了规划信息早期存在但格式适配问题。

Comments Accepted at the 6th DriveX Workshop (Foundation Models for Autonomous Driving), ECCV 2026. 14 pages, 8 figures, 4 tables

URL PDF HTML 收藏
2608.07176 2026-08-10 cs.CV cs.AI 新提交

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

面向隐空间生成的表征驱动型内窥镜视觉嵌入对齐

Francisco Caetano, Tim J. M. Jaspers, Haiko Middeljans, Martijn R. Jong, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Albert J. de Groof, Jacques J. Bergman, Peter H. N. De With, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心) University of Amsterdam(阿姆斯特丹大学)

AI总结 本研究针对内窥镜生成模型的领域差距与计算成本问题,提出REVEAL模型,基于500万帧内窥镜数据训练,在多任务中性能优于同类模型,为临床智能工具开发提供基础。

Comments Accepted at the DCA-MI Workshop (ECCV 2026)

URL PDF HTML 收藏
2608.07063 2026-08-10 cs.CR cs.AI 新提交

Soft Redaction of Image Provenance via Zero-Knowledge Proofs

通过零知识证明对图像来源进行软编辑

Muhammad Awan, John Collomosse

AI总结 针对图像来源透明度与隐私的冲突,提出基于零知识证明的软编辑方法,通过距离证明实现隐私保护,兼容C2PA且构建与验证效率较高。

Comments To appear at ECCV 2026 workshop on Privacy Fairness Accountability and Transparency in Computer Vision (PFATCV)

URL PDF HTML 收藏
2608.07003 2026-08-10 cs.CV 新提交

HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models

HRDiT:基于现成扩散Transformer模型的无需训练高分辨率图像生成

Yu Xue, Haoxuan Qu, Zhuoling Li, Hongbin Xu, Jianxiong Yin, Simon See, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) South China University of Technology(华南理工大学) NVIDIA AI Tech Centre(英伟达AI技术中心)

AI总结 本研究针对现成DiT模型适配高分辨率图像合成的空间紊乱、生成时间长两大挑战,提出新方法,经实验验证其有效性,代码公开。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2608.06973 2026-08-10 cs.CV 新提交

When One Modality Is Not Enough: Multimodal Sex and Life-Stage Classification of Red Deer from Aerial RGB-Thermal Video

当单模态不够时:基于航拍RGB-热红外视频的马鹿多模态性别与生命阶段分类

Hugo Markoff, Christoph Praschl, Ivan Ludoški, Sara Beery, Michael Ørsted, David C. Schedl

机构 * Aalborg University(奥尔堡大学) University of Applied Sciences Upper Austria(上奥地利应用科学大学) University of Novi Sad(诺威萨德大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究以马鹿为对象,融合航拍RGB与热红外视频的自监督DINOv3特征,构建多模态分类流程,在四次飞行中实现26只个体25只的正确分类,提升了种群性别与生命阶段分类的鲁棒性,可自动化获取兽群结构数据。

Comments Accepted at the ECCV 2026 Workshop on Computer Vision for Ecology (CV4Ecology), archival proceedings track. 17 pages, 7 figures, 5 tables

URL PDF HTML 收藏