arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-12 至 2026-08-12 收录 18
2608.10995 2026-08-12 cs.CV 新提交

HNDiff: Haze-Noise Diffusion for Image Dehazing

HNDiff:用于图像去雾的雾霾-噪声扩散模型

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学) National Chengchi University(国立政治大学) NVIDIA(英伟达)

AI总结 本文提出嵌入大气散射模型的HNDiff扩散框架,通过雾霾感知噪声调度器关联正向退化物理机制,反向同步去雾去噪,改进主流去雾骨干网络并在基准数据集达最优结果。

Comments Accepted to ECCV 2026. Project Page: https://jin-ting-he.github.io/HNDiff

URL PDF HTML 收藏
2608.10677 2026-08-12 cs.CV 新提交

Chartography: A Benchmark for Professional Chart Understanding

Chartography:专业图表理解基准

Suhaas Garre, Chris Mutty, Sushant Mehta, Edwin Chen

机构 * Surge AI

AI总结 本研究推出含100项任务的Chartography基准,其采用专业领域特定图表格式,评估显示前沿模型在该基准上表现远低于饱和水平,失败集中于视觉感知,研究还发布了相关任务、图像及评估代码。

Comments 16 pages, 5 figures, 5 tables. Accepted at the 2nd Workshop on Benchmarking Evidence-Aligned Multimodal Reasoning (BEAM 2), ECCV 2026

URL PDF HTML 收藏
2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

URL PDF HTML 收藏
2608.10544 2026-08-12 cs.CV cs.AI cs.LG 新提交

Flow Straight to Reality: Perceptually Consistent Flow Matching for Efficient Image Restoration

直接流向现实:用于高效图像复原的感知一致流匹配

Sangwoo Jo, Donggeun Ko, Jayeon Kang, Youngsang Kwak, Jaehwa Kwak, Sungjoon Choi

机构 * Korea University(高丽大学) Aim Future

AI总结 本文提出PCFlow框架,通过结合潜在一致性流目标、LCPL损失与无冲突梯度投影策略,实现高效图像复原,在低计算成本下取得竞争力性能。

Comments Accepted to ECCV 2026. Code is available at https://github.com/aiimaginglab/PCFlow

URL PDF HTML 收藏
2608.10500 2026-08-12 cs.CV 新提交

DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars

DSAR:用于生成逼真可动画化虚拟化身的布料时序动力学双流自回归建模

Haozhong Xiong, Yao Yu, Yu Zhou, Sidan Du

机构 * Nanjing University(南京大学)

AI总结 本文提出DSAR双流自回归框架,显式建模布料时序因果结构,解决现有方法布料动力学捕捉不足问题,在多方面性能获显著提升。

Comments Accepted to ECCV 2026. 25 pages, 7 figures, including supplementary material

URL PDF HTML 收藏
2608.10411 2026-08-12 cs.CV 新提交

A second-order theory of texture for depth from focus

聚焦测距的纹理二阶理论

Sreekar Ranganathan, Ioannis Gkioulekas

AI总结 该研究提出基于波动光学的纹理二阶理论,发现传统视为无纹理的表面因主观散斑也会产生纹理,通过窄带光谱滤波器提升二阶纹理对比度,大幅改善看似无纹理场景的被动深度重建效果。

Comments ECCV 2026, project website: https://imaging.cs.cmu.edu/second-order-texture/

URL PDF HTML 收藏
2608.10345 2026-08-12 cs.CV 新提交

CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images

CasDeblurGS:用于从两张模糊图像重建3D高斯溅射的级联2D到3D多视图一致性方法

Haeyun Choi, Minhyuk Jang, I-Gil Kim

机构 * University of Virginia(弗吉尼亚大学) KT R&D Center(KT研发中心)

AI总结 CasDeblurGS是一种级联框架,仅用两张已知内参的运动模糊图像即可重建连贯3D场景,在Deblur-NeRF场景上PSNR较基线提升1.19dB和2.11dB,渲染与几何一致性均改善。

Comments Accepted to the ECCV 2026 MUSTCV Workshop. Project page: https://haeyun-choi.github.io/Cascaded2D3D_page/

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

URL PDF HTML 收藏
2608.08580 2026-08-12 cs.CV 版本更新

Where Is the Bee? Detecting Tiny Pollinators with a Single Collaborative-Head Transformer

蜜蜂在哪里?用单协作头Transformer检测小型传粉昆虫

Junsu Kim, Seungryul Baek

机构 * UNIST(蔚山科学技术院)

AI总结 针对ECCV 2026 BuzzSpot挑战赛中小型传粉昆虫检测的难点,采用带Swin-L骨干的Co-DINO,结合裁剪马赛克池微调与类别加权ETF损失,在无推理增强下获挑战赛第一。

Comments The 1st rank method's paper at CVPPA@ECCV 2026 BuzzSpot Challenge

URL PDF HTML 收藏
2608.08522 2026-08-12 cs.RO 版本更新

EsaacSim: A Multimodal Event Camera Add-on for NVIDIA Isaac Sim

EsaacSim:适用于NVIDIA Isaac Sim的多模态事件相机附加组件

Ignacio Bugueno-Cordova, Malte Kuhlmann, Nicolás Navarro-Guerrero, Miguel Campusano, Rodrigo Verschae

机构 * Leibniz Universität Hannover(莱布尼茨汉诺威大学) L3S Research Center(L3S研究中心) University of Southern Denmark(南丹麦大学) University of Chile(智利大学)

AI总结 本文提出适用于NVIDIA Isaac Sim的多模态事件相机附加组件EsaacSim,可实现多模态事件相机在线仿真,在多种分辨率下具备高效性能,支持机器人研究的多模态仿真与合成数据生成。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

URL PDF HTML 收藏
2608.08494 2026-08-12 cs.CV 版本更新

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化

Qiang Hu, Yuxuan Luo, Yingjie Guo, Hao Wang, Qimei Wang, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.23908 2026-08-12 cs.CV 版本更新

Embeddings based Anomaly Detection for Cleaning Global Crop Type Reference Datasets

基于嵌入的异常检测用于清理全球作物类型参考数据集

Syed Roshaan Ali Shah, Kristof Van Tricht, Christina Butsko, Jeroen Degerickx, Zoltan Szantoi

机构 * VITO Remote Sensing(弗拉芒技术研究所遥感部) European Space Agency (ESA)(欧洲航天局)

AI总结 研究通过地理空间基础模型生成的嵌入能否用于清理全球作物类型参考数据集,提出基于嵌入的局部感知异常检测框架,并通过实验验证其有效性,改进了作物类型模型,为清理地球观测参考数据集提供了可复制扩展的模板。

Comments Camera-ready version. Accepted for Oral Presentation at Terrabytes II at ECCV 2026

URL PDF HTML 收藏
2607.14945 2026-08-12 cs.CV 版本更新

Introspective Attention Modulation for Safe Text-to-Image Generation

用于安全文本到图像生成的内省注意力调制

Basim Azam, Hossein Rahmani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lancaster University(兰卡斯特大学)

AI总结 研究基于流的文本到图像模型易产生不安全内容的问题,提出通过推理时内省调节注意力动态实现安全的方法,该方法在保持或提升质量的同时显著提高安全分数,为安全图像生成提供新途径。

Comments Accepted at ECCV 2026. 20 pages, 7 figures. Project page: https://basim-azam.github.io/iam/

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

URL PDF HTML 收藏
2605.12739 2026-08-12 cs.HC 版本更新

Quieting the Cobwebs: Browser Interaction for Visual Floaters

静音蛛网:用于视觉浮渣的浏览器交互

Kenneth Ge, Jinglin Li, Shikhar Ahuja

AI总结 本文提出了一种基于眼物理的浮渣模拟工具,用于评估不同运动水平下的文本可读性,并开发了一个新型浏览器扩展,通过减少眼球运动来最大化浏览器任务的信噪比,适用于所有UI元素。

Comments Accepted at ECCV 2026 HCV Workshop

URL PDF HTML 收藏
2603.25467 2026-08-12 cs.CV 版本更新

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

URL PDF HTML 收藏
2509.21263 2026-08-12 cs.CV 版本更新

Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors

基于VGGT先验的几何基础密集语义匹配研究

Songlin Yang, Tianyi Wei, Yushi Lan, Zeqi Xiao, Anyi Rao, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

AI总结 本文针对现有语义匹配方法的几何歧义与最近邻规则局限,采用VGGT先验,通过特征调整、循环训练等策略实现适配,在多方面性能优于基线。

Comments ECCV 2026

URL PDF HTML 收藏