arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

至 收录 4771
2608.11498 2026-08-13 cs.CV cs.ET cs.LG 新提交

Language-Structured Relational Q-Learning for Threat-Aware Control in Safety-Critical Driving

面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习

Aditya Humnabadkar, Huaizhong Zhang, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

AI总结 该研究针对安全关键驾驶,提出语言结构化关系Q学习(ERQ-Net),经2500个场景测试,提升了威胁感知能力但存在识别-控制差距,为相关策略学习提供了新视角。

Comments Accepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026

URL PDF HTML 收藏
2608.11474 2026-08-13 cs.CV 新提交

Test-Time Hallucination Control in Large Vision-Language Models

大型视觉语言模型的测试时幻觉控制

Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian, Mohammadreza Alimoradijazi, Aijun An, Hossein Rahmani

机构 * Australian National University(澳大利亚国立大学) The University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) York University(约克大学) Lancaster University(兰卡斯特大学)

AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。

Comments Accepted at ECCV 2026 MUCG

URL PDF HTML 收藏
2608.11352 2026-08-13 cs.CL cs.LG 新提交

ODE-Based Transformer Decoders for Iterative Sign Language Translation

基于常微分方程的Transformer解码器用于迭代手语翻译

Tuğçe Kızıltepe, Hacer Yalim Keles

机构 * ASELSAN(阿塞尔桑(土耳其国防工业公司)) Hacettepe University(哈杰泰佩大学)

AI总结 该研究将受常微分方程启发的高阶数值积分格式应用于迭代手语翻译,提出参数高效的解码器,在不增参数下提升性能,在两个基准上优于IPSLT基线。

Comments Accepted at the 14th International Workshop on Assistive Computer Vision and Robotics (ACVR 2026), held in conjunction with ECCV 2026

URL PDF HTML 收藏
2608.11332 2026-08-13 cs.CL cs.CV 新提交

Gloss-Free Representation Learning for Cross-Dataset Sign Spotting

无 gloss( gloss 指手语 gloss,即手语的书面转写)的跨数据集手语定位表征学习

Oğuz Akif Tüfekcioğlu, Ezgi Ekin, Mustafa Kaan Çevik, Hacer Yalim Keles

机构 * Hacettepe University(哈杰泰佩大学)

AI总结 本研究针对资源受限语言的手语研究,用土耳其广播语料库 TSL-News 基于转录文本的伪 gloss 标签预训练手语编码器,在跨数据集手语定位任务中显著提升性能,证明松散对齐的广播数据可提供有效弱监督学习手语表征。

Comments Accepted at the 4th LIMIT Workshop (Representation Learning with Very Limited Resources), ECCV 2026. The abstract was shortened to comply with arXiv's 1,920-character limit

URL PDF HTML 收藏
2608.11285 2026-08-13 cs.CV cs.AI cs.CR cs.LG 新提交

SegPAR: Class-Centric Decision-Based Sparse Attack for Semantic Segmentation

SegPAR:面向语义分割的以类别为中心的基于决策的稀疏攻击

Dongsu Song, DaeYun GO, Boseung Seo, Jay Hoon Jung

机构 * Korea Aerospace University(韩国航空航天大学)

AI总结 该研究针对语义分割领域基于决策的黑盒稀疏攻击研究不足的问题,提出以类别为中心的SegPAR框架,引入差异奖励提升效率,实验显示其性能优于黑盒基线且与白盒攻击相当。

Comments ECCV 2026 poster

URL PDF HTML 收藏
2608.10798 2026-08-13 cs.CV cs.AI cs.LG 版本更新

Beyond Fixed Luminance: Towards Panchromatic and Orthochromatic Image Colorization

超越固定亮度:迈向全色与正色图像上色

Swarnim Maheshwari, Syed Imam Ali, Vineeth N. Balasubramanian

AI总结 该研究针对固定亮度图像上色系统在正色摄影输入下不可靠的问题,提出基于基础图像编辑模型的亮度无关框架,结合混合灰度目标训练,提升了正色输入上色的鲁棒性并减少色彩伪影。

Comments Accepted at ECCV 2026

URL PDF HTML 收藏
2607.00407 2026-08-13 cs.AI 版本更新

Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising

个性化作为逆向规划:通过结构去噪学习智能幻灯片生成的潜在设计意图

Tianci Liu, Zihan Dong, Linjun Zhang, Haoyu Wang, Jing Gao, Emre Kiciman, Ranveer Chandra, Wei-Ting Chen

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) University at Albany(奥尔巴尼大学) Microsoft(微软)

AI总结 提出SPIRE框架,将页面级幻灯片个性化视为逆向规划问题,通过结构去噪和强化学习协作学习潜在设计意图,无需预设模板或用户详细指令。

Comments ECCV 2026

URL PDF HTML 收藏
2512.07826 2026-08-13 cs.CV 版本更新

OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing

OpenVE-3M: 一种大规模高质量的指令引导视频编辑数据集

Haoyang He, Jie Wang, Jiangning Zhang, Zhucun Xue, Xingyuan Bu, Qiangpeng Yang, Shilei Wen, Lei Xie

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

AI总结 OpenVE-3M是一个大规模高质量的指令引导视频编辑数据集,包含多种编辑类型,通过精心设计的数据管道生成,并展示了高效的5B模型在基准测试中的卓越性能。

Comments Accepted by ECCV'26. Project page: https://lewandofskee.github.io/projects/OpenVE

URL PDF HTML 收藏
2511.01143 2026-08-13 cs.CV cs.AI 版本更新

MicroAUNet: Boundary-Enhanced Multi-scale Fusion with Knowledge Distillation for Colonoscopy Polyp Image Segmentation

MicroAUNet:结合知识蒸馏的边界增强多尺度融合用于结肠镜息肉图像分割

Ziyi Wang, Yuanmei Zhang, Baoying Ye, Yimei Jiang, Leilei Gu, Suncheng Xiang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学)

AI总结 本文针对结肠镜息肉分割模型边界模糊或复杂度高的问题,提出轻量型MicroAUNet,结合深度可分离空洞卷积与通道-空间注意力块,辅以渐进式两阶段知识蒸馏,在低复杂度下实现先进分割准确率,适用于实时临床应用。

Comments Accepted to MedVidU @ ECCV 2026

URL PDF HTML 收藏
2312.00114 2026-08-13 cs.CV 版本更新

Un-EVIMO: Unsupervised Event-Based Independent Motion Segmentation

Un-EVIMO:基于事件的无监督独立运动分割

Ziyun Wang, Jinyuan Guo, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学) Archimedes, Athena RC(阿基米德、阿泰纳RC)

AI总结 本研究提出首个利用几何约束生成IMO伪标签的无监督事件框架,在EVIMO数据集上评估显示其IMO分割性能与监督方法相当,可处理任意非预定物体且易扩展至无昂贵标注的数据集。

Comments European Conference on Computer Vision 2024

URL PDF HTML 收藏
2608.10995 2026-08-12 cs.CV 新提交

HNDiff: Haze-Noise Diffusion for Image Dehazing

HNDiff:用于图像去雾的雾霾-噪声扩散模型

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学) National Chengchi University(国立政治大学) NVIDIA(英伟达)

AI总结 本文提出嵌入大气散射模型的HNDiff扩散框架,通过雾霾感知噪声调度器关联正向退化物理机制,反向同步去雾去噪,改进主流去雾骨干网络并在基准数据集达最优结果。

Comments Accepted to ECCV 2026. Project Page: https://jin-ting-he.github.io/HNDiff

URL PDF HTML 收藏
2608.10677 2026-08-12 cs.CV 新提交

Chartography: A Benchmark for Professional Chart Understanding

Chartography:专业图表理解基准

Suhaas Garre, Chris Mutty, Sushant Mehta, Edwin Chen

机构 * Surge AI

AI总结 本研究推出含100项任务的Chartography基准,其采用专业领域特定图表格式,评估显示前沿模型在该基准上表现远低于饱和水平,失败集中于视觉感知,研究还发布了相关任务、图像及评估代码。

Comments 16 pages, 5 figures, 5 tables. Accepted at the 2nd Workshop on Benchmarking Evidence-Aligned Multimodal Reasoning (BEAM 2), ECCV 2026

URL PDF HTML 收藏
2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

URL PDF HTML 收藏
2608.10544 2026-08-12 cs.CV cs.AI cs.LG 新提交

Flow Straight to Reality: Perceptually Consistent Flow Matching for Efficient Image Restoration

直接流向现实:用于高效图像复原的感知一致流匹配

Sangwoo Jo, Donggeun Ko, Jayeon Kang, Youngsang Kwak, Jaehwa Kwak, Sungjoon Choi

机构 * Korea University(高丽大学) Aim Future

AI总结 本文提出PCFlow框架,通过结合潜在一致性流目标、LCPL损失与无冲突梯度投影策略,实现高效图像复原,在低计算成本下取得竞争力性能。

Comments Accepted to ECCV 2026. Code is available at https://github.com/aiimaginglab/PCFlow

URL PDF HTML 收藏
2608.10500 2026-08-12 cs.CV 新提交

DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars

DSAR:用于生成逼真可动画化虚拟化身的布料时序动力学双流自回归建模

Haozhong Xiong, Yao Yu, Yu Zhou, Sidan Du

机构 * Nanjing University(南京大学)

AI总结 本文提出DSAR双流自回归框架,显式建模布料时序因果结构,解决现有方法布料动力学捕捉不足问题,在多方面性能获显著提升。

Comments Accepted to ECCV 2026. 25 pages, 7 figures, including supplementary material

URL PDF HTML 收藏
2608.10411 2026-08-12 cs.CV 新提交

A second-order theory of texture for depth from focus

聚焦测距的纹理二阶理论

Sreekar Ranganathan, Ioannis Gkioulekas

AI总结 该研究提出基于波动光学的纹理二阶理论,发现传统视为无纹理的表面因主观散斑也会产生纹理,通过窄带光谱滤波器提升二阶纹理对比度,大幅改善看似无纹理场景的被动深度重建效果。

Comments ECCV 2026, project website: https://imaging.cs.cmu.edu/second-order-texture/

URL PDF HTML 收藏
2608.10345 2026-08-12 cs.CV 新提交

CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images

CasDeblurGS:用于从两张模糊图像重建3D高斯溅射的级联2D到3D多视图一致性方法

Haeyun Choi, Minhyuk Jang, I-Gil Kim

机构 * University of Virginia(弗吉尼亚大学) KT R&D Center(KT研发中心)

AI总结 CasDeblurGS是一种级联框架,仅用两张已知内参的运动模糊图像即可重建连贯3D场景,在Deblur-NeRF场景上PSNR较基线提升1.19dB和2.11dB,渲染与几何一致性均改善。

Comments Accepted to the ECCV 2026 MUSTCV Workshop. Project page: https://haeyun-choi.github.io/Cascaded2D3D_page/

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

URL PDF HTML 收藏
2608.08580 2026-08-12 cs.CV 版本更新

Where Is the Bee? Detecting Tiny Pollinators with a Single Collaborative-Head Transformer

蜜蜂在哪里?用单协作头Transformer检测小型传粉昆虫

Junsu Kim, Seungryul Baek

机构 * UNIST(蔚山科学技术院)

AI总结 针对ECCV 2026 BuzzSpot挑战赛中小型传粉昆虫检测的难点,采用带Swin-L骨干的Co-DINO,结合裁剪马赛克池微调与类别加权ETF损失,在无推理增强下获挑战赛第一。

Comments The 1st rank method's paper at CVPPA@ECCV 2026 BuzzSpot Challenge

URL PDF HTML 收藏
2608.08522 2026-08-12 cs.RO 版本更新

EsaacSim: A Multimodal Event Camera Add-on for NVIDIA Isaac Sim

EsaacSim:适用于NVIDIA Isaac Sim的多模态事件相机附加组件

Ignacio Bugueno-Cordova, Malte Kuhlmann, Nicolás Navarro-Guerrero, Miguel Campusano, Rodrigo Verschae

机构 * Leibniz Universität Hannover(莱布尼茨汉诺威大学) L3S Research Center(L3S研究中心) University of Southern Denmark(南丹麦大学) University of Chile(智利大学)

AI总结 本文提出适用于NVIDIA Isaac Sim的多模态事件相机附加组件EsaacSim,可实现多模态事件相机在线仿真,在多种分辨率下具备高效性能,支持机器人研究的多模态仿真与合成数据生成。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

URL PDF HTML 收藏
2608.08494 2026-08-12 cs.CV 版本更新

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化

Qiang Hu, Yuxuan Luo, Yingjie Guo, Hao Wang, Qimei Wang, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。

Comments Accepted by ECCV 2026

URL PDF HTML 收藏
2607.23908 2026-08-12 cs.CV 版本更新

Embeddings based Anomaly Detection for Cleaning Global Crop Type Reference Datasets

基于嵌入的异常检测用于清理全球作物类型参考数据集

Syed Roshaan Ali Shah, Kristof Van Tricht, Christina Butsko, Jeroen Degerickx, Zoltan Szantoi

机构 * VITO Remote Sensing(弗拉芒技术研究所遥感部) European Space Agency (ESA)(欧洲航天局)

AI总结 研究通过地理空间基础模型生成的嵌入能否用于清理全球作物类型参考数据集,提出基于嵌入的局部感知异常检测框架,并通过实验验证其有效性,改进了作物类型模型,为清理地球观测参考数据集提供了可复制扩展的模板。

Comments Camera-ready version. Accepted for Oral Presentation at Terrabytes II at ECCV 2026

URL PDF HTML 收藏
2607.14945 2026-08-12 cs.CV 版本更新

Introspective Attention Modulation for Safe Text-to-Image Generation

用于安全文本到图像生成的内省注意力调制

Basim Azam, Hossein Rahmani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lancaster University(兰卡斯特大学)

AI总结 研究基于流的文本到图像模型易产生不安全内容的问题,提出通过推理时内省调节注意力动态实现安全的方法,该方法在保持或提升质量的同时显著提高安全分数,为安全图像生成提供新途径。

Comments Accepted at ECCV 2026. 20 pages, 7 figures. Project page: https://basim-azam.github.io/iam/

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

URL PDF HTML 收藏
2605.12739 2026-08-12 cs.HC 版本更新

Quieting the Cobwebs: Browser Interaction for Visual Floaters

静音蛛网:用于视觉浮渣的浏览器交互

Kenneth Ge, Jinglin Li, Shikhar Ahuja

AI总结 本文提出了一种基于眼物理的浮渣模拟工具,用于评估不同运动水平下的文本可读性,并开发了一个新型浏览器扩展,通过减少眼球运动来最大化浏览器任务的信噪比,适用于所有UI元素。

Comments Accepted at ECCV 2026 HCV Workshop

URL PDF HTML 收藏
2603.25467 2026-08-12 cs.CV 版本更新

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

URL PDF HTML 收藏
2509.21263 2026-08-12 cs.CV 版本更新

Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors

基于VGGT先验的几何基础密集语义匹配研究

Songlin Yang, Tianyi Wei, Yushi Lan, Zeqi Xiao, Anyi Rao, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

AI总结 本文针对现有语义匹配方法的几何歧义与最近邻规则局限,采用VGGT先验,通过特征调整、循环训练等策略实现适配,在多方面性能优于基线。

Comments ECCV 2026

URL PDF HTML 收藏
2608.09691 2026-08-11 cs.CV 新提交

Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes

扩散目标,保留其标签:通过VLM构建的3D植被场景从少量未标记照片中整理检测器训练数据

Mario Malizia, Marnix Enting, Rob Haelterman, Ken Hasselmann

机构 * Royal Military Academy(皇家军事学院) KU Leuven(鲁汶大学) Flanders Make(佛兰德制造研究院)

AI总结 本研究针对植被中小物体标记图像稀缺导致检测器跨站点泛化差的问题,通过VLM构建3D植被场景合成标记训练图像,实现无监督站点适应,在排雷基准上性能优于传统跨站点标签复用。

Comments Accepted at the Curated Data for Efficient Learning (CDEL) Workshop @ ECCV 2026

URL PDF HTML 收藏
2608.09636 2026-08-11 cs.CV cs.AI 新提交

NeuroRefiner: Morphology-Aware Multi-Agent Refinement for 3D Fluorescence Microscopy Neuron Segmentation

NeuroRefiner:面向3D荧光显微镜神经元分割的形态感知多智能体细化方法

Haiyang Yan, Jinyue Guo, Yanchao Zhang, Bingqing Wang, Zhenchen Li, Jing Liu, Jiazheng Liu, Linlin Li, Hua Han

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Normal University(北京师范大学)

AI总结 针对3D荧光显微镜神经元分割的拓扑与细节保留难题,本文提出NeuroRefiner多智能体系统结合TopoRefineNet工具,在多数据集上实现优于现有方法的分割性能,ZBFWB数据集F1分数提升3.02%。

Comments Accept by ECCV 2026

URL PDF HTML 收藏