arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-07 至 2026-08-07 共收录 5
2608.06142 2026-08-07 cs.CV 新提交

Learning visual representations for compositional analysis of artworks and photographs

面向艺术品与照片的组合分析学习视觉表征

Fatemeh Behrad, Tinne Tuytelaars, Johan Wagemans

机构 * KU Leuven University(KU Leuven大学(荷语鲁汶大学))

AI总结 该研究对比了受人类启发的构图分析方法与微调基础模型两种范式,在三类任务上评估性能,发现前者冻结编码器时具竞争力且可解释,后者微调后性能更优但可解释性与泛化性下降。

Comments ECCV workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05626 2026-08-07 cs.CV 新提交

Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping

通过SDR融合与增益图逆色调映射实现双输出多曝光HDR重建

Jinho Kim, Jinwoo Kim, Seon Joo Kim

机构 * Yonsei University(延世大学)

AI总结 该研究提出DOME-HDR框架,通过LoRA适配的潜在扩散模型与双交叉注意力融合模块生成SDR,结合HPGM网络预测增益图实现多曝光HDR重建,在多个数据集上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05424 2026-08-07 cs.CV cs.LG 新提交

Invisible Shortcuts: Why Vision Encoders Know Your Camera

隐形捷径:视觉编码器为何了解你的相机

Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos, Noa Garcia, Giorgos Tolias

AI总结 该研究发现视觉编码器会利用像素级隐形元数据痕迹形成捷径,元数据-语义关联越强模型敏感性越高,提出的缓解策略可降低敏感性并提升分布外泛化能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05260 2026-08-07 cs.CV 新提交

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

一段文本胜过千条标题:重新思考视觉-语言检索的文本监督

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。

Comments Accepted at the MUCG workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏