arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-05 至 2026-08-05 共收录 11
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03407 2026-08-05 cs.CV cs.AI cs.LG 新提交

Distilled Roads: Generalisable Road Network Extraction Across Sensors, Resolutions, and Region

蒸馏路网:跨传感器、分辨率和区域的通用路网提取

Sanayya, Rakshith Sathish, Ashwathi Nambiar

AI总结 本研究提出结合跨分辨率知识蒸馏、多传感器训练与拓扑感知监督的框架,构建出泛化性强、效率高的路网提取模型,在公开基准上性能优于现有最优方法。

Comments Accepted at ECCV 2026 workshop - TerraBytes II

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03323 2026-08-05 cs.CV 新提交

PolyLayout: Multi-room Manhattan Layout Estimation

PolyLayout:多房间曼哈顿布局估计

Gustav Hanning, Shaohui Liu, Rémi Pautrat, Marc Pollefeys, Kalle Åström, Viktor Larsson

AI总结 针对现有多房间布局估计方法泛化差、未利用建筑结构的问题,提出 PolyLayout 方法,通过联合优化跨房间的曼哈顿 3D 多边形,在新基准上实现了优于现有方法的准确性与鲁棒性。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03198 2026-08-05 cs.CV cs.RO 新提交

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

通过可微物理渲染连接在线与离线手写文字

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

AI总结 该研究提出统一在线-离线手写生成框架,通过物理画笔模型与可微渲染模块解决两类手写生成范式的缺陷,经实验验证实现了结构与视觉保真度。

Comments Accepted at ECCV 2026, Project page: https://seonmip.github.io/onoff

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02990 2026-08-05 cs.RO 新提交

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22673 2026-08-05 cs.GR cs.CV 版本更新

URHead: A Unified UV-Space Representation for Joint Mesh-3DGS Optimization in Head Avatars

URHead:用于头部虚拟形象中联合网格-3DGS优化的统一UV空间表示

Seonghak Lee, Junhee Cho, Jisoo Park, Min-Gyu Park, Jongmin Lee, Ju Hong Yoon, Junseok Kwon

AI总结 研究针对头部虚拟形象,提出URHead统一表示法,通过UV空间统一及联合优化,让网格与高斯方法互补,保持参数可控性与特定主体细节,在重建质量和动画一致性上超越现有方法。

Comments Project page/code: https://lseonghak.github.io/website/project/urhead/, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18673 2026-08-05 cs.CV 版本更新

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能

Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

机构 * University of British Columbia(英属哥伦比亚大学) Weathon Software(威盛软件)

AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。

Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27741 2026-08-05 cs.CV 版本更新

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

SIFT: 视频扩散模型中物理合理运动的自我想象微调

Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 针对视频扩散模型生成运动物理不合理的问题,提出自我想象微调(SIFT)范式,通过从模型自身生成视频学习而非直接重建真实视频,结合运动感知判别监督和渐进式难例重放策略,提升运动解耦与物理真实性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27975 2026-08-05 cs.CV cs.AI 版本更新

TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions

TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准

Ce Chen, Yi Ren, Yuanming Li, Viktor Goriachko, Zhenhui Ye, Zujin Guo, Zhibin Hong, Mingming Gong

机构 * University of Melbourne(墨尔本大学) HeyGen Research(HeyGen研究院) Nanyang Technological University(南洋理工大学)

AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。

Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01312 2026-08-05 cs.CV 版本更新

P3P Made Easy

P3P简化

Seong Hun Lee, Patrick Vandewalle, Javier Civera

机构 * EAVISE, KU Leuven(鲁汶大学EAVISE实验室) I3A, University of Zaragoza(萨拉戈萨大学I3A研究所)

AI总结 本文重新审视经典的透视三点问题,提出一个简洁的代数求解器,在精度和运行时间上与最新方法相当,平衡了简洁性、效率和准确性。

Comments Accepted to ECCV Workshop 2026 (SFM-DL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01973 2026-08-05 cs.CV 版本更新

NearID: Identity Representation Learning via Near-identity Distractors

NearID: 通过近身份干扰实现身份表示学习

Aleksandar Cvejic, Rameen Abdal, Abdelrahman Eldesokey, Bernard Ghanem, Peter Wonka

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Snap Research(Snap研究院)

AI总结 本文提出NearID框架,通过近身份干扰消除背景影响,提升身份识别精度,改进模型在个性化生成和图像编辑任务中的表现。

Comments Accepted to ECCV 2026, Code, model, and dataset are released, visit https://github.com/Gorluxor/NearID

详情

展开后加载摘要…

URL PDF HTML 收藏