arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-09 至 2026-07-09 共收录 15
2604.19238 2026-07-09 cs.CV 版本更新

Allo{SR}$^2$: Rectifying One-Step Super-Resolution to Stay Real via Allomorphic Generative Flows

Allo{SR}$^2$: 通过全形生成流纠正一步超分辨率以保持真实

Zihan Wang, Xudong Huang, Junbo Qiao, Wei Li, Jie Hu, Xinghao Chen, Shaohui Lin

机构 * East China Normal University Huawei Noah's Ark Lab(华东师范大学华为诺亚实验室)

AI总结 本文提出Allo{SR}$^2$,通过全形生成流纠正一步超分辨率轨迹,以维持高保真生成现实。方法利用SNR引导轨迹初始化和FATC确保稳定路径,同时通过ATM策略减少分布差异,实验证明其在真实世界超分辨率中表现优异。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16446 2026-07-09 cs.CV 版本更新

Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline

统一去除雨滴和反射:一个新的基准和一个新流程

Xingyu Liu, Zewei He, Yu Chen, Chunyu Zhu, Zixuan Chen, Xing Luo, Zhe-Ming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空航天学院) Huanjiang Laboratory(浣江实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出统一去除雨滴和反射的任务,并构建了新的基准数据集,同时提出基于扩散的新型框架DiffUR³,有效去除两种退化,实验表明在基准和真实场景中表现优异。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07831 2026-07-09 cs.CR cs.CL cs.CV 版本更新

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Junxian Duan, Huaibo Huang, Jie Cao, Ran He

机构 * SAIS, UCAS(中国科学院大学人工智能学院) SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。

Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05249 2026-07-09 cs.CV 版本更新

RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes

RL-AWB: 基于深度强化学习的低光夜间场景自动白平衡校正

Yuan-Kang Lee, Kuan-Lin Chen, Chia-Che Chang, Yu-Lun Liu

机构 * MediaTek Inc.(联发科技股份有限公司) National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 本文提出RL-AWB框架,结合统计方法与深度强化学习解决低光环境下色彩恒常性问题,通过统计算法与强化学习动态优化参数,提升低光和明亮场景的泛化能力。

Comments ECCV 2026. Project page: https://ntuneillee.github.io/research/rl-awb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25739 2026-07-09 cs.CV 版本更新

MegaFlow: Zero-Shot Large Displacement Optical Flow

MegaFlow:零样本大位移光流

Dingxi Zhang, Fangjinhua Wang, Marc Pollefeys, Haofei Xu

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft(微软) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心)

AI总结 MegaFlow通过预训练视觉先验解决大位移零样本光流问题,利用全局Vision Transformer实现全局匹配,结合轻量迭代优化提升精度,实验显示其在多个光流基准和长距离点跟踪任务中表现优异。

Comments [ECCV 2026] Project Page: https://kristen-z.github.io/projects/megaflow Code: https://github.com/cvg/megaflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04547 2026-07-09 cs.LG cs.CV 版本更新

Activation Quantization of Vision Encoders Needs Prefixing Registers

视觉编码器的激活量化需要前缀寄存器

Seunghyeon Kim, Taesun Yeom, Jinho Kim, Wonpyo Park, Kyuyeun Kim, Jaeho Lee

机构 * POSTECH Dankook University(Dankook 大学) Google(谷歌)

AI总结 本文提出RegCache算法,通过引入前缀标记减少视觉编码器中的异常值,提升低比特量化模型性能,尤其在极低比特情况下效果显著。

Comments Accepted to ECCV 2026. Code: https://github.com/spbob0418/RegCache

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15685 2026-07-09 cs.MM cs.AI cs.CV cs.SD 版本更新

DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

DASH:动态音频驱动的语义分块以实现高效的多模态令牌压缩

Bingzhou Li, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

AI总结 DASH通过动态音频驱动的语义分块方法,有效压缩多模态令牌,提升推理效率,优于传统固定窗口分块和注意力剪枝方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21556 2026-07-09 cs.CV 版本更新

ECHO: Ego-Centric modeling of Human-Object interactions

ECHO:人类-物体交互的以自我为中心建模

Ilya A. Petrov, Vladimir Guzov, Riccardo Marin, Emre Aksan, Xu Chen, Daniel Cremers, Thabo Beeler, Gerard Pons-Moll

AI总结 ECHO首次提出统一框架,通过头和手腕追踪联合恢复人体姿态、物体运动和接触动力学,解决稀疏信号下的人类-物体交互建模难题。

Comments Accepted at ECCV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09385 2026-07-09 cs.CV 版本更新

EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation

EventVGGT:探索跨模态蒸馏以实现一致的基于事件的深度估计

Yinrui Ren, Jinjing Zhu, Kanghao Chen, Zhuoxiao Li, Jing Ou, Zidong Cao, Tongyan Hua, Peilun Shi, Yingchun Fu, Wufan Zhao, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(珠海)) CUHK(香港中文大学) SCNU(华南师范大学)

AI总结 EventVGGT通过跨模态蒸馏实现一致的基于事件的深度估计,有效提升深度预测精度和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06445 2026-07-09 cs.CV 版本更新

What if? Emulative Simulation with World Models for Situated Reasoning

如果呢?基于世界模型的仿真模拟用于情境推理

Ruiping Liu, Yufan Chen, Yuheng Zhang, Junwei Zheng, Kunyu Peng, Chengzhi Wu, Chenguang Huang, Di Wen, Jiaming Zhang, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) RAI Institute(RAI研究所)

AI总结 提出WanderDream数据集,利用世界模型进行心理探索的仿真模拟,使代理无需主动探索即可回答空间假设问题,实验证明心理探索对情境推理至关重要。

Comments Accepted at ECCV 2026. The data and code are available at: https://github.com/RuipingL/WanderDream

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06285 2026-07-09 cs.CV 版本更新

MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training

MMEarth-Bench:通过多模态测试时训练进行全局模型适配

Lucia Gordon, Serge Belongie, Christian Igel, Nico Lang

机构 * Harvard University, USA(哈佛大学,美国) University of Copenhagen, Denmark(哥本哈根大学,丹麦)

AI总结 研究针对地理空间机器学习中现有基准数据集不足,引入含多模态任务的MMEarth-Bench,通过多模态测试时训练方法提升模型性能,改善地理泛化能力。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15770 2026-07-09 physics.optics cs.AR cs.CV 版本更新

Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding

通过纳米光子波前编码实现物理基础的单目深度

Bingxuan Li, Jiahao Wu, Yuan Xu, Zezheng Zhu, Yunxiang Zhang, Kenneth Chen, Yanqi Liang, Nanfang Yu, Qi Sun

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学)

AI总结 研究旨在解决单目深度感知中度量尺度模糊问题,核心方法是用超透镜通过纳米光子学编码深度线索,结合DFMs与输入自适应策略及模拟管道,实验证明该方法有效提升单目度量深度传感精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05711 2026-07-09 cs.CV 版本更新

From My View to Yours: Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision

从我的视角到你的视角:利用特权自我中心监督从外中心视频中学习自我中心线索

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Elorian AI

AI总结 研究针对视觉语言模型难以从外中心视频推断自我中心属性的问题,提出Ego2ExoVLM框架,利用时间同步视频对及特权监督,通过两个组件实现此能力,在多任务评估中取得领先性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05044 2026-07-09 cs.CV 版本更新

Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation

通过密集轨迹生成实现几何感知单图像4D合成

Yanran Zhang, Ziyi Wang, Wenzhao Zheng, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 针对单图像4D合成挑战,提出MoGe4D框架,通过密集轨迹生成实现几何感知合成。引入数据集,构建4D-STraG及4D-ViSM。实验证明该方法能生成高质量4D场景,具强时空连贯性和几何感知一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏