arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2603.26266 2026-07-01 cs.AI cs.CV 版本更新

GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation

GUIDE:通过实时网络视频检索和即插即用标注解决GUI代理的领域偏见

Rui Xie, Zhi Gao, Chenrui Shi, Zirui Shang, Lu Chen, Qing Li

机构 * Shanghai Jiao Tong University(上海交通大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) Beijing Institute of Technology(北京理工大学)

AI总结 GUIDE通过实时网络视频检索和即插即用标注框架,解决GUI代理的领域偏见问题,通过视频语义分析和自动化标注流程提升代理对特定应用的操作流程和UI布局的理解,实验表明其在多代理系统和单模型代理中均能提升性能。

Comments Accepted to ECCV 2026. 30 pages: 15-page main paper followed by supplementary material as an appendix (Sections A-F). Project page: https://sharryXR.github.io/GUIDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24036 2026-07-01 cs.CV 版本更新

SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision

SpectralSplats: 通过谱矩监督实现鲁棒的可微跟踪

Avigail Cohen Rimon, Amir Mann, Mirela Ben Chen, Or Litany

机构 * Technion - Israel Institute of Technology(以色列理工学院) NVIDIA(英伟达)

AI总结 提出SpectralSplats框架,通过将优化目标从空间域转移到频率域,利用全局复正弦特征(谱矩)构建全局吸引域,解决3D高斯泼溅跟踪中因严重错位导致的梯度消失问题,并设计频率退火策略实现从全局凸性到精确空间对齐的平滑过渡。

Comments Accepted to ECCV 2026. Project page: https://avigailco.github.io/SpectralSplats/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23297 2026-07-01 cs.CV cs.LG eess.IV 版本更新

Drop-In Perceptual Optimization for 3D Gaussian Splatting

3D高斯溅射的即插即用感知优化

Ezgi Ozyilkan, Zhiqi Chen, Oren Rippel, Jona Ballé, Kedar Tatwawadi

机构 * Apple(苹果公司) Tandon School of Engineering, New York University(纽约大学坦登工程学院)

AI总结 针对3DGS依赖像素级损失导致模糊的问题,提出正则化Wasserstein损失WD-R,通过大规模人类主观实验验证其在纹理恢复和感知指标上的优势,并推广到多种框架和场景压缩任务。

Comments Accepted as a conference paper at ECCV'26. Project page: https://apple.github.io/ml-perceptual-3dgs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13402 2026-07-01 cs.CV cs.LG 版本更新

Event-Driven Video Generation

事件驱动视频生成

Chika Maduabuchi, Jindong Wang

机构 * William & Mary(威廉与玛丽学院)

AI总结 提出事件驱动视频生成(EVD),通过轻量级头部预测令牌级事件活动,并利用事件门控采样在交互区域集中更新,以修正对象交互错误,提升状态持久性、空间准确性和接触稳定性。

Comments Accepted to ECCV 2026. Project webpage: https://evd-project-website.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16250 2026-07-01 cs.CV cs.AI 版本更新

Visual Prompt Discovery via Semantic Exploration

通过语义探索发现视觉提示

Jaechang Kim, Yotaro Shimose, Zhao Wang, Kuang-Da Wang, Jungseul Ok, Shingo Takamatsu

机构 * Sony Group Corporation(索尼集团公司) Pohang University of Science and Technology(浦项科技大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 提出SEVEX算法,通过抽象思想空间和语义反馈自动探索任务级视觉提示,提升LVLM图像感知能力。

Comments Accepted to ECCV 2026, project page: https://jaechang.dev/projects/SEVEX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18242 2026-07-01 cs.CV 版本更新

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA:学习规划与验证以实现自我中心视频推理

Yogesh Kulkarni, Pooyan Fazli

AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22265 2026-07-01 cs.LG cs.CV 版本更新

Entropy-Controlled Flow Matching

熵控流匹配

Chika Maduabuchi

机构 * William & Mary(威廉与玛丽学院)

AI总结 提出熵控流匹配(ECFM),通过约束连续方程路径的全局熵率,避免低熵瓶颈导致的语义模式丢失,并证明其与薛定谔桥的联系及最优传输收敛性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03510 2026-07-01 cs.CV 版本更新

G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation

G2P:面向边界感知3D分割的高斯到点属性对齐

Hojun Song, Chae-yeong Song, Jeong-hun Hong, Chaewon Moon, Soo Ye Kim, Yiyi Liao, Jaehyup Lee, Sang-hyo Park

机构 * Kyungpook National University(庆北国立大学) Korea Electronics Technology Institute(韩国电子技术研究院) Adobe Research(Adobe研究院) Zhejiang University(浙江大学)

AI总结 提出G2P方法,通过将3D高斯泼溅的属性(如不透明度和尺度)传递到点云,解决几何特征无法区分外观相似物体的问题,实现边界感知的3D分割。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21291 2026-07-01 cs.CV 版本更新

Gaussian Belief Propagation Network for Depth Completion

高斯置信传播网络用于深度补全

Jie Tang, Pingping Xie, Jian Li, Ping Tan

机构 * National University of Defense Technology(国防科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出高斯置信传播网络(GBPN),融合深度学习与概率图模型,通过动态构建马尔可夫随机场并利用高斯置信传播推断,实现高稀疏度下的鲁棒深度补全。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16959 2026-07-01 cs.LG cs.AI cs.NE stat.ML 版本更新

Graph Coloring for Multi-Task Learning

多任务学习的图着色方法

Santosh Patapati, Ian Noronha

机构 * Stony Brook University AI Innovation Institute(石溪大学人工智能创新研究所) Purdue University(普渡大学)

AI总结 提出SON-GOKU调度器,通过构建梯度干扰图并应用贪心图着色将任务分组,每步仅激活一组任务,减少梯度干扰,提升多任务学习性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04390 2026-07-01 cs.CV cs.AI 版本更新

FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring

FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊

Geunhyuk Youk, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。

Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20935 2026-07-01 cs.CV 版本更新

ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation

ISAC:无需训练的实例到语义注意力控制用于多实例生成

Sanghyun Jo, Wooyeol Lee, Ziseok Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19778 2026-07-01 cs.CV 版本更新

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer

相位对齐的混合分辨率扩散Transformer旋转位置编码

Haoyu Wu, Jingyi Xu, Qiaomu Miao, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。

Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18775 2026-07-01 cs.CV cs.AI 版本更新

Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise

重新思考基于扩散的虚拟试穿中的服装条件:解耦,而非去噪

Kihyun Na, Jinyoung Choi, Injung Kim

机构 * Handong Global University(韩东国际大学)

AI总结 针对扩散虚拟试穿中双UNet结构参数多、空间拼接全微调失效的问题,通过可视化研究揭示服装条件必须与去噪过程解耦,提出DeCo-VTON模型,以单网络架构达到双UNet水平且成本减半。

Comments Accepted at ECCV 2026. 28 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20995 2026-07-01 cs.CV cs.LG cs.SD eess.AS 版本更新

Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

逐步视频到音频合成:通过负音频引导

Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony AI, Tokyo, Japan(索尼人工智能(东京,日本)) Sony Group Corporation, Tokyo, Japan(索尼集团公司(东京,日本))

AI总结 提出逐步视频到音频生成方法,通过负音频引导避免重复生成,增强声音分离性和最终音频质量,优于现有基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25682 2026-07-01 cs.CV 版本更新

Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples

少样本合成图像溯源:有限样本下识别未见生成器

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22476 2026-07-01 cs.CV 版本更新

Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA

多通道不确定性加权分数匹配用于医学UDA中的条件扩散

Chen Li, Meilong Xu, Xiaoling Hu, Weimin Lyu, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院与哈佛医学院)

AI总结 提出UPDiff-UDA框架,通过不确定性加权的分数匹配聚合多通道伪标签,结合贝塞尔曲线适应,提升跨模态医学图像分割性能。

Comments 28 pages, 7 figures. Accepted by ECCV'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02798 2026-07-01 cs.CV eess.IV physics.optics 版本更新

Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion

无滤波器快照高光谱成像引导补丁扩散

Dean Hazineh, Luca Sacchi, Davide Cassara, Federico Capasso, Todd Zickler

机构 * Harvard University(哈佛大学)

AI总结 提出使用条件去噪扩散模型,通过小补丁移位不变操作和光学点扩散函数物理一致性引导,从单衍射透镜和滤光片全色传感器捕获的灰度快照中重建高光谱图像。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30598 2026-06-30 cs.CV

Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation

面向野外场景的自我中心3D手-物体姿态估计

Siddhant Bansal, Zhifan Zhu, Shashank Tripathi, Jiahe Zhao, Michael J. Black, Dima Damen

机构 * University of Bristol(布里斯托大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)

AI总结 针对野外自我中心RGB图像中手-物体姿态估计的遮挡和接触模糊问题,提出EPIC-Contact数据集和HOPformer端到端Transformer模型,联合预测双手和物体姿态,在ARCTIC和EPIC-Contact上显著提升成功率并降低接触偏差。

Comments Accepted at ECCV 2026; Project Page: https://sid2697.github.io/epic-contact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30557 2026-06-30 cs.CV

EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics

EcoVideo: 云边动态中的熵编排视频生成范式

Jiayu Chen, Hengyi Zhang, Maoliang Li, Minyu Li, Zihao Zheng, Xuanzhe Liu, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University, China(北京大学计算机科学学院,中国) State Key Lab of Multimedia Information Processing, Peking University, China(北京大学多媒体信息处理国家重点实验室,中国) International School, Beijing University of Posts and Telecommunications, China(北京邮电大学国际学院,中国) School of Information Science and Technology, Beijing Forestry University, China(北京林业大学信息科学与技术学院,中国)

AI总结 提出EcoVideo框架,利用自注意力熵进行无训练帧选择,云大模型去噪关键帧,边轻量模型插值重建,自适应调整预算和深度,实现2.9倍端到端加速。

Comments EcoVideo is honored to be accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30498 2026-06-30 cs.CV cs.AI

On the Faithfulness of Post-Hoc Concept Bottleneck Models

事后概念瓶颈模型的忠实性研究

Laines Schmalwasser, Jan Blunk, Niklas Penzel, Julia Niebling, Joachim Denzler

机构 * Institute of Data Science, German Aerospace Center(数据科学研究所,德国航空航天中心) Computer Vision Group Jena, Friedrich Schiller University Jena(贾恩计算机视觉小组,弗里德里希·席勒大学贾恩) GEOMAR Helmholtz Centre for Ocean Research Kiel(基尔海洋研究赫尔姆霍茨中心)

AI总结 本文分析事后概念瓶颈模型(post-hoc CBMs)中概念投影的失败案例,提出新指标解耦概念忠实性与预测准确性,揭示标准准确率评估无法检测的不忠实行为。

Comments Accepted at ECCV 2026, 41 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30492 2026-06-30 cs.CV

RBE-Flow: Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration

RBE-Flow:基于特征流形的递归贝叶斯估计用于跨模态配准

Mengzhu Ding, Xin Song, Xiaoke Ding, Hongwei Ding, Xuecong Liu

机构 * Northeastern University, China(东北大学)

AI总结 针对跨模态图像配准中非线性辐射差异和几何畸变导致的优化困难,提出RBE-Flow框架,将密集流估计重构为特征流形上的闭环递归贝叶斯估计,通过递归流形优化和不确定性自适应概率更新实现自校正,在多个基准上取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30476 2026-06-30 cs.CV cs.RO eess.IV

PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking

PS-MOT: 从点种子培育实例意识用于多目标跟踪

Kai Luo, Fei Teng, Mengfei Duan, Wanjun Jia, Xu Wang, Hao Shi, Kunyu Peng, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Karlsruhe Institute of Technology(卡尔斯鲁厄大学)

AI总结 提出PS-MOT,一种点监督多目标跟踪方法,通过层次化流水线(数据级TFP、模型级PEWA、损失级UGL)解决空间模糊和身份漂移问题,在多个数据集上达到新最优。

Comments Accepted to ECCV 2026. The source code is available at https://github.com/xifen523/PS-MOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30474 2026-06-30 cs.RO

Grasp-Oriented Non-Prehensile Manipulation via Learning a Graspability Field

基于抓取能力场学习的面向抓取的非抓取操作

Licheng Zhong, Gim Hee Lee

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

AI总结 提出通过学习物体配置的抓取能力场,将非抓取操作优化为最大化抓取成功概率,而非达到预设位姿,实现闭环操作到抓取的单一策略。

Comments European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30360 2026-06-30 cs.LG cs.CV

On the Vulnerability of Parameter-Level Defenses to Model Merging

参数级防御对模型合并的脆弱性

Kuangpu Guo, Qingyan Zheng, Jian Liang, Yongcan Yu, Zilei Wang, Ran He, Tieniu Tan

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所国家工程实验室及机器智能研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文揭示参数级防御因保护任务向量幅度小而失效,提出锚点引导攻击(AGA)通过预训练模型恢复变换矩阵,并设计锚点排斥微调(ARF)作为防御。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30355 2026-06-30 cs.CV cs.AI

Residual-Guided Expert Specialization for Incomplete Multimodal Learning

残差引导的专家特化用于不完整多模态学习

Seunghun Baek, Jihwan Park, Jaeyoon Sim, Minjae Jeong, Hoseok Lee, Won Hwa Kim

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

AI总结 提出MARS框架,利用缺失引起的表示偏差引导专家特化,通过残差信号路由样本到对应专家,并引入差异感知噪声正则化缓解训练-测试路由差距,在缺失场景下提升多模态分类与分割性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏