arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-01 至 2026-07-01 共收录 85
2604.09100 2026-07-01 cs.CV cs.RO 版本更新

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。

Comments 29 pages, 10 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04834 2026-07-01 cs.CV cs.MM cs.RO eess.IV 版本更新

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景

Jiajun Zhai, Hao Shi, Shangwei Guo, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hunan University(湖南大学)

AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。

Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04050 2026-07-01 cs.CV cs.LG 版本更新

TORA: Topological Representation Alignment for 3D Shape Assembly

TORA:基于拓扑的3D形状组装表示对齐

Nahyuk Lee, Zhiang Chen, Marc Pollefeys, Sunghwan Hong

机构 * Independent Researcher(独立研究员) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

AI总结 TORA通过拓扑优先的表示对齐框架,利用预训练3D编码器的关联结构提升3D形状组装的对齐效果,通过余弦匹配和CKA损失增强拓扑对齐,实现更快收敛和更高精度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26266 2026-07-01 cs.AI cs.CV 版本更新

GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation

GUIDE:通过实时网络视频检索和即插即用标注解决GUI代理的领域偏见

Rui Xie, Zhi Gao, Chenrui Shi, Zirui Shang, Lu Chen, Qing Li

机构 * Shanghai Jiao Tong University(上海交通大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) Beijing Institute of Technology(北京理工大学)

AI总结 GUIDE通过实时网络视频检索和即插即用标注框架,解决GUI代理的领域偏见问题,通过视频语义分析和自动化标注流程提升代理对特定应用的操作流程和UI布局的理解,实验表明其在多代理系统和单模型代理中均能提升性能。

Comments Accepted to ECCV 2026. 30 pages: 15-page main paper followed by supplementary material as an appendix (Sections A-F). Project page: https://sharryXR.github.io/GUIDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24036 2026-07-01 cs.CV 版本更新

SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision

SpectralSplats: 通过谱矩监督实现鲁棒的可微跟踪

Avigail Cohen Rimon, Amir Mann, Mirela Ben Chen, Or Litany

机构 * Technion - Israel Institute of Technology(以色列理工学院) NVIDIA(英伟达)

AI总结 提出SpectralSplats框架,通过将优化目标从空间域转移到频率域,利用全局复正弦特征(谱矩)构建全局吸引域,解决3D高斯泼溅跟踪中因严重错位导致的梯度消失问题,并设计频率退火策略实现从全局凸性到精确空间对齐的平滑过渡。

Comments Accepted to ECCV 2026. Project page: https://avigailco.github.io/SpectralSplats/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23297 2026-07-01 cs.CV cs.LG eess.IV 版本更新

Drop-In Perceptual Optimization for 3D Gaussian Splatting

3D高斯溅射的即插即用感知优化

Ezgi Ozyilkan, Zhiqi Chen, Oren Rippel, Jona Ballé, Kedar Tatwawadi

机构 * Apple(苹果公司) Tandon School of Engineering, New York University(纽约大学坦登工程学院)

AI总结 针对3DGS依赖像素级损失导致模糊的问题,提出正则化Wasserstein损失WD-R,通过大规模人类主观实验验证其在纹理恢复和感知指标上的优势,并推广到多种框架和场景压缩任务。

Comments Accepted as a conference paper at ECCV'26. Project page: https://apple.github.io/ml-perceptual-3dgs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13402 2026-07-01 cs.CV cs.LG 版本更新

Event-Driven Video Generation

事件驱动视频生成

Chika Maduabuchi, Jindong Wang

机构 * William & Mary(威廉与玛丽学院)

AI总结 提出事件驱动视频生成(EVD),通过轻量级头部预测令牌级事件活动,并利用事件门控采样在交互区域集中更新,以修正对象交互错误,提升状态持久性、空间准确性和接触稳定性。

Comments Accepted to ECCV 2026. Project webpage: https://evd-project-website.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16250 2026-07-01 cs.CV cs.AI 版本更新

Visual Prompt Discovery via Semantic Exploration

通过语义探索发现视觉提示

Jaechang Kim, Yotaro Shimose, Zhao Wang, Kuang-Da Wang, Jungseul Ok, Shingo Takamatsu

机构 * Sony Group Corporation(索尼集团公司) Pohang University of Science and Technology(浦项科技大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 提出SEVEX算法,通过抽象思想空间和语义反馈自动探索任务级视觉提示,提升LVLM图像感知能力。

Comments Accepted to ECCV 2026, project page: https://jaechang.dev/projects/SEVEX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18242 2026-07-01 cs.CV 版本更新

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA:学习规划与验证以实现自我中心视频推理

Yogesh Kulkarni, Pooyan Fazli

AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22265 2026-07-01 cs.LG cs.CV 版本更新

Entropy-Controlled Flow Matching

熵控流匹配

Chika Maduabuchi

机构 * William & Mary(威廉与玛丽学院)

AI总结 提出熵控流匹配(ECFM),通过约束连续方程路径的全局熵率,避免低熵瓶颈导致的语义模式丢失,并证明其与薛定谔桥的联系及最优传输收敛性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03510 2026-07-01 cs.CV 版本更新

G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation

G2P:面向边界感知3D分割的高斯到点属性对齐

Hojun Song, Chae-yeong Song, Jeong-hun Hong, Chaewon Moon, Soo Ye Kim, Yiyi Liao, Jaehyup Lee, Sang-hyo Park

机构 * Kyungpook National University(庆北国立大学) Korea Electronics Technology Institute(韩国电子技术研究院) Adobe Research(Adobe研究院) Zhejiang University(浙江大学)

AI总结 提出G2P方法,通过将3D高斯泼溅的属性(如不透明度和尺度)传递到点云,解决几何特征无法区分外观相似物体的问题,实现边界感知的3D分割。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21291 2026-07-01 cs.CV 版本更新

Gaussian Belief Propagation Network for Depth Completion

高斯置信传播网络用于深度补全

Jie Tang, Pingping Xie, Jian Li, Ping Tan

机构 * National University of Defense Technology(国防科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出高斯置信传播网络(GBPN),融合深度学习与概率图模型,通过动态构建马尔可夫随机场并利用高斯置信传播推断,实现高稀疏度下的鲁棒深度补全。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16959 2026-07-01 cs.LG cs.AI cs.NE stat.ML 版本更新

Graph Coloring for Multi-Task Learning

多任务学习的图着色方法

Santosh Patapati, Ian Noronha

机构 * Stony Brook University AI Innovation Institute(石溪大学人工智能创新研究所) Purdue University(普渡大学)

AI总结 提出SON-GOKU调度器,通过构建梯度干扰图并应用贪心图着色将任务分组,每步仅激活一组任务,减少梯度干扰,提升多任务学习性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04390 2026-07-01 cs.CV cs.AI 版本更新

FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring

FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊

Geunhyuk Youk, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。

Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20935 2026-07-01 cs.CV 版本更新

ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation

ISAC:无需训练的实例到语义注意力控制用于多实例生成

Sanghyun Jo, Wooyeol Lee, Ziseok Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19778 2026-07-01 cs.CV 版本更新

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer

相位对齐的混合分辨率扩散Transformer旋转位置编码

Haoyu Wu, Jingyi Xu, Qiaomu Miao, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。

Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18775 2026-07-01 cs.CV cs.AI 版本更新

Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise

重新思考基于扩散的虚拟试穿中的服装条件:解耦,而非去噪

Kihyun Na, Jinyoung Choi, Injung Kim

机构 * Handong Global University(韩东国际大学)

AI总结 针对扩散虚拟试穿中双UNet结构参数多、空间拼接全微调失效的问题,通过可视化研究揭示服装条件必须与去噪过程解耦,提出DeCo-VTON模型,以单网络架构达到双UNet水平且成本减半。

Comments Accepted at ECCV 2026. 28 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20995 2026-07-01 cs.CV cs.LG cs.SD eess.AS 版本更新

Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

逐步视频到音频合成:通过负音频引导

Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony AI, Tokyo, Japan(索尼人工智能(东京,日本)) Sony Group Corporation, Tokyo, Japan(索尼集团公司(东京,日本))

AI总结 提出逐步视频到音频生成方法,通过负音频引导避免重复生成,增强声音分离性和最终音频质量,优于现有基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25682 2026-07-01 cs.CV 版本更新

Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples

少样本合成图像溯源:有限样本下识别未见生成器

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22476 2026-07-01 cs.CV 版本更新

Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA

多通道不确定性加权分数匹配用于医学UDA中的条件扩散

Chen Li, Meilong Xu, Xiaoling Hu, Weimin Lyu, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院与哈佛医学院)

AI总结 提出UPDiff-UDA框架,通过不确定性加权的分数匹配聚合多通道伪标签,结合贝塞尔曲线适应,提升跨模态医学图像分割性能。

Comments 28 pages, 7 figures. Accepted by ECCV'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02798 2026-07-01 cs.CV eess.IV physics.optics 版本更新

Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion

无滤波器快照高光谱成像引导补丁扩散

Dean Hazineh, Luca Sacchi, Davide Cassara, Federico Capasso, Todd Zickler

机构 * Harvard University(哈佛大学)

AI总结 提出使用条件去噪扩散模型,通过小补丁移位不变操作和光学点扩散函数物理一致性引导,从单衍射透镜和滤光片全色传感器捕获的灰度快照中重建高光谱图像。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏