arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 325
2603.14965 2026-07-01 cs.CV 版本更新

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18242 2026-07-01 cs.CV 版本更新

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA:学习规划与验证以实现自我中心视频推理

Yogesh Kulkarni, Pooyan Fazli

AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22265 2026-07-01 cs.LG cs.CV 版本更新

Entropy-Controlled Flow Matching

熵控流匹配

Chika Maduabuchi

机构 * William & Mary(威廉与玛丽学院)

AI总结 提出熵控流匹配(ECFM),通过约束连续方程路径的全局熵率,避免低熵瓶颈导致的语义模式丢失,并证明其与薛定谔桥的联系及最优传输收敛性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03510 2026-07-01 cs.CV 版本更新

G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation

G2P:面向边界感知3D分割的高斯到点属性对齐

Hojun Song, Chae-yeong Song, Jeong-hun Hong, Chaewon Moon, Soo Ye Kim, Yiyi Liao, Jaehyup Lee, Sang-hyo Park

机构 * Kyungpook National University(庆北国立大学) Korea Electronics Technology Institute(韩国电子技术研究院) Adobe Research(Adobe研究院) Zhejiang University(浙江大学)

AI总结 提出G2P方法,通过将3D高斯泼溅的属性(如不透明度和尺度)传递到点云,解决几何特征无法区分外观相似物体的问题,实现边界感知的3D分割。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21291 2026-07-01 cs.CV 版本更新

Gaussian Belief Propagation Network for Depth Completion

高斯置信传播网络用于深度补全

Jie Tang, Pingping Xie, Jian Li, Ping Tan

机构 * National University of Defense Technology(国防科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出高斯置信传播网络(GBPN),融合深度学习与概率图模型,通过动态构建马尔可夫随机场并利用高斯置信传播推断,实现高稀疏度下的鲁棒深度补全。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16959 2026-07-01 cs.LG cs.AI cs.NE stat.ML 版本更新

Graph Coloring for Multi-Task Learning

多任务学习的图着色方法

Santosh Patapati, Ian Noronha

机构 * Stony Brook University AI Innovation Institute(石溪大学人工智能创新研究所) Purdue University(普渡大学)

AI总结 提出SON-GOKU调度器,通过构建梯度干扰图并应用贪心图着色将任务分组,每步仅激活一组任务,减少梯度干扰,提升多任务学习性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04390 2026-07-01 cs.CV cs.AI 版本更新

FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring

FMA-Net++:运动与曝光感知的联合视频超分辨率与去模糊

Geunhyuk Youk, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

AI总结 提出非循环序列级框架FMA-Net++,通过层次细化双向聚合块实现并行处理与长时域建模,引入曝光时间感知调制层处理曝光依赖模糊,在合成数据上训练达到SOTA性能。

Comments Accepted to ECCV 2026. Project Page: https://kaist-viclab.github.io/fmanetpp_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20935 2026-07-01 cs.CV 版本更新

ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation

ISAC:无需训练的实例到语义注意力控制用于多实例生成

Sanghyun Jo, Wooyeol Lee, Ziseok Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19778 2026-07-01 cs.CV 版本更新

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer

相位对齐的混合分辨率扩散Transformer旋转位置编码

Haoyu Wu, Jingyi Xu, Qiaomu Miao, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。

Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18775 2026-07-01 cs.CV cs.AI 版本更新

Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise

重新思考基于扩散的虚拟试穿中的服装条件:解耦,而非去噪

Kihyun Na, Jinyoung Choi, Injung Kim

机构 * Handong Global University(韩东国际大学)

AI总结 针对扩散虚拟试穿中双UNet结构参数多、空间拼接全微调失效的问题,通过可视化研究揭示服装条件必须与去噪过程解耦,提出DeCo-VTON模型,以单网络架构达到双UNet水平且成本减半。

Comments Accepted at ECCV 2026. 28 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20995 2026-07-01 cs.CV cs.LG cs.SD eess.AS 版本更新

Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

逐步视频到音频合成:通过负音频引导

Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony AI, Tokyo, Japan(索尼人工智能(东京,日本)) Sony Group Corporation, Tokyo, Japan(索尼集团公司(东京,日本))

AI总结 提出逐步视频到音频生成方法,通过负音频引导避免重复生成,增强声音分离性和最终音频质量,优于现有基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25682 2026-07-01 cs.CV 版本更新

Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples

少样本合成图像溯源:有限样本下识别未见生成器

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22476 2026-07-01 cs.CV 版本更新

Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA

多通道不确定性加权分数匹配用于医学UDA中的条件扩散

Chen Li, Meilong Xu, Xiaoling Hu, Weimin Lyu, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院与哈佛医学院)

AI总结 提出UPDiff-UDA框架,通过不确定性加权的分数匹配聚合多通道伪标签,结合贝塞尔曲线适应,提升跨模态医学图像分割性能。

Comments 28 pages, 7 figures. Accepted by ECCV'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02798 2026-07-01 cs.CV eess.IV physics.optics 版本更新

Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion

无滤波器快照高光谱成像引导补丁扩散

Dean Hazineh, Luca Sacchi, Davide Cassara, Federico Capasso, Todd Zickler

机构 * Harvard University(哈佛大学)

AI总结 提出使用条件去噪扩散模型,通过小补丁移位不变操作和光学点扩散函数物理一致性引导,从单衍射透镜和滤光片全色传感器捕获的灰度快照中重建高光谱图像。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05092 2026-06-29 cs.RO cs.AI cs.CV 版本更新

Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout

Driver-WM:以驾驶员为中心的交通条件潜在世界模型用于车内动态展开

Haozhuang Chi, Daosheng Qiu, Hao Su, Haochen Liu, Zirui Li, Haoruo Zhang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Hubei University, Wuhan, China(湖北大学,武汉,中国) Osaka University, Osaka, Japan(大阪大学,大阪,日本)

AI总结 提出Driver-WM,一种以驾驶员为中心的潜在世界模型,通过门控因果注入机制在紧凑潜在空间中联合预测驾驶员物理运动、行为和情感,实现外部交通到内部动态的因果展开。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026). This version includes the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20328 2026-06-29 cs.CV 版本更新

HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

混合潜在推理与解耦策略优化

Tao Cheng, Shi-Zhe Chen, Hao Zhang, Yixin Qin, Jinwen Luo, Zheng Wei

机构 * Tencent PCG(腾讯PCG) Tencent CSIG(腾讯CSIG)

AI总结 本文提出HyLaR框架,通过结合离散文本生成与连续视觉潜在表示,提升多模态大语言模型在细粒度感知和通用多模态理解中的性能。

Comments Accepted to ECCV 2026

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25168 2026-06-29 cs.CV 版本更新

ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis

ET-SAM: 面向统一场景文本检测与布局分析的高效SAM点提示预测

Xike Zhang, Maoyuan Ye, Juhua Liu, Bo Du

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence(计算机科学学院、多媒体软件国家工程研究中心、人工智能研究院) Hubei Key Laboratory of Multimedia(湖北多媒体重点实验室) Network Communication Engineering, Wuhan University, Hubei, China(网络通信工程、武汉大学、湖北、中国)

AI总结 提出ET-SAM框架,通过轻量级点解码器生成单词热图以预测少量前景点,结合联合训练策略利用异构文本级标注,实现约3倍推理加速并在多个数据集上提升性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19466 2026-06-29 cs.CV 版本更新

ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

ProactiveBench: 多模态大语言模型主动性的基准测试

Thomas De Min, Subhankar Roy, Stéphane Lathuilière, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) University of Bergamo(贝拉米奥大学) Inria Grenoble(格勒诺布尔研究所) Bruno Kessler Foundation(布鲁诺·凯斯勒基金会)

AI总结 提出ProactiveBench基准,评估多模态大语言模型在遮挡识别等任务中请求用户干预的主动性,发现模型普遍缺乏主动性且与能力无关,但可通过强化学习微调习得。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05663 2026-06-29 cs.CV 版本更新

Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding

保持证据链:面向视频时序定位的无训练令牌剪枝的语义证据分配

Jiaqi Li, Shuntian Zheng, Yixian Shen, Jia-Hong Huang, Xiaoman Lu, Minzhe Ni, Yu Guan

机构 * University of Warwick(沃里克大学) University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊人工智能研究院)

AI总结 提出SemVID无训练剪枝框架,通过证据保留和连接强度原则选择对象、运动和上下文令牌,在仅保留12.5%视觉令牌时保持95.4% mIoU,实现5.8倍预填充加速。

Comments Project at https://jiaqili404.github.io/SemVID

Journal ref The 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05233 2026-06-29 cs.RO 版本更新

MobileManiBench: Simplifying Model Verification for Mobile Manipulation

MobileManiBench:简化移动操作模型验证

Wenbo Wang, Fangyun Wei, QiXiu Li, Xi Chen, Yaobo Liang, Chang Xu, Jiaolong Yang, Baining Guo

机构 * Microsoft Research Asia(微软亚洲研究院) University of Sydney(悉尼大学) Tsinghua University(清华大学)

AI总结 提出仿真优先框架MobileManiBench,基于NVIDIA Isaac Sim和强化学习自动生成多样化移动操作轨迹,包含300K条轨迹,用于验证VLA模型在真实部署前的性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18197 2026-06-29 cs.AI 版本更新

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

GAIA: 用于训练GUI测试时缩放评论模型的数据飞轮系统

Shaokang Wang, Pei Fu, Ruoceng Zhang, Shaojie Zhang, Xiuwen Xi, Jiahui Yang, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

AI总结 提出GAIA数据飞轮系统,通过训练直觉评论模型(ICM)评估GUI代理动作的正确性,利用正负样本迭代提升代理测试时性能,实验表明该方法能持续改进多种模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20196 2026-06-29 cs.AI 版本更新

Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

面向选择性多模态大语言模型遗忘的良性记忆遗忘

Zhen Zeng, Leijiang Gu, Zhangling Duan, Feng Li, Cees G. M. Snoek, Meng Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) University of Amsterdam(阿姆斯特丹大学)

AI总结 针对多模态大语言模型隐私泄露问题,提出S-MLLMUn Bench基准和SMFA框架,实现精确删除敏感知识同时保持模型基础能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03117 2026-06-29 cs.CV cs.SD 版本更新

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

通过高级模态条件与交互驯服文本到发声视频生成

Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, XiaoJiang Liu, Ruihua Song, Meng Cao

机构 * Renmin University of China(中国人民大学) Apple(苹果公司)

AI总结 提出分层视觉基础字幕框架(HVGC)生成解耦的视频和音频字幕,并基于此引入双塔扩散变换器BridgeDiT,通过双交叉注意力机制实现对称双向信息交互,在三个基准数据集上达到最先进结果。

Comments The 19th European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03704 2026-06-29 cs.CV 版本更新

QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

QuantV2X:一种用于协同感知的全量化多智能体系统

Seth Z. Zhao, Huizhi Zhang, Zhaowei Li, Juntong Peng, Anthony Chui, Zewei Zhou, Zonglin Meng, Hao Xiang, Zhiyu Huang, Fujia Wang, Ran Tian, Chenfeng Xu, Bolei Zhou, Jiaqi Ma

机构 * UCLA(加州大学洛杉矶分校) UW-Madison(威斯康星大学麦迪逊分校) NCSU(北卡罗来纳州立大学) Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出首个全量化多智能体系统QuantV2X,通过端到端量化策略同时降低计算负载和传输带宽,在低比特约束下达到与全精度相当的精度,并显著降低延迟、提升mAP30。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07460 2026-06-29 cs.CV cs.CL 版本更新

SIGNER: Temporally Grounded Sign Language Generation via Time-Resolved Conditioning

SIGNER: 通过时间分辨条件实现时间对齐的手语生成

Taeryung Lee, Hyeongjin Nam, Gyeongsik Moon, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(首尔大学电子与计算机工程系及ASRI) Dept. of CSE, Korea University(高丽大学计算机科学与工程系)

AI总结 提出SIGNER框架,通过时间分辨条件(时间-词汇条件与局部时间融合)确保手语生成中词汇顺序正确和语义准确,在Phoenix-2014T和CSL-Daily上达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11755 2026-06-26 cs.CV 版本更新

Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints

可控的第一人称视角视频生成:基于遮挡感知的稀疏3D手部关节点

Chenyangguang Zhang, Botao Ye, Boqi Chen, Alexandros Delitzas, Fangjinhua Wang, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Microsoft(微软)

AI总结 提出利用稀疏3D手部关节点作为显式控制信号,通过遮挡感知特征提取和3D加权机制,实现高保真、3D一致的第一人称手物交互视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01958 2026-06-26 cs.CV 版本更新

MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction

MAVFusion: 基于运动感知稀疏交互的高效红外与可见光视频融合

Xilai Li, Weijun Jiang, Xiaosong Li, Yang Liu, Hongbin Wang, Tao Ye, Huafeng Li, Haishu Tan

机构 * Foshan University(佛山大学) Kunming University of Science and Technology(昆明理工大学) China University of Mining and Technology(中国矿业大学)

AI总结 提出MAVFusion端到端视频融合框架,通过运动感知稀疏交互机制,利用光流识别动态区域并分配跨模态注意力,对静态区域使用轻量弱交互模块,在保持时间一致性和细节的同时加速推理,达到14.16 FPS。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10446 2026-06-26 cs.CV 版本更新

SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning

SignSparK: 通过稀疏关键帧学习实现高效多语言手语生成

Jianhe Low, Alexandre Symeonidis-Herzig, Maksym Ivashechkin, Ozge Mercanoglu Sincan, Richard Bowden

机构 * CVSSP, University of Surrey, United Kingdom(CVSSP,萨里大学,英国)

AI总结 提出SignSparK框架,利用稀疏关键帧和条件流匹配生成流畅3D手语序列,缓解回归到均值问题,支持多语言和关键帧到姿态编辑,实现最先进性能。

Comments Accepted at European Conference on Computer Vision (ECCV) 2026. Project page available: https://cogvis-cvssp.github.io/papers/signspark/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18254 2026-06-26 cs.CV 版本更新

UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles

UniFlow: 自动驾驶车辆的零样本激光雷达场景流

Siyi Li, Qingwen Zhang, Ishan Khatri, Kyle Vedder, Eric Eaton, Deva Ramanan, Neehar Peri

AI总结 提出UniFlow,一种跨多数据集训练的激光雷达场景流前馈模型,无需架构修改即可泛化到未见传感器,在Waymo和nuScenes上分别提升5.1%和35.2%,并在TruckScenes和AEVAScenes上超越先前数据集专用模型30.1%和22.5%。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://lisiyi777.github.io/UniFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏