arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2606.31981 2026-07-01 cs.CV cs.AI 新提交

LUNA: Learning Universal 3D Human Animation Beyond Skinning

LUNA: 超越蒙皮的学习通用3D人体动画

Peng Li, Rawal Khirodkar, Junxuan Li, Yuan Dong, Chen Cao, Yuan Liu, Wenhan Luo, Yike Guo, Shunsuke Saito

机构 * The Hong Kong University of Science and Technology(香港科技大学) Codec Avatars Lab, Meta(Meta编解码虚拟形象实验室)

AI总结 提出无LBS的通用神经动画模型LUNA,通过Transformer运动回归器将多种2D控制映射为3D高斯变形,结合混合监督实现零样本跨身份泛化。

Comments ECCV 2026, Project page: https://penghtyx.github.io/LUNA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31895 2026-07-01 cs.CV 新提交

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31834 2026-07-01 cs.CV cs.AI 新提交

Real-Time Source-Free Object Detection

实时无源目标检测

Sairam VCR, Varun Gopal, Poornima Jain, Vineeth N Balasubramanian, Muhammad Haris Khan

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31830 2026-07-01 cs.CV cs.RO 新提交

PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving

PriorEye: 用于端到端自动驾驶的地理空间视觉先验

Kyuhwan Yeon, Benjamin Ramtoula, Daniele De Martini

AI总结 提出地理空间视觉先验和双记忆架构,增强端到端自动驾驶的预见性和鲁棒性,在NAVSIM-v2上持续提升性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31814 2026-07-01 cs.CV 新提交

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior

基于几何先验的自回归模型生成车道拓扑推理

Jiahui Fu, Zehao Huang, Han Li, Naiyan Wang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 提出TopoGPT生成式框架,通过自回归序列建模学习车道图结构的几何先验,解决现有方法端点不一致和遮挡导致图不完整的问题,在OpenLane-V2上提升6.4/11.6个点。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31811 2026-07-01 cs.CV 新提交

MuSViT: A Foundation Vision Model for Sheet Music Representation

MuSViT: 一种用于乐谱表示的基础视觉模型

Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez, Juan C. Martinez-Sevilla, Francisco J. Castellanos, María Alfaro-Contreras, Jorge Calvo-Zaragoza

机构 * Pattern Recognition and Artificial Intelligence Group, University of Alicante, Spain(西班牙阿利坎特大学模式识别与人工智能组)

AI总结 提出MuSViT,首个基于ViT的乐谱基础视觉模型,通过掩码自编码器预训练于970万页IMSLP数据,采用两阶段课程学习,在下游任务中优于通用视觉编码器,并直接编码符号音乐结构。

Comments Accepted at European Conference on Computer Vision (ECCV'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31764 2026-07-01 cs.GR cs.CV 新提交

NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics

NURBS Splatting:统一的可微分矢量图形渲染框架

Jingye Qiu, Shizhe Zhou

机构 * Hunan University(湖南大学)

AI总结 提出NURBS Splatting框架,将平面有理曲线表示为连续高斯场,通过沿曲线参数域和封闭区域内部采样高斯函数,将渲染重构成具有稳定梯度的平滑累积过程,支持长样条、有理权重、非均匀节点和封闭区域填充,在书法重建、矢量化框架和长样条图像抽象中表现更优。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31734 2026-07-01 cs.CV 新提交

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31695 2026-07-01 cs.CV 新提交

Intrinsically Stable Spiking Neural Networks: Overcoming the Performance Barrier in the Absence of Batch Normalization

内在稳定的脉冲神经网络:克服无批归一化下的性能障碍

Ruichen Ma, Xiaoyang Zhang, Jian Bai, Guanchao Qiao, Liwei Meng, Ning Ning, Yang Liu, Shaogang Hu

机构 * University of Electronic Science and Technology of China (UESTC)(电子科技大学) Beijing Institute of Remote-Sensing Equipment(北京遥感设备研究所) Shenzhen Institute for Advanced Study, UESTC(电子科技大学深圳高等研究院)

AI总结 针对无批归一化SNN性能严重下降的问题,提出内在稳定SNN(IS-SNN)架构,通过拓扑感知权重标准化和修改残差连接消除激活归一化层,实现与动态BN相当甚至更优的性能,并大幅降低硬件资源消耗。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31683 2026-07-01 cs.CV cs.AI cs.LG 新提交

Histogram-constrained Image Generation

直方图约束的图像生成

Haoming Liu, Yuanhe Guo, Yijia Cao, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

AI总结 提出直方图约束图像生成(HIG)框架,通过最优传输理论在扩散模型中精确施加用户指定的分布约束,实现全局与局部之间的中间粒度控制,并展示其在颜色/潜在直方图约束生成和高容量信息嵌入中的应用。

Comments Accepted to ECCV 2026; 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31680 2026-07-01 cs.CV 新提交

ShellMaker: Language-Guided Exterior Completion under Structural Constraints

ShellMaker: 结构约束下的语言引导外部补全

Ruiqi Xu, Daniel Aliaga

机构 * Purdue University(普渡大学)

AI总结 提出ShellMaker框架,在保持建筑足迹、墙体几何和开口语义固定约束下,通过参数化屋顶生成、LLM部件提示优化、联合材质检索和几何感知组装,实现语言引导的建筑外部补全。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31664 2026-07-01 cs.CV cs.AI 新提交

Sparsity-Inducing Divergence Losses for Biometric Verification

用于生物特征验证的稀疏诱导散度损失

Dimitrios Koutsianos, Ladislav Mošner, Yannis Panagakis, Themos Stafylakis

机构 * Athens University of Economics and Business(雅典经济与商业大学) Archimedes/Athena Research Center(阿基米德/雅典娜研究中心) Brno University of Technology(布尔诺理工大学) Omilia National and Kapodistrian University of Athens(雅典大学)

AI总结 提出Q-Margin损失,通过将边际惩罚编码到参考测度中,在α-散度框架下实现稀疏性与判别性嵌入,在人脸和说话人验证中优于ArcFace和CosFace。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31471 2026-07-01 cs.CV 新提交

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

边建图边思考:用于增量式3D场景图的异步视觉-语言智能体

Deniz Bickici, Michael Pabst, Shohei Mori, Dieter Schmalstieg

机构 * University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨技术大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院)

AI总结 提出异步架构,轻量在线建图与重型语义精化并发运行,通过语义闭环、属性标注和空间关系推导,实现探索时可查询且语义渐增的3D场景图,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026. Project page: https://denizbickici.github.io/thinkgraphs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31451 2026-07-01 cs.RO cs.AI 新提交

UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation

UniTac: 一种用于跨传感器触觉理解与生成的统一多模态模型

Jiahang Tu, Fengyu Yang, Chenyang Ma, Xihang Yu, Ziyao Zeng, Shaokai Wu, Hanbin Zhao, Zhi Tao, Chao Zhang, Hui Qian, Alex Wong

机构 * Zhejiang University(浙江大学) Yale University(耶鲁大学) University of Oxford(牛津大学) MIT(麻省理工学院) Shanghai Jiaotong University(上海交通大学) UNIX AI

AI总结 提出UniTac,首个统一多模态模型,通过双级表示编码传感器和物体属性,实现触觉理解与生成,在跨传感器任务上达到最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31382 2026-07-01 cs.RO 新提交

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。

Comments 22 pages, 3 figures, ECCV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31323 2026-07-01 cs.CV 新提交

Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation

基于扩散模型的加速似然最大化用于多样化内容生成

Hyunsoo Lee, Inwoo Hwang, Young Min Kim

机构 * Seoul National University(首尔国立大学)

AI总结 提出加速似然最大化(ALM)方法,通过直接优化未观测区域并引入加速策略,实现高效、全局一致的内容生成,在多种任务中超越现有方法。

Comments ECCV 2026. Project website: http://hleephilip.github.io/ALM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31278 2026-07-01 cs.CV 新提交

Editing Everything Everywhere All at Once

一次性编辑所有内容

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31270 2026-07-01 cs.CV cs.AI cs.CL cs.CY cs.LG 新提交

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

从失败中学习:计算机使用代理的推理时自我改进

Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt, Serena Yeung-Levy, Yuhui Zhang

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。

Comments Published in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31242 2026-07-01 cs.CV 新提交

UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup Tables

UHD-MFF:通过可学习查找表打破多焦点超高清图像融合的障碍

Yibing Zhang, Xunpeng Yi, Qinglong Yan, Yeda Wang, Han Xu, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院) School of Automation, Southeast University(东南大学自动化学院)

AI总结 针对超高清多焦点图像融合中的数据、模型和部署三大障碍,提出首个大规模超高清数据集UHD-MFF和基于可学习查找表的UMF-LUT框架,实现实时4K融合。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31219 2026-07-01 cs.CV 新提交

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene: 具有C-V2X通信特性的多模态协作自主基准

Bo Wu, Ruoshen Mo, Justin Yue, Yanyu Zhang, Janice Nguyen, Guoyuan Wu, Amit Roy-Chowdhury, Matthew J. Barth, Hang Qiu

机构 * University of California, Riverside(加州大学河滨分校)

AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。

Comments Accepted to ECCV 2026. 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31201 2026-07-01 cs.CV 新提交

ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling

ExPLoRe: 面向多目标掩码图像建模的专家级补丁损失路由

Konstantinos Georgiou, Maofeng Tang, Hairong Qi

机构 * Min H. Kao Department of Electrical Engineering and Computer Science, The University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校电气工程与计算机科学系高民浩系)

AI总结 提出ExPLoRe方法,利用软混合专家(MoE)的调度权重作为逐补丁损失系数,通过损失耦合实现内容相关的目标加权,在ImageNet-1K上提升线性探测和微调精度,并开发适应策略改善下游迁移。

Comments Accepted to ECCV 2026. Main paper 15 pages, 3 figures; supplementary material included as appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31172 2026-07-01 cs.CV 新提交

HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection

HSDF-Lane: 高度对齐符号距离场与语义车道先验用于3D车道检测

Jiyong Boo, Byeongin Joung, Hyemin Yang, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 提出HSDF-Lane,通过高度对齐符号距离场隐式建模道路表面,结合可微渲染生成准确高度图和表面对齐特征,并引入车道感知语义位置编码注入车道先验,在OpenLane基准上实现3D车道检测和高度图估计的最优性能。

Comments ECCV 2026, Project page: https://jiyongboo.github.io/HSDF-Lane-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31127 2026-07-01 cs.CV cs.AI cs.LG 新提交

SkillSpotter: Pose-Aware Multi-View Skilled Action Detection and Grading in Ego-Exo Videos

SkillSpotter: 姿态感知的多视角熟练动作检测与分级在自我-外部视频中

Björn Braun, Christian Holz

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

AI总结 针对自我-外部视频中熟练动作检测与分级任务,提出SkillSpotter,通过自适应时间抑制、门控3D身体姿态融合和双向跨视角注意力模块,显著提升检测与分级性能。

Comments Accepted for publication at European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31125 2026-07-01 cs.CV 新提交

WildProp: Visual Estimation of Wildlife Body Proportions at Scale

WildProp: 大规模野生动物身体比例视觉估计

Mustafa Chasmai, Aaron Sun, Subhransu Maji

AI总结 提出WildProp,一种无需训练的框架,通过检索驱动的对应关系从大规模非约束图像中估计野生动物身体比例分布,无需逐物种训练,在鸟类和两栖动物数据集上中位相对误差10-20%。

Comments Accepted to ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31100 2026-07-01 cs.CV 新提交

TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis

TaxoMIL:用于层次化全切片图像分析的分层约束学习

Chaeyeon Lee, Khang Nguyen Quoc, Jinsol Song, Yosep Chong, Kwangil Yim, Jin Tae Kwak

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)

AI总结 提出TaxoMIL框架,将WSI诊断重构为多粒度文本生成任务,通过双头Transformer解码器和分类学引导目标,实现层次感知的准确预测。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏