arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 5171 篇
2609.37907 2026-09-30 cs.AI cs.CV 新提交

Pixels to Keys: Exploring Spatial and Motion Cues in Gameplay Inverse Dynamics

从像素到按键:探索游戏逆向动力学中的空间与运动线索

Abhishek Pillai, Ekta Prashnani, Joohwan Kim, Iuri Frosio

机构 * NVIDIA(英伟达)

AI总结 本研究在数据受限场景下探索游戏逆向动力学模型,分析空间运动特征、架构与训练目标的影响,发现架构和运动流提取关键,并揭示不平衡指标局限及动作歧义需显式建模。

Comments Accepted at the Workshop on Multimodal Digital Agents (ECCV 2026): this https URL (https://mda-workshop.allen.ai/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36644 2026-09-30 cs.CV 新提交

OCA: ODE-Driven Cross-Attention for Image-to-Point-Cloud Registration

OCA:基于ODE驱动的交叉注意力用于图像到点云配准

Pei An, Jiaqi Yang, Yulong Wang, Siwen Quan, Liangliang Nan

机构 * Huazhong University of Science and Technology(华中科技大学) ; Northwestern Polytechnical University(西北工业大学) ; Huazhong Agricultural University(华中农业大学) ; Delft University of Technology(代尔夫特理工大学)

AI总结 针对图像到点云配准中交叉注意力模糊性问题,提出ODE驱动的交叉注意力模块(OCA),通过常微分方程建模特征交互,集成至五个基线,在四个数据集上配准召回率提升最高达15%。

Comments Accepted to ECCV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36442 2026-09-30 cs.CV cs.AI 新提交

Online Versatile Incremental Learning: Towards Class and Domain-Agnostic Adaptation at Any Time

在线多功能增量学习:面向任意时间的类别与领域无关自适应

Jae-Ho Lee, Min-Yeong Park, Jun-Yeong Moon, Jung Uk Kim, Gyeong-Moon Park

机构 * Korea University(高丽大学) ; Kyung Hee University(庆熙大学)

AI总结 针对类别和领域同时在线演变的持续学习难题,提出TopFlow框架,通过领域无关流匹配和全局拓扑保持机制,在无明确边界场景下实现最先进性能。

Comments 17 pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36440 2026-09-30 cs.CV 新提交

DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing

DARE 缓解幻觉:双路径自回归感知编辑

Jae-Ho Lee, Jeong-Eun Lee, Gyeong-Moon Park

机构 * Korea University(高丽大学)

AI总结 针对大型视觉语言模型中的对象幻觉问题,提出融合文本与图像双路径及自回归感知信号的DARE编辑框架,有效减少幻觉并保持多模态性能。

Comments 19 pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.32013 2026-09-30 cs.CV cs.AI 版本更新

TriO: Tri-Modal Unsupervised Occupancy World Model for Anything Perception

TriO:面向万物感知的三模态无监督占用世界模型

Quinlan Sykora, Sourav Biswas, Christopher Diehl, Andrew Cunningham, Thomas Gilles, Raquel Urtasun

AI总结 TriO利用相机、激光雷达和雷达三种模态进行无监督自监督,预测4D占用、障碍物分割、光流和激光雷达,实现开放集长尾物体分割,并在多个3D/4D任务上达到最先进水平。

Comments Published at ECCV 2026, 49 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31764 2026-09-30 cs.GR cs.CV 版本更新

NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics

NURBS Splatting:统一的可微分矢量图形渲染框架

Jingye Qiu, Shizhe Zhou

机构 * Hunan University(湖南大学)

AI总结 提出NURBS Splatting框架,将平面有理曲线表示为连续高斯场,通过沿曲线参数域和封闭区域内部采样高斯函数,将渲染重构成具有稳定梯度的平滑累积过程,支持长样条、有理权重、非均匀节点和封闭区域填充,在书法重建、矢量化框架和长样条图像抽象中表现更优。

Comments Accepted to ECCV 2026. Updated Fig. 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12041 2026-09-30 cs.CL 版本更新

POET: Preference Optimization for Enhanced Text-to-Image Generation

改进文本到图像生成:输入侧推理时缩放

Ruibo Chen, Jiacheng Pan, Heng Huang, Zhenheng Yang

机构 * TikTok ; University of Maryland, College Park(马里兰大学)

AI总结 提出基于LLM的提示重写框架,通过奖励系统和迭代DPO训练优化输入提示,无需监督数据,显著提升多种T2I模型的图像文本对齐与质量,并展现跨模型可迁移性和可扩展性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.35096 2026-09-29 cs.CV cs.LG 新提交

DF-CBM: Region-Aware Concept Bottleneck Models for Deepfake Detection

DF-CBM:用于深度伪造检测的区域感知概念瓶颈模型

Georgios Tsoumplekas, Vazgken Vanian, Alexandros Doumanoglou, Panos K. Papadopoulos, Yannis Spyridis, Dimitrios Zarpalas, Vasileios Argyriou

机构 * Kingston University London(伦敦金斯顿大学) ; Centre for Research and Technology Hellas (CERTH)(希腊研究与技术中心)

AI总结 提出DF-CBM,一种区域感知概念瓶颈模型,通过概念预测与掩蔽注意力实现可解释的深度伪造检测,优于概念基线并接近黑盒检测器性能。

Comments ECCV 2026 (AI4MFDD 2026 workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.34398 2026-09-29 cs.LG 新提交

GeoCFM: Positive-Only Conditional Flow Matching for Mineral Occurrence Sampling

GeoCFM:用于矿产赋存采样的仅正例条件流匹配

Moshe Eliasof, Eldad Haber

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) ; University of British Columbia(不列颠哥伦比亚大学)

AI总结 针对矿产发现中仅正例的稀疏监督问题,提出条件流匹配模型GeoCFM,学习赋存位置的条件分布,在合成与真实数据上优于基线并表征不确定性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.33582 2026-09-29 cs.CV 新提交

Fill2SR: Repurposing Inpainting Diffusion Transformers for Real-World Super-Resolution

Fill2SR:将修复扩散Transformer重新用于真实世界超分辨率

Xingfu Yi, Xiaoxue Yu

机构 * Zhejiang University(浙江大学)

AI总结 Fill2SR通过重利用掩码修复扩散Transformer实现真实世界超分辨率,无需额外空间分支,支持混合分辨率训练,在合成和真实基准上取得优异性能。

Comments ECCV 2026. 26 pages, 12 figures, including an 8-page appendix with additional visual results

Journal ref Computer Vision - ECCV 2026, Part XXIV, Lecture Notes in Computer Science, vol. 17024, pp. 441-457 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.33523 2026-09-29 cs.CV 新提交

In-Token Learning for High-Fidelity Image Restoration via Diffusion Transformers

In-Token Learning:基于扩散Transformer的高保真图像恢复

Xingfu Yi, Xiaoxue Yu

机构 * Zhejiang University(浙江大学) ; Independent Researcher(独立研究者)

AI总结 提出In-Token Learning框架,通过条件整流流匹配适配扩散Transformer,融合降质令牌与潜在令牌并采用直接低质量引导,在多个数据集上实现高保真图像恢复,含QHD推理与12K演示。

Comments Technical report, 25 pages, 12 figures. Preserves the earlier broader study underlying Fill2SR (ECCV 2026), including automatic colorization; Fill2SR subsequently developed the real-world super-resolution direction

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.33450 2026-09-29 cs.CV 新提交

Native Association: Confidence-Aware Human Perception in the Wild with a Foundation VLM

原生关联:基于基础视觉语言模型的野外置信度感知人类感知

Igal Dmitriev, Ofir Liba

机构 * WSC Sports(WSC体育公司(或WSC Sports,按原文保留))

AI总结 本研究提出原生关联方法,通过微调0.77B的Florence-2模型,以语法约束序列直接输出球员属性,消除身份互换,相比零样本API将错误关联降低4倍,并实现检测F1达0.95,支持置信度拒绝与缩放重读,表明增益源于结构而非权重。

Comments Accepted at the ECCV 2026 Workshop on Human-Centered Multimodal Intelligence in the Wild (HCMIW). 16 pages, 1 figure, 2 tables; supplementary material included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.32389 2026-09-29 cs.CV eess.IV 新提交

RefCompose: Multi-Reference Image Generation via LoRA-Conditioned Diffusion

RefCompose:基于LoRA条件扩散的多参考图像生成

Sai Sri Teja Kuppa, Parth Shinde, Priyadharsan Balaji S, Jinka Harshavardhan, Sriprabha Ramanarayanan

AI总结 RefCompose通过固定分辨率参考画布和双流LoRA适配器解耦布局与外观,实现恒定内存的多参考图像生成,在Dense Layout协议上优于现有方法。

Comments Accepted in ECCV 2026 Workshop on AI for Visual Arts

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31938 2026-09-29 cs.LG cs.PF 新提交

Cache-Aware Conv3D Lowering Across Embedded World-Model Decoders

缓存感知的Conv3D降级:跨嵌入式世界模型解码器

Jiaming Zhang, Wu Yang, Shuai Tao, Wulong Liu

AI总结 提出缓存感知的Conv3D降级为批处理Conv2D,在Jetson AGX Orin上加速VAE解码约7倍,降低生成延迟超2倍,无需修改模型。

Comments 16 pages, 1 figure, 6 tables. ECCV 2026 workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.27682 2026-09-29 cs.CV 版本更新

Gender Bias in Vision-Language In-Context Learning

视觉-语言上下文学习中的性别偏见

Tong Xiang, Yuta Nakashima, Noa Garcia

机构 * The University of Osaka(大阪大学)

AI总结 本研究提出VL-BICLE框架,系统评估六个大型视觉-语言模型在上下文学习中的性别偏见,发现性别化演示通过跨性别机制影响偏见,并用稳定扩散合成图像替换真实图像以有效去偏。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03018 2026-09-29 cs.CV cs.SD 版本更新

$C^3$ASD: Multi-Level Consistency-Driven Representation Learning for Robust Active Speaker Detection

$C^3$ASD:多层次一致性驱动的表示学习

Jin Hong, Jisoo Park, Junseok Kwon

机构 * Chung-Ang University(中央大学)

AI总结 研究视频中活跃说话者检测问题,提出$C^3$ASD框架,含嵌入级、序列级和预测级一致性约束,提升跨模态表示鲁棒性,在多种损坏下有显著改进。

Comments ECCV 2026

Journal ref Computer Vision - ECCV 2026, LNCS 17056, pp. 171-195, Springer (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21956 2026-09-29 cs.CV 版本更新

Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation

基于注意力先验引导知识蒸馏的增强去噪粗到细红外小目标检测

Houzhang Fang, Ruixuan Huang, Qiuhuan Chen, Xiaolin Wang, Yi Chang, Luxin Yan

机构 * Xidian University(西安电子科技大学) ; Huazhong University of Science and Technology(华中科技大学)

AI总结 提出一种粗到细的红外小目标检测框架ECFNet,通过粗阶段的区域二分类网络和去噪辅助训练抑制背景,细阶段的轻量检测器与注意力先验知识蒸馏提升精度,在三个数据集上优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10214 2026-09-29 cs.CV cs.GR 版本更新

Beyond Inpainting: Unleash 3D Understanding for Stable Camera-Controlled Video Generation

超越修复:释放3D理解以实现精确的相机控制视频生成

Dong-Yu Chen, Yixin Guo, Shuojin Yang, Tai-Jiang Mu, Shi-Min Hu

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(BNRist,计算机科学与技术系,清华大学)

AI总结 DepthDirector通过双流条件机制和LoRA适配器实现精确摄像机控制,提升视频生成的3D理解和视觉质量。

Comments ECCV 2026, Project page: https://eleanor6725.github.io/DepthDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09814 2026-09-29 cs.CV 版本更新

Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation

DynaIP: 动态图像提示适配器用于可扩展的零样本个性化文本到图像生成

Zhizhong Wang, Tianyi Chu, Zeyi Huang, Nanyang Wang, Kehan Li

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

AI总结 DynaIP通过动态解耦策略和层次特征融合模块,提升零样本个性化文本到图像生成的细粒度概念保真度与多主体扩展能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30795 2026-09-28 cs.CV 新提交

Motion Style Slider: Endpoint-Supervised Continuous Style Control for Human Motion Diffusion

运动风格滑块:面向人体运动扩散的端点监督连续风格控制

Chen-Chieh Liao, Yichen Peng, Yiyi Cai, Yûi Ono, Hiroki Hanaoka, Erwin Wu, Hideki Koike, Shuichi Kurabayashi

机构 * Institute of Science Tokyo(东京科学大学) ; Cygames, Inc.(Cygames 公司) ; The University of Tokyo(东京大学)

AI总结 提出运动风格滑块框架,通过端点监督在嵌入空间构建风格方向,实现无需中间真值的连续单调风格强度控制,兼容预训练扩散模型并支持异构数据集。

Journal ref Liao, CC. et al. (2026). Motion Style Slider: Endpoint-Supervised Continuous Style Control for Human Motion Diffusion. In ECCV 2026. Lecture Notes in Computer Science, vol 17026. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26342 2026-09-28 cs.LG cs.AI 版本更新

Geometry-Aware Hyperbolic Residual-Quantized Variational Autoencoders

几何感知的双曲残差量化

Alessio Colombo, Melika Ayoughi

机构 * Universiteit van Amsterdam(阿姆斯特丹大学)

AI总结 针对残差量化在欧几里得空间忽视层次结构的问题,提出几何感知双曲残差量化,通过前向聚合与后向梯度路由提升稳定性,在层次任务中优于双曲基线,但纯压缩仍以欧氏方法为佳。

Comments 14-page main paper (30 pages total with references and appendix), 3 figures, 8 tables. Accepted at the Beyond Euclidean Workshop, ECCV 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06436 2026-09-28 cs.CV cs.GR 版本更新

PLSR: Progressive and Localized Super-Resolution of 3D Objects via Localized Latent Voxel Diffusion

PLSR:通过局部化潜在体素扩散实现3D物体的渐进式与局部化超分辨率

Yuxin Liu, Minshan Xie, Jiawen Liang, Runsong Zhu, Chi-Wing Fu, Tien-Tsin Wong

机构 * The Chinese University of Hong Kong(香港中文大学) ; Guangdong University of Technology(广东工业大学) ; City University of Hong Kong(香港城市大学) ; Monash University(莫纳什大学)

AI总结 针对现有3D生成模型分辨率受限的问题,提出PLSR框架,通过分解局部子任务与流式生成器微调,实现高效高细节的3D超分辨率生成。

Comments 34 pages, 15 figures, including supplementary material. ECCV 2026. Additional evaluation data are provided as ancillary files

Journal ref Computer Vision - ECCV 2026, Lecture Notes in Computer Science, vol. 17050, pp. 281-299, Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13106 2026-09-28 cs.CV

UL-VIO: Ultra-lightweight Visual-Inertial Odometry with Noise Robust Test-time Adaptation

UL-VIO:超轻量视觉-惯性里程计与噪声鲁棒的测试时间适应

Jinho Park, Se Young Chun, Mingoo Seok

机构 * Columbia University, New York NY 10027, USA Dept. of ECE, INMC \& IPAI, Seoul National University, Republic of Korea

AI总结 本文提出UL-VIO,一种超轻量的视觉-惯性里程计,通过在测试时利用视觉-惯性一致性进行适应,实现资源高效的适应方法,实验表明其在不同动态领域转移场景下有效。

Journal ref European Conference on Computer Vision (ECCV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.29788 2026-09-25 cs.CV cs.GR 新提交

OREO: Fidelity Alignment in 3D Generation via On-the-fly Rendering-Editing Optimization

OREO:通过即时渲染-编辑优化实现三维生成中的保真度对齐

Zhiyuan Ma, Wenbo Hu, Wang Zhao, Pengfei Wang, Ying Shan, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ; Tencent ARC Lab(腾讯ARC实验室)

AI总结 OREO提出一种动态优化框架,利用二维扩散先验和强化编辑,以即时渲染编辑作为伪目标,提升三维生成模型的视觉保真度。

Comments Accepted to ECCV 2026. Our project page is at https://theericma.github.io/oreo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.29347 2026-09-25 cs.CV 新提交

SEE Challenge 2026: Event-Guided Brightness Adjustment Across a Broad Illumination Range

SEE Challenge 2026:事件引导的宽光照范围亮度调整

Yunfan Lu, Mingchao Xu, Hanyu Zhou, Shaoyu Liu, Haoyue Liu, Peiqi Duan, Shihan Peng, Yinqiang Zheng, Boxin Shi, Gim Hee Lee, Hui Xiong, Davide Scaramuzza

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; National University of Singapore(新加坡国立大学) ; Xidian University(西安电子科技大学) ; Tsinghua University(清华大学) ; Huazhong University of Science and Technology(华中科技大学) ; Peking University(北京大学) ; The University of Tokyo(东京大学) ; University of Zurich(苏黎世大学)

AI总结 针对宽光照范围的事件引导恢复,SEE Challenge 2026基于SEE-600K数据集组织竞赛,采用开放系统协议,以PSNR排名、SSIM为辅,验证了六种系统并分析了其性能与失败模式。

Comments This report has been accepted for publication at an ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.29292 2026-09-25 cs.CV 新提交

PHOSA: Photorealistic 3D Sign Avatar Modeling and Benchmark

PHOSA:逼真三维手语虚拟形象建模与基准

Haodong Wang, Hezhen Hu, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出PHOSA方法,通过构建多视角中文手语数据集MVSign和解耦虚拟形象表示,实现高保真手语建模,并在手部与面部细节上取得优异效果,且能泛化至单目视频。

Comments ECCV 2026, project page: https://naaapi.github.io/PHOSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02714 2026-09-25 cs.CV

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

ExploreVLA: 为端到端自动驾驶的密集世界建模与探索

Zihao Sheng, Xin Ye, Jingru Luo, Sikai Chen, Liu Ren

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出基于世界建模的统一理解与生成框架,通过密集监督和内在奖励提升自动驾驶策略探索能力,在NAVSIM和nuScenes基准上取得优异性能。

Comments Accepted to ECCV 2026. The code is available at https://zihaosheng.github.io/ExploreVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.28473 2026-09-24 cs.CV cs.LG 新提交

On the Diffusibility of High-Dimensional Latents

高维潜在变量的可扩散性

Chao Feng, Zhiyang Xu, Bowei Chen, Yuanjun Xiong, Xiyao Wang, Jui-Hsien Wang, Richard Zhang, Zhe Lin, Andrew Owens, Yijun Li

机构 * Cornell University(康奈尔大学) ; Adobe ; Virginia Tech(弗吉尼亚理工大学) ; University of Washington(华盛顿大学) ; University of Maryland(马里兰大学)

AI总结 本文发现表示自编码器微调后虽重建更好但有效维度降低,标准速度预测需拟合正交噪声致效率低下,改用x0预测聚焦信号流形,在多个强重建编码器上持续提升文生图性能。

Comments Accepted to ECCV 2026. Project page: https://cfeng16.github.io/on_the_diffusibility/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.27346 2026-09-24 cs.RO 新提交

Reflection-Aware Reasoning for Non-Line-of-Sight Pedestrian Localization

反射感知推理用于非视距行人定位

Byeonggyu Park, Mingu Jeon, Seong-Woo Kim

AI总结 针对自车动态室外环境中的非视距行人定位难题,提出融合相机与雷达点云、推断反射信息并利用物理引导光线追踪的框架,实验验证其有效性。

Comments Accepted at ECCV 2026

Journal ref Park, Byeonggyu, Mingu Jeon, and Seong-Woo Kim. "Reflection-Aware Reasoning for Non-line-of-Sight Pedestrian Localization." European Conference on Computer Vision. Cham: Springer Nature Switzerland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28404 2026-09-24 cs.CV 版本更新

How Far Can 5,500 Hours of Driving Take You? A Scaling Law Analysis of Video Diffusion Models

5500小时驾驶数据能带来多大提升?视频扩散模型的缩放定律分析

Victor Besnier, Anh-Quan Cao, Elias Ramzi, Spyros Gidaris, Tuan-Hung Vu, Andrei Bursuc, Eloi Zablocki, Matthieu Cord

机构 * Sorbonne Université(索邦大学)

AI总结 本研究针对自动驾驶视频生成,通过对100万至90亿参数的视频扩散模型开展缩放定律分析,明确训练时长、模型规模、数据量的影响,训练出的90亿参数模型在nuScenes上达到开源最优。

Journal ref [Archival Track] ECCV 2026 DriveX - 6th Workshop on Foundation Models for Autonomous Driving

详情

展开后加载摘要…

URL PDF HTML 收藏
↑