arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 5079
2609.10733 2026-09-11 eess.IV 新提交

XPos3R: Cross-Modal Transformer for Intraoperative 2D/3D Registration

XPos3R:用于术中2D/3D配准的跨模态Transformer

Shiyan Su, Ruyi Zha, Hongdong Li, Xuelian Cheng, Zongyuan Ge

AI总结 XPos3R提出非对称编码器-解码器跨模态Transformer,实现术中2D/3D配准,无需患者特异性训练,在真实基准上超越现有方法,误差低于4毫米。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11804 2026-09-11 cs.CV cs.AI cs.LG 新提交

Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling

Logit Refiner:通过尺度内依赖建模改进视觉自回归模型

Meimingwei Li, Stefan Andreas Baumann, Felix Krause, Björn Ommer

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

AI总结 针对视觉自回归模型并行解码忽略尺度内依赖导致局部不连贯的问题,提出Logit Refiner轻量模块,通过顺序采样恢复依赖,仅增10%参数,显著提升生成质量并泛化至文本到图像生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11673 2026-09-11 cs.CV cs.LG 新提交

Multimodal Taxonomic Conditioning for Generative Plankton Imagery

生成式浮游生物图像的多模态分类条件化

Daniela Ivanova, Ozgu Goksu, Nicolas Pugeault

机构 * University of Glasgow(格拉斯哥大学) National Defence University(国防大学)

AI总结 针对浮游生物成像数据长尾分布问题,提出以分类学为条件、结合CLIP编码器与扩散变换器生成合成图像的方法,提升稀有分类群分类可靠性。

Comments European Conference on Computer Vision (ECCV) 2nd Workshop on Marine Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11506 2026-09-11 cs.CV eess.IV 新提交

UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound

UBone3D:用于超声解剖三维形状补全的物理校正条件流匹配

Weiying Chen, Yuchong Gao, Siyuan Li, Marek Reformat, Rui Zheng, Edmond Lou

机构 * University of Alberta(阿尔伯塔大学) ShanghaiTech University(上海科技大学)

AI总结 UBone3D利用物理校正条件流匹配,结合CT先验和超声模拟,从含伪影的超声点云中完成解剖形状补全,显著提升重建精度。

Comments Accepted to ECCV 2026. Camera-ready Author Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11486 2026-09-11 cs.CV 新提交

FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation

FreeFlow:一种用于光流估计的无偏置分层Transformer

Vladislav Bargatin, Alexander Yakovenko, Khaled Abud, Dmitriy Vatolin

机构 * AI Center, Lomonosov MSU(罗蒙诺索夫莫斯科国立大学人工智能中心) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) MSU Institute for Artificial Intelligence(莫斯科国立大学人工智能研究所)

AI总结 FreeFlow提出无流特定归纳偏置的分层Transformer,结合三种注意力变体,在多个光流基准上取得最先进结果并保持内存效率。

Comments Accepted at ECCV 2026. Project page: https://github.com/msu-video-group/freeflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11439 2026-09-11 cs.CV 新提交

Multi-Modal Controlled Coherent Motion Generation

多模态受控连贯动作生成

Yifei Liu, Qiong Cao, Hongwei Yi, Huaiguang Jiang, Changxing Ding

机构 * South China University of Technology(华南理工大学) Joy Future Academy(京东探索研究院) Peking University(北京大学)

AI总结 本文提出MOCO,一种基于扩散的框架,通过解耦去噪步骤独立生成各模态动作并逐步协调,实现无需对齐数据的多模态连贯动作生成,在专用基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11242 2026-09-11 cs.CV cs.AI 新提交

From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models

从评估到增强:视频生成模型的视频思考推理基准测试与改进

Meng Luo, Yicheng Liu, Jiahao Wang, Yuanxing Zhang, Xin Tao, Pengfei Wan, Kun Gai, Hao Fei

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Kuaishou Technology(快手科技) University of Oxford(牛津大学)

AI总结 本文提出VWG-Bench基准测试和Vid-PRE提示增强器,用于评估并提升视频生成模型的推理能力,揭示了渲染与推理的差距并提供了改进方案。

Comments Accepted to ECCV 2026. 46 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11156 2026-09-11 cs.CV 新提交

UniH$^3$: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration

UniH$^3$:统一分层同质性与异质性用于全能医学图像恢复

Zhiwen Yang, Jiayin Li, Chengyu Liu, Hui Zhang, Bingzheng Wei, Yan Xu

机构 * School of Biological Science and Medical Engineering, Beihang University(北京航空航天大学生物科学与医学工程学院) Department of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系)

AI总结 提出UniH3框架,通过分层同质性记忆和异质性平衡器统一医学图像中的同质性与异质性,实现全能医学图像恢复,在两个大规模基准上达到最先进性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10789 2026-09-11 cs.CV 新提交

Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration

双参数流图学习用于连续时间微分同胚图像配准

Mohammadjavad Matinkia, Nilanjan Ray

机构 * University of Alberta(阿尔伯塔大学)

AI总结 提出双参数流图学习框架,直接学习非自治ODE的连续时间解,无需离散化,在九个数据集上提升配准精度并保持微分同胚性。

Comments Published at European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10187 2026-09-11 cs.CV 版本更新

3rd Place Solution to Human Motion Challenges in Real-World and Clinical Settings (MoCha) @ECCV2026: Language-Aligned Motion Representations for Domain-Generalizable UPDRS-Gait Severity Estimation

真实世界与临床场景下人体运动挑战赛(MoCha)@ECCV2026 第三名解决方案:面向领域泛化的 UPDRS-步态严重程度评估的语言对齐运动表示

Soojie Kim, Muhammad Munsif, Minkyung Kim, Seungryul Baek

机构 * UNIST(蔚山国立科学技术院)

AI总结 本文提出语言对齐的运动表示方法,结合 Bi-GRU、文本对齐训练、领域自适应与参数合并,实现领域泛化的 UPDRS-步态严重程度评估,在 MoCha 挑战赛中以 637K 参数取得宏 F1 0.57,排名第三。

Comments 3rd Place Solution to the MoCha 2026 Challenge at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07154 2026-09-11 cs.CV 版本更新

Ambient @ EgoLongQA 2026: Distilling Long-Video perception into a Sub-2B Model

Ambient @ EgoLongQA 2026:将长视频感知蒸馏到亚20亿参数模型中

Logesh Kumar Umapathi

机构 * Team Ambient(环境团队)

AI总结 通过将智能体流水线的感知模块蒸馏到修剪后的2B模型中,以1.1%参数达到大型流水线89%准确率,在EgoLongQA挑战赛≤2B组别夺冠。

Comments Winning solution technical report for the EgoLongQA track of the ECCV 2026 Wearable AI Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07099 2026-09-11 cs.CV cs.AI 版本更新

Ambient @ EgoProactive 2026 : Proactive Egocentric Assistance with Visually Grounded Supervision

Ambient @ EgoProactive 2026:基于视觉接地监督的主动式自我中心辅助

Logesh Kumar Umapathi

机构 * Team Ambient(Ambient团队)

AI总结 本研究提出单令牌分类与视觉接地监督方法,在ECCV 2026可穿戴AI挑战赛中获大模型组第一,显著提升干预决策性能。

Comments Winning solution technical report for the EgoProactive track of the ECCV 2026 Wearable AI Grand Challenge . Updated code and huggingface model / datasets link

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12935 2026-09-11 cs.CV 版本更新

Task Alignment: A Simple Proxy for Practical Model Merging Across Diverse Vision Tasks

任务对齐:一种简单的有效代理,用于计算机视觉中的模型融合

Pau de Jorge, César Roberto de Souza, Björn Michele, Mert Bülent Sarıyıldız, Philippe Weinzaepfel, Florent Perronnin, Diane Larlus, Yannis Kalantidis

机构 * NAVER LABS Europe(NAVER欧洲实验室)

AI总结 本文提出任务对齐代理,解决多任务视觉模型中模型融合的超参数选择问题,提升模型融合在复杂场景中的实用性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21291 2026-09-11 cs.CV 版本更新

Gaussian Belief Propagation Network for Depth Completion

高斯置信传播网络用于深度补全

Jie Tang, Pingping Xie, Jian Li, Ping Tan

机构 * National University of Defense Technology(国防科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出高斯置信传播网络(GBPN),融合深度学习与概率图模型,通过动态构建马尔可夫随机场并利用高斯置信传播推断,实现高稀疏度下的鲁棒深度补全。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10363 2026-09-10 cs.CV cs.GR 新提交

SceneHI: High-Resolution 3D-Consistent Scene Texturing with Controllable Illumination

SceneHI:可控光照下的高分辨率三维一致场景纹理生成

Athanasios Tragakis, Marco Aversa, Daniela Ivanova, Chaitanya Kaul, Roderick Murray-Smith, Daniele Faccio, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学)

AI总结 SceneHI提出一种无需微调或优化的三维纹理合成框架,通过解析像素到纹素映射和高分辨率潜在纹理实现多视角一致的高分辨率纹理生成,并嵌入光照感知阴影,相比现有方法生成时间减少80%。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10292 2026-09-10 cs.CV 新提交

Isotropic Embedding Perturbations for Robust Vision Language Encoders

各向同性嵌入扰动用于鲁棒视觉语言编码器

Hyesong Choi, Daeun Kim, Song Park, Taekyung Kim, Byeongho Heo, Sangdoo Yun, Dongbo Min, Dongyoon Han

机构 * Soongsil Univ.(崇实大学) NAVER AI Lab(NAVER AI实验室) Ewha W. Univ.(梨花女子大学)

AI总结 Aether是一种即插即用的嵌入空间各向同性扰动增强方法,通过受控alpha混合施加扩散式随机扰动,在多种架构和识别任务上超越传统像素级增强组合,显著提升视觉语言编码器的多模态对齐性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09924 2026-09-10 cs.CV 新提交

Multimodal Emotion Recognition in Conversations via Class-Wise Adaptive Modality Fusion and Affective Geometry

对话中的多模态情绪识别:基于类别自适应模态融合与情感几何

Oriol Marín, Roger Marí, Gloria Haro, Rafael Redondo

机构 * Eurecat, Centre Tecnològic de Catalunya(加泰罗尼亚技术中心Eurecat) Universitat Pompeu Fabra(庞培法布拉大学)

AI总结 本研究提出一种结合外观与几何视觉表示、类别自适应模态融合及效价-唤醒先验的ERC方法,在MELD和IEMOCAP上显著提升性能,验证了结构化面部线索与情感几何的互补价值。

Comments Accepted at the 11th Workshop and Competition on Affective Behavior Analysis in-the-Wild (ABAW) at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09705 2026-09-10 cs.CV 新提交

Cross-Species Animal Re-Identification with Semantic Consistency Learning

跨物种动物重识别中的语义一致性学习

Shuoyi Chen, Yuejia Li, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

AI总结 提出语义一致性学习(SCL)框架,通过前景-背景解耦谱归一化和跨物种邻域建模,在11个数据集上实现跨物种动物重识别的最优性能。

Comments Accepted to ECCV 2026. 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09491 2026-09-10 cs.CV 新提交

Learning Global Camera Poses from Noisy View-Graphs for Structure from Motion

从含噪视图图学习全局相机位姿用于运动恢复结构

Fadi Khatib, Meirav Galun, Ronen Basri

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

AI总结 本文提出一种基于图神经网络的全局运动恢复结构框架,从含噪视图图学习相机位姿,无需真值监督,高效可扩展,在多个数据集上精度优于深度轨迹法,速度优于经典流程。

Comments Accepted to ECCV 2026. Project page: https://vgpa-sfm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09394 2026-09-10 cs.CV 新提交

OmniPoint: Universal Monocular Metric Pointcloud from Any Camera

OmniPoint:任意相机的通用单目度量点云

Botao Ye, Marc Pollefeys, Ming-Hsuan Yang, Abhijit Kundu

机构 * ETH Zurich(苏黎世联邦理工学院) Google DeepMind(谷歌DeepMind)

AI总结 OmniPoint提出统一框架,采用解耦射线距离表示与双向增强策略,实现跨针孔、鱼眼等相机的零样本单目度量重建,达到最先进性能。

Comments ECCV 20026. Project Page: https://botaoye.github.io/omnipoint/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09188 2026-09-10 cs.CV 新提交

Lensless Gaze Is Not Private by Default: Auditing Identity Leakage Across Disclosure Surfaces

无镜头注视默认并不私密:审计跨披露表面的身份泄露

Rahul Vimalkanth, Kaushik Mitra

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校)

AI总结 本研究通过模拟攻击审计无镜头近眼传感的身份泄露,发现编码测量虽视觉不可读,但学习型对手仍可高精度恢复身份,表明默认隐私假设不成立。

Comments 16 pages, 5 figures. Accepted at the PFATCV Workshop, ECCV 2026. Code available at https://github.com/xoxo121/Lensless-Gaze-Is-Not-Private-by-Default

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.08038 2026-09-10 cs.CV cs.AI 版本更新

SAFER-Activities: A Dataset for Smart Assessment of Fall Events and Routine Activities

SAFER-Activities:用于跌倒事件与日常活动智能评估的数据集

Diwas Lamsal, Pramod Wickramatilake, Jednipat Moonrinta, Mongkol Ekpanyapong, Matthew N. Dailey

机构 * KU Leuven(鲁汶大学) Asian Institute of Technology(亚洲理工学院)

AI总结 提出SAFER-Activities数据集,含66小时多摄像头视频、85,310个动作实例和30类帧级标注,用于跌倒检测与活动监控,并验证了骨架模型在跨域泛化上的优势。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07941 2026-09-10 cs.CV 版本更新

ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding

ReactVAU:用于流式视频异常理解的慢-快解耦框架

Chia-Hui Chen, Shih-Ying Yeh, Fu-En Yang, Min-Hung Chen, Shang-Hong Lai

机构 * National Tsing Hua University(国立清华大学) NVIDIA(英伟达)

AI总结 ReactVAU提出慢-快解耦框架,以轻量快速检测与重量慢速推理协同,实现流式视频异常理解,兼顾性能与效率。

Comments Accepted to ECCV 2026. Project page: https://huiyuiui.github.io/ReactVAU/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06646 2026-09-10 cs.CV cs.AI 版本更新

When Does a Laugh Begin? Structured Annotator Disagreement in Temporal Laughter Localization

笑声何时开始?时间笑声定位中的结构化标注者分歧

Eyal Hanania, Daniel Arkushin, Naveh Ayal, Jonathan Benvenisti, Amos Bercovich, Elie Zemmour, Sahar Froim

机构 * WSC Sports(WSC体育)

AI总结 本研究揭示时间笑声定位中标注者分歧的结构化特性,提出基于共形校准容差带的分歧校准评估方法,以更可靠地评测系统性能。

Comments Accepted to the Workshop on Affective & Behavior Analysis in-the-wild, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06714 2026-09-10 cs.CV 版本更新

Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

锚定而非分级:视觉-语言模型在纹理倾斜感知中失败

Qian Zhang, Michal Golovanevsky, Fulvio Domini, James Tompkin

机构 * Brown University(布朗大学) Harvard University(哈佛大学)

AI总结 研究视觉-语言模型(VLM)在纹理倾斜感知任务中的表现,发现零样本和上下文提示均产生锚定失败,仅预测少数离散角度,监督微调部分缓解但残留锚定,表明问题在于表示到输出的语言接口无法分级表达。

Comments 19 pages main paper and refs + 8 pages supplementary. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21957 2026-09-10 cs.CV 版本更新

Bounding-Box Trajectories Matter for Video Anomaly Detection

边界框轨迹对视频异常检测至关重要

Inpyo Song, Jangwon Lee

机构 * Sungkyunkwan University(成均馆大学)

AI总结 本文提出TrajVAD框架,通过建模多类边界框轨迹来学习正常运动模式,利用边界框轨迹作为主要异常线索,在ShanghaiTech数据集上取得优于现有姿态基方法的性能。

Comments ECCV 2026

Journal ref Computer Vision - ECCV 2026, Lecture Notes in Computer Science, vol. 17009, pp. 175-193, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00809 2026-09-10 cs.CV 版本更新

Let ViT Speak: Generative Language-Image Pre-training

让ViT说话:生成式语言-图像预训练

Yan Fang, Mengcheng Lan, Zilong Huang, Weixian Lei, Yunqing Zhao, Yujie Zhong, Yingchen Yu, Qi She, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。

Comments Accepted by ECCV 2026. 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22404 2026-09-10 cs.CV cs.AI 版本更新

RAU: Reference-based Anatomical Understanding with Vision Language Models

RAU:基于参考的解剖学理解与视觉语言模型

Yiwei Li, Yikang Liu, Jiaqi Guo, Lin Zhao, Zheyuan Zhang, Xiao Chen, Boris Mailhe, Ankush Mukherjee, Terrence Chen, Shanhui Sun

机构 * United Imaging Intelligence(联合影像智能) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)

AI总结 针对医学图像中专家标注稀缺问题,提出RAU框架,利用视觉语言模型进行基于参考图像的空间推理,结合SAM2实现解剖结构识别、定位与分割,在多个数据集上优于基线,并具备良好泛化能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08364 2026-09-10 cs.CV cs.LG math.AT math.CO math.MG 交叉投稿

Scalar Function Topology Divergence: Comparing Topology of 3D Objects

标量函数拓扑散度:比较3D对象的拓扑

Ilya Trofimov, Daria Voronkova, Eduard Tulchinskii, Evgeny Burnaev, Serguei Barannikov

机构 * Skolkovo Institute of Science and Technology(斯克尔科夫科学与技术研究所) AIRI(AI研究机构) CNRS, IMJ, Paris Cité University(国家科学研究中心、巴黎城市大学) AI Foundation and Algorithm Lab(AI基金会与算法实验室)

AI总结 提出标量函数拓扑散度(SFTD),通过最小化确保拓扑特征定位一致,作为附加损失改善3D重建并识别分割错误,且优于Betti匹配损失。

Journal ref ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06874 2026-09-09 eess.IV cs.CE cs.CV q-bio.QM 新提交

MedGSSR: Generalizable Medical Image Super-Resolution 3D Reconstruction via Hierarchical Feed-forward Gaussian Splatting

MedGSSR:基于层级前馈高斯溅射的通用医学图像超分辨率三维重建

Chengkai Wang, Luoyu Hong, Yiting Zhao, Jiamin Wang, Xiang Feng, Feiwei Qin, Zhenzhong Kuang, Xuefei Yin, Ali Bashashati, Yanming Zhu

机构 * University of British Columbia(不列颠哥伦比亚大学) Hangzhou Dianzi University(杭州电子科技大学) ShanghaiTech University(上海科技大学) Griffith University(格里菲斯大学)

AI总结 针对医学3D超分辨率中现有方法依赖逐对象优化、保真度低的问题,提出端到端前馈框架MedGSSR,采用显式3D高斯场与层级投影,实现任意尺度超分辨率,在MRI和CT基准上显著优于现有方法,且无需逐对象优化,具备跨数据集泛化能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏