XPos3R: Cross-Modal Transformer for Intraoperative 2D/3D Registration
XPos3R:用于术中2D/3D配准的跨模态Transformer
AI总结 XPos3R提出非对称编码器-解码器跨模态Transformer,实现术中2D/3D配准,无需患者特异性训练,在真实基准上超越现有方法,误差低于4毫米。
Comments Accepted to ECCV 2026
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
XPos3R:用于术中2D/3D配准的跨模态Transformer
AI总结 XPos3R提出非对称编码器-解码器跨模态Transformer,实现术中2D/3D配准,无需患者特异性训练,在真实基准上超越现有方法,误差低于4毫米。
Comments Accepted to ECCV 2026
Logit Refiner:通过尺度内依赖建模改进视觉自回归模型
机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
AI总结 针对视觉自回归模型并行解码忽略尺度内依赖导致局部不连贯的问题,提出Logit Refiner轻量模块,通过顺序采样恢复依赖,仅增10%参数,显著提升生成质量并泛化至文本到图像生成。
Comments ECCV 2026
生成式浮游生物图像的多模态分类条件化
机构 * University of Glasgow(格拉斯哥大学) ; National Defence University(国防大学)
AI总结 针对浮游生物成像数据长尾分布问题,提出以分类学为条件、结合CLIP编码器与扩散变换器生成合成图像的方法,提升稀有分类群分类可靠性。
Comments European Conference on Computer Vision (ECCV) 2nd Workshop on Marine Vision
UBone3D:用于超声解剖三维形状补全的物理校正条件流匹配
机构 * University of Alberta(阿尔伯塔大学) ; ShanghaiTech University(上海科技大学)
AI总结 UBone3D利用物理校正条件流匹配,结合CT先验和超声模拟,从含伪影的超声点云中完成解剖形状补全,显著提升重建精度。
Comments Accepted to ECCV 2026. Camera-ready Author Version
FreeFlow:一种用于光流估计的无偏置分层Transformer
机构 * AI Center, Lomonosov MSU(罗蒙诺索夫莫斯科国立大学人工智能中心) ; Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) ; MSU Institute for Artificial Intelligence(莫斯科国立大学人工智能研究所)
AI总结 FreeFlow提出无流特定归纳偏置的分层Transformer,结合三种注意力变体,在多个光流基准上取得最先进结果并保持内存效率。
Comments Accepted at ECCV 2026. Project page: https://github.com/msu-video-group/freeflow
多模态受控连贯动作生成
机构 * South China University of Technology(华南理工大学) ; Joy Future Academy(京东探索研究院) ; Peking University(北京大学)
AI总结 本文提出MOCO,一种基于扩散的框架,通过解耦去噪步骤独立生成各模态动作并逐步协调,实现无需对齐数据的多模态连贯动作生成,在专用基准上优于现有方法。
Comments ECCV 2026
从评估到增强:视频生成模型的视频思考推理基准测试与改进
机构 * National University of Singapore(新加坡国立大学) ; Nanjing University(南京大学) ; Kuaishou Technology(快手科技) ; University of Oxford(牛津大学)
AI总结 本文提出VWG-Bench基准测试和Vid-PRE提示增强器,用于评估并提升视频生成模型的推理能力,揭示了渲染与推理的差距并提供了改进方案。
Comments Accepted to ECCV 2026. 46 pages, 41 figures
UniH$^3$:统一分层同质性与异质性用于全能医学图像恢复
机构 * School of Biological Science and Medical Engineering, Beihang University(北京航空航天大学生物科学与医学工程学院) ; Department of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系)
AI总结 提出UniH3框架,通过分层同质性记忆和异质性平衡器统一医学图像中的同质性与异质性,实现全能医学图像恢复,在两个大规模基准上达到最先进性能。
Comments This paper has been accepted by ECCV 2026
双参数流图学习用于连续时间微分同胚图像配准
机构 * University of Alberta(阿尔伯塔大学)
AI总结 提出双参数流图学习框架,直接学习非自治ODE的连续时间解,无需离散化,在九个数据集上提升配准精度并保持微分同胚性。
Comments Published at European Conference on Computer Vision (ECCV), 2026
真实世界与临床场景下人体运动挑战赛(MoCha)@ECCV2026 第三名解决方案:面向领域泛化的 UPDRS-步态严重程度评估的语言对齐运动表示
机构 * UNIST(蔚山国立科学技术院)
AI总结 本文提出语言对齐的运动表示方法,结合 Bi-GRU、文本对齐训练、领域自适应与参数合并,实现领域泛化的 UPDRS-步态严重程度评估,在 MoCha 挑战赛中以 637K 参数取得宏 F1 0.57,排名第三。
Comments 3rd Place Solution to the MoCha 2026 Challenge at ECCV 2026
Ambient @ EgoLongQA 2026:将长视频感知蒸馏到亚20亿参数模型中
机构 * Team Ambient(环境团队)
AI总结 通过将智能体流水线的感知模块蒸馏到修剪后的2B模型中,以1.1%参数达到大型流水线89%准确率,在EgoLongQA挑战赛≤2B组别夺冠。
Comments Winning solution technical report for the EgoLongQA track of the ECCV 2026 Wearable AI Grand Challenge
Ambient @ EgoProactive 2026:基于视觉接地监督的主动式自我中心辅助
机构 * Team Ambient(Ambient团队)
AI总结 本研究提出单令牌分类与视觉接地监督方法,在ECCV 2026可穿戴AI挑战赛中获大模型组第一,显著提升干预决策性能。
Comments Winning solution technical report for the EgoProactive track of the ECCV 2026 Wearable AI Grand Challenge . Updated code and huggingface model / datasets link
任务对齐:一种简单的有效代理,用于计算机视觉中的模型融合
机构 * NAVER LABS Europe(NAVER欧洲实验室)
AI总结 本文提出任务对齐代理,解决多任务视觉模型中模型融合的超参数选择问题,提升模型融合在复杂场景中的实用性。
Comments Accepted at ECCV 2026
高斯置信传播网络用于深度补全
机构 * National University of Defense Technology(国防科技大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出高斯置信传播网络(GBPN),融合深度学习与概率图模型,通过动态构建马尔可夫随机场并利用高斯置信传播推断,实现高稀疏度下的鲁棒深度补全。
Comments Accepted by ECCV 2026
SceneHI:可控光照下的高分辨率三维一致场景纹理生成
机构 * University of Glasgow(格拉斯哥大学)
AI总结 SceneHI提出一种无需微调或优化的三维纹理合成框架,通过解析像素到纹素映射和高分辨率潜在纹理实现多视角一致的高分辨率纹理生成,并嵌入光照感知阴影,相比现有方法生成时间减少80%。
Comments ECCV 2026
各向同性嵌入扰动用于鲁棒视觉语言编码器
机构 * Soongsil Univ.(崇实大学) ; NAVER AI Lab(NAVER AI实验室) ; Ewha W. Univ.(梨花女子大学)
AI总结 Aether是一种即插即用的嵌入空间各向同性扰动增强方法,通过受控alpha混合施加扩散式随机扰动,在多种架构和识别任务上超越传统像素级增强组合,显著提升视觉语言编码器的多模态对齐性能。
Comments ECCV 2026
对话中的多模态情绪识别:基于类别自适应模态融合与情感几何
机构 * Eurecat, Centre Tecnològic de Catalunya(加泰罗尼亚技术中心Eurecat) ; Universitat Pompeu Fabra(庞培法布拉大学)
AI总结 本研究提出一种结合外观与几何视觉表示、类别自适应模态融合及效价-唤醒先验的ERC方法,在MELD和IEMOCAP上显著提升性能,验证了结构化面部线索与情感几何的互补价值。
Comments Accepted at the 11th Workshop and Competition on Affective Behavior Analysis in-the-Wild (ABAW) at ECCV 2026
跨物种动物重识别中的语义一致性学习
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
AI总结 提出语义一致性学习(SCL)框架,通过前景-背景解耦谱归一化和跨物种邻域建模,在11个数据集上实现跨物种动物重识别的最优性能。
Comments Accepted to ECCV 2026. 18 pages, 5 figures
从含噪视图图学习全局相机位姿用于运动恢复结构
机构 * Weizmann Institute of Science(魏茨曼科学研究所)
AI总结 本文提出一种基于图神经网络的全局运动恢复结构框架,从含噪视图图学习相机位姿,无需真值监督,高效可扩展,在多个数据集上精度优于深度轨迹法,速度优于经典流程。
Comments Accepted to ECCV 2026. Project page: https://vgpa-sfm.github.io/
OmniPoint:任意相机的通用单目度量点云
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google DeepMind(谷歌DeepMind)
AI总结 OmniPoint提出统一框架,采用解耦射线距离表示与双向增强策略,实现跨针孔、鱼眼等相机的零样本单目度量重建,达到最先进性能。
Comments ECCV 20026. Project Page: https://botaoye.github.io/omnipoint/
无镜头注视默认并不私密:审计跨披露表面的身份泄露
机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校)
AI总结 本研究通过模拟攻击审计无镜头近眼传感的身份泄露,发现编码测量虽视觉不可读,但学习型对手仍可高精度恢复身份,表明默认隐私假设不成立。
Comments 16 pages, 5 figures. Accepted at the PFATCV Workshop, ECCV 2026. Code available at https://github.com/xoxo121/Lensless-Gaze-Is-Not-Private-by-Default
SAFER-Activities:用于跌倒事件与日常活动智能评估的数据集
机构 * KU Leuven(鲁汶大学) ; Asian Institute of Technology(亚洲理工学院)
AI总结 提出SAFER-Activities数据集,含66小时多摄像头视频、85,310个动作实例和30类帧级标注,用于跌倒检测与活动监控,并验证了骨架模型在跨域泛化上的优势。
Comments Accepted to ECCV 2026
ReactVAU:用于流式视频异常理解的慢-快解耦框架
机构 * National Tsing Hua University(国立清华大学) ; NVIDIA(英伟达)
AI总结 ReactVAU提出慢-快解耦框架,以轻量快速检测与重量慢速推理协同,实现流式视频异常理解,兼顾性能与效率。
Comments Accepted to ECCV 2026. Project page: https://huiyuiui.github.io/ReactVAU/
笑声何时开始?时间笑声定位中的结构化标注者分歧
机构 * WSC Sports(WSC体育)
AI总结 本研究揭示时间笑声定位中标注者分歧的结构化特性,提出基于共形校准容差带的分歧校准评估方法,以更可靠地评测系统性能。
Comments Accepted to the Workshop on Affective & Behavior Analysis in-the-wild, ECCV 2026
锚定而非分级:视觉-语言模型在纹理倾斜感知中失败
机构 * Brown University(布朗大学) ; Harvard University(哈佛大学)
AI总结 研究视觉-语言模型(VLM)在纹理倾斜感知任务中的表现,发现零样本和上下文提示均产生锚定失败,仅预测少数离散角度,监督微调部分缓解但残留锚定,表明问题在于表示到输出的语言接口无法分级表达。
Comments 19 pages main paper and refs + 8 pages supplementary. Accepted to ECCV 2026
边界框轨迹对视频异常检测至关重要
机构 * Sungkyunkwan University(成均馆大学)
AI总结 本文提出TrajVAD框架,通过建模多类边界框轨迹来学习正常运动模式,利用边界框轨迹作为主要异常线索,在ShanghaiTech数据集上取得优于现有姿态基方法的性能。
Comments ECCV 2026
Journal ref Computer Vision - ECCV 2026, Lecture Notes in Computer Science, vol. 17009, pp. 175-193, Springer, 2026
让ViT说话:生成式语言-图像预训练
机构 * Beijing Jiaotong University(北京交通大学) ; ByteDance(字节跳动) ; Nanyang Technological University(南洋理工大学)
AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。
Comments Accepted by ECCV 2026. 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP
RAU:基于参考的解剖学理解与视觉语言模型
机构 * United Imaging Intelligence(联合影像智能) ; School of Computing, University of Georgia(佐治亚大学计算机学院) ; Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)
AI总结 针对医学图像中专家标注稀缺问题,提出RAU框架,利用视觉语言模型进行基于参考图像的空间推理,结合SAM2实现解剖结构识别、定位与分割,在多个数据集上优于基线,并具备良好泛化能力。
Comments ECCV 2026
标量函数拓扑散度:比较3D对象的拓扑
机构 * Skolkovo Institute of Science and Technology(斯克尔科夫科学与技术研究所) ; AIRI(AI研究机构) ; CNRS, IMJ, Paris Cité University(国家科学研究中心、巴黎城市大学) ; AI Foundation and Algorithm Lab(AI基金会与算法实验室)
AI总结 提出标量函数拓扑散度(SFTD),通过最小化确保拓扑特征定位一致,作为附加损失改善3D重建并识别分割错误,且优于Betti匹配损失。
Journal ref ECCV 2024
MedGSSR:基于层级前馈高斯溅射的通用医学图像超分辨率三维重建
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; ShanghaiTech University(上海科技大学) ; Griffith University(格里菲斯大学)
AI总结 针对医学3D超分辨率中现有方法依赖逐对象优化、保真度低的问题,提出端到端前馈框架MedGSSR,采用显式3D高斯场与层级投影,实现任意尺度超分辨率,在MRI和CT基准上显著优于现有方法,且无需逐对象优化,具备跨数据集泛化能力。
Comments ECCV 2026