SMG: Semantic Motion Graph for Monocular Dynamic Gaussian Splatting
SMG:用于单目动态高斯溅射的语义运动图
机构 * Cornell University(康奈尔大学)
AI总结 该研究针对单目动态高斯溅射过拟合、复杂场景下表现差的问题,提出SMG模型,引入新数据集,实现了该任务的最优性能。
Comments ECCV 2026
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
SMG:用于单目动态高斯溅射的语义运动图
机构 * Cornell University(康奈尔大学)
AI总结 该研究针对单目动态高斯溅射过拟合、复杂场景下表现差的问题,提出SMG模型,引入新数据集,实现了该任务的最优性能。
Comments ECCV 2026
SegWave:基于小波的篡改区域分割
机构 * IIIT-Hyderabad(印度国际信息技术研究所海得拉巴分校) ; IISER-Bhopal(印度科学教育与研究研究所博帕尔分校)
AI总结 针对图像真实性验证难题,提出SegWave混合框架,结合Transformer与DWT并引入ASA模块,经多基准数据集实验,其性能优于现有最先进的篡改检测方法。
Comments Accepted at the PFATCV Workshop, ECCV 2026
失效还是漂移?在合成与真实世界干扰下评估单目SLAM
机构 * University of Mannheim(曼海姆大学) ; Max-Planck-Institute for Informatics(马克斯·普朗克信息学研究所)
AI总结 本研究评估单目SLAM在合成与真实世界干扰下的表现,区分跟踪失效与漂移,发现学习型跟踪器会产生持续漂移,且其排序随干扰物理保真度变化。
Comments Accepted at the 3rd NeuSLAM workshop at ECCV 2026
APT:用于完全再生图像篡改定位的锚点对齐扰动
机构 * KAIST(韩国科学技术院)
AI总结 针对现有篡改定位方法在完全再生图像中失效的问题,提出半脆弱潜在空间扰动APT,通过锚点对齐特征实现篡改定位,在COCO数据集上FR IoU达0.92,性能优于基线,可泛化到未知篡改类型。
Comments Accepted to ECCV 2026
拍品提取模型:从拍卖目录中进行多模态拍品提取
机构 * FAU Erlangen(埃尔朗根-纽伦堡大学) ; Pattern Recognition Lab(模式识别实验室)
AI总结 该研究提出基于视觉语言模型(VLM)的流水线,从历史拍卖目录中自动提取结构化拍品级元数据,对比不同部署模式的模型性能,为文化遗产机构提供可行的自动化分析方案。
Comments Accepted at the VISART Workshop (Computer Vision for Art Analysis), ECCV 2026. 19 pages, 6 figures, 5 tables. Supplementary material included as an appendix. Code, benchmark data, and prompt templates: https://github.com/mathiaszinnen/auction-lot-extraction
CapFrame:基于几何伪标签的3D高斯场景中文本引导视角定位
机构 * Institute of Science Tokyo(东京科学大学) ; Denso IT Laboratory, Inc.(电装IT实验室) ; National Institute of Informatics(信息学研究所)
AI总结 本文针对3D高斯场景中虚拟相机位姿需人工设置的问题,提出CapFrame框架,通过检索-转换-优化流程实现文本引导的视角定位,实验表明其对齐度优于基线方法。
Comments Accepted at ECCV 2026
NoisEasier:用于文本到视频生成的测试时噪声优化
机构 * Michigan State University(密歇根州立大学)
AI总结 本研究提出NoisEasier框架,通过测试时噪声优化提升文本到视频生成的组合对齐效果,在多数据集实验中取得超10%平均增益,为可控文本到视频生成提供有效新范式。
Comments Accepted to ECCV 2026
基于线性注意力的像素空间扩散实现高效高质量深度估计
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院) ; MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(上海交通大学人工智能研究院(教育部人工智能重点实验室))
AI总结 本研究提出基于线性注意力的像素空间生成框架Lapis,通过由粗到细的层级结构解决生成式深度估计的高计算成本问题,在多分辨率基准上实现SOTA精度,推理延迟大幅降低。
Comments Accepted by ECCV 2026
最近的目标是错误的:Arc2Face身份遗忘中的目标分离
机构 * University of Oxford(牛津大学)
AI总结 该研究针对Arc2Face身份遗忘中重定向目标导致的失败问题,通过审计Arc2Face发现目标分离是关键设计变量,采用特定策略可提升干净遗忘率并降低遗忘身份的重新识别率。
Comments 16 pages, accepted at the ECCV 2026 Workshop on Unlearning and Model Editing (U&ME)
当3D高斯溅射(3DGS)恢复真实表面时
机构 * School of EECS, Penn State(宾夕法尼亚州立大学电子工程与计算机科学学院)
AI总结 该研究构建基于首击渲染抽象的数学框架,明确3D高斯溅射(3DGS)的可识别性窗口,经合成与真实数据集实验验证,揭示角容量对3DGS恢复真实表面的关键影响。
Comments Accepted at ECCV 2026. 30 pages, 3 figures, 1 table; includes supplementary material
OPAL:用于可解释图像分类的正交原型对齐学习
机构 * Universitat Politècnica de València(瓦伦西亚理工大学) ; Mines Paris, PSL University(巴黎矿业学院,巴黎文理研究大学) ; Artikode Intelligence S.L.
AI总结 提出单阶段端到端框架OPAL,通过正交基锚定潜在空间、空间竞争机制实现可解释图像分类,性能优于同类模型,可提供细粒度视觉解释。
Comments Accepted at ECCV 2026
用于时空对齐图像翻译与生成的离散扩散桥
机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; The University of Hong Kong(香港大学) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)
AI总结 该研究提出离散扩散桥(DDB)框架,解决离散扩散在图像翻译与生成中的时空错位问题,通过混合吸收机制和信息引导噪声调度实现平衡,在多生成任务中表现优异且适配低采样步数场景。
Comments Accepted to ECCV 2026
生物力学三维人体:从三维人体基础模型自监督蒸馏生物力学姿态
机构 * Shirley Ryan AbilityLab(雪莉·瑞安能力实验室) ; Northwestern University(西北大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 该研究扩展SAM-3D-Body模型新增生物力学预测头,用JAX结合Equinox实现,在公开数据集训练后,在多数据集验证中优于现有生物力学回归模型,仅略逊于需高成本轨迹优化的同类方法。
Comments Accepted to the ECCV 2026 Workshop MoCha
FoundYou:个性化分割与检索的统一模型
机构 * Politecnico di Torino(都灵理工大学) ; Miguel Hernández University of Elche(埃尔切米格尔·埃尔南德斯大学) ; Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚人工智能研究生学院与研究网络)
AI总结 本研究提出FoundYou统一框架,基于SAM 2的实例级线索实现个性化分割与检索,在相关基准上取得显著性能提升,模型规模小、速度快,且在类别级检索任务中也达最优。
Comments ECCV 2026. Project page: https://ga1i13o.github.io/FoundYou
强安全护栏下大型视觉语言模型的护栏无关社会偏见评估
机构 * NVIDIA(英伟达)
AI总结 本研究针对强护栏LVLMs的偏见评估难题,提出解耦人物属性推断的评估方法,发现20款LVLMs均存在不当使用用户人口统计信息的偏见,且专有模型偏见低于开源模型。
Comments Accepted at ECCV 2026
TRINITY:面向个人风格视频精彩片段检测的多视角基准测试集
机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)
AI总结 针对个人风格视频精彩片段检测的传统方法泛化性差的问题,提出TRINITY多视角基准测试集与对应多分支架构,在两个数据集上显著优于现有方法,验证了多视角建模的有效性。
Comments 32 pages, 9 figures. Accepted to ECCV 2026
面向基于校准数字孪生的浅血管定位的可信机器人辅助滑动触诊
机构 * Imperial College London(帝国理工学院)
AI总结 本文提出带校准数字孪生的机器人辅助滑动触诊框架,结合时空图神经网络实现浅血管定位,在三类数据集上验证了模拟到真实的定位精度,为可信触觉触诊提供了进展。
Comments ECCV workshop paper
用受约束的大语言模型(LLM)弥合语义与物理鸿沟,实现安全可信的机器人操纵
机构 * Imperial College London(帝国理工学院)
AI总结 该研究针对语言引导机器人操纵的语言-动作鸿沟,通过类型化契约约束LLM决策,结合MoveIt流水线验证,在多类机器人任务上实现了优于脚本策略的安全可靠性能。
Comments ECCV Workshop paper
Hyper3-CLIP:层级条件双曲视觉-语言训练
机构 * hyper 3 labs(超3实验室) ; Hasso Plattner Institute(哈索·普拉特纳研究所) ; University of Potsdam(波茨坦大学) ; Faculty of Computers and Data Science, Alexandria University(亚历山大大学计算机与数据科学学院) ; Faculty of Computer Science and Engineering, Alamein International University(阿拉曼国际大学计算机科学与工程学院)
AI总结 Hyper3-CLIP结合层级条件与双曲几何,通过文本构建多粒度查询层级训练视觉-语言模型,提升图像-文本检索与多标签分类性能,在层级指标上保持竞争力。
Comments 16 pages, 2 figures, ECCV 2026 Beyond Euclidean Workshop
面向开放词汇三维场景理解的动态鲁棒光度-语义重建
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) ; Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) ; The Chinese University of Hong Kong(香港中文大学) ; Deepeleph Intelligent Technology(深智科技)
AI总结 提出SPAR架构与动态区域感知训练范式,解决NVS与OVS模型在动态场景的特征错位问题,在D-RE10K基准上实现SOTA性能,3/4视图下PSNR达22.15/23.33 dB,运动掩码预测mIoU达88.5%。
Comments Accepted to the European Conference on Computer Vision (ECCV) 2026
STARLINC:基于帧间相关性的卫星尾迹伪影去除
机构 * Seoul National University(首尔大学)
AI总结 针对低轨卫星污染天文图像的问题,本文提出无需像素级标注的STARLINC框架,结合合成尾迹生成、帧间差分图和热图实现尾迹去除,性能优于基线,可扩展用于下一代天文观测。
Comments Accepted to ECCV 2026
mmIR:用于3D毫米波雷达ADC合成的频率空间逆渲染方法
机构 * Cornell Tech(康奈尔科技学院)
AI总结 提出开源可微分的FMCW雷达逆渲染器mmIR,采用LiDAR辅助逆渲染,在ColoRadar数据集上实现高分辨率3D雷达数据合成,相关性能优于Sionna-RT且可跨雷达硬件迁移。
Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Project page: https://mmwave-inverse-rendering.github.io/
ReconSplat:超越观测视图的通用3D场景重建
机构 * TU Darmstadt(达姆施塔特工业大学) ; Zuse School ELIZA(楚斯学校ELIZA)
AI总结 ReconSplat是基于3DGS与MV-LDM的前馈3D场景重建模型,解决未观测区域视图生成与几何一致性的权衡问题,在RealEstate10K、DL3DV-10K基准上优于现有方法,可外推未观测视点并保持精确几何。
Comments ECCV 2026. Code and additional visual results are available on our project page: https://visinf.github.io/reconsplat
ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集
机构 * OPPO US AI Center(OPPO美国人工智能中心) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California San Diego(加利福尼亚大学圣迭戈分校)
AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。
Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision
RoboGesture:面向人形机器人交互的实时语义对齐式伴随语音手势生成
机构 * Tsinghua University(清华大学) ; Galbot Inc.(Galbot公司) ; Beijing Institute of Technology(北京理工大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学) ; Shanghai Qi Zhi Institute(上海智知研究院)
AI总结 本研究提出 RoboGesture 框架,构建专属数据集并设计相关算法,使人形机器人可实时生成语义对齐的伴随语音手势,在 Unitree G1 机器人上的实验表明其性能优于现有最优方法。
Comments Accepted at ECCV 2026. Project page: https://RoboGesture.github.io
WildFin:用于鱼类行为识别的野外数据集
机构 * Cornell University(康奈尔大学) ; University of Colorado Boulder(科罗拉多大学博尔德分校) ; HHMI Janelia Research Campus(HHMI珍妮亚研究园区)
AI总结 针对复杂海洋环境中鱼类行为识别模型失效问题,推出WildFin野外数据集,经大规模整理标注后对视觉基础模型测试,发现其与现实需求存在显著差距。
Comments 31 pages, 4 figures ECCV Marine 26 Workshop
CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练
机构 * University of Moratuwa(莫拉图瓦大学) ; Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) ; Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))
AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。
Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)
ReViV:从单目自我中心视频中重建4D中的观看者和视图
机构 * ETH Zurich(苏黎世联邦理工学院) ; Delft University of Technology(代尔夫特理工大学) ; Microsoft(微软)
AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。
Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable
PoseShield: 用于人体自碰撞解析的神经碰撞场
机构 * Purdue University(普渡大学) ; LightSpeed Studios(LightSpeed工作室) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 针对SMPL人体姿态估计中的自碰撞问题,提出在姿态空间直接定义神经碰撞约束,通过Eikonal正则化优化求解,实现95.8%的碰撞修复成功率。
Comments ECCV 2026. Code: https://github.com/lzhyu/PoseShield
曲率自适应一致性流匹配:基于强化学习的自主轨迹优化
机构 * Tsinghua University(清华大学)
AI总结 提出曲率自适应一致性流匹配(CACFM),利用强化学习代理动态构建效率导向课程,优先处理关键区域,在FLUX和SDXL等大规模模型上实现最先进结果,极少数步下保持高视觉保真度。
Comments Accepted by ECCV 2026