GET: Generative Embedding Translation for Medical Image Segmentation
GET:用于医学图像分割的生成式嵌入翻译
AI总结 该研究提出GET框架,基于Stable Diffusion VAE的冻结潜在空间实现医学图像分割,在多数据集上优于各类基线,参数更少且域偏移下性能提升显著。
Comments Accepted at ECCV 2026 - BioImage Computing Workshop
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
GET:用于医学图像分割的生成式嵌入翻译
AI总结 该研究提出GET框架,基于Stable Diffusion VAE的冻结潜在空间实现医学图像分割,在多数据集上优于各类基线,参数更少且域偏移下性能提升显著。
Comments Accepted at ECCV 2026 - BioImage Computing Workshop
FixAnything:基于视频生成先验的3D一致性渲染优化
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。
Comments Appearing in ECCV 2026. Project page: this https URL (https://fix-anything.github.io)
用于基于文本的人员异常搜索的动作对齐检索与成对多模态重排序
机构 * University of Science, VNU-HCM(胡志明市国家大学科学大学) ; Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学)
AI总结 针对基于文本的人员异常搜索中现有方法的局限,提出ActPair三阶段由粗到细框架,结合动作对齐检索与成对多模态重排序,在PAB测试集取得最优结果且可有效迁移至新数据集。
Comments Accepted to the AI City workshop @ ECCV 2026
BenthicFlow:基于流匹配生成可扩展水下环境
机构 * Eindhoven University of Technology(埃因霍温理工大学)
AI总结 BenthicFlow是基于条件流匹配的统一框架,可联合生成对齐纹理与深度图,实现无需单独拼接模型的可扩展水下RGBD场景,实验证实其能生成匹配目标分布的大型3D海底环境。
Comments Accepted to ECCV 2026 in the 2nd Workshop on Marine Vision
视觉Transformer对小麦表型分析的合并容忍度有多高?
AI总结 该研究针对小麦表型分析任务,系统基准测试了ToMe和互相对合并的合并容忍度,发现分类对合并容忍度高,检测和分割受多种因素限制,部署价值需在目标运行时分析。
Comments Accepted to the CVPPA workshop at ECCV 2026
Misanthrope:一种隐私保护型关键点检测器
机构 * Austrian Institute of Technology(奥地利技术研究所) ; Technical University of Braunschweig(布伦瑞克工业大学) ; University of Vienna(维也纳大学)
AI总结 本研究提出新型隐私保护关键点检测器Misanthrope,通过自蒸馏训练避免在人体上检测关键点以从源头缓解逆攻击,其图像匹配性能与最优方法相当,在人体干扰的挑战性场景及2021图像匹配挑战测试集上表现更优。
Comments Accepted to Privacy preserving Visual Localization (PPVLM) workshop at the European Conference on Computer Vision (ECCV) 2026
视频帧插值中用于序列建模的跟随运动方法
机构 * IPAI, Seoul National University(首尔国立大学 IPAI)
AI总结 针对SSMs预定义扫描顺序难以建模VFI动态运动轨迹的问题,提出MGMVFI模型,通过运动引导序列化与上下文合成等组件实现SOTA性能,为视频插值序列建模开辟新方向。
Comments Accepted to ECCV 2026
概念图谱绘制:面向透明数据剪枝的全局分布结构感知
机构 * Huazhong University of Science and Technology(华中科技大学) ; Ant Group(蚂蚁集团) ; Chinese Academy of Sciences(中国科学院)
AI总结 该研究提出Mapping the Concept Landscape框架,以样本级图刻画语义概念全局分布,开发贪心概念覆盖最大化算法,实现更优数据剪枝效率并提供可解释的审计轨迹。
Comments ECCV 2026
看见不可见:用于稀疏视图三维泛化的高斯语义嵌入方法
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学全球未来技术研究院)
AI总结 本文提出新型通用三维高斯溅射框架SeeU,通过跨视图熵感知模块与条件高斯变换器优化高斯估计,在稀疏视图场景下提升新视图合成的渲染质量与结构完整性,外推设置下PSNR较SOTA方法提升2.44 dB。
Comments Accepted at the ECCV 2026 Workshop on 3DWM
LoViF 2026:首届雨滴与反射联合去除挑战赛:方法与结果
AI总结 该论文回顾了首届LoViF 2026雨滴与反射联合去除挑战赛,该赛针对自动驾驶雨天雨滴-反射复合退化问题,吸引149人参赛、12份有效提交,基于RDRF数据集评估,分析方法结果并提供研究见解。
Comments ECCV 2026 Workshops
面向组合视觉数据检索的逐样本感知插值权重学习
机构 * AI Center, Samsung Electronics(三星电子AI中心) ; POSTECH(浦项科技大学) ; Ajou University(明知大学)
AI总结 针对组合视觉数据检索中基于MLLM方法延迟高的问题,提出SRAIN框架,通过批量排名感知权重估计和合成难负样本的内存库,实现低延迟且性能优异的检索。
Comments ECCV 2026
SAM3Dual:第8届大规模视频对象分割(LSVOS)挑战赛MOSEv2赛道的第3名解决方案
机构 * Chung-Ang University(中央大学)
AI总结 该研究提出SAM3Dual作为第8届LSVOS挑战赛MOSEv2赛道第3名方案,通过无训练推理扩展SAM 3,划分时序内存分支并融合,获J&F分数64.37,实现高效长期VOS性能。
Comments 3rd place solution to the MOSEv2 Track of the 8th LSVOS Challenge at ECCV 2026
可缩放矢量图形隐空间
机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)
AI总结 本文提出SLS(SVG隐空间),一种基于Transformer的自编码器,学习SVG路径的稠密可逆隐表示,可降低下游任务FLOPs超150倍,为矢量图形研究提供通用隐空间基础。
Comments Accepted at The 19th European Conference on Computer Vision -- ECCV 2026
面向无混叠的4D高斯表示:结合运动感知滤波
机构 * Indian Institute of Science(印度科学学院) ; Samsung R&D Institute India - Bangalore(三星印度班加罗尔研发研究院)
AI总结 针对动态场景4D表示的混叠问题,提出运动感知3D平滑滤波器,适配各类4D表示,在标准数据集上性能优于现有最优方法。
Comments Accepted to ECCV 2026. Project Page: this https URL (https://maaf-4dgs.github.io/)
计划而非解码器:诊断与修复推理增强型文本到图像生成中的组合式失败
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 该研究针对推理增强型文本到图像生成的组合式失败,发现问题源于规划器而非解码器,通过编辑计划(如重写几何结构)可显著提升生成质量,还发布了相关评估协议及数据。
Comments 15 pages, 7 figures. Accepted at ECCV 2026 (oral)
EXPL-FR:基于视觉-语言对齐的人脸识别模型解释方法
机构 * Fraunhofer IGD(弗劳恩霍夫应用研究促进协会图形数据处理研究所) ; TU Darmstadt(达姆施塔特工业大学)
AI总结 EXPL-FR是一种基于视觉-语言对齐的人脸识别模型解释方法,通过轻量适配器在FR嵌入空间内生成语义特征,支持多粒度解释,可实现无标签的属性级审计与模型性能排名。
Comments Accepted at the ECCV 2026 Workshops
BIMScript:用于BIM导入的材料感知结构化场景程序
机构 * Aalborg University(奥尔堡大学) ; Pioneer Centre for Artificial Intelligence(人工智能先锋中心)
AI总结 本文提出BIMScript,通过扩展布局语言属性、优化解码方案、改进粒度处理,实现合成扫描数据到BIM工具的端到端自动导入,且支持大语言模型驱动的可持续性推理。
Comments Project Page: see this https URL (https://bimscriptworld.github.io/BIMScript/); to be published in ECCV 2026 TwinWorld Workshop
对齐人类感知:用于视频生成的校准分布奖励学习
AI总结 本文针对视频生成中奖励信号不可靠、偏好维度权衡丢失、KL散度难捕捉偏好全局结构的问题,提出统一偏好感知学习框架,通过精英过滤、分布建模与Wasserstein对齐改进,提升了奖励可靠性与视频感知一致性。
Comments Accepted by ECCV 2026
GuideFetch:用于辅助机器狗并发导航与物体检索的任务协调框架
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Hunan University(湖南大学)
AI总结 针对异构辅助机器狗的导航与物体检索并发任务,提出GuideFetch协调框架,通过LLM规划与状态验证提升执行效率,并行执行可缩短41.3%平均总完成时间。
Comments Accepted to the 1st Workshop on Multimodal Digital Agents (MDA) at ECCV 2026
CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会
AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。
Comments Accepted to the Explainable Computer Vision (eXCV) Workshop at ECCV 2026
层神经网络是否使用和乐性?一项测量-干预-控制研究
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)
AI总结 以层神经网络为测试平台,对训练后的三角循环积进行与基无关测量,通过神经层传播等方法区分几何变化等,在不同实验设置下观察其效果,研究层神经网络是否使用和乐性及相关特性。
Comments Accepted as an extended abstract at Geometric Intelligence @ ECCV 2026
FSDC-DETR:面向小目标检测的频域-空域协同DETR
机构 * Micro-Intelligence(微智感知) ; East China Normal University(华东师范大学) ; University of Leicester(莱斯特大学) ; Chongqing Normal University(重庆师范大学)
AI总结 针对现有检测器易丢失小目标高频分量的问题,提出频域-空域协同DETR框架,通过双分支融合、交互机制与动态下采样实现小目标检测性能显著提升。
Comments Accepted by ECCV 2026
GeoMix: 通过全局上下文和多检测器训练实现无描述符视觉定位
机构 * Aalto University(阿尔托大学) ; Tampere University(坦佩雷大学) ; University of Oulu(奥卢大学)
AI总结 提出GeoMix框架,通过局部方向与距离嵌入、全局上下文节点和多检测器混合训练,增强几何判别性,显著提升无描述符视觉定位精度。
Comments ECCV 2026
SceneOrchestra: 通过完整工具调用轨迹生成实现高效的代理3D场景合成
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 SceneOrchestra通过训练可调的 orchestration 框架优化工具调用流程,消除逐步审查循环,提升效率和输出质量。
Comments Accepted by ECCV 2026
LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; NEC Labs America(NEC美国实验室) ; UC San Diego(加州大学圣迭戈分校)
AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。
Comments Accepted by ECCV 2026. Project Page: this https URL (https://yunhe24.github.io/langdrivectrl/)
FaCT-GS:基于高斯点撒的快速可扩展CT重建
机构 * Technical University of Denmark(丹麦技术大学)
AI总结 本文提出FaCT-GS框架,通过优化体素化和光栅化流程,实现快速且可扩展的CT重建,比现有方法快4-13倍,适用于不同投影尺寸。
Comments Accepted at the European Conference on Computer Vision (ECCV) 2026
ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) ; Huazhong University of Science and Technology(华中科技大学) ; Zhejiang University(浙江大学)
AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。
Comments Accepted at the European Conference on Computer Vision (ECCV) 2026
VisionCoach: 通过视觉感知提示强化视频推理
AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。
Comments Accepted to ECCV 2026; Project website: this https URL (https://visioncoach.github.io/)