SUMI: Scalable Unified Model for 3D Point Cloud Inference
SUMI:用于三维点云推理的可扩展统一模型
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对点云补全由粗到精范式中局部细节重构不足的问题,提出扩散增强细化模块SUMI,可集成到现有模型,在多个基准数据集上实现性能提升。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
SUMI:用于三维点云推理的可扩展统一模型
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对点云补全由粗到精范式中局部细节重构不足的问题,提出扩散增强细化模块SUMI,可集成到现有模型,在多个基准数据集上实现性能提升。
RPL-UIE:面向水下图像增强的可靠先验学习
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对水下图像增强的语义漂移问题,提出RPL-UIE两阶段教师-学生框架,结合RPRD与FPRD缩小师生模型先验学习差异,在基准测试、下游视觉任务及真实ROV数据上表现良好。
Comments 34 pages, 10 figures, and 6 tables
统一深度随机过程用于图像增强
机构 * Wrocław University of Science and Technology(沃拉布大学科学与技术学院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文统一了图像增强中的深度随机过程,通过分类为无条件扩散模型、Ornstein-Uhlenbeck过程和扩散桥三类连续时间过程,揭示其共同的SDE框架,并通过实验分析不同设计对性能的影响。
Comments 27 pages, in proceesings of the 43rd International Conference on Machine Learning, Seoul, South Korea
GeoRect4D:几何兼容的生成性矩形化用于动态稀疏视角3D重建
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出GeoRect4D框架,通过闭环优化结合显式3D一致性与生成性细化,解决动态稀疏视角3D重建中的几何崩溃和漂移问题,提升重建精度与时间一致性。
无监督深度生成模型在神经影像中的异常检测:一项系统性综述
机构 * Univ Rennes, Inria, CNRS, Inserm, IRISA UMR 6074, Empenn, Rennes, France(法国里昂大学、Inria、CNRS、Inserm、IRISA UMR 6074、Empenn、里昂) ; Siemens Healthineers, Courbevoie, France(法国西门子医疗影像公司、Courbevoie) ; CHU Rennes, Radiology Department, Rennes, France(里昂大学医院、放射科、法国里昂) ; CHU Rennes, Physical Medicine and Rehabilitation Department, Rennes, France(里昂大学医院、康复医学部、法国里昂) ; Centre de Kerpape, Ploemeur, France(凯帕尔中心、法国普洛梅尔) ; Univ Rennes, Inria, CNRS, IRISA, Rennes, France(法国里昂大学、Inria、CNRS、IRISA、里昂)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文综述了无监督深度生成模型在神经影像异常检测中的应用,指出其在病理无关定位中的潜力及现存挑战。
KAN We Flow? 通过KAN与RWKV实现3D操作的机器人操控进步
机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学智能工程与自动化学院) ; Beijing Hydrogen Intelligence Technology Co. Ltd.(北京氢能智能科技有限公司) ; School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 KAN-We-Flow通过结合RWKV和KAN技术,实现轻量高效的3D机器人操作策略,显著提升性能与效率。
Comments Accepted By ICRA2026
基于卫星图像与大气场的潜式整流流热带气旋预报
机构 * Khulna University of Engineering & Technology(库尔纳工程技术大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本研究提出单步潜式整流流模型,联合预报热带气旋的卫星图像与大气场,采样速度快、预报精度高,路径误差较基线降低,为热带气旋预报提供高效方案。
Comments 9 pages, 2 figures, 6 tables
WaveDiT: 面向高效3D脑MRI合成的分布感知小波流匹配
机构 * Politecnico di Bari(巴里理工大学) ; Sapienza University of Rome(罗马大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出WaveDiT,一种在3D Haar离散小波变换系数空间中运行的条件流匹配框架,通过分解时空注意力与基于高阶小波统计的带状异方差不确定性建模,实现单GPU上全分辨率3D脑MRI高效合成,在分布对齐和下游任务中优于现有方法。
Comments Provisionally accepted at MICCAI 2026
使用CLIP进行合成图像检测:理解和评估预测线索
机构 * Institute for Data Science I4DS(数据科学研究所) ; University of Applied Sciences FHNW(应用科学大学) ; FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。
Comments 10 figures; 25 pages
基于推理时无梯度优化的空间接地文本到视频生成
机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) ; Obvious Research
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。
Comments Camera Ready Version
$μ$Flow:利用平均图像提升深度伪造人脸检测器的泛化能力
机构 * University of Catania(卡塔尼亚大学) ; University of Nottingham(诺丁汉大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出仅用真实图像训练的单类深度伪造检测器$μ$Flow,通过平均图像放大生成痕迹并利用归一化流对齐特征分布,实现跨生成器类别的高泛化性能。
Comments Accepted at the European Conference on Computer Vision (ECCV) 2026
InfiniVerse: 面向自动驾驶的占用引导无界场景生成
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; University of New South Wales(新南威尔士大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出InfiniVerse统一框架,通过3D占用表示和视频扩散模型实现从单帧到长距离、2D-3D对齐的动态城市场景可控生成,在Waymo和nuScenes上达到SOTA。
Comments Paper accepted as poster at ECCV workshop SPAD
一种用于大规模和复杂事件的InSAR相位解包裹框架
机构 * Visual Information Laboratory, School of Computer Science, University of Bristol, UK(布里斯托尔大学计算机科学学院视觉信息实验室) ; COMET, School of Earth Sciences, University of Bristol, UK(布里斯托尔大学地球科学学院COMET中心) ; COMET, School of Computer Science, University of Bristol, UK(布里斯托尔大学计算机科学学院COMET中心)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出基于扩散模型的相位解包裹框架,用于处理大规模干涉图并解决由变形引起的相位不连续性,实验表明其在近地表变形场景中有效。
LiveAnimate:稳定的长时长流驱动人体动画实时生成系统
机构 * The Chinese University of Hong Kong(香港中文大学) ; Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务组) ; Liblib AI
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 LiveAnimate基于14B参数视频DiT,经两阶段训练结合PR-Sink等设计,实现19.63 FPS长时长流人体动画生成,兼顾实时性、质量与稳定性,优于现有系统。
GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除
机构 * Tsinghua University(清华大学) ; Pengcheng National Laboratory(鹏城实验室) ; Huawei(华为) ; Southeast University(东南大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。
SIFT-VTON:跨注意力中的几何对应监督用于虚拟试穿
机构 * The Graduate School of Data Science, Yokohama City University, Kanagawa, Japan(数据科学研究生院, Yokohama 市立大学,神奈川县,日本)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SIFT-VTON方法,利用SIFT关键点匹配提供显式几何指导,提升扩散模型在虚拟试穿中的细节保留能力。
Comments Accepted at ICPR2026
RadarGen:从摄像头生成汽车雷达点云
机构 * Technion(技术学院) ; MIT(麻省理工学院) ; NVIDIA(英伟达) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。
Comments ECCV 2026. Project page: https://radargen.github.io/
连接事件流与DiT:事件引导的视频帧插值
机构 * The University of Tokyo(东京大学) ; South China University of Technology(华南理工大学) ; Wuhan University(武汉大学) ; Singapore Management University(新加坡管理大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出基于适配器的框架,将事件衍生提示融入预训练图像转视频扩散模型,利用IWEs与双向稀疏光流引导生成,提升视频帧插值质量,效果优于现有SOTA方法。
Comments https://joseph-lin-tech.github.io/BridgeEventDiT-VFI/
单连通三维流形的自适应体积参数化及应用
专题命中 扩散模型 :diffusion(abstract);分类 cs.GR
AI总结 本文针对现有体积参数化方法不匹配三维流形形状导致畸变的问题,提出自适应体积参数化框架,含三类目标域设置与三步算法,可应用于多分辨率重网格化等任务,验证了其有效性。
3D场景生成:一项综述
机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。
Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation
想象式生成人工智能:跨越熵墙进入超越模仿的世界
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出IGA框架,通过熵约束投影实现从模仿到想象的生成,可修复数据多样性并实现可控频谱外推,相关方法适用于DDPM等扩散模型。
UniScale:任意尺度的工业异常生成
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对工业异常检测中真实异常样本不足及小尺度异常易丢失的问题,提出UniScale框架,通过EMT策略和生成后融合去噪方法,在VisA、MVTec AD 2等数据集上显著优于现有方法。
Comments Accepted at ECCV2026
Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化
机构 * McGill University(麦吉尔大学) ; Université de Montréal(蒙特利尔大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; Mila – Quebec AI Institute(魁北克AI研究所)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。
并非所有帧都值得完全计算:通过选择性计算和预测外推加速自回归视频生成
机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) ; Shenzhen University of Advanced Technology(深圳理工大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SCOPE框架,通过三模式调度器和选择性计算,提升自回归视频扩散模型效率,在保持质量的同时实现4.73倍加速。
从对齐到合成:用于文本到CT生成的对比体 grounding
机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) ; Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。
Comments Accepted at BMVC 2026
Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成
机构 * Vorch Team(Vorch团队) ; Tongji University(同济大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。
Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/
序数神经坍缩作为视觉导航的表征先验
机构 * Seoul National University(首尔大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对视觉模仿学习中编码器学习到模糊、动作无关表征的问题,提出ORION方法,利用导航动作的序数结构显式组织表征空间,在仿真和真实环境中显著提升导航成功率。
Comments 27 pages, 14 figures. Supplementary material included
一种用于超混沌映射构建的3D级联交叉耦合框架及其在彩色图像加密中的应用
专题命中 扩散模型 :diffusion(abstract);分类 cs.MM
AI总结 本文提出了一种3D级联交叉耦合框架用于构建超混沌映射,并应用于彩色图像加密,实现了高安全性的加密方案。
Comments Withdrawn as the research requires substantial additional work and major revisions to meet the standard of a complete study
分辨率无关的神经算子用于多速率稀疏视角CT
机构 * Caltech(加州理工学院) ; IIT Kanpur(印度理工学院坎普尔分校) ; Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 CTO提出一种分辨率无关的神经算子框架,通过连续函数空间实现多速率稀疏视角CT重建的泛化,提升重建质量和效率。
面向有效边界表示(B-Rep)生成:无需训练的线框异常检测与修复
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对CAD模型B-Rep生成中线框的几何拓扑异常问题,提出无需训练的WDR框架,通过GTAD检测风险、EGGTR修复,提升了B-Rep有效性且保留模型质量,可集成至多种生成流水线。