Root-Selecting Fixed-Point Inversion for Rectified Flows via Trajectory Straightness
基于轨迹直线度的整流流根选择不动点反演
机构 * KAIST(韩国科学技术院)
专题命中 扩散模型 :image editing(abstract);分类 cs.CV
AI总结 提出SelFix方法,通过选择使逆轨迹更直的不动点解,在整流流中实现精确反演,提升图像重建和编辑质量。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
基于轨迹直线度的整流流根选择不动点反演
机构 * KAIST(韩国科学技术院)
专题命中 扩散模型 :image editing(abstract);分类 cs.CV
AI总结 提出SelFix方法,通过选择使逆轨迹更直的不动点解,在整流流中实现精确反演,提升图像重建和编辑质量。
动作生成应从何处开始?面向生成式机器人策略的可学习源先验
机构 * Southeast University(东南大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出LeaP,用轻量MLP预测基于本体感知的对角高斯分布作为动作生成源先验,替代标准高斯分布,在15个RoboTwin任务中平均成功率81.6%,优于基线方法6.5-25.5个百分点。
MeiBRD:元学习术中生物力学残余变形
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Vanderbilt University(范德堡大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出混合配准框架,利用稀疏术中对应点自适应生物力学先验,通过图神经扩散函数学习残余变形,结合元学习从术中样本中快速适应,在肝脏体模上优于现有方法。
SierpinskiCam: 基于谢尔宾斯基三角形图案线索的相机控制视频重拍
机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; VISTEC, Thailand(泰国威斯泰克科学技术研究院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出SierpinskiCam方法,通过谢尔宾斯基圆顶纹理线索增强几何引导,并引入参考视频条件机制,解决单目视频重拍中相机大角度偏离时的稀疏区域问题,提升相机可控性、几何一致性和视频质量。
Comments 20 pages, 13 figures
精确后验分数估计用于求解线性逆问题
机构 * University of Oxford(牛津大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; EverEx
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出精确后验分数(EPS)方法,通过闭式后验分数将线性逆问题转化为去噪问题,无需梯度或投影,在FFHQ和ImageNet上优于现有方法。
GraphBEV++: 自动驾驶中的多模态特征对齐
机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院,交通数据挖掘与具身智能北京市重点实验室) ; School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) ; University of Macau(澳门大学) ; Nanyang Technological University(南洋理工大学) ; The University of Queensland(昆士兰大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对自动驾驶中BEV感知的特征未对齐问题,提出GraphBEV++框架,通过局部对齐(LocalAlign-v2)和全局对齐(GlobalAlign-v2)模块,利用图匹配、可变形偏移和扩散去噪方法,在多种基准上实现最优性能。
Comments 30 pages, 7 figures
基于累积能量过滤的无训练稀疏注意力
机构 * Huawei Technologies(华为技术有限公司)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出动态阈值策略,在保持固定召回率的同时提高稀疏性,并与Flash Attention深度集成,无需额外掩码计算,在Wan 2.2上稀疏度从61.42%提升至82%,VBench指标下降小于5%。
面向遥感图像与视频的无训练开放词汇视觉定位
机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; Interdisciplinary Institute of Artificial Intelligence, Xidian University(西安电子科技大学跨学科人工智能研究院) ; School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) ; Northwest Institute of Nuclear Technology(西北核技术研究所) ; School of Physics and Information Engineering, Fuzhou University(福州大学物理与信息工程学院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出无训练框架RSVG-ZeroOV,利用冻结的通用基础模型通过概览-聚焦-演化范式实现零样本开放词汇遥感视觉定位,并扩展至视频时空定位,在多个基准上超越现有零样本方法。
迈向全貌:小面积移动传感器的累积指纹映射与重建
机构 * Tsinghua University(清华大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对小面积移动指纹传感中采集与识别不匹配的问题,提出累积映射与重建框架,将局部观测序列转化为统一指纹状态,实现单次匹配,提升效率与鲁棒性。
Track2View: 通过配对3D点轨迹实现4D一致的相机控制视频生成
机构 * Washington University in St. Louis(圣路易斯华盛顿大学) ; University of Copenhagen(哥本哈根大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出Track2View,利用配对3D点轨迹为视频扩散变压器提供显式时空对应,实现新视角视频渲染,在视觉质量、视角同步和相机精度上达到最先进水平。
通过程序化数据增强实现更丰富的材质生成
专题命中 扩散模型 :diffusion(abstract);分类 cs.GR
AI总结 提出一种程序化数据增强方法,将简单PBR材质的单瓣GGX镜面反射扩展为多层模型,以捕获更丰富的非漫反射效果,并通过神经材质编码和扩散模型生成实现更丰富的材质生成。
ReGenHuman: 重新生成人体外观以实现逼真的全身视频匿名化
机构 * Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出ReGenHuman,首个同时实现逼真、时间一致且天生匿名的全身视频匿名化流水线,采用“重新生成而非编辑”范式,利用结构条件微调视频扩散模型合成人体区域。
基于潜在空间运动建模的二维电影心脏磁共振时序一致且可控视频生成
机构 * Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(苏州生物医学工程与技术研究所,中国科学院) ; SyCoIA, IMT Mines Ales(SyCoIA,IMT Mines Ales)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出一种文本到视频生成方法,通过解耦心脏空间结构与时间运动,利用微调扩散模型合成初始帧,再以心脏相位嵌入条件化潜在流模型生成完整运动,实现高时序一致性和解剖可控性。
Journal ref ISBI 2026 - IEEE International Symposium on Biomedical Imaging, Apr 2026, London, United Kingdom. pp.1-4
Ultra Flash: 将实时流式视频生成扩展到高分辨率
机构 * JD Explore Academy(京东探索研究院) ; USTC(中国科学技术大学) ; PKU(北京大学) ; THU(清华大学) ; BUAA(北京航空航天大学) ; FDU(复旦大学) ; HKUST(香港科技大学) ; HKU(香港大学) ; CUHK(香港中文大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出Ultra Flash级联框架,通过架构保持的超分辨率训练、因果流式潜在上采样器和高分辨率解码器、以及级联优化方案,在单GPU上实现1K分辨率约30 FPS和2K分辨率约18 FPS的实时高分辨率流式视频生成。
CausalMotion: 基于关键帧与轨迹引导的结构化物理推理实现免训练视频生成
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; ShanghaiTech University(上海科技大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出CausalMotion框架,利用视觉语言模型将文本提示分解为因果一致的关键帧和物体运动轨迹,作为软约束引导预训练视频扩散模型,无需额外训练即可提升物理合理性和时间连贯性。
Comments Project Page: https://zhuangsh0713.github.io/CausalMotion/
面向不同生成器的可泛化深度伪造检测的多域特征融合框架
机构 * School of Electrical Engineering and Computer Science (SEECS), National University of Sciences and Technology (NUST), Islamabad, Pakistan(巴基斯坦国立科技大学电气工程与计算机科学学院) ; Department of Communication, Quality Management and Information Systems, Mid Sweden University, Ostersund Campus, Sweden(瑞典中部大学通信、质量管理和信息系统系,厄斯特松德校区) ; Department of Computer Science, Electrical and Space Engineering, Lulea University of Technology, Luleå, Sweden(瑞典吕勒奥理工大学计算机科学、电气与空间工程系)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出SGFF-Net,融合空间、梯度和DWT频率表示,在双残差学习架构中实现跨生成器和跨范式的深度伪造检测,准确率提升至79.80%。
时间回溯搜索:测试时生成式视频推理
机构 * Northeastern University(东北大学) ; Independent Researcher(独立研究者) ; Harvard & Kempner(哈佛大学与肯普纳研究所) ; MIT(麻省理工学院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出时间回溯搜索(TBS),通过将搜索空间转移到时间轴,在扩散过程中定位失败点并回溯重启,显著提升视频模型在测试时的推理能力。
利用深度学习薛定谔桥改进月球地形
机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程系) ; NASA Goddard Space Flight Center(美国国家航空航天局戈达德太空飞行中心) ; Center for Research and Exploration in Space Science and Technology (CRESST II), University of Maryland, College Park(马里兰大学帕克分校空间科学与技术研究与探索中心(CRESST II)) ; National Institute for Astrophysics (INAF), Astrophysical Observatory of Turin(意大利国家天体物理研究所(INAF)都灵天体物理天文台)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出基于扩散薛定谔桥的生成模型,结合光学影像约束,实现月球地形超分辨率重建,并提供像素级不确定性估计。
Journal ref The Planetary Science Journal 7.6 (2026): 139
NavWAM:用于目标条件视觉导航的导航世界动作模型
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(国立信息学研究所) ; AIRoA ; ATR
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。
Comments Project page: https://dachii-azm.github.io/navwam/
OmniDirector: 无需配对数据的通用多镜头相机克隆
机构 * Kuaishou Technology(快手科技) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。
Comments 12 pages, 8 figures
VideoMDM: 从2D监督走向3D人体运动生成
机构 * Technion(以色列理工学院) ; NVIDIA(英伟达)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出VideoMDM框架,利用单目视频的2D姿态通过扩散模型学习3D运动先验,使用深度加权的2D重投影损失近似3D监督,在HumanML3D上接近全3D监督性能。
Comments https://videomdm.github.io/
TetherCache: 基于门控召回与可信对齐的自回归长视频生成稳定性方法
机构 * Tsinghua University(清华大学) ; D-INFK, ETH Zürich(苏黎世联邦理工学院计算机科学系)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出TetherCache,一种无需训练、即插即用的缓存管理策略,通过门控召回(GRAB)和可信对齐编辑(TAME)缓解自回归视频扩散模型中的上下文漂移,实现稳定长视频生成。
Comments 17 pages, 8 figures
少步生成模型作为有损压缩
机构 * University of Tokyo(东京大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 研究将少步生成模型(Rectified Flow、CTM、MeanFlow)用于反向信道编码框架进行有损压缩,通过参数化等效和局部高斯近似实现无需重训练的编解码,在低分辨率基准上减少编解码时间并提升低比特率下的真实性。
用于3D打印火星地形模型的立体重建基准测试
机构 * MIT Cambridge, MA, USA(麻省理工学院,马萨诸塞州剑桥,美国)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对火星图像低纹理、不规则和部分观测的特点,评估从NASA好奇号图像估计立体深度、补全几何并导出可打印网格的流程,发现基准精度不直接迁移到火星地形重建,几何补全存在局部保真度与全局连通性的权衡。
Comments 9 pages, 7 figures, CVPR End-to-End 3D Workshop 2026
视频世界模型的潜在空间记忆
机构 * Zhejiang University(浙江大学) ; Microsoft Research(微软研究院) ; Adelaide University(阿德莱德大学) ; Monash University(莫纳什大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。
Comments Project Page: https://aka.ms/latent-spatial-memory, Code: https://github.com/microsoft/LatentSpatialMemory
MemoryVLA++:通过记忆与想象在视觉-语言-动作模型中进行时间建模
机构 * Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; Dexmal ; StepFun
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出MemoryVLA++框架,通过工作记忆、感知-认知记忆库和想象未来状态的世界模型,实现完整时间建模,在模拟和真实机器人任务上显著提升长时域和依赖记忆与想象的任务性能。
Comments The project is available at https://shihao1895.github.io/MemoryVLA-PP-Web
AHA-WAM:异步自适应时域世界-动作建模与观测引导的上下文路由
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Baidu AI Cloud(百度智能云) ; The University of Hong Kong(香港大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出AHA-WAM,一种基于双扩散Transformer的异步时域自适应世界-动作模型,通过低频世界规划器和高频动作执行器解耦时序,实现高效闭环控制,在RoboTwin和真实任务上达到SOTA性能。
Comments Project page: https://serene-sivy.github.io/aha-wam/
视觉提示结合基于特征重建的双教师监督异常检测
机构 * IBM Research Europe Zurich(IBM欧洲研究院苏黎世分院)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 针对异常检测在真实场景中因物体尺度、视角等变化失效的问题,提出视觉提示管道、解冻教师模型和扩散生成数据增强,在AeBAD数据集上提升3.5个百分点。
视频基础模型是否理解直觉物理?逐层探测分析
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 通过冻结特征探测,研究预训练视频基础模型在直觉物理信息上的编码能力,发现V-JEPA表现最佳,物理信息在中后期层最易获取,且时序破坏显著降低性能。
EgoTactile: 从自我中心视频学习日常物体的抓取压力
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 提出EgoTactile基准和条件扩散框架EgoPressureDiff,从自我中心视频估计全手抓取压力,解决视觉-物理歧义,实现鲁棒迁移。
Comments Accepted to ICML2026 spotlight