arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1448 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1448 篇

2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 62%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19537 2026-08-03 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 版本更新 62%

Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook

生成式AI时代的深度伪造媒体生成与检测:综述与展望

Florinel-Alin Croitoru, Andrei-Iulian Hiji, Vlad Hondru, Nicolae Catalin Ristea, Paul Irofti, Marius Popescu, Cristian Rusu, Radu Tudor Ionescu, Fahad Shahbaz Khan, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。

Comments Accepted in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18314 2026-07-29 cs.CV cs.GR cs.RO 版本更新 62%

Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting

Diff2DGS: 通过2D高斯点散布实现遮挡手术场景的可靠重建

Tianyi Song, Danail Stoyanov, Evangelos Mazomenos, Francisco Vasconcelos

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Diff2DGS通过两阶段框架提升遮挡手术场景的3D重建精度,结合扩散模型和可学习变形模型,实现更准确的几何和外观重建。

Comments This work has been accpeted by the IEEE Robotics and Automation Letters(RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新 62%

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05354 2026-06-25 cs.CV cs.GR 版本更新 62%

SplatPainter: Interactive Authoring of 3D Gaussians from 2D Edits via Test-Time Training

SplatPainter: 通过测试时训练从2D编辑交互式创作3D高斯

Yang Zheng, Hao Tan, Kai Zhang, Peng Wang, Leonidas Guibas, Gordon Wetzstein, Wang Yifan

机构 * Stanford University(斯坦福大学) Adobe

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出SplatPainter,一种状态感知的前馈模型,通过测试时训练实现从用户2D视图连续编辑3D高斯资产,支持局部细节优化、涂改和全局重着色,达到交互速度。

Comments project page https://y-zheng18.github.io/SplatPainter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01538 2026-06-12 cs.GR cs.CV cs.LG 版本更新 62%

MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics

MPMWorlds: 用于推断和外推物理动力学的物质点法模拟

Žiga Kovačič, Kevin Ellis

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 通过构建2D物质点法(MPM)模拟数据集,研究从视频推断物理动力学并外推时间演化的能力,比较代码生成与视频扩散方法的优劣。

Comments 16 pages, 13 figures. Project page: https://zzigak.github.io/mpmworlds/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14614 2026-06-10 cs.CV cs.GR 版本更新 62%

WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling

WorldPlay:面向实时交互式世界建模的长期几何一致性

Wenqiang Sun, Haiyu Zhang, Haoyuan Wang, Junta Wu, Zehan Wang, Zhenwei Wang, Yunhong Wang, Jun Zhang, Tengfei Wang, Chunchao Guo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出WorldPlay流式视频扩散模型,通过双重动作表示、重构上下文记忆和上下文强制蒸馏方法,实现实时交互式世界建模并保持长期几何一致性,生成24 FPS的720p长视频。

Comments project page: https://3d-models.hunyuan.tencent.com/world/, demo: https://3d.hunyuan.tencent.com/sceneTo3D, code: https://github.com/Tencent-Hunyuan/HY-WorldPlay

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07011 2026-06-09 cs.CV cs.GR 版本更新 62%

HiMat: DiT-based Ultra-High Resolution SVBRDF Generation

HiMat: 基于DiT的超高分辨率SVBRDF生成

Zixiong Wang, Jian Yang, Yiwei Hu, Milos Hasan, Beibei Wang

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Adobe Research(Adobe研究) NVIDIA Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出HiMat框架,利用扩散变压器和线性注意力在高压缩潜空间生成4K SVBRDF,并通过CrossStitch模块保持跨图一致性,实现高效、多样化的超高分辨率材质生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-25 cs.LG cs.CV 版本更新 57%

Continuous Adversarial MeanFlow Transfer

连续对抗平均流迁移

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出MeanFlow-Transfer与Continuous Adversarial MeanFlow,解决有限数据下新域生成器训练的适配与加速问题,在四个源模型适配五个目标域时,FID等指标相当或更优且NFEs最多减125倍,少步FID平均提29%。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-25 cs.CV 版本更新 57%

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Haoxuan Che, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24289 2026-08-25 cs.CV cs.LG 版本更新 57%

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: https://primecai.github.io/mmm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01479 2026-08-24 cs.CV 版本更新 57%

RecGen3D: Reconstruction-Guided 3D Generation in a Shared Canonical Space

UniRecGen:统一多视图3D重建与生成

Zhisheng Huang, Jiahao Chen, Cheng Lin, Chenyu Hu, Hanzhuo Huang, Zhengming Yu, Mengfei Li, Yuheng Liu, Zekai Gu, Zibo Zhao, Yuan Liu, Xin Li, Wenping Wang

机构 * Macau University of Science and Technology(澳门科技大学) Xidian University(西安电子科技大学) ShanghaiTech University(上海科技大学) Hong Kong University of Science and Technology(香港科技大学) University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 UniRecGen融合了高效重建与生成模型,通过共享空间协作学习提升多视图3D模型的完整性和一致性,实验显示其在稀疏观测下生成更精确稳定的3D模型。

Comments Accepted to SIGGRAPH Asia 2026 (Conference Papers). 21 pages including supplementary material. Code: https://github.com/zsh523/RecGen3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10519 2026-08-21 cs.CV 版本更新 57%

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

SparSTAR:用于时空自回归视频合成的稀疏注意力机制

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17097 2026-08-21 cs.CV 版本更新 57%

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

HarmoHOI:用于多视图手-物体交互合成的外观与3D运动协调

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) Shadow AI(影谱科技)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对多视图手-物体交互合成难题,提出HarmoHOI统一扩散框架,用多视图扩散Transformer混合模型联合建模视频与点轨迹,结合全局运动对齐扩散确保一致性,采用混合数据学习策略,实现多视图HOI高质量合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-08-20 cs.CV cs.LG 版本更新 57%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

Comments Published in TMLR (09/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08115 2026-08-19 cs.CV 版本更新 57%

SUMI: Scalable Unified Model for 3D Point Cloud Inference

SUMI:用于三维点云推理的可扩展统一模型

Yanlong Li, Kanchana Thilakarathna

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对点云补全由粗到精范式中局部细节重构不足的问题,提出扩散增强细化模块SUMI,可集成到现有模型,在多个基准数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00137 2026-08-19 eess.IV cs.CV 版本更新 57%

Two-Stage Teacher-Student Reliable Prior Learning for Robust Underwater Image Enhancement

RPL-UIE:面向水下图像增强的可靠先验学习

Yifan Chen, Jiaming Liu, Ye Zheng, Zhe Sun, Tao Chen

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对水下图像增强的语义漂移问题,提出RPL-UIE两阶段教师-学生框架,结合RPRD与FPRD缩小师生模型先验学习差异,在基准测试、下游视觉任务及真实ROV数据上表现良好。

Comments 34 pages, 10 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01568 2026-08-19 cs.CV 版本更新 57%

Unifying Deep Stochastic Processes for Image Enhancement

统一深度随机过程用于图像增强

Wojciech Kozłowski, Radosław Kuczbański, Kamil Adamczewski, Karol Szczypkowski, Maciej Zięba

机构 * Wrocław University of Science and Technology(沃拉布大学科学与技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文统一了图像增强中的深度随机过程,通过分类为无条件扩散模型、Ornstein-Uhlenbeck过程和扩散桥三类连续时间过程,揭示其共同的SDE框架,并通过实验分析不同设计对性能的影响。

Comments 27 pages, in proceesings of the 43rd International Conference on Machine Learning, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20784 2026-08-19 cs.CV 版本更新 57%

GeoRect4D: Geometry-Compatible Generative Rectification for Dynamic Sparse-View 3D Reconstruction

GeoRect4D:几何兼容的生成性矩形化用于动态稀疏视角3D重建

Zhenlong Wu, Zihan Zheng, Xuanxuan Wang, Lei Huang, Hongwei Hu, Xiaoyun Zhang, Qiang Hu, Wenjun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GeoRect4D框架,通过闭环优化结合显式3D一致性与生成性细化,解决动态稀疏视角3D重建中的几何崩溃和漂移问题,提升重建精度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14462 2026-08-19 cs.CV 版本更新 57%

Unsupervised Deep Generative Models for Anomaly Detection in Neuroimaging: A Systematic Scoping Review

无监督深度生成模型在神经影像中的异常检测:一项系统性综述

Youwan Mahé, Elise Bannier, Stéphanie Leplaideur, Elisa Fromont, Francesca Galassi

机构 * Univ Rennes, Inria, CNRS, Inserm, IRISA UMR 6074, Empenn, Rennes, France(法国里昂大学、Inria、CNRS、Inserm、IRISA UMR 6074、Empenn、里昂) Siemens Healthineers, Courbevoie, France(法国西门子医疗影像公司、Courbevoie) CHU Rennes, Radiology Department, Rennes, France(里昂大学医院、放射科、法国里昂) CHU Rennes, Physical Medicine and Rehabilitation Department, Rennes, France(里昂大学医院、康复医学部、法国里昂) Centre de Kerpape, Ploemeur, France(凯帕尔中心、法国普洛梅尔) Univ Rennes, Inria, CNRS, IRISA, Rennes, France(法国里昂大学、Inria、CNRS、IRISA、里昂)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了无监督深度生成模型在神经影像异常检测中的应用,指出其在病理无关定位中的潜力及现存挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01115 2026-08-19 cs.RO cs.CV 版本更新 57%

KAN We Flow? Advancing Robotic Manipulation with 3D Flow Matching via KAN & RWKV

KAN We Flow? 通过KAN与RWKV实现3D操作的机器人操控进步

Zhihao Chen, Yiyuan Ge, Ziyang Wang, Youwei Zhang

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学智能工程与自动化学院) Beijing Hydrogen Intelligence Technology Co. Ltd.(北京氢能智能科技有限公司) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 KAN-We-Flow通过结合RWKV和KAN技术,实现轻量高效的3D机器人操作策略,显著提升性能与效率。

Comments Accepted By ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08354 2026-08-18 cs.CV 版本更新 57%

Tropical Cyclone Forecasting via Latent Rectified Flow using Satellite Imagery and Atmospheric Fields

基于卫星图像与大气场的潜式整流流热带气旋预报

Meheru Zannat, Sk. Md. Masudul Ahsan

机构 * Khulna University of Engineering & Technology(库尔纳工程技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出单步潜式整流流模型,联合预报热带气旋的卫星图像与大气场,采样速度快、预报精度高,路径误差较基线降低,为热带气旋预报提供高效方案。

Comments 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08670 2026-08-18 cs.CV 版本更新 57%

WaveDiT: Distribution-Aware Wavelet Flow Matching for Efficient 3D Brain MRI Synthesis

WaveDiT: 面向高效3D脑MRI合成的分布感知小波流匹配

Danilo Danese, Angela Lombardi, Giuseppe Fasano, Matteo Attimonelli, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学) Sapienza University of Rome(罗马大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出WaveDiT,一种在3D Haar离散小波变换系数空间中运行的条件流匹配框架,通过分解时空注意力与基于高阶小波统计的带状异方差不确定性建模,实现单GPU上全分辨率3D脑MRI高效合成,在分布对齐和下游任务中优于现有方法。

Comments Provisionally accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12381 2026-08-18 cs.CV 版本更新 57%

Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues

使用CLIP进行合成图像检测:理解和评估预测线索

Marco Willi, Melanie Mathys, Michael Graber

机构 * Institute for Data Science I4DS(数据科学研究所) University of Applied Sciences FHNW(应用科学大学) FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。

Comments 10 figures; 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13037 2026-08-17 cs.CV 版本更新 57%

Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

基于推理时无梯度优化的空间接地文本到视频生成

Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord

机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) Obvious Research

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。

Comments Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30528 2026-08-17 cs.CV cs.LG 版本更新 57%

$μ$Flow: Leveraging Average Images for Improving Generalisation of Deepfake Faces Detectors

$μ$Flow:利用平均图像提升深度伪造人脸检测器的泛化能力

Orazio Pontorno, Mattia Litrico, Luca Guarnera, Mario Valerio Giuffrida, Sebastiano Battiato

机构 * University of Catania(卡塔尼亚大学) University of Nottingham(诺丁汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出仅用真实图像训练的单类深度伪造检测器$μ$Flow,通过平均图像放大生成痕迹并利用归一化流对齐特征分布,实现跨生成器类别的高泛化性能。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31109 2026-08-17 cs.CV 版本更新 57%

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving

InfiniVerse: 面向自动驾驶的占用引导无界场景生成

Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学) Huawei Technologies Ltd.(华为技术有限公司) University of New South Wales(新南威尔士大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出InfiniVerse统一框架,通过3D占用表示和视频扩散模型实现从单帧到长距离、2D-3D对齐的动态城市场景可控生成,在Waymo和nuScenes上达到SOTA。

Comments Paper accepted as poster at ECCV workshop SPAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21378 2026-08-17 cs.CV cs.AI physics.geo-ph 版本更新 57%

An InSAR Phase Unwrapping Framework for Large-scale and Complex Events

一种用于大规模和复杂事件的InSAR相位解包裹框架

Yijia Song, Juliet Biggs, Alin Achim, Robert Popescu, Simon Orrego, Nantheera Anantrasirichai

机构 * Visual Information Laboratory, School of Computer Science, University of Bristol, UK(布里斯托尔大学计算机科学学院视觉信息实验室) COMET, School of Earth Sciences, University of Bristol, UK(布里斯托尔大学地球科学学院COMET中心) COMET, School of Computer Science, University of Bristol, UK(布里斯托尔大学计算机科学学院COMET中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的相位解包裹框架,用于处理大规模干涉图并解决由变形引起的相位不连续性,实验表明其在近地表变形场景中有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11745 2026-08-14 cs.CV 版本更新 57%

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

LiveAnimate:稳定的长时长流驱动人体动画实时生成系统

Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务组) Liblib AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 LiveAnimate基于14B参数视频DiT,经两阶段训练结合PR-Sink等设计,实现19.63 FPS长时长流人体动画生成,兼顾实时性、质量与稳定性,优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30045 2026-08-14 cs.CV 版本更新 57%

DualEraser: Joint Video Object and Effect Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

机构 * Tsinghua University(清华大学) Pengcheng National Laboratory(鹏城实验室) Huawei(华为) Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏