arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-26 至 2025-11-26 共收录 82 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2511.19965 2025-11-26 cs.CV 91%

HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning

HiCoGen: 通过强化学习在扩散模型中实现层次化组合文本到图像生成

Hongji Yang, Yucheng Zhou, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Zhejiang ZEEKR Automobile Research & Development Co., Ltd.(浙江浙汽汽车研发有限公司)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 HiCoGen通过强化学习和层次化合成框架提升文本到图像生成的组合性和准确性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19458 2025-11-26 cs.CV cs.AI 86%

Personalized Reward Modeling for Text-to-Image Generation

面向文本到图像生成的个性化奖励建模

Jeongeun Lee, Ryang Heo, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 PIGReward通过动态生成用户条件评估维度和推理过程,实现文本到图像生成的个性化评估与优化,提升生成图像与个体意图的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08701 2025-11-26 cs.CV cs.AI cs.LG 79%

SafeFix: Targeted Model Repair via Controlled Image Generation

SafeFix: 通过受控图像生成实现目标模型修复

Ouyang Xu, Baoming Zhang, Ruiyu Mao, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 SafeFix通过生成语义忠实的图像来修复模型,提升模型对罕见案例的鲁棒性,减少系统性错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14993 2025-11-26 cs.AI cs.CV 70%

Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification

多模态生成式AI:多模态大语言模型、扩散模型与统一

Xin Wang, Yuwei Zhou, Bin Huang, Hong Chen, Wenwu Zhu

机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。

Comments 21 pages, 10 figures, 3 tables

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03263 2025-11-26 cs.LG cs.AI 50%

Memory Self-Regeneration: Uncovering Hidden Knowledge in Unlearned Models

记忆自我再生:在未学习模型中揭示隐藏知识

Agnieszka Polowczyk, Alicja Polowczyk, Joanna Waczyńska, Piotr Borycki, Przemysław Spurek

机构 * Silesian University of Technology(谢勒斯大学技术学院) Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出记忆自我再生任务和MemoRa策略,旨在解决模型遗忘难题,通过增强知识检索的鲁棒性提升反学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2511.19435 2025-11-26 cs.CV 70%

Are Image-to-Video Models Good Zero-Shot Image Editors?

图像到视频模型是否是良好的零样本图像编辑器?

Zechuan Zhang, Zhenyuan Chen, Zongxin Yang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 IF-Edit通过无需微调的框架,利用预训练图像到视频扩散模型实现指令驱动的图像编辑,解决提示错位、冗余时间潜在特征和模糊后期帧问题,展现强大的推理能力和通用编辑竞争力。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20640 2025-11-26 cs.CV cs.AI cs.GR cs.LG 62%

MotionV2V: Editing Motion in a Video

MotionV2V: 视频中运动的编辑

Ryan Burgert, Charles Herrmann, Forrester Cole, Michael S Ryoo, Neal Wadhwa, Andrey Voynov, Nataniel Ruiz

机构 * Google(谷歌) Stony Brook University(石溪大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MotionV2V通过直接编辑稀疏轨迹实现视频运动编辑,利用生成性主干提升视频编辑能力,在用户研究中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 50 篇

2511.19990 2025-11-26 cs.CV 83%

OmniRefiner: Reinforcement-Guided Local Diffusion Refinement

OmniRefiner: 基于强化学习的局部扩散细化

Yaoli Liu, Ziheng Ouyang, Shengtao Lou, Yiren Song

机构 * Zhejiang University(浙江大学) Nankai University(南开大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 OmniRefiner通过强化学习和局部扩散细化技术,提升参考引导图像生成中细粒度细节的保留与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19936 2025-11-26 cs.CV 83%

Image Diffusion Models Exhibit Emergent Temporal Propagation in Videos

图像扩散模型在视频中表现出涌现的时间传播

Youngseo Kim, Dohyun Kim, Geonhee Han, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(计算机科学与工程系,韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DRIFT框架,利用预训练图像扩散模型和SAM引导的掩码细化,实现视频中鲁棒的零样本物体跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19910 2025-11-26 eess.IV cs.CV 83%

DLADiff: A Dual-Layer Defense Framework against Fine-Tuning and Zero-Shot Customization of Diffusion Models

DLADiff: 一种双层防御框架,用于对抗扩散模型的微调和零样本定制

Jun Jia, Hongyi Miao, Yingjie Zhou, Linhan Cao, Yanwei Jiang, Wangqiu Zhou, Dandan Zhu, Hua Yang, Wei Sun, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Hefei University of Technology(合肥工业大学) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DLADiff提出一种双层防御框架,通过双代理模型和交替动态微调有效防御扩散模型的微调和零样本生成攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19385 2025-11-26 cs.CV cs.AI 83%

Advancing Limited-Angle CT Reconstruction Through Diffusion-Based Sinogram Completion

通过扩散基于的sinogram补全推进有限角度CT重建

Jiaqi Guo, Santiago Lopez-Tapia, Aggelos K. Katsaggelos

机构 * Dept. of Electrical and Computer Engineering, Northwestern University, Evanston, IL, USA(电气与计算机工程系,西北大学,爱荷华州埃文斯顿)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的sinogram补全方法,结合蒸馏和伪逆约束,实现高效准确的有限角度CT重建,有效抑制伪影并保持结构细节。

Comments Accepted at the 2025 IEEE International Conference on Image Processing (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20390 2025-11-26 cs.CV 79%

FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers

FREE: 用于并行扩散变换器的不确定性感知自回归

Xinwan Wen, Bowen Li, Jiajun Luo, Ye Li, Zhi Wang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FREE通过引入不确定性感知的自回归方法,在并行扩散变换器中实现高效的无损加速,提升去噪效率的同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20263 2025-11-26 cs.CV 79%

Advancing Image Classification with Discrete Diffusion Classification Modeling

通过离散扩散分类建模推进图像分类

Omer Belhasin, Shelly Golan, Ran El-Yaniv, Michael Elad

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiDiCM框架,利用扩散过程建模类别标签的后验分布,以提升图像分类在高不确定性条件下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13344 2025-11-26 cs.CV cs.AI cs.LG 79%

RoPECraft: Training-Free Motion Transfer with Trajectory-Guided RoPE Optimization on Diffusion Transformers

RoPECraft:基于轨迹引导的RoPE优化实现无需训练的运动迁移

Ahmet Berke Gokmen, Yigit Ekin, Bahri Batuhan Bilecen, Aysegul Dundar

机构 * Bilkent University(比尔肯大学) ETH Zurich(苏黎世联邦理工学院) Max Planck Institute(马克斯·普朗克研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RoPECraft通过轨迹引导的RoPE优化实现无需训练的视频运动迁移,有效编码运动并提升生成质量。

Comments https://berkegokmen1.github.io/RoPECraft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15631 2025-11-26 eess.IV cs.CV 79%

A Diffusion Model for Simulation Ready Coronary Anatomy with Morpho-skeletal Control

一种具有形态-骨骼控制的可用于模拟的冠状动脉解剖扩散模型

Karim Kadry, Shreya Gupta, Jonas Sogbadji, Michiel Schaap, Kersten Petersen, Takuya Mizukami, Carlos Collet, Farhad R. Nezami, Elazer R. Edelman

机构 * Institute of Medical Engineering, MIT(麻省理工学院医学工程研究所) Brigham and Women's Hospital, Harvard(哈佛大学布莱尔妇女医院) HeartFlow(HeartFlow公司) Showa University(昭和大学) OLV Aalst

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于潜在扩散模型的冠状动脉解剖生成方法,通过形态-骨骼控制实现可控的解剖合成,用于虚拟干预研究。

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20587 2025-11-26 cs.LG 78%

Anatomica: Localized Control over Geometric and Topological Properties for Anatomical Diffusion Models

Anatomica: 通过几何和拓扑属性的局部控制实现解剖扩散模型

Karim Kadry, Abdallah Abdelwahed, Shoaib Goraya, Ajay Manicka, Naravich Chutisilp, Farhad Nezami, Elazer Edelman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Anatomica通过局部几何和拓扑控制生成解剖体素地图,支持多类解剖结构的高效生成与控制。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20470 2025-11-26 cs.SD cs.AI 78%

Efficient and Fast Generative-Based Singing Voice Separation using a Latent Diffusion Model

高效且快速的基于生成模型的歌唱语音分离

Genís Plaja-Roglans, Yun-Ning Hung, Xavier Serra, Igor Pereira

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于潜在扩散模型的高效歌唱语音分离方法,通过仅使用孤立人声和混音对进行训练,提升了分离性能和推理效率,并发布模块化工具包供进一步研究。

Comments Accepted for oral presentation at IJCNN 2025

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN), Rome, Italy, 2025, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20122 2025-11-26 cs.IR 78%

Towards A Tri-View Diffusion Framework for Recommendation

迈向推荐任务的三视扩散框架

Ximing Chen, Pui Ieng Lei, Yijun Sheng, Yanyan Liu, Zhiguo Gong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种三视扩散框架,通过最大化亥姆霍兹自由能结合能量最大化和熵最小化,提升推荐任务的准确性和效率。

Comments 13 pages, 11 figures, accepted by KDD2026 (First Cycle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20015 2025-11-26 cs.LG cs.SY eess.SY 78%

iRadioDiff: Physics-Informed Diffusion Model for Indoor Radio Map Construction and Localization

iRadioDiff:基于物理的扩散模型用于室内无线电地图构建与定位

Xiucheng Wang, Tingwei Yuan, Yang Cao, Nan Cheng, Ruijin Sun, Weihua Zhuang

机构 * State Key Laboratory of ISN(信息与通信工程国家重点实验室) Xidian University(西安电子科技大学) School of Telecommunications Engineering(电信工程学院) School of Artificial Intelligence(人工智能学院) School of Information Science and Technology(信息科学与技术学院) Southwest Jiaotong University(西南交通大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 iRadioDiff通过物理引导的扩散模型实现高保真室内无线电地图构建与定位,结合多路径先验和物理约束提升建模精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19984 2025-11-26 cs.LG 78%

Rethinking Message Passing Neural Networks with Diffusion Distance-guided Stress Majorization

重新思考基于扩散距离引导的压力主要化的消息传递神经网络

Haoran Zheng, Renchi Yang, Yubo Zhou, Jianliang Xu

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DDSM模型,通过引入扩散距离和压力主要化技术,解决MPNNs中的过度平滑和相关性问题,并在多种图结构上取得优异性能。

Comments Accepted by SIGKDD 2026. The code is available at https://github.com/HaoranZ99/DDSM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19924 2025-11-26 math.PR 78%

Maximal Solutions and Stochastic Free Boundary Formulations for Stochastic Willmore and Surface Diffusion Flows on $\R^2$

随机Willmore流与表面扩散流在R²上的最大解与随机自由边界公式

Qi Yan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了随机Willmore流和表面扩散流在R²上的最大解问题,通过将问题转化为随机Stefan问题并应用相关理论,证明了局部强解的存在性和唯一性。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19664 2025-11-26 cs.LG stat.ML 78%

Demystifying Diffusion Objectives: Reweighted Losses are Better Variational Bounds

解析扩散目标:加权损失是更好的变分界界

Jiaxin Shi, Michalis K. Titsias

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种新的理论框架,通过构建时间依赖的变分下界,改进了扩散模型的训练目标,提升了图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17532 2025-11-26 cs.NI cs.AI 78%

Denoising Refinement Diffusion Models for Simultaneous Generation of Multi-scale Mobile Network Traffic

去噪细化扩散模型用于多尺度移动网络流量的同时生成

Xiaoqian Qi, Haoye Chai, Sichang Liu, Lei Yue, Raoyuan Pan, Yue Wang, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京理工大学,清华大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) China Mobile Communications Group Guangxi Co., Ltd.(中国移动通信集团广西有限公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ZoomDiff通过多阶段去噪细化扩散模型实现多尺度移动网络流量的同时生成,提升了流量预测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07902 2025-11-26 cs.LG physics.comp-ph stat.ML 78%

FunDiff: Diffusion Models over Function Spaces for Physics-Informed Generative Modeling

FunDiff: 在函数空间中基于扩散模型的物理引导生成建模

Sifan Wang, Zehao Dou, Siming Shan, Tong-Rui Liu, Lu Lu

机构 * Institute for Foundations of Data Science, Yale University(数据科学基础研究所,耶鲁大学) Department of Statistics and Data Science, Yale University(统计与数据科学系,耶鲁大学) Laboratoire Navier, École nationale des ponts et chaussées, Institut Polytechnique de Paris, University Gustave Eiffel, CNRS UMR 8205(纳维实验室,巴黎理工学院,格斯塔夫·埃菲尔大学,CNRS UMR 8205) Department of Chemical and Environmental Engineering, Yale University(化学与环境工程系,耶鲁大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FunDiff通过结合扩散过程与函数自编码器,实现函数空间中的物理引导生成建模,确保生成样本符合物理定律并具备高保真度。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20715 2025-11-26 math.NA cs.NA 78%

Neural semi-Lagrangian method for high-dimensional advection-diffusion problems

神经半拉格朗日方法用于高维对流-扩散问题

Emmanuel Franck, Victor Michel-Dansac, Laurent Navoret, Vincent Vigon

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种结合半拉格朗日方法和神经网络的新型方法,用于高维对流-扩散问题的高效数值近似。

Journal ref Computer Methods in Applied Mechanics and Engineering Volume 448, Part B, 1 January 2026, 118481

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11051 2025-11-26 math.PR 78%

Darboux Transformation of Diffusion Processes

扩散过程的达布变换

Alexey Kuznetsov, Minjian Yuan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文从马尔可夫半群角度研究扩散过程的达布变换,结合Doob变换和对称性方法,推导出连接两个过程转移概率密度的公式,并给出相关例子的显式计算。

Journal ref SIGMA 21 (2025), 099, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13641 2025-11-26 math.PR math.AP 78%

A critical drift-diffusion equation: intermittent behavior

一个关键的漂移扩散方程:间歇行为

Felix Otto, Christian Wagner

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过分析漂移扩散过程中的临界情况,揭示了调和坐标下雅可比矩阵的尖锐非正交特性,并将其与间歇性现象联系起来。

Comments Parts of the results of this unpublished preprint are subsumed by the new preprint arXiv:2511.15473

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12099 2025-11-26 cs.CV 77%

Zero-Shot Video Translation via Token Warping

零样本视频翻译 via 标签扭曲

Haiming Zhu, Yangyang Xu, Jun Yu, Shengfeng He

机构 * School of Computer Science and Engineering at South China University of Technology(华南理工大学计算机科学与工程学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算机与信息系)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出TokenWarping框架,通过光流扭曲提升视频翻译的时间一致性与质量。

Comments Code is available at: https://github.com/Alex-Zhu1/TokenWarping

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20520 2025-11-26 cs.CV 57%

HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation

HBridge: 通过非对称H形架构桥接异构专家以实现统一的多模态理解和生成

Xiang Wang, Zhifei Zhang, He Zhang, Zhe Lin, Yuqian Zhou, Qing Liu, Shiwei Zhang, Yijun Li, Shaoteng Liu, Haitian Zheng, Jason Kuen, Yuehuan Wang, Changxin Gao, Nong Sang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 HBridge通过非对称H形架构,优化异构专家的模态先验利用,提升多模态生成效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20307 2025-11-26 cs.CV 57%

TReFT: Taming Rectified Flow Models For One-Step Image Translation

TReFT: 修正流模型用于一步图像翻译

Shengqian Li, Ming Gao, Yi Liu, Zuzeng Lin, Feng Wang, Feng Dai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Beihang University(北航) Tianjin University(天津大学) CreateAI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 TReFT通过简化架构和优化损失函数,实现修正流模型在一步图像翻译中的高效实时应用。

详情

展开后加载摘要…

URL PDF HTML 收藏