arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-08 至 2025-12-08 共收录 25 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 25 篇

2512.05152 2025-12-08 cs.CV 88%

EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models

EFDiT:利用扩散变换器模型实现高效的细粒度图像生成

Kun Wang, Donglin Di, Tonghua Su, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chongqing Research Institute of HIT(重庆HIT研究所) Li Auto(利汽车) University of New South Wales(新南威尔士大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 EFDiT通过引入分层嵌入器和ProAttention机制,提升细粒度图像生成的语义信息融合和细节表现,优于现有微调方法。

Comments 6pages, 5figures, published to 2025 IEEE International Conference on Multimedia and Expo (ICME), Nantes, France, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03540 2025-12-08 cs.CV cs.AI 85%

CookAnything: A Framework for Flexible and Consistent Multi-Step Recipe Image Generation

CookAnything: 一个灵活且一致的多步骤食谱图像生成框架

Ruoxuan Zhang, Bin Wen, Hongxia Xie, Yi Yao, Songhan Zuo, Jian-Yu Jiang-Lin, Hong-Han Shuai, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Taiwan University(国立台湾大学)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 CookAnything通过引入步骤式区域控制、灵活RoPE和跨步骤一致性控制,实现了灵活且一致的多步骤食谱图像生成,提升复杂烹饪指令的视觉合成质量。

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15432 2025-12-08 cs.CV 85%

MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications

MedDiff-FM: 一种基于扩散的多功能医学图像应用基础模型

Yongrui Yu, Yannian Gu, Shaoting Zhang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学清元研究 institute)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 MedDiff-FM是一种基于扩散的医学图像基础模型,通过预训练和微调实现多种医学图像处理任务,如去噪、异常检测和超分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15663 2025-12-08 cs.SE cs.AI 85%

SustainDiffusion: Optimising the Social and Environmental Sustainability of Stable Diffusion Models

SustainDiffusion: 优化稳定扩散模型的社会和环境可持续性

Giordano d'Aloisio, Tosin Fadahunsi, Jay Choy, Rebecca Moussa, Federica Sarro

机构 * University of L'Aquila(拉奎拉大学) University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 SustainDiffusion通过优化超参数和提示结构,减少稳定扩散模型的性别、种族偏见和能耗,提升其社会和环境可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05198 2025-12-08 cs.CV cs.GR cs.LG 84%

Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models

你的潜在掩码是错的:用于扩散模型的像素等效潜在合成

Rowan Bradbury, Dazhi Zhong

机构 * Bradbury Group(布拉德伯格集团)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本文提出PELC原则,通过DecFormer实现像素等效潜在合成,提升扩散模型在补全任务中的性能与保真度。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01498 2025-12-08 cs.CV cs.AI 83%

AortaDiff: A Unified Multitask Diffusion Framework For Contrast-Free AAA Imaging

AortaDiff:一种用于无对比剂AAA成像的统一多任务扩散框架

Yuxuan Ou, Ning Bi, Jiazhen Pan, Jiancheng Yang, Boliang Yu, Usama Zidan, Regent Lee, Vicente Grau

机构 * Department of Engineering Science, University of Oxford, United Kingdom(牛津大学工程科学系) Nuffield Department of Surgical Sciences, University of Oxford, United Kingdom(牛津大学外科科学努尔菲尔德系) Technical University of Munich, Germany(慕尼黑技术大学) ELLIS Institute Finland, Finland(芬兰ELLIS研究所) Aalto University, Finland(阿alto大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 AortaDiff通过统一多任务扩散框架实现无对比剂AAA成像,同时生成合成CECT图像并分割主动脉腔和血栓,提升了分割精度和临床测量准确性。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05754 2025-12-08 cs.CV 79%

USV: Unified Sparsification for Accelerating Video Diffusion Models

USV:统一稀疏化以加速视频扩散模型

Xinjian Wu, Hongmei Wang, Yuan Zhou, Qinglin Lu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 USV通过统一稀疏化策略提升视频扩散模型的效率,实现去噪速度提升83.3%和端到端加速22.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05240 2025-12-08 cs.CV 79%

IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction

IE2Video: 适配预训练扩散模型以实现事件视频重建

Dmitrii Torbunov, Onur Okuducu, Yi Huang, Odera Dim, Rebecca Coles, Yonggang Cui, Yihui Ren

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IE2Video通过适配预训练扩散模型,实现从单帧和事件数据重建RGB视频,提升视频重建质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05134 2025-12-08 cs.CV cs.DC cs.LG 79%

InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models

InvarDiff:跨尺度不变性缓存用于加速扩散模型

Zihao Wu

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 InvarDiff通过利用扩散模型中时间步和层尺度的跨尺度不变性,实现无需训练的加速方法,显著提升推理速度并保持图像保真度。

Comments 8 pages main, 8 pages appendix, 16 figures, 5 tables. Code: https://github.com/zihaowu25/InvarDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04926 2025-12-08 cs.CV 79%

Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion

语义优先:通过异步潜在扩散和谐统一语义与纹理建模

Yueming Pan, Ruoyu Feng, Qi Dai, Yuqi Wang, Wenfeng Lin, Mingyu Guo, Chong Luo, Nanning Zheng

机构 * IAIR, Xi’an Jiaotong University(西安交通大学IAIR) Microsoft Research Asia(微软亚洲研究院) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SFD通过异步方式优先生成语义,提升潜在扩散模型在图像生成中的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01826 2025-12-08 cs.CV 79%

GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer

GLDiTalker: 基于图潜在扩散变换器的语音驱动3D面部动画

Yihong Lin, Zhaoxin Fan, Xianjia Wu, Lingyu Xiong, Liang Peng, Xiandong Li, Wenxiong Kang, Songju Lei, Huang Xu

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Huawei Cloud(华为云) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GLDiTalker通过图潜在扩散变换器解决语音驱动3D面部动画中的模态不一致问题,提升唇形同步精度和运动多样性。

Comments 9 pages, 5 figures

Journal ref the 34th International Joint Conference on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05829 2025-12-08 math.AP math-ph math.CV math.MP 78%

Higher-order diffusion and Cahn-Hilliard-type models revisited on the half-line

高阶扩散与Cahn-Hilliard型模型重新审视在半线上的应用

A. Chatziafratis, A. Miranville, G. Karali, A. S. Fokas, E. C. Aifantis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过Fokas统一变换方法和新方法的协同作用,研究了四阶扩散方程及其Cahn-Hilliard模型在半线上的初始边界值问题,推导了解的正则性和渐进行为,并构造了新的反例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04596 2025-12-08 cs.LG 78%

QoSDiff: An Implicit Topological Embedding Learning Framework Leveraging Denoising Diffusion and Adversarial Attention for Robust QoS Prediction

QoSDiff: 一种利用去噪扩散和对抗注意力的隐式拓扑嵌入学习框架,用于鲁棒的QoS预测

Guanchen Du, Jianlong Xu, Wei Wei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 QoSDiff通过去噪扩散和对抗注意力机制,实现隐式拓扑关系建模,提升QoS预测的鲁棒性和泛化能力。

Comments Preprint submitted to IEEE Transactions on Services Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18680 2025-12-08 cs.IT eess.SP math.IT 78%

Spatiotemporal First-Arrival Modeling and Parameter Estimation in Drift-Diffusion Molecular Channels

时空首到达建模与在漂移扩散分子通道中的参数估计

Yun-Feng Lo, Yen-Chi Lee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于时空耦合建模的分子通道参数估计方法,通过漂移移键技术实现了对不可检测信号的可靠检测。

Comments 5 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07339 2025-12-08 cs.RO cs.AI cs.LG 67%

Real-Time Execution of Action Chunking Flow Policies

实时执行动作分块流策略

Kevin Black, Manuel Y. Galliker, Sergey Levine

机构 * Physical Intelligence(物理智能) UC Berkeley(伯克利大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract)

AI总结 本文提出实时分块(RTC)方法,通过在执行当前动作分块的同时生成下一个分块,实现动作分块策略的实时异步执行,提升任务吞吐量和精确任务成功率。

Comments published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05928 2025-12-08 cs.CV 57%

A Comparative Study on Synthetic Facial Data Generation Techniques for Face Recognition

合成面部数据生成技术在人脸识别中的比较研究

Pedro Vidal, Bernardo Biesseck, Luiz E. L. Coelho, Roger Granada, David Menotti

机构 * Department of Informatics, Federal University of Paraná(帕拉那联邦大学信息学院) IFMT, Pontes e Lacerda(Pontes e Lacerda 工业技术学院) UFMG(伯南布哥大学) Unico IDTech(Unico IDTech 公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究比较了不同合成面部数据生成技术在人脸识别中的有效性,评估了多个数据集上的性能,指出合成数据在捕捉现实变化方面的潜力及进一步研究的必要性。

Comments 18 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00769 2025-12-08 cs.CV 57%

ZQBA: Zero Query Black-box Adversarial Attack

ZQBA:零查询黑盒对抗攻击

Joana C. Costa, Tiago Roxo, Hugo Proença, Pedro R. M. Inácio

机构 * sins-lab(sins实验室) Instituto de Telecomunicações(电信研究所) Universidade da Beira Interior(贝拉内大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ZQBA通过利用深度神经网络的特征图生成对抗样本,无需多次查询即可有效攻击目标模型,且保持扰动不可察觉性。

Comments Accepted in ICAART 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05139 2025-12-08 cs.CV cs.LG stat.ML 57%

Spatiotemporal Satellite Image Downscaling with Transfer Encoders and Autoregressive Generative Models

时空卫星图像降尺度的迁移编码与自回归生成模型

Yang Xiang, Jingwen Zhong, Yige Yan, Petros Koutrakis, Eric Garshick, Meredith Franklin

机构 * University of Toronto(多伦多大学) Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院) Harvard Medical School(哈佛医学院) VA Healthcare System Boston, U.S. Department of Veterans Affairs(美国退伍军人事务部波士顿医疗系统)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于迁移学习和自回归生成模型的时空卫星图像降尺度方法,通过预训练U-Net编码器和扩散模型,实现高分辨率图像重建,提升环境监测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20949 2025-12-08 cond-mat.mtrl-sci 50%

SMC-X: A Distributed Scalable Monte Carlo Simulation Method for Chemically Complex Alloys

SMC-X:一种用于化学复杂合金的分布式可扩展蒙特卡罗模拟方法

Xianglin Liu, Kai Yang, Fanli Zhou, Pengxiang Xu

专题命中 扩散模型 :diffusion(abstract)

AI总结 SMC-X方法通过分布式计算实现了大规模原子级模拟,突破性地模拟了1280亿原子的高熵合金系统,为理解纳米沉淀尺寸的理论预测提供了重要支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05685 2025-12-08 math.DS 50%

An output scaling layer boosts deep neural networks for multiscale ODE systems

输出缩放层提升深度神经网络用于多尺度ODE系统

Yuxiao Yi, Weizong Wang, Tianhan Zhang, Zhi-Qin John Xu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出GBCT方法,通过非线性缩放缓解多尺度ODE系统的挑战,显著提升深度神经网络的预测精度和训练效率。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05297 2025-12-08 cs.LG cs.AI cs.NA math.NA 50%

CFO: Learning Continuous-Time PDE Dynamics via Flow-Matched Neural Operators

CFO: 通过流匹配神经算子学习连续时间PDE动力学

Xianglong Hou, Xinquan Huang, Paris Perdikaris

机构 * Graduate Group in Applied Mathematics and Computational Science(应用数学与计算科学联合研究生组) Department of Mechanical Engineering and Applied Mechanics(机械工程与应用力学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 CFO通过流匹配神经算子学习连续时间PDE动力学,实现高效且稳定的长期预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05296 2025-12-08 cond-mat.mtrl-sci cond-mat.mes-hall physics.app-ph physics.chem-ph physics.comp-ph 50%

Mapping vacancy and bonding electron distributions around aluminium nanovoids

铝纳米空洞周围空位和结合电子分布的映射

Philip N. H. Nakashima, Yu-Tsun Shao, Zezhong Zhang, Andrew E. Smith, Tianyu Liu, Nikhil V. Medhekar, Joanne Etheridge, Laure Bourgeois, Jian-Min Zuo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出了一种方法,用于测量铝中纳米空洞周围空位和结合电子分布,揭示了受辐射损坏空洞的自愈现象,并为多相纳米结构材料的电子特性研究提供了新途径。

Comments 69 pages, 4 main figures, 11 extended data figures, 9 supplementary figures, 1 main table, 1 supplementary table, 96 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06135 2025-12-08 physics.flu-dyn 50%

Thermo-viscous instability of flow in a weakly heat-conducting channel

弱导热通道中流体的热粘性不稳定性

Federico Lanza, Gaute Linga, Fabian Barras, Eirik Grude Flekkøy

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究弱导热通道中热粘性流体的不稳定性,揭示其在高佩奇数和大粘度对比下的标度行为及模式选择机制。

Comments 46 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09290 2025-12-08 cond-mat.mes-hall cond-mat.str-el 50%

Spin phase detection by spin current in a chiral helimagnet

通过手性螺旋磁体中的自旋电流检测自旋相

Nan Jiang, Shota Suzuki, Issei Sasaki, Kazuki Yamada, Ryoma Kawahara, Shintaro Takada, Yusuke Shimamoto, Hiroki Shoji, Yusuke Kousaka, Jun-ichiro Ohe, Yoshihiko Togawa, Yasuhiro Niimi

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过自旋电流检测手性螺旋磁体中的自旋相,为纳米级自旋电子器件提供了新的内部自由度利用方法。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05429 2025-12-08 cond-mat.mtrl-sci 50%

Investigating electron conductivity regimes in the bacterial cytochrome wire OmcS

研究细菌细胞色素线中的电子导电性区域

L. N. Mohanam, R. Umeda, L. Gu, Y. Song, D. J. Tobias, A. I. Hochbaum, R. Wu, S. Sharifzadeh

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究OmcS线中的电子导电性区域,通过量子模型揭示血红素排列与长程导电性的关系

详情

展开后加载摘要…

URL PDF HTML 收藏