arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-23 至 2025-12-23 共收录 84 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 84 篇

2407.16292 2025-12-23 cs.CY cs.AI 85%

Visual Stereotypes of Autism Spectrum in Janus-Pro-7B, DALL-E, Stable Diffusion, SDXL, FLUX, and Midjourney

自闭症光谱的视觉刻板印象:Janus-Pro-7B、DALL-E、Stable Diffusion、SDXL、FLUX和Midjourney的视觉表现

Maciej Wodziński, Marcin Rządeczka, Anastazja Szuła, Kacper Dudzic, Marcin Moskalewicz

机构 * Maria Curie-Skłodowska University(玛丽·居里大学) IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本研究评估了六个AI图像生成模型在自闭症相关图像中的刻板印象表现,发现尽管技术有所改进,但模型在再现潜在有害刻板印象方面无显著变化。

Comments Preprint of a publication accepted to Identity-Aware AI 2025 (ECAI 2025)

Journal ref CEUR Workshop proceeding, 2025, Vol-4136 urn:nbn:de:0074-4136-x; https://ceur-ws.org/Vol-4136/iaai15.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23484 2025-12-23 cs.MM cs.CV eess.IV 84%

TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity

TAG-WM: 通过扩散反向敏感性实现的抗篡改生成图像水印

Yuzhuo Chen, Zehua Ma, Han Fang, Weiming Zhang, Nenghai Yu

机构 * Anhui Province Key Laboratory of Digital Security, University of Science and Technology of China(安徽省数字安全重点实验室,中国科学技术大学) School of Computing, National University of Singapore(computing学院,新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 TAG-WM通过扩散反向敏感性实现抗篡改生成图像水印,提升篡改鲁棒性和定位能力,保持生成质量与水印容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05844 2025-12-23 cs.CV cs.AI cs.IT cs.LG eess.IV math.IT 84%

Enhancing Diffusion Model Guidance through Calibration and Regularization

通过校准和正则化增强扩散模型引导

Seyed Alireza Javid, Amirhossein Bagheri, Nuria González-Prelcic

机构 * UC San Diego(加州大学圣迭戈分校) Politecnico di Milano(米兰理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文通过校准和正则化方法提升扩散模型引导效果,改进分类器校准和采样策略,提升图像生成质量。

Comments Accepted from NeurIPS 2025 Workshop on Structured Probabilistic Inference & Generative Modeling. Code available at https://github.com/ajavid34/guided-info-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV 83%

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18254 2025-12-23 cs.CV 83%

Loom: Diffusion-Transformer for Interleaved Generation

Loom:用于交错生成的扩散-变压器

Mingcheng Ye, Jiaming Liu, Yiren Song

机构 * Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Loom通过统一的扩散-变压器框架实现交错生成,提供更高效和可控的长周期生成,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18161 2025-12-23 cs.CV 83%

Local Patches Meet Global Context: Scalable 3D Diffusion Priors for Computed Tomography Reconstruction

局部片段与全局上下文:用于计算机断层扫描重建的可扩展3D扩散先验

Taewon Yang, Jason Hu, Jeffrey A. Fessler, Liyue Shen

机构 * EECS Department, University of Michigan(密歇根大学电子工程与计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种3D片段基扩散模型,通过学习3D片段先验实现高效高分辨率3D CT重建,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09922 2025-12-23 cs.LG 82%

Prototype-Guided Diffusion: Visual Conditioning without External Memory

原型引导扩散:无需外部记忆的视觉条件生成

Bilal Faye, Hanane Azzag, Mustapha Lebbah

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 原型引导扩散模型通过对比学习生成紧凑视觉原型,实现无需外部记忆的高效图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 79%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19584 2025-12-23 eess.IV cs.CV physics.med-ph 79%

Patlak Parametric Image Estimation from Dynamic PET Using Diffusion Model Prior

基于扩散模型先验的动态PET参数图像估计

Ziqian Huang, Boxiao Yu, Siqi Li, Savas Ozdemir, Sangjin Bae, Jae Sung Lee, Guobao Wang, Kuang Gong

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(J. Crayton Pruitt家族生物医学工程系,佛罗里达大学) Department of Radiology, University of Florida(放射学系,佛罗里达大学) Interdisciplinary Program in Bioengineering, Seoul National University(生物工程跨学科项目,首尔国立大学) Department of Nuclear Medicine, Seoul National University College of Medicine(核医学系,首尔国立大学医学院) Department of Radiology, University of California Davis Health(放射学系,加州大学戴维斯医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的动态PET参数图像估计框架,利用Patlak模型提升图像质量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18843 2025-12-23 cs.CV 79%

Brain-Gen: Towards Interpreting Neural Signals for Stimulus Reconstruction Using Transformers and Latent Diffusion Models

Brain-Gen: 向利用Transformer和潜在扩散模型解释神经信号以实现刺激重建

Hasib Aslam, Muhammad Talal Faiz, Muhammad Imran Malik

机构 * School of Electrical Engineering and Computer Science, National University of Sciences and Technology (NUST)(电气工程与计算机科学学院,国立科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Brain-Gen通过结合Transformer和潜在扩散模型,从EEG信号中提取空间-时间表示,实现对视觉刺激的重建,提升了EEG信号的语义解释能力。

Comments 21 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 79%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12159 2025-12-23 cs.CV 79%

DPL: Spatial-Conditioned Diffusion Prototype Enhancement for One-Shot Medical Segmentation

DPL:基于扩散的原型增强用于单次医疗分割

Ziyuan Gao, Philippe Morel

机构 * University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPL通过扩散增强和空间感知条件机制,提升单次医疗图像分割的原型表示能力,实现更鲁棒的泛化性能。

Comments Accepted at IVCNZ 2025. To be published in IEEE proceedings

Journal ref 2025 40th International Conference on Image and Vision Computing New Zealand (IVCNZ), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12538 2025-12-23 eess.IV cs.CV 79%

High Frequency Matters: Uncertainty Guided Image Compression with Wavelet Diffusion

高频至关重要:基于小波扩散的不确定性引导图像压缩

Juan Song, Jiaxiang He, Lijie Yang, Mingtao Feng, Keyan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于小波扩散的不确定性引导图像压缩方法,通过高频压缩和残差编解码器提升图像压缩的保真度和效率。

Comments Revised version for IEEE TMM submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18241 2025-12-23 cs.CV 79%

SG-RIFE: Semantic-Guided Real-Time Intermediate Flow Estimation with Diffusion-Competitive Perceptual Quality

SG-RIFE:基于语义的实时中间流估计与扩散竞争感知质量

Pan Ben Wong, Chengli Wu, Hanyue Lu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SG-RIFE通过引入语义引导的微调策略和模块,实现了在实时条件下超越扩散方法的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 79%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12691 2025-12-23 cs.LG cs.AI cs.CV 79%

DiffEM: Learning from Corrupted Data with Diffusion Models via Expectation Maximization

DiffEM: 通过期望最大化从损坏数据中学习扩散模型

Danial Hosseintabar, Fan Chen, Giannis Daras, Antonio Torralba, Constantinos Daskalakis

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffEM通过期望最大化从损坏数据中学习扩散模型,利用条件扩散模型重建干净数据并优化模型参数,有效提升图像重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12898 2025-12-23 cs.LG cs.AI cs.CV cs.RO 79%

Vidar: Embodied Video Diffusion Model for Generalist Manipulation

Vidar:面向通用操作的具身视频扩散模型

Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Vidar通过具身视频扩散模型和掩码逆动力学模型,实现了在不同机器人形态上的通用操作,仅需少量人类演示即可超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04262 2025-12-23 cs.CV 79%

Bridging Geometry-Coherent Text-to-3D Generation with Multi-View Diffusion Priors and Gaussian Splatting

弥合几何一致性文本到3D生成与多视图扩散先验和高斯点云

Feng Yang, Wenliang Qian, Wangmeng Zuo, Hui Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出耦合分数蒸馏框架,通过多视图联合分布先验和高斯点云优化,实现几何一致的文本到3D生成。

Comments Accepted by Neural Networks. The final published version is available at https://doi.org/10.1016/j.neunet.2025.108511

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18071 2025-12-23 eess.SP 79%

Deep Learning Surrogate for Fast CIR Prediction in Reactive Molecular Diffusion Advection Channels

深度学习代理用于反应分子扩散-对流通道中快速CIR预测

Meysam Ghanbari, Mohammad Taghi Dabiri, Mazen Hasna, Tanvir Alam, Khalid Qaraqe

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种深度学习代理,用于快速预测反应分子扩散-对流通道中的CIR,通过生成大量数据集并训练神经网络,实现了高效且精确的CIR预测。

Comments Conference paper, proposes a deep-learning surrogate for fast prediction of channel impulse responses in reactive molecular diffusion advection channels

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19646 2025-12-23 cond-mat.stat-mech math.AP math.PR 78%

Escape from heterogeneous diffusion

逃离异质扩散

Hwai-Ray Tung, Sean D Lawley

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了异质扩散中逃逸时间与分裂概率的分析方法,揭示了扩散率对逃逸时间的影响机制,并探讨了Itô与Stratonovich解释在物理系统中的应用。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19516 2025-12-23 cs.LG cs.AI 78%

LacaDM: A Latent Causal Diffusion Model for Multiobjective Reinforcement Learning

LacaDM:一种用于多目标强化学习的潜在因果扩散模型

Xueming Yan, Bo Yin, Yaochu Jin

机构 * School of Information Science and Technology, Guangdong University of Foreign Studies(广东外语大学信息科学与技术学院) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LacaDM通过学习环境状态与策略之间的潜在因果关系,提升多目标强化学习在复杂环境中的适应性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19293 2025-12-23 math.PR 78%

On a finite quasi birth-death process with catastrophes and its diffusion approximation

关于具有灾难的有限准生-死过程及其扩散近似

Giulia Di Nunno, Barbara Martinucci, Serena Spina

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有灾难的有限准生-死过程,通过推导其扩散近似,分析了过程的瞬态和长期行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19004 2025-12-23 cs.CL cs.AI cs.LG 78%

Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models

基于上下文的初始化以减少扩散语言模型中的生成路径长度

Tongyuan Miao, Gary Huang, Kai Jun Han, Annie Jiang

机构 * University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于上下文的初始化方法,通过注入提示条件先验来减少扩散语言模型生成路径长度,提升解码效率并解决预热启动的准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18867 2025-12-23 math.PR 78%

Diffusion Approximations to Schrödinger Bridges on Manifolds

流形上的Schrödinger桥的小温度扩散近似

Garrett Mulcahy, Soumik Pal

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了流形上Schrödinger桥的小温度扩散近似,证明了在特定条件下Schrödinger势能梯度收敛到流形类比的得分函数,并展示了欧几里得Schrödinger桥的近似方法。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18791 2025-12-23 cs.SD cs.AI cs.CR 78%

Smark: A Watermark for Text-to-Speech Diffusion Models via Discrete Wavelet Transform

Smark:通过离散小波变换实现文本到语音扩散模型的水印

Yichuan Zhang, Chengxin Li, Yujie Gu

机构 * Faculty of Information Science and Electrical Engineering, Kyushu University, Fukuoka, Japan(九州大学信息科学与电气工程学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Smark通过离散小波变换在TTS扩散模型的低频区域嵌入水印,实现高质量语音生成与知识产权保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18736 2025-12-23 cs.LG 78%

Is Your Conditional Diffusion Model Actually Denoising?

你的条件扩散模型真的在去噪吗?

Daniel Pfrommer, Zehao Dou, Christopher Scarvelis, Max Simchowitz, Ali Jadbabaie

机构 * MIT Cambridge, MA 02139(麻省理工学院) Yale University New Haven, CT 06520(耶鲁大学) CMU Pittsburgh, PA 15213(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了条件扩散模型的去噪过程偏差,提出Schedule Deviation度量方法,揭示了模型在不同条件下的去噪流程差异问题。

Comments 41 pages, 14 figures, published in Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18722 2025-12-23 cs.LG 78%

Generating Risky Samples with Conformity Constraints via Diffusion Models

通过扩散模型生成受约束的高风险样本

Han Yu, Hao Zou, Xingxuan Zhang, Zhengyi Wang, Yue He, Kehan Li, Peng Cui

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 RiskyDiff通过扩散模型生成受约束的高风险样本,通过嵌入筛选和危险梯度引导提高生成样本的风险,同时增强类别符合性以提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06263 2025-12-23 quant-ph 78%

Adiabaticity Crossover: From Anderson Localization to Planckian Diffusion

绝热性交叉:从安德森局域到普朗克扩散

Tiange Xiang, Yubo Zhang, Joonas Keski-Rahkonen, Anton M. Graf, Eric J. Heller

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过量子-声学视角揭示电子输运中绝热性与相位失真之间的交叉,发现普朗克域内扩散率与温度关系,为奇异金属电阻率提供新见解。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04798 2025-12-23 cs.LG 78%

TabRep: Training Tabular Diffusion Models with a Simple and Effective Continuous Representation

TabRep: 通过简单有效的连续表示训练表格扩散模型

Jacob Si, Zijing Ou, Mike Qu, Zhengrui Xiang, Yingzhen Li

机构 * Imperial College London(伦敦帝国学院) Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TabRep通过统一连续表示训练表格扩散模型,实现高效生成高质量表格数据并保持隐私。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18576 2025-12-23 math.AP 78%

Sharp criteria for a degenerate diffusion-aggregation system with the intermediate exponent

退化扩散-聚集体系统中具有中间指数的严格判据

Tiantian Zhou, Li Chen, Yutian Lei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了退化扩散-聚集体系统中具有中间指数的严格判据,通过两种不同的初始数据假设,建立了两个等价的临界阈值条件,统一了分类结果。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏