arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-23 至 2025-12-23 共收录 111 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2512.18675 2025-12-23 cs.CV 88%

AsyncDiff: Asynchronous Timestep Conditioning for Enhanced Text-to-Image Diffusion Inference

AsyncDiff: 异步时间步条件化以提升文本到图像扩散推理

Longhuan Xu, Feng Yin, Cunjian Chen

机构 * Southeast University-Monash University Joint Graduate School(东南大学-墨尔本大学联合研究生院) Southeast University(东南大学) Monash University(墨尔本大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 AsyncDiff通过异步时间步条件化提升文本到图像扩散推理性能,采用轻量时间步预测模块和动态缩放参数实现更灵活的噪声控制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01298 2025-12-23 cs.CV cs.AI 85%

Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models

通过统一生成模型中的多模态推理链提升图像生成

Yi Wang, Mushui Liu, Wanggui He, Hanyang Yuan, Longxiang Zhang, Ziwei Huang, Guanghao Zhang, Wenkai Fang, Haoze Jiang, Shengxuming Zhang, Dong She, Jinlong Liu, Weilong Dai, Mingli Song, Hao Jiang, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文通过引入多模态推理链提升统一生成模型的复杂图像生成能力,提出FoXperts架构和MCoT方法,实现更高效的多模态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18766 2025-12-23 cs.CV 79%

MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation

MaskFocus: 为掩码图像生成聚焦策略优化

Guohui Zhang, Hu Yu, Xiaoxiao Ma, Yaning Pan, Hang Xu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 MaskFocus通过聚焦关键步骤优化策略,提升掩码图像生成模型的性能。

Comments Code is available at https://github.com/zghhui/MaskFocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17860 2025-12-23 cs.CV cs.AI cs.LG 74%

Towards Facilitated Fairness Assessment of AI-based Skin Lesion Classifiers Through GenAI-based Image Synthesis

通过生成式人工智能图像合成促进AI皮肤病变分类器的公平性评估

Ko Watanabe, Stanislav Frolov, Aya Hassan, David Dembinsky, Adriano Lucieri, Andreas Dengel

机构 * DFKI GmbH(德累斯顿理工大学人工智能研究所)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 本文通过生成式人工智能图像合成方法,评估AI皮肤病变分类器的公平性,验证合成图像在公平性测试中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19680 2025-12-23 cs.CV 57%

VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

VA-$π$: 变分策略对齐用于像素感知自回归生成

Xinyao Liao, Qiyuan He, Kai Xu, Xiaoye Qu, Yicong Li, Wei Wei, Angela Yao

机构 * Huazhong University of Science & Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。

Comments 21 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19300 2025-12-23 cs.CV 57%

RMLer: Synthesizing Novel Objects across Diverse Categories via Reinforcement Mixing Learning

RMLer: 通过强化混合学习跨多样类别合成新物体

Jun Li, Zikun Chen, Haibo Chen, Shuo Chen, Jian Yang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 RMLer通过强化混合学习框架,有效解决跨类别文本到图像生成中的概念混合问题,提升合成物体的连贯性和保真度。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2512.18853 2025-12-23 cs.CV cs.HC 57%

VizDefender: Unmasking Visualization Tampering through Proactive Localization and Intent Inference

VizDefender:通过主动定位和意图推断揭示可视化篡改

Sicheng Song, Yanjie Zhang, Zixin Chen, Huamin Qu, Changbo Wang, Chenhui Li

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 VizDefender通过半脆弱水印和意图分析模块,主动定位和推断可视化篡改,有效检测和分析数据篡改与视觉编码篡改。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE PacificVis'26 TVCG Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25141 2025-12-23 cs.CV 57%

EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift

EIRES: 通过编辑诱导的重建误差偏移实现无需训练的AI生成图像检测

Wan Jiang, Jing Yan, Xiaojing Chen, Lin Shen, Chenhao Lin, Yunfeng Diao, Richang Hong

机构 * HFUT(合肥大学) AHU(安徽大学) XJTU(西安交通大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 EIRES通过编辑诱导的重建误差偏移实现无需训练的AI生成图像检测,利用结构编辑揭示真实与生成图像的固有差异,提高检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 84 篇

2407.16292 2025-12-23 cs.CY cs.AI 85%

Visual Stereotypes of Autism Spectrum in Janus-Pro-7B, DALL-E, Stable Diffusion, SDXL, FLUX, and Midjourney

自闭症光谱的视觉刻板印象:Janus-Pro-7B、DALL-E、Stable Diffusion、SDXL、FLUX和Midjourney的视觉表现

Maciej Wodziński, Marcin Rządeczka, Anastazja Szuła, Kacper Dudzic, Marcin Moskalewicz

机构 * Maria Curie-Skłodowska University(玛丽·居里大学) IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本研究评估了六个AI图像生成模型在自闭症相关图像中的刻板印象表现,发现尽管技术有所改进,但模型在再现潜在有害刻板印象方面无显著变化。

Comments Preprint of a publication accepted to Identity-Aware AI 2025 (ECAI 2025)

Journal ref CEUR Workshop proceeding, 2025, Vol-4136 urn:nbn:de:0074-4136-x; https://ceur-ws.org/Vol-4136/iaai15.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23484 2025-12-23 cs.MM cs.CV eess.IV 84%

TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity

TAG-WM: 通过扩散反向敏感性实现的抗篡改生成图像水印

Yuzhuo Chen, Zehua Ma, Han Fang, Weiming Zhang, Nenghai Yu

机构 * Anhui Province Key Laboratory of Digital Security, University of Science and Technology of China(安徽省数字安全重点实验室,中国科学技术大学) School of Computing, National University of Singapore(computing学院,新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 TAG-WM通过扩散反向敏感性实现抗篡改生成图像水印,提升篡改鲁棒性和定位能力,保持生成质量与水印容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05844 2025-12-23 cs.CV cs.AI cs.IT cs.LG eess.IV math.IT 84%

Enhancing Diffusion Model Guidance through Calibration and Regularization

通过校准和正则化增强扩散模型引导

Seyed Alireza Javid, Amirhossein Bagheri, Nuria González-Prelcic

机构 * UC San Diego(加州大学圣迭戈分校) Politecnico di Milano(米兰理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文通过校准和正则化方法提升扩散模型引导效果,改进分类器校准和采样策略,提升图像生成质量。

Comments Accepted from NeurIPS 2025 Workshop on Structured Probabilistic Inference & Generative Modeling. Code available at https://github.com/ajavid34/guided-info-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV 83%

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18254 2025-12-23 cs.CV 83%

Loom: Diffusion-Transformer for Interleaved Generation

Loom:用于交错生成的扩散-变压器

Mingcheng Ye, Jiaming Liu, Yiren Song

机构 * Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Loom通过统一的扩散-变压器框架实现交错生成,提供更高效和可控的长周期生成,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18161 2025-12-23 cs.CV 83%

Local Patches Meet Global Context: Scalable 3D Diffusion Priors for Computed Tomography Reconstruction

局部片段与全局上下文:用于计算机断层扫描重建的可扩展3D扩散先验

Taewon Yang, Jason Hu, Jeffrey A. Fessler, Liyue Shen

机构 * EECS Department, University of Michigan(密歇根大学电子工程与计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种3D片段基扩散模型,通过学习3D片段先验实现高效高分辨率3D CT重建,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09922 2025-12-23 cs.LG 82%

Prototype-Guided Diffusion: Visual Conditioning without External Memory

原型引导扩散:无需外部记忆的视觉条件生成

Bilal Faye, Hanane Azzag, Mustapha Lebbah

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 原型引导扩散模型通过对比学习生成紧凑视觉原型,实现无需外部记忆的高效图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 79%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19584 2025-12-23 eess.IV cs.CV physics.med-ph 79%

Patlak Parametric Image Estimation from Dynamic PET Using Diffusion Model Prior

基于扩散模型先验的动态PET参数图像估计

Ziqian Huang, Boxiao Yu, Siqi Li, Savas Ozdemir, Sangjin Bae, Jae Sung Lee, Guobao Wang, Kuang Gong

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(J. Crayton Pruitt家族生物医学工程系,佛罗里达大学) Department of Radiology, University of Florida(放射学系,佛罗里达大学) Interdisciplinary Program in Bioengineering, Seoul National University(生物工程跨学科项目,首尔国立大学) Department of Nuclear Medicine, Seoul National University College of Medicine(核医学系,首尔国立大学医学院) Department of Radiology, University of California Davis Health(放射学系,加州大学戴维斯医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的动态PET参数图像估计框架,利用Patlak模型提升图像质量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18843 2025-12-23 cs.CV 79%

Brain-Gen: Towards Interpreting Neural Signals for Stimulus Reconstruction Using Transformers and Latent Diffusion Models

Brain-Gen: 向利用Transformer和潜在扩散模型解释神经信号以实现刺激重建

Hasib Aslam, Muhammad Talal Faiz, Muhammad Imran Malik

机构 * School of Electrical Engineering and Computer Science, National University of Sciences and Technology (NUST)(电气工程与计算机科学学院,国立科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Brain-Gen通过结合Transformer和潜在扩散模型,从EEG信号中提取空间-时间表示,实现对视觉刺激的重建,提升了EEG信号的语义解释能力。

Comments 21 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 79%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12159 2025-12-23 cs.CV 79%

DPL: Spatial-Conditioned Diffusion Prototype Enhancement for One-Shot Medical Segmentation

DPL:基于扩散的原型增强用于单次医疗分割

Ziyuan Gao, Philippe Morel

机构 * University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPL通过扩散增强和空间感知条件机制,提升单次医疗图像分割的原型表示能力,实现更鲁棒的泛化性能。

Comments Accepted at IVCNZ 2025. To be published in IEEE proceedings

Journal ref 2025 40th International Conference on Image and Vision Computing New Zealand (IVCNZ), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12538 2025-12-23 eess.IV cs.CV 79%

High Frequency Matters: Uncertainty Guided Image Compression with Wavelet Diffusion

高频至关重要:基于小波扩散的不确定性引导图像压缩

Juan Song, Jiaxiang He, Lijie Yang, Mingtao Feng, Keyan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于小波扩散的不确定性引导图像压缩方法,通过高频压缩和残差编解码器提升图像压缩的保真度和效率。

Comments Revised version for IEEE TMM submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18241 2025-12-23 cs.CV 79%

SG-RIFE: Semantic-Guided Real-Time Intermediate Flow Estimation with Diffusion-Competitive Perceptual Quality

SG-RIFE:基于语义的实时中间流估计与扩散竞争感知质量

Pan Ben Wong, Chengli Wu, Hanyue Lu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SG-RIFE通过引入语义引导的微调策略和模块,实现了在实时条件下超越扩散方法的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 79%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12691 2025-12-23 cs.LG cs.AI cs.CV 79%

DiffEM: Learning from Corrupted Data with Diffusion Models via Expectation Maximization

DiffEM: 通过期望最大化从损坏数据中学习扩散模型

Danial Hosseintabar, Fan Chen, Giannis Daras, Antonio Torralba, Constantinos Daskalakis

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffEM通过期望最大化从损坏数据中学习扩散模型,利用条件扩散模型重建干净数据并优化模型参数,有效提升图像重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12898 2025-12-23 cs.LG cs.AI cs.CV cs.RO 79%

Vidar: Embodied Video Diffusion Model for Generalist Manipulation

Vidar:面向通用操作的具身视频扩散模型

Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Vidar通过具身视频扩散模型和掩码逆动力学模型,实现了在不同机器人形态上的通用操作,仅需少量人类演示即可超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04262 2025-12-23 cs.CV 79%

Bridging Geometry-Coherent Text-to-3D Generation with Multi-View Diffusion Priors and Gaussian Splatting

弥合几何一致性文本到3D生成与多视图扩散先验和高斯点云

Feng Yang, Wenliang Qian, Wangmeng Zuo, Hui Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出耦合分数蒸馏框架,通过多视图联合分布先验和高斯点云优化,实现几何一致的文本到3D生成。

Comments Accepted by Neural Networks. The final published version is available at https://doi.org/10.1016/j.neunet.2025.108511

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18071 2025-12-23 eess.SP 79%

Deep Learning Surrogate for Fast CIR Prediction in Reactive Molecular Diffusion Advection Channels

深度学习代理用于反应分子扩散-对流通道中快速CIR预测

Meysam Ghanbari, Mohammad Taghi Dabiri, Mazen Hasna, Tanvir Alam, Khalid Qaraqe

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种深度学习代理,用于快速预测反应分子扩散-对流通道中的CIR,通过生成大量数据集并训练神经网络,实现了高效且精确的CIR预测。

Comments Conference paper, proposes a deep-learning surrogate for fast prediction of channel impulse responses in reactive molecular diffusion advection channels

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19646 2025-12-23 cond-mat.stat-mech math.AP math.PR 78%

Escape from heterogeneous diffusion

逃离异质扩散

Hwai-Ray Tung, Sean D Lawley

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了异质扩散中逃逸时间与分裂概率的分析方法,揭示了扩散率对逃逸时间的影响机制,并探讨了Itô与Stratonovich解释在物理系统中的应用。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19516 2025-12-23 cs.LG cs.AI 78%

LacaDM: A Latent Causal Diffusion Model for Multiobjective Reinforcement Learning

LacaDM:一种用于多目标强化学习的潜在因果扩散模型

Xueming Yan, Bo Yin, Yaochu Jin

机构 * School of Information Science and Technology, Guangdong University of Foreign Studies(广东外语大学信息科学与技术学院) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LacaDM通过学习环境状态与策略之间的潜在因果关系,提升多目标强化学习在复杂环境中的适应性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19293 2025-12-23 math.PR 78%

On a finite quasi birth-death process with catastrophes and its diffusion approximation

关于具有灾难的有限准生-死过程及其扩散近似

Giulia Di Nunno, Barbara Martinucci, Serena Spina

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有灾难的有限准生-死过程,通过推导其扩散近似,分析了过程的瞬态和长期行为。

详情

展开后加载摘要…

URL PDF HTML 收藏