arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-24 至 2025-11-24 共收录 42 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2507.20973 2025-11-24 cs.LG cs.CV 89%

Model-Agnostic Gender Bias Control for Text-to-Image Generation via Sparse Autoencoder

面向文本到图像生成的模型无关性别偏见控制:通过稀疏自编码器

Chao Wu, Zhenyi Wang, Kangxian Xie, Naresh Kumar Devulapally, Vishnu Suresh Lokhande, Mingchen Gao

机构 * University at Buffalo, USA(美国布法罗大学) University of Maryland, College Park, USA(马里兰大学 College Park 分校)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SAE Debias,通过稀疏自编码器在文本到图像生成中减轻性别偏见,提供可解释且模型无关的去偏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17282 2025-11-24 cs.CV cs.AI cs.CY 86%

Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation

文化消逝之处:揭示文本到图像生成中的文化差距

Chuancheng Shi, Shangze Li, Shiming Guo, Simiao Xie, Wenhua Wu, Jingtong Dou, Chao Wu, Canran Xiao, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出了一种解决多语言文本到图像生成中文化一致性问题的方法,通过局部化文化敏感信号并改进模型对文化相关层的激活,提升生成图像的文化一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16917 2025-11-24 cs.CV 81%

UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation

UniModel: 一种仅依赖视觉的统一多模态理解和生成框架

Chi Zhang, Jiepeng Wang, Youming Wang, Yuanzhi Liang, Xiaoyan Yang, Zuoxin Li, Haibin Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 UniModel通过统一模型、任务和表示,在单一视觉空间中实现多模态理解和生成的统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16965 2025-11-24 cs.CV cs.LG 79%

Real-Time Cooked Food Image Synthesis and Visual Cooking Progress Monitoring on Edge Devices

边缘设备上的实时烹饪食品图像合成与视觉烹饪进程监控

Jigyasa Gupta, Soumya Goyal, Anil Kumar, Ishan Jindal

机构 * Samsung R&D Institute India(三星印度研发院)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种边缘高效的生成模型,通过引入基于烤箱的烹饪进程数据集和领域特定的CIS度量标准,实现了在边缘设备上实时合成逼真烹饪食品图像并监控烹饪进程。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22300 2025-11-24 cs.CR cs.AI cs.CV 79%

T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model

T2I-RiskyPrompt:用于评估、攻击和防御文本到图像模型安全性的基准

Chenyu Zhang, Tairen Zhang, Lanjun Wang, Ruidong Chen, Wenhui Li, Anan Liu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 T2I-RiskyPrompt提出了一种用于评估文本到图像模型安全性的综合基准,通过层次化风险分类和原因驱动的检测方法,全面评估了多种模型和防御策略的安全性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17987 2025-11-24 cs.CR cs.AI cs.CV 79%

Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning

通过LLM推理进行文本到图像模型的劫持:Reason2Attack

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, An-An Liu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 Reason2Attack通过将劫持攻击融入LLM后训练过程,提升生成对抗性提示的推理能力,实现更高效的文本到图像模型攻击

Comments Noted that This paper includes model-generated content that may contain offensive or distressing material

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17255 2025-11-24 cs.CV cs.IR 74%

A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback

略多一些像这个:利用视觉语言模型进行文本到图像检索的相关反馈

Bulat Khaertdinov, Mirela Popa, Nava Tintarev

机构 * Maastricht University(马斯特里赫特大学)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本文提出基于相关反馈机制提升视觉语言模型文本到图像检索性能的方法,通过四种反馈策略在Flickr30k和COCO数据集上验证,提升了检索效果并增强了多轮检索的鲁棒性。

Comments Accepted to WACV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17358 2025-11-24 cs.CL 50%

Don't Learn, Ground: A Case for Natural Language Inference with Visual Grounding

不要学习,而是依托:自然语言推理与视觉依托的案例

Daniil Ignatev, Ayman Santeer, Albert Gatt, Denis Paperno

机构 * Utrecht University(乌特勒支大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出了一种基于视觉依托的零样本自然语言推理方法,通过生成视觉表示并比较与假设的相似度,实现高精度推理,展示了对文本偏见的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 24 篇

2508.09327 2025-11-24 cs.CV 86%

Lung-DDPM+: Efficient Thoracic CT Image Synthesis using Diffusion Probabilistic Model

Lung-DDPM+: 基于扩散概率模型的高效胸腔CT图像合成

Yifan Jiang, Ahmad Shariftabrizi, Venkata SK. Manem

机构 * Centre de recherche du CHU de Québec-Université Laval(魁北克-拉瓦尔大学研究中心) Department of Molecular Biology, Medical Biochemistry and Pathology, Université Laval(拉瓦尔大学分子生物学、医学生物化学与病理学系) Cancer Research Center, Université Laval(拉瓦尔大学癌症研究中心) Big Data Research Center, Université Laval(拉瓦尔大学大数据研究中心) Department of Radiology, Carver College of Medicine - The University of Iowa(爱荷华大学卡弗医学院放射科)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 Lung-DDPM+通过结合结节语义布局和肺部DPM求解器,实现了高效且高质量的胸腔CT图像合成,提升了生成效率与质量,适用于医学影像中的肿瘤合成与病变生成。

Comments Accepted by Computers in Biology and Medicine (CIBM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16904 2025-11-24 cs.CV 83%

Warm Diffusion: Recipe for Blur-Noise Mixture Diffusion Models

Warm Diffusion: Blur-Noise Mixture Diffusion Models的配方

Hao-Chien Hsueh, Chi-En Yen, Wen-Hsiao Peng, Ching-Chun Huang

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Hsinchu, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,Hsinchu,台湾)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Warm Diffusion通过融合模糊与噪声的混合模型,解决传统热扩散和冷扩散的不足,提升图像生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10629 2025-11-24 cs.CV 83%

One Small Step in Latent, One Giant Leap for Pixels: Fast Latent Upscale Adapter for Your Diffusion Models

潜在空间中的一小步,像素世界中的一大跃:一种快速的潜在上采样适配器用于您的扩散模型

Aleksandr Razin, Danil Kazantsev, Ilya Makarov

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出一种轻量级潜在上采样适配器,通过潜在空间单次前向传递实现高分辨率图像合成,提升效率并保持保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13750 2025-11-24 cs.LG cs.AI 82%

SCALEX: Scalable Concept and Latent Exploration for Diffusion Models

SCALEX:扩散模型的可扩展概念与潜在空间探索

E. Zhixuan Zeng, Yuhao Chen, Alexander Wong

机构 * University of Waterloo(滑铁卢大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 SCALEX通过自然语言提示实现扩散模型潜在空间的可扩展自动化探索,能够检测性别偏见、评估语义对齐并揭示概念结构。

Comments Accepted to WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07160 2025-11-24 cs.CV cs.MM 81%

HDCompression: Hybrid-Diffusion Image Compression for Ultra-Low Bitrates

HDCompression: 混合扩散图像压缩用于超低比特率

Lei Lu, Yize Li, Yanzhi Wang, Wei Wang, Wei Jiang

机构 * Northeastern University(东北大学) Futurewei Technologies Inc.(未来科技公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 HDCompression通过结合生成性VQ建模和扩散模型,提升超低比特率下的图像压缩保真度和感知质量。

Comments Accepted by PRICAI 2025 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17481 2025-11-24 cs.CV 79%

Counterfactual World Models via Digital Twin-conditioned Video Diffusion

通过数字孪生条件的视频扩散实现反事实世界模型

Yiqing Shen, Aiza Maksutova, Chenjia Li, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CWMDT通过构建数字孪生和应用大语言模型,实现反事实世界模型,提升对视频正向模拟的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17150 2025-11-24 cs.CV 79%

DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving

DiffRefiner: 通过扩散细化与语义交互实现从粗到细的轨迹规划用于端到端自动驾驶

Liuhan Yin, Runkun Ju, Guodong Guo, Erkang Cheng

机构 * Nullmax

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffRefiner通过两阶段框架结合扩散细化与语义交互,实现更精确的端到端自动驾驶轨迹规划,取得新纪录。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15983 2025-11-24 math.PR math.AP 78%

A Critical Drift-Diffusion Equation: Connections to the Diffusion on $\textbf{SL}(2)$

关键的漂移-扩散方程:与SL(2)上的扩散的联系

Peter Morfe, Felix Otto, Christian Wagner

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过连接二维漂移-扩散过程与SL(2)上的自然扩散,揭示了临界情况下超扩散行为与起始点依赖性的非高斯特性。

Comments The results of this unpublished preprint are subsumed by the new preprint arXiv:2511.15473

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16926 2025-11-24 physics.geo-ph stat.ML 78%

Diffusion-Inversion-Net (DIN): An End-to-End Direct Probabilistic Framework for Characterizing Hydraulic Conductivities and Quantifying Uncertainty

扩散-反演网络(DIN):一种端到端的直接概率框架,用于表征水力传导率和量化不确定性

Xun Zhang, Weijie Yang, Jiangjiang Zhang, Simin Jiang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DIN是一种端到端的直接概率框架,用于反演地下水流动和溶质传输过程,通过去噪扩散模型直接生成后验参数场并量化不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16675 2025-11-24 cs.LG cs.AI 78%

Joint Design of Protein Surface and Structure Using a Diffusion Bridge Model

利用扩散桥模型联合设计蛋白质表面和结构

Guanlue Li, Xufeng Zhao, Fang Wu, Sören Laue

机构 * University of Hamburg(汉堡大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PepBridge通过整合受体表面几何和生化性质,联合设计蛋白质表面和结构,提升蛋白质设计的物理合理性和结构可行性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13428 2025-11-24 cs.RO 78%

VLM-SFD: VLM-Assisted Siamese Flow Diffusion Framework for Dual-Arm Cooperative Manipulation

VLM-SFD:基于视觉语言模型的双臂协作操作Siamese流扩散框架

Jiaming Chen, Yiyu Jiang, Aoshen Huang, Yang Li, Wei Pan

机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 VLM-SFD通过双编码器-解码器架构和视觉语言模型,提升双臂协作操作的模仿学习效率与泛化能力。

Comments Accepted by IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07005 2025-11-24 eess.SY cs.LG cs.SY math.OC 78%

Global Search for Optimal Low Thrust Spacecraft Trajectories using Diffusion Models and the Indirect Method

利用扩散模型和间接方法进行最优低推力航天器轨迹的全局搜索

Jannik Graebner, Ryne Beeson

机构 * PhD Student, Department of Mechanical and Aerospace Engineering, Princeton University, NJ, USA(普林斯顿大学机械与航空航天工程系博士生) Assistant Professor, Department of Mechanical and Aerospace Engineering, Princeton University, NJ, USA(普林斯顿大学机械与航空航天工程系助理教授)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用扩散模型和间接方法加速低推力航天器轨迹的全局搜索,通过训练模型预测共轭解结构变化,提升求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17484 2025-11-24 cs.CV 57%

Radar2Shape: 3D Shape Reconstruction from High-Frequency Radar using Multiresolution Signed Distance Functions

Radar2Shape:基于高频雷达的多分辨率符号距离函数的3D形状重建

Neel Sortur, Justin Goodwin, Purvik Patel, Luis Enrique Martinez, Tzofi Klinghoffer, Rajmonda S. Caceres, Robin Walters

机构 * Northeastern University(东北大学) MIT Lincoln Laboratory(麻省理工学院林肯实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Radar2Shape通过多分辨率符号距离函数和去噪扩散模型,实现从部分观测高频雷达信号中重建任意3D形状。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17074 2025-11-24 cs.CV 57%

Diversity Has Always Been There in Your Visual Autoregressive Models

你的视觉自回归模型中始终存在多样性

Tong Wang, Guanyu Yang, Nian Liu, Kai Wang, Yaxing Wang, Abdelrahman M Shaker, Salman Khan, Fahad Shahbaz Khan, Senmao Li

机构 * Southeast University(东南大学) MBZUAI City University of Hong Kong(香港城市大学) Nankai University(南开大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DiverseVAR方法,通过调整特征图关键组件以恢复视觉自回归模型的生成多样性,提升生成多样性的同时保持高质量合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12233 2025-11-24 cs.CV cs.AI 57%

Model Inversion Attack Against Deep Hashing

针对深度哈希的模型逆向攻击

Dongdong Zhao, Qiben Xu, Ranxin Fang, Baogang Song

机构 * Wuhan University of Technology(武汉理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DHMI框架,首次针对深度哈希进行模型逆向攻击,通过语义哈希中心和替代模型优化,实现高保真图像重建,揭示深度哈希的隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06767 2025-11-24 eess.IV cs.CV 57%

DIMA: DIffusing Motion Artifacts for unsupervised correction in brain MRI images

DIMA: 通过扩散模型实现脑部MRI图像的无监督运动伪影校正

Paolo Angella, Luca Balbi, Fabrizio Ferrando, Paolo Traverso, Rosario Varriale, Vito Paolo Pastore, Matteo Santacesaria

机构 * MaLGa Center, DIMA, University of Genoa(马尔加中心、DIMA、热那亚大学) DIBRIS, University of Genoa(DIBRIS、热那亚大学) Esaote S.p.A.(埃萨奥特公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DIMA通过扩散模型实现脑部MRI图像的无监督运动伪影校正,无需配对数据,具有更好的泛化能力。

Comments 7 pages, 5 figures, 7 tables

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17496 2025-11-24 cs.RO cs.MA 50%

MDG: Masked Denoising Generation for Multi-Agent Behavior Modeling in Traffic Environments

MDG:面向交通环境多智能体行为建模的遮蔽去噪生成

Zhiyu Huang, Zewei Zhou, Tianhui Cai, Yun Zhang, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 MDG通过遮蔽去噪生成方法,实现高效可控的多智能体轨迹生成,适用于自动驾驶和交通模拟中的行为建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00709 2025-11-24 math.PR math.AP 50%

The Gaussian free-field as a stream function: continuum version of the scale-by-scale homogenization result

高斯自由场作为流函数:连续版本的逐尺度均质化结果

Peter Morfe, Felix Otto, Christian Wagner

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文在连续设定下重新推导了关于高斯自由场作为流函数的均质化结果,并通过 Itô 随机微分方程清晰定义了代理,利用 Itô 计算高效估算残差。

Comments The results of this unpublished preprint are subsumed by the newer preprint arXiv:2511.15473

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17249 2025-11-24 cs.LG 50%

FlexiFlow: decomposable flow matching for generation of flexible molecular ensemble

FlexiFlow: 可分解的流匹配用于生成灵活的分子集合

Riccardo Tedoldi, Ola Engkvist, Patrick Bryant, Hossein Azizpour, Jon Paul Janet, Alessandro Tibo

机构 * Molecular AI, Discovery Sciences, R&D AstraZeneca(分子人工智能、发现科学、研发阿斯图瑞卡制药) Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程、查尔姆斯理工大学和哥德堡大学) KTH Royal Institute of Technology(皇家理工学院) Science for Life Laboratory(生命科学实验室) Stockholm University(斯德哥尔摩大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 FlexiFlow通过可分解的流匹配方法,实现了分子及其多个构象的联合生成,提升了分子生成的多样性和准确性。

Comments Preprint. Code to be released upon full publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17151 2025-11-24 cond-mat.mes-hall 50%

Enhanced Efficiency of Intermediate-Band Semiconductor Solar Cells Embedded with Quantum Dot Superlattices

嵌入量子点超晶格的中间带半导体太阳能电池效率提升

Naira Petrosyan, Lilit Yeganyan, Aram Manaselyan, Vram Mughnetsyan, Vidar Gudmundsson, Albert Kirakosyan

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过多尺度方法结合理论计算、实验数据和计算模型,优化量子点超晶格结构,提升中间带太阳能电池效率至13.3%。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16958 2025-11-24 econ.TH 50%

Real Option AI: Reversibility, Silence, and the Release Ladder

实时选项AI:可逆性、沉默与释放阶梯

I. Sebastian Buhai

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了AI产品发布节奏作为战略实时选项的最优执行,揭示了可逆性、沉默与释放阶梯的内生机制,以及杠杆对不可逆性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15628 2025-11-24 math.PR 50%

Infinite-dimensional diffusions and depletion interaction for a model of colloids

无限维扩散与耗尽相互作用:一种胶体模型的研究

Myriam Fradon, Alexander Zass

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究探讨了胶体模型中不同大小硬球的无限维扩散动力学,发现大球间短程吸引耗尽相互作用,并分析了相关Gibbs测度与渗流及最优排列的联系。

Comments Version accepted for publication in the Annales de la Faculté des Sciences de Toulouse. 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏