arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2337 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2337 篇

2608.11732 2026-08-13 cs.CR cs.AI 新提交 88%

Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation

基于塌陷生成的文本到图像扩散模型指纹识别

Yuanmin Huang, Chen Chen, Geng Hong, Xiaoyu You, Hui Xue, Zhenxing Qian, Mi Zhang, Min Yang

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 本研究提出基于塌陷生成的非侵入式指纹框架,可在白盒和黑盒设置下验证文本到图像扩散模型的所有权,且对微调衍生模型及混淆具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06424 2026-08-10 cs.SD cs.CL cs.LG 新提交 88%

Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

用于文本引导语音修复与编辑的多编解码器离散扩散模型

Iftach Shoham, Tali Dror, Oren Gal, Haim Permuter, Gilad Katz, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) University of Haifa(海法大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 该研究提出基于分层编解码器令牌的离散扩散框架SIEDD,其核心架构HiCoDD结合音素级约束等技术,在RealEdit基准中实现最优语音编辑性能,且优于自回归基线,显著提升上下文保留的语音重建与编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03990 2026-08-05 cs.LG 新提交 88%

Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation

用于合成组织病理学图像生成的条件扩散模型评估

Seyed Kahaki, Shijie Li, Weijie Chen, Nicholas Petrick

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

AI总结 本研究针对合成组织病理学图像生成的评估问题,提出基于数字病理学预训练基础模型改进的FID、IS及精确率-召回率指标,实验发现改进后的IS与下游细胞核分割性能相关性更高,且生成数据多样性对分割性能的提升作用强于单张图像视觉保真度。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07072 2026-07-09 cs.LG 新提交 88%

An Hybrid Quantum-Classical Diffusion Model for Image Generation

一种用于图像生成的混合量子-经典扩散模型

Qipeng Qian, Keli Deng, Yuntao Qian

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

AI总结 研究针对量子扩散模型应用于经典高维数据的限制,提出结合经典自动编码器与混合态量子去噪扩散概率模型的混合生成管道,用于图像生成,通过简化反向动力学算法展示该方法在MNIST图像生成上的效果及意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18040 2026-08-19 cs.LG cs.CV 新提交 87%

Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

优化你的采样:基于贝叶斯优化的调优扩散采样

Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

AI总结 本研究提出OYS方法,将扩散模型采样的时间步长选择作为黑盒优化问题,用贝叶斯优化直接优化目标指标,可提升多类图像生成任务性能,大幅降低推理成本且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22428 2026-07-27 cs.HC cs.AI cs.LG cs.MM 新提交 87%

Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability

剖析艺术领域的扩散模型:交互式模型调整与基于实践的可解释性

Ahmed M. Abuzuraiq, Philippe Pasquier

机构 * School of Interactive Arts and Technology, Surrey, Canada(交互艺术与技术学院,英国苏城)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 研究探讨创意实践中可解释人工智能,提出以实验和干预为中心的方法,通过集成模型调整和交互界面到工作流程,经对Stable Diffusion 1.5分析,助艺术家理解模型组件对生成图像的影响,让大型模型成为创意材料。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14580 2026-07-17 cs.CV cs.LG 新提交 87%

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

先进图像生成:负提示优化与潜在分类器引导

Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 该研究提出新系统,通过微调序列到序列语言模型集成负提示优化与潜在空间分类器引导,自动生成优化负提示,用混合分类器评估引导扩散步骤,减少伪影并提高语义保真度,提升Stable Diffusion图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06590 2026-07-09 cs.CV cs.LG 新提交 87%

AI for Cultural Heritage Textiles: Fine-Tuned Latent Diffusion for Novel Ulos Motif Synthesis

用于文化遗产纺织品的人工智能:针对新型乌洛花纹合成的微调潜在扩散模型

Humasak Tommy Argo Simanjuntak, Jesika Purba, Sitogab Girsang, Widya Manurung, Samuel Situmeang, Arlinta Barus, Daniel Oranova Siahaan

机构 * Information Systems Study Program, Faculty of Informatics and Electrical Engineering, Institut Teknologi Del(信息系统研究项目,信息与电气工程学院,技术学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 该研究针对传统乌洛编织局限,提出在高分辨率乌洛图案数据集上微调Protogen v3.4和Stable Diffusion v1.4两个潜在扩散模型来生成新颖设计,通过多种方式评估模型性能,发现特定引导尺度能平衡保真度与多样性,支持非物质文化遗产创新更新。

Comments 21 pages, 8 figures, 3 tables. The manuscript is currently under review at the 2026 4th International Conference on Data, Information and Computing Science (https://www.cdics.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20416 2026-07-08 cs.LG cs.CV 新提交 87%

On the Redundancy of Timestep Embeddings in Diffusion Models

扩散模型中时间步嵌入的冗余性研究

José A. Chávez

机构 * Independent Researcher, Lima, Peru(独立研究者,秘鲁利马)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文通过理论和实验证明,在U-Net和Diffusion Transformer架构中,扩散模型无需显式时间步嵌入也能达到全局最优,甚至在某些指标上超越有条件模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11615 2026-06-18 cs.CV cs.CR cs.LG 新提交 87%

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16887 2026-08-18 cs.CV 新提交 87%

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16923 2026-08-19 cs.SI cs.LG 新提交 87%

Network Denoising Revisited: A Ricci-Flow-Inspired Graph Diffusion Method

重访网络去噪:一种受里奇流启发的图扩散方法

Ye Fang, Chuan-Xian Ren

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 该研究针对现有网络去噪方法忽略图非欧几里得几何的问题,提出受里奇流启发的曲率引导图扩散方法Ricci-Diffusion,经实验验证其可提升结构恢复与下游性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18019 2026-08-19 math.NA cs.NA math.DS 新提交 87%

Ordered Diffusion Kernels

有序扩散核(Ordered Diffusion Kernels, ODKs)

Jack H. Soulsby, Andreas C. S. Jørgensen, Atiyo Ghosh, Vahid Shahrezaei

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出新型有序扩散核(ODKs),可近似任意伊藤SDE的无穷小生成元,通过松弛势估计为序推断实现平流与扩散解耦,经合成数据验证能准确恢复多种动力系统属性。

Comments 46 pages, 7 figures, 46 page appendix, related to work presented at ECMTB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15727 2026-08-18 cs.LG cs.AI stat.ML 新提交 87%

FirstDiff: One-Step Diffusion-Based Anomaly Detection for Multivariate Time Series via Initial Noise Prediction

FirstDiff:基于初始噪声预测的单步扩散模型多变量时间序列异常检测

Ali Boudaghi, Alireza Nemati, Hadi Zare

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 FirstDiff是一种基于初始噪声预测的单步扩散异常检测框架,采用Diffusion Transformer作为骨干,仅需一次去噪网络评估即可在五个基准数据集上实现最优多变量时间序列异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07430 2026-08-10 cs.LG cs.AI 新提交 87%

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

扩散大语言模型作为目标与对抗者:机制性安全漏洞利用

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06210 2026-08-07 cs.RO 新提交 87%

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

VIDP:用于柔顺机器人操作的可变阻抗扩散策略(Variable Impedance Diffusion Policy)

Hisham Khalil, Neil Fernandes, Thomas M. Kwok, Hsiu-Chin Lin, Yue Hu

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 该研究针对接触丰富的机器人操作问题,提出基于模仿学习的可变阻抗控制框架VIDP,利用TP-DAMM从多样本演示中提取物理一致的轨迹分布,无需力传感器即可联合预测位姿与柔顺性,在真实实验中任务成功率及力、跟踪误差表现均优于基线方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 87%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23626 2026-06-23 cs.LG cs.AI 新提交 87%

DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

DiT-Reward:文本到图像奖励建模的生成式表示

Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy, JD.com(京东探索研究院,京东) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Peking University(北京大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 提出DiT-Reward,利用预训练文本到图像扩散Transformer的生成表示进行奖励预测,在多个偏好基准上超越HPSv3,并实现1.65倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 87%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13740 2026-06-15 cs.LG 新提交 87%

Efficient On-Device Diffusion LLM Inference with Mobile NPU

基于移动NPU的高效设备端扩散大语言模型推理

Tuowei Wang, Yanfan Sun, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11655 2026-07-14 cs.CV 新提交 86%

Feature-Space Guided Diffusion for Realistic Ultrasound Image Synthesis

用于逼真超声图像合成的特征空间引导扩散

Marina Domínguez, Nélida Mirabet-Herranz, Valery Naranjo

机构 * Artikode Intelligence S.L.(Artikode智能有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对条件扩散模型合成超声图像逼真度不足问题,提出无需训练的特征空间候选引导(FSCG)采样策略,通过局部k近邻特征校正及按特征空间能量选最佳候选,缩小与真实图像差距,在多数据集上效果优于标准采样及其他基线。

Comments 11 pages, 4 figures. Pre-review manuscript version of a paper accepted at DGM4MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09787 2026-07-14 cs.CV cs.LG 新提交 86%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交 86%

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title);分类 cs.CV

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22924 2026-06-23 cs.CV 新提交 86%

MythraGen: Two-Stage Retrieval Augmented Art Generation Framework

MythraGen:两阶段检索增强艺术生成框架

Quang-Khai Le, Cong-Long Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh city, Vietnam(胡志明市科学大学) Vietnam National University, Ho Chi Minh city, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MythraGen框架,结合艺术检索与LoRA微调,通过检索与提示最相似的艺术图像微调Stable Diffusion,在WikiArt数据集上生成高质量、风格匹配的艺术作品。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14727 2026-06-16 cs.CV 新提交 86%

FairGen: Preference-Aligned Diffusion for Demographically Equitable Medical Image Synthesis

FairGen: 用于人口统计公平医学图像生成的偏好对齐扩散模型

Zhimin Li, Ruichen Zhang, Zhen Tan, Howard J Aizenstein, Jingtong Hu, Tianlong Chen

机构 * University of Pittsburgh, Swanson School of Engineering(匹兹堡大学斯旺森工程学院) The University of North Carolina at Chapel Hill, Department of Computer Science(北卡罗来纳大学教堂山分校计算机科学系) Arizona State University, School of Computing and Augmented Intelligence(亚利桑那州立大学计算与增强智能学院) University of Pittsburgh, Department of Psychiatry(匹兹堡大学精神病学系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 提出FairGen框架,通过将医生偏好嵌入扩散模型生成过程,合成人口统计平衡的医学图像,在皮肤、胸片和脑MRI任务上分别实现95.9%、80.0%和35.2%的公平性提升,同时保持诊断准确性。

Comments Accepted for publication in npj Digital Medicine. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10653 2026-06-10 cs.CV 新提交 86%

STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model

STEDiff: 增强文本嵌入以提升扩散模型中文本到图像的对齐

Hailan Zhang, Haipeng Liu, Bo Fu, Yang Wang

机构 * Hailan Zhang, Haipeng Liu, Yang Wang(未明确机构) Bo Fu(未明确机构)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title);分类 cs.CV

AI总结 提出训练免费的STEDiff方法,通过利用[EOT]令牌增强子句语义并引入语义增强损失,在文本嵌入空间中改善扩散模型对复杂提示的语义对齐,无需微调或布局先验。

Comments 8 pages, 8 figures, to appear at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13247 2026-06-12 cs.AI 新提交 86%

EPIG: Emotion-Based Prompting for Personalised Image Generation

EPIG:基于情感提示的个性化图像生成

Emna Othmen, Mohamed Yassine Landolsi, Lotfi Ben Romdhane

机构 * MARS Research Lab LR17ES05, ISITCom, University of Sousse(苏塞大学ISITCom学院MARS研究实验室LR17ES05)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract,comments);diffusion(abstract,comments)

AI总结 提出EPIG方法,利用心理学效价-唤醒模型在提示层面增强情感表达,无需训练即可控制生成图像的唤醒度,在10个多样化提示上平均唤醒误差降低14%-17%。

Comments Submitted to arXiv. 20 pages, 4 figures. Work on emotion-based prompt engineering for text-to-image diffusion models with applications in personalized image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19344 2026-07-22 cs.CV cs.AI cs.GR 新提交 86%

Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

外观指针——扩散变压器的多模态区域控制

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha

机构 * Brown University(布朗大学) Adobe Research(Adobe 研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 针对可控图像生成难题,提出外观指针方法,通过区域对应网络和空间聚合机制生成并细化指针,为扩散变压器引入模态无关的局部多模态控制接口,单一模型性能达或超现有技术。

Comments 38 Pages, Preprint with supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20334 2026-08-21 cs.CV 新提交 85%

Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models

Swift-Image:探索紧凑统一图像生成模型的性能前沿

Taihang Hu, Zhao Wang, Zuan Gao, Tao Liu, Hao Yan, Zhengze Xu, Yuhang Yu, Yongchao Du, Xingjian Wang, Jun Zheng, Qinye Zhou, Zhengrui Chen, Chao Lin, Yefeng Shen, Zhengtao Wu, Ge Wu, Xiaoli Xu, Denghui Yang, Huayu Zhang, Mingzhou Zhang, Mengting Chen

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本研究提出紧凑统一图像生成模型Swift-Image,采用6B单流DiT等技术,实现领先综合性能,压缩后3B模型无明显损失,还总结了相关实用经验。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-19 cs.CV cs.AI 新提交 85%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏