arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-01 至 2025-12-01 共收录 126 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2511.18742 2025-12-01 cs.CV cs.AI cs.LG 92%

ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion

ProxT2I:通过近端扩散实现高效的奖励引导文本到图像生成

Zhenghan Fang, Jian Zheng, Qiaozi Gao, Xiaofeng Gao, Jeremias Sulam

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ProxT2I通过近端扩散和奖励引导方法,提升文本到图像生成的效率和人类偏好对齐,实现高效且轻量的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22245 2025-12-01 cs.CV 88%

Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models

语义锚定用于文本到图像扩散模型中的稳健个性化

Seoyun Yang, Gihoon Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 通过语义锚定方法,文本到图像扩散模型在有限参考图像中实现稳健个性化,平衡主题保真度与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12932 2025-12-01 cs.CV 86%

Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes

Text2Traffic: 一种用于交通场景的文本到图像生成与编辑方法

Feng Lv, Haoxuan Feng, Zilu Zhang, Chunlong Xia, Yanfeng Li

机构 * Baidu(百度) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文提出了一种统一的文本驱动框架,通过可控掩码机制和多视角数据增强,提升交通场景中文本到图像生成与编辑的保真度和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22119 2025-12-01 cs.CV 83%

PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and Fuzz Optimization

PROMPTMINER: 通过强化学习和模糊优化对文本到图像生成模型进行黑盒提示窃取

Mingzhe Li, Renhao Zhang, Zhiyang Wen, Siqi Pan, Bruno Castro da Silva, Juan Zhai, Shiqing Ma

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 PROMPTMINER通过强化学习和模糊优化实现文本到图像生成模型的黑盒提示窃取,有效恢复图像生成提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22982 2025-12-01 cs.CV cs.AI 70%

Ovis-Image Technical Report

Ovis-Image 技术报告

Guo-Hua Wang, Liangfu Cao, Tianyu Cui, Minghao Fu, Xiaohao Chen, Pengxin Zhan, Jianshan Zhao, Lan Li, Bowen Fu, Jiaqi Liu, Qing-Guo Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Ovis-Image 是一个70亿参数的文本到图像模型,通过优化的多模态主干和文本聚焦训练方法,在紧凑架构下实现与大型开源模型相当的文本渲染性能。

Comments Code is released at https://github.com/AIDC-AI/Ovis-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04675 2025-12-01 cs.CV 70%

InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation

InfinityStar: 一种统一的时空自回归模型用于视觉生成

Jinlai Liu, Jian Han, Bin Yan, Hui Wu, Fengda Zhu, Xing Wang, Yi Jiang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 InfinityStar是一种统一的时空自回归模型,能够高效生成高分辨率图像和动态视频,其在VBench上的表现优于现有自回归模型,且生成速度显著快于扩散方法。

Comments NeurIPS 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22943 2025-12-01 cs.CL cs.CV 57%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01008 2025-12-01 cs.CV cs.AI 57%

IntrinsiX: High-Quality PBR Generation using Image Priors

IntrinsiX: 基于图像先验的高质量PBR生成

Peter Kocsis, Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 IntrinsiX通过图像先验生成高质量PBR图像,提升内容创作中的重新照明和纹理生成能力。

Comments Project page: https://peter-kocsis.github.io/IntrinsiX/ Video: https://youtu.be/b0wVA44R93Y

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 6 篇

2511.23105 2025-12-01 cs.CV 88%

NumeriKontrol: Adding Numeric Control to Diffusion Transformers for Instruction-based Image Editing

NumeriKontrol: 为基于指令的图像编辑添加数字控制

Zhenyu Xu, Xiaoqi Shen, Haotian Nan, Xinyu Zhang

机构 * East China Normal University(华东师范大学) South China University of Technology(华南理工大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 NumeriKontrol通过引入数字控制框架,实现基于指令的图像编辑中对编辑强度的精确控制,提升交互编辑的灵活性和精度。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24657 2025-12-01 cs.CV 83%

Group Relative Attention Guidance for Image Editing

基于组相对注意力的图像编辑

Xuanpu Zhang, Xuesong Niu, Ruidong Chen, Dan Song, Jianhao Zeng, Penghui Du, Haoxiang Cao, Kai Wu, An-an Liu

机构 * Tianjin University(天津大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 GRAG通过组相对注意力机制实现对图像编辑强度的连续精细控制,无需额外调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23240 2025-12-01 cs.CV 79%

Autoregressive Styled Text Image Generation, but Make it Reliable

自回归风格文本图像生成,但使其更可靠

Carmine Zaccagnino, Fabio Quattrini, Vittorio Pippi, Silvia Cascianelli, Alessio Tonioni, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Google(谷歌)

专题命中 图像编辑 :image generation(title);image editing(abstract);分类 cs.CV

AI总结 本文提出Eruku方法,通过多模态提示条件生成任务和分类器自由引导策略,改进自回归模型以生成更可靠、更忠实于文本提示的风格化文本图像。

Comments Accepted at WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23199 2025-12-01 cs.CV cs.AI 70%

Vision Bridge Transformer at Scale

大规模 Vision Bridge Transformer

Zhenxiong Tan, Zeqing Wang, Xingyi Yang, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 ViBT 是一种大规模 Bridge 模型,通过 Transformer 架构和方差稳定的速度匹配目标,实现高效图像和视频翻译任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22688 2025-12-01 cs.LG cs.AI 67%

Test-time scaling of diffusions with flow maps

扩散模型测试时间缩放与流映射

Amirmojtaba Sabour, Michael S. Albergo, Carles Domingo-Enrich, Nicholas M. Boffi, Sanja Fidler, Karsten Kreis, Eric Vanden-Eijnden

机构 * NVIDIA(NVIDIA公司) University of Toronto(多伦多大学) Vector Institute(向量研究所) Harvard University(哈佛大学) Kempner Institute(凯姆纳研究所) IAIFI(IAIFI机构) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学) Courant Institute, New York University(纽约大学应用数学学院) ML Lab at Capital Fund Management (CFM)(Capital Fund Management (CFM)机器学习实验室)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

AI总结 本文提出通过流映射改进扩散模型测试时间性能,通过流映射与速度场关系构建FMTT算法,实现更优奖励上升并支持复杂图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22237 2025-12-01 cs.CV 57%

Creating Blank Canvas Against AI-enabled Image Forgery

对抗AI图像伪造的空白画布创建

Qi Song, Ziyuan Luo, Renjie Wan

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出了一种基于Segment Anything Model的对抗性方法,通过将图像转换为空白画布来检测AI图像伪造,利用频率感知优化策略提升篡改定位能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 81 篇

2504.13987 2025-12-01 cs.CV cs.AI 85%

Entropy Rectifying Guidance for Diffusion and Flow Models

熵校正引导用于扩散和流模型

Tariq Berrada Ifriqi, Adriana Romero-Soriano, Michal Drozdzal, Jakob Verbeek, Karteek Alahari

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔研究所) LJK, France(法国劳埃德-约瑟夫-克劳德实验室) McGill University(麦吉尔大学) Mila, Quebec AI institute(魁北克人工智能研究所) Canada CIFAR AI chair(加拿大 CIFAR 人工智能主席)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ERG是一种基于注意力机制变化的简单有效引导方法,能同时提升图像质量、多样性及提示一致性,适用于扩散和流模型的多种生成任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00234 2025-12-01 cs.LG cs.CV cs.NA math.NA physics.comp-ph stat.ML 85%

Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms

离散扩散模型的快速求解器:高阶算法的理论与应用

Yinuo Ren, Haoxuan Chen, Yuchen Zhu, Wei Guo, Yongxin Chen, Grant M. Rotskoff, Molei Tao, Lexing Ying

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。

Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23377 2025-12-01 cs.CV 83%

DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline

DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线

Rui Zhang, Hongxia Wang, Hangqing Liu, Yang Zhou, Qiang Zeng

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。

Comments 13pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19104 2025-12-01 cs.LG eess.IV stat.ML 82%

Composition and Alignment of Diffusion Models using Constrained Learning

扩散模型的组成与对齐:基于约束学习

Shervin Khalafi, Ignacio Hounie, Dongsheng Ding, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Tennessee, Knoxville(田纳西大学,基洛那分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出了一种基于约束学习的框架,通过统一对齐和组成扩散模型,以提高生成样本的质量和符合用户需求的能力。

Comments 48 pages, 6 figures, 15 tables; Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16786 2025-12-01 cs.DC 82%

Staleness-Centric Optimizations for Parallel Diffusion MoE Inference

以 staleness 为中心的并行扩散 MoE 推理优化

Jiajun Luo, Lizhuo Luo, Jianru Xu, Jiajun Song, Rongwei Lu, Chen Tang, Zhi Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 DICE 提出了一种以 staleness 为中心的优化框架,通过交错并行性、选择性同步和条件通信减少 staleness,实现 1.26 倍速度提升并保持高质量。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00359 2025-12-01 cs.LG eess.IV 82%

Linearly Constrained Diffusion Implicit Models

线性约束扩散隐式模型

Vivek Jayaram, Ira Kemelmacher-Shlizerman, Steven M. Seitz, John Thickstun

机构 * University of Washington(华盛顿大学) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 CDIM通过动态调整投影步骤减少数量,实现快速准确解决噪声线性逆问题,适用于多种图像处理任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 79%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22870 2025-12-01 cs.CV q-bio.NC 79%

Scalable Diffusion Transformer for Conditional 4D fMRI Synthesis

可扩展的扩散变换器用于条件4D fMRI合成

Jungwoo Seo, David Keetae Park, Shinjae Yoo, Jiook Cha

机构 * Seoul National University(首尔国立大学) Brookhaven National Laboratory(布鲁赫斯旺国家实验室) Seoul National Laboratory(首尔国立实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种可扩展的扩散变换器,用于条件4D fMRI合成,通过结合3D VQ-GAN和CNN-Transformer结构,实现了高精度的任务条件生成。

Comments Accepted at NeurIPS 2025 Workshop: Foundation Models for the Brain and Body. 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22759 2025-12-01 cs.CV cs.AI 79%

MammoRGB: Dual-View Mammogram Synthesis Using Denoising Diffusion Probabilistic Models

MammoRGB: 基于去噪扩散概率模型的双视角乳腺X线合成

Jorge Alberto Garza-Abdala, Gerardo A. Fumagal-González, Daly Avendano, Servando Cardona, Sadam Hussain, Eduardo de Avila-Armenta, Jasiel H. Toscano-Martínez, Diana S. M. Rosales Gurmendi, Alma A. Pedro-Pérez, Jose Gerardo Tamez-Pena

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MammoRGB利用三通道DDPM生成双视角乳腺X线图像,通过不同通道编码提升图像保真度和跨视角一致性,为数据集增强提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03143 2025-12-01 cs.CV 79%

SARD: Segmentation-Aware Anomaly Synthesis via Region-Constrained Diffusion with Discriminative Mask Guidance

SARD: 通过区域约束扩散与判别掩码引导进行的分段感知异常合成

Yanshu Wang, Xichen Xu, Xiaoning Lei, Guoyang Xie

机构 * Global Institute of Future Technology(未来技术全球研究所) Shanghai Jiao Tong University(上海交通大学) Department of Intelligent Manufacturing(智能制造系) Contemporary Amperex Technology Co.,Ltd(当代电子技术有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SARD通过区域约束扩散与判别掩码引导方法,提升工业异常检测系统的鲁棒性,实现更精确的像素级异常合成。

Comments Accepted by The 2025 International Conference on Machine Intelligence and Nature-InspireD Computing (MIND)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11764 2025-12-01 cs.CV eess.IV 79%

DiffFuSR: Super-Resolution of all Sentinel-2 Multispectral Bands using Diffusion Models

DiffFuSR:利用扩散模型实现所有Sentinel-2多光谱波段的超分辨率处理

Muhammad Sarmad, Arnt-Børre Salberg, Michael Kampffmeyer

机构 * Norwegian Computing Center(挪威计算中心) Department of Physics and Technology, UiT The Arctic University of Norway(物理与技术系,UiT 北极大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffFuSR通过扩散模型和融合策略实现Sentinel-2多光谱波段的超分辨率处理,提升反射率保真度和光谱一致性。

Comments Accepted for Publication at IEEE TRANSACTIONS ON GEOSCIENCE AND REMOTE SENSING (TGRS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22488 2025-12-01 cs.CV 79%

AI killed the video star. Audio-driven diffusion model for expressive talking head generation

AI杀死了视频明星。用于表达性说话头生成的音频驱动扩散模型

Baptiste Chopin, Tashvik Dhamija, Pranav Balaji, Yaohui Wang, Antitza Dantcheva

机构 * Centre INRIA d’Université Côte d’Azur(INRIA中心,坎特伯雷大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Dimitra++通过音频驱动的扩散模型生成具有真实嘴唇运动、面部表情和头部姿态的说话头,优于现有方法。

Comments arXiv admin note: text overlap with arXiv:2502.17198

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22456 2025-12-01 cs.CV 79%

ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models

ITS3D: 推理时缩放用于文本引导的3D扩散模型

Zhenglin Zhou, Fan Ma, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua

机构 * ReLER, Zhejiang University(浙江大学ReLER实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ITS3D通过优化问题和验证器引导搜索算法,提升文本引导的3D扩散模型生成质量。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD 79%

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19229 2025-12-01 cs.CV cs.AI 79%

Learning Plug-and-play Memory for Guiding Video Diffusion Models

学习插件式记忆以指导视频扩散模型

Selena Song, Ziming Xu, Zijun Zhang, Kun Zhou, Jiaxian Guo, Lianhui Qin, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiT-Mem,通过学习插件式记忆增强视频扩散模型的物理规则遵循和视频保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17138 2025-12-01 cs.CV 79%

One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution

一步扩散变换器用于可控的现实世界图像超分辨率

Yushun Fang, Yuxiang Chen, Shibo Yin, Qiang Hu, Jiangchao Yao, Ya Zhang, Xiaoyun Zhang, Yanfeng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc(小红书公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ODTSR通过噪声混合视觉流和保真度感知对抗训练,实现一步扩散变换器在现实世界图像超分辨率中的保真度与可控性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏