arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-05 至 2025-12-05 共收录 53 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2512.04087 2025-12-05 q-bio.NC cs.CL cs.CV cs.CY cs.HC 86%

Human-Centred Evaluation of Text-to-Image Generation Models for Self-expression of Mental Distress: A Dataset Based on GPT-4o

以人为中心评估文本到图像生成模型以表达心理压力:基于GPT-4o的数据库

Sui He, Shenbin Qian

机构 * School of Culture and Communication, Swansea University(文化与沟通学院,萨里大学) Department of Informatics, University of Oslo(信息学院,奥斯陆大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本研究基于GPT-4o构建首个公开的文本到图像评估数据集,评估AI生成图像在心理健康自我表达中的有效性,发现角色提示设计显著影响用户评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG 83%

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04857 2025-12-05 cs.CV 83%

Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens

自回归图像生成只需少量缓存的token

Ziran Qin, Youru Lv, Mingbao Lin, Zeren Zhang, Chanfan Gan, Tieyuan Chen, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten Peking University(北京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 LineAR通过行级缓存压缩技术,在自回归图像生成中实现内存节省和吞吐量提升,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24387 2025-12-05 cs.CV 57%

CoCoIns: Consistent Subject Generation via Contrastive Instantiated Concepts

CoCoIns: 通过对比实例概念实现一致主体生成

Lee Hsin-Ying, Kelvin C. K. Chan, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CoCoIns通过对比学习实现一致主体生成,提升多生成内容的一致性与灵活性。

Comments TMLR 2025. Project page: https://contrastive-concept-instantiation.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17793 2025-12-05 cs.CV cs.AI 57%

SYNTHIA: Novel Concept Design with Affordance Composition

SYNTHIA:基于功能连贯性的新型概念设计

Hyeonjeong Ha, Xiaomeng Jin, Jeonghwan Kim, Jiateng Liu, Zhenhailong Wang, Khanh Duy Nguyen, Ansel Blume, Nanyun Peng, Kai-Wei Chang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 SYNTHIA通过分层概念本体和课程学习方案,实现基于功能连贯性的新颖设计生成。

Comments ACL 2025 Main, Code is available https://github.com/HyeonjeongHa/SYNTHIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15061 2025-12-05 cs.AI 50%

Empowering Clients -- Transformation of Design Processes Due to Generative AI

赋能客户——生成式人工智能对设计过程的转变

Johannes Schneider, Kilic Sinem, Daniel Stockhammer

机构 * University of Liechtenstein(利希滕斯坦大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 研究探讨生成式AI如何改变建筑设计过程,发现AI使客户能更快参与设计,但可能阻碍创新,同时引发建筑师角色转变和文化同质化风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2409.19051 2025-12-05 cs.CV cs.AI cs.MM 73%

Multimodal Markup Document Models for Graphic Design Completion

多模态标记文档模型用于图形设计完成

Kotaro Kikuchi, Ukyo Honda, Naoto Inoue, Mayu Otani, Edgar Simo-Serra, Kota Yamaguchi

机构 * Waseda University(早稻田大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 MarkupDM是一种多模态标记文档模型,通过统一处理图形设计任务,实现文本、图像和属性值的完成,展示了其在设计自动化中的广泛适用性。

Comments Accepted by ACM Multimedia 2025, Project page: https://cyberagentailab.github.io/MarkupDM/

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025. p.11022-11031

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23002 2025-12-05 cs.CV 57%

JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization

JarvisEvo: 向自进化式照片编辑代理迈进:协同编辑器-评估器优化

Yunlong Lin, Linqing Wang, Kunjie Lin, Zixu Lin, Kaixiong Gong, Wenbo Li, Bin Lin, Zhenxi Li, Shiyi Zhang, Yuyang Peng, Wenxun Dai, Xinghao Ding, Chunyu Wang, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文元)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 JarvisEvo通过协同编辑器-评估器优化,实现自进化式照片编辑代理,提升编辑质量和内容保真度。

Comments 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 32 篇

2408.10901 2025-12-05 cs.CV cs.AI cs.LG 89%

A Gray-box Attack against Latent Diffusion Model-based Image Editing by Posterior Collapse

针对基于潜在扩散模型的图像编辑的灰盒攻击

Zhongliang Guo, Chun Tong Lei, Lei Fang, Shuai Zhao, Yifei Qian, Jingyu Lin, Zeyu Wang, Cunjian Chen, Ognjen Arandjelović, Chun Pong Lau

机构 * School of Computer Science, University of St Andrews(圣安德鲁大学计算机科学学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Department of Data Science and Artificial Intelligence, Monash University(墨尔本大学数据科学与人工智能系) College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于后验崩溃现象的灰盒攻击方法,通过调整参数实现两种崩溃类型,有效防止未经授权的图像编辑,且对模型依赖低,计算效率高。

Comments 15 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04499 2025-12-05 cs.CV cs.GR 81%

Back to Basics: Motion Representation Matters for Human Motion Generation Using Diffusion Model

回归基础:扩散模型在人类运动生成中的运动表示至关重要

Yuduo Jin, Brandon Haworth

机构 * University of Victoria(维多利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文探讨了运动表示和损失函数对扩散模型生成人类运动的影响,通过实验评估不同运动表示和配置的效果,以提升运动扩散模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05000 2025-12-05 cs.CV cs.AI 79%

Reflection Removal through Efficient Adaptation of Diffusion Transformers

通过高效适应扩散变换器实现反射去除

Daniyar Zakarin, Thiemo Wandel, Anton Obukhov, Dengxin Dai

机构 * ETH Zürich(苏黎世联邦理工学院) HUAWEI Bayer Lab(华为拜耳实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散变换器的高效反射去除方法,通过物理驱动的数据合成和LoRA适应,实现了高保真的反射去除性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04699 2025-12-05 cs.CV 79%

OmniScaleSR: Unleashing Scale-Controlled Diffusion Prior for Faithful and Realistic Arbitrary-Scale Image Super-Resolution

OmniScaleSR: 解锁受控扩散先验以实现高保真和逼真任意尺度图像超分辨率

Xinning Chai, Zhengxue Cheng, Yuhong Zhang, Hengsheng Zhang, Yingsheng Qin, Yucai Yang, Rong Xie, Li Song

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) College of Information, Mechanical and Electrical Engineering, Shanghai Normal University(上海师范大学信息、机械与电气工程学院) Transsion in China(中国Transsion) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OmniScaleSR通过显式扩散控制机制和多领域保真度增强,实现高保真和逼真任意尺度图像超分辨率。

Comments Accepted as TCSVT, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04504 2025-12-05 cs.CV 79%

UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers

UltraImage: 重新思考图像扩散变换器中的分辨率外推

Min Zhao, Bokai Yan, Xue Yang, Hongzhou Zhu, Jintao Zhang, Shilong Liu, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, Tsinghua University(计算机科学与技术系,北京理工大学中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(光明人工智能学院,中国人民大学) Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UltraImage通过修正主导频率和自适应注意力集中,解决了图像扩散变换器在高分辨率外推中的内容重复和质量下降问题,实现了高达6K*6K的生成能力。

Comments Project page: https://thu-ml.github.io/ultraimage.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04459 2025-12-05 cs.CV 79%

dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning

dVLM-AD:通过可控推理增强扩散视觉语言模型以实现驾驶

Yingzi Ma, Yulong Cao, Wenhao Ding, Shuibai Zhang, Yan Wang, Boris Ivanovic, Ming Jiang, Marco Pavone, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 dVLM-AD通过可控推理提升扩散视觉语言模型,实现更一致的驾驶推理与规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04385 2025-12-05 cs.LG cs.AI cs.CV 79%

STeP-Diff: Spatio-Temporal Physics-Informed Diffusion Models for Mobile Fine-Grained Pollution Forecasting

STeP-Diff:用于移动细粒污染预报的时空物理指导扩散模型

Nan Zhou, Weijie Hong, Huandong Wang, Jianfeng Zheng, Qiuhua Wang, Yali Song, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Tech- nology (BNRist), Tsinghua University, China(电子工程系,北京信息科学与技术国家研究中心(BNRist),清华大学) Shenzhen Smartcity Communication, Shenzhen, China(深圳智慧城市通信) College of Soil and Water Conservation, Southwest Forestry University, China(水土保持学院,西南林业大学) College of Civil Engineering, Southwest Forestry University, China(土木工程学院,西南林业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 STeP-Diff通过结合DeepONet和PDE指导的扩散模型,有效提升移动细粒污染预报的精度与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22622 2025-12-05 cs.CV 79%

Zero4D: Training-Free 4D Video Generation From Single Video Using Off-the-Shelf Video Diffusion

Zero4D: 无需训练的单视频生成4D视频

Jangho Park, Taesung Kwon, Jong Chul Ye

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Zero4D通过无需训练的视频扩散模型,将单视频扩展为多视角4D视频,保持空间时间一致性。

Comments project page: https://zero4dvid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04985 2025-12-05 stat.ML cs.LG math.ST stat.TH 78%

Towards a unified framework for guided diffusion models

迈向引导扩散模型的统一框架

Yuchen Jiao, Yuxin Chen, Gen Li

机构 * Department of Statistics, the Chinese University of Hong Kong, Hong Kong(香港中文大学统计学系) Department of Statistics and Data Science, the Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院统计学与数据科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出统一框架,通过引入奖励引导项提升扩散模型奖励表现,并首次理论化无分类器引导的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04960 2025-12-05 cs.RO 78%

Hybrid-Diffusion Models: Combining Open-loop Routines with Visuomotor Diffusion Policies

混合扩散模型:结合开环流程与视觉运动扩散策略

Jonne Van Haastregt, Bastian Orthmann, Michael C. Welle, Yuchong Zhang, Danica Kragic

机构 * INCAR Robotics AB(INCAR机器人公司) KTH Royal Institute of Technology(皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 混合扩散模型结合开环流程与视觉运动扩散策略,通过遥控增强原语实现高效任务执行,验证于现实挑战任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04771 2025-12-05 cs.MA cs.LG 78%

Complementary Characterization of Agent-Based Models via Computational Mechanics and Diffusion Models

通过计算力学和扩散模型互补性表征基于代理的模型

Roberto Garrone

机构 * University of Milano-Bicocca(米兰-比科卡大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过计算力学和扩散模型互补性表征基于代理的模型,结合时间结构与分布几何分析复杂模拟模型。

Comments 11 pages. Methods paper introducing a dual-domain framework for analyzing ABM dynamics. Companion temporal-analysis preprint: arXiv:2510.12729

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14033 2025-12-05 physics.med-ph 78%

Adaptive Diffusion Models for Sparse-View Motion-Corrected Head Cone-beam CT

自适应扩散模型用于稀疏视图运动校正头锥形束CT

Antoine De Paepe, Alexandre Bousse, Clémentine Phung-Ngoc, Youness Mellak, Dimitris Visvikis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出了一种结合联合重建和运动估计的自适应扩散模型,用于解决头锥形束CT中稀疏视图下的运动补偿和图像重建问题,实验显示其在低剂量成像中具有显著优势。

Comments 12 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04586 2025-12-05 eess.IV 78%

Structure-Aware Adaptive Kernel MPPCA Denoising for Diffusion MRI

结构感知自适应核MPPCA去噪用于扩散磁共振成像

Ananya Singhal, Dattesh Dayanand Shanbhag, Sudhanya Chatterjee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出结构感知自适应核MPPCA方法,通过自适应补丁大小提升扩散磁共振成像的去噪效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04145 2025-12-05 astro-ph.IM astro-ph.GA 78%

Minuet: A Diffusion Autoencoder for Compact Semantic Compression of Multi-Band Galaxy Images

Minuet:一种用于多波段星系图像紧凑语义压缩的扩散自编码器

Alexander T. Gagliano, Yunyi Shen, V. A. Villar

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Minuet 通过低维扩散自编码器实现多波段星系图像的紧凑语义压缩,用于高效重建和科学分析。

Comments 27 pages, 15 figures, to be submitted to ApJ. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04135 2025-12-05 cs.LG 78%

Decoding Large Language Diffusion Models with Foreseeing Movement

通过预见性移动解码大语言扩散模型

Yichuan Mo, Quan Chen, Mingjie Li, Zeming Wei, Yisen Wang

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学) School of Mathematical Sciences, Peking University(数学学院,北京大学) CISPA Helmholtz Center for Information Security, Germany(信息安全赫尔姆霍兹中心,德国) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出FDM和FDM-A方法,通过整合局部和全局考虑,提升大语言扩散模型的解码效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13593 2025-12-05 quant-ph 71%

Forward-Time Equivalent of a "Retrocausal" Diffusion Hidden Variable Model for Quantum Mechanics

量子力学中“逆行因果”扩散隐藏变量模型的正向时间等效模型

William S. DeWitt, Benjamin H. Feintzeig

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出一种正向时间动力学模型,等效于量子力学中具有未来时间边界条件的逆行因果扩散隐藏变量模型,并通过均场极限解释其指导项的来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04969 2025-12-05 cs.CV cs.LG 57%

Rethinking the Use of Vision Transformers for AI-Generated Image Detection

重新思考视觉Transformer在AI生成图像检测中的应用

NaHyeon Park, Kunhee Kim, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sogang University(成均馆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MoLD方法,通过动态整合多层ViT特征提升AI生成图像检测性能,增强模型泛化能力与现实鲁棒性。

Comments Code: https://github.com/nahyeonkaty/mold

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04519 2025-12-05 cs.CV 57%

VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory

VideoSSM:基于混合状态-空间记忆的自回归长视频生成

Yifei Yu, Xiaoshan Wu, Xinting Hu, Tao Hu, Yangtian Sun, Xiaoyang Lyu, Bo Wang, Lin Ma, Yuewen Ma, Zhongrui Wang, Xiaojuan Qi

机构 * HKU(香港大学) PICO, ByteDance(字节跳动PICO) SUSTech(南方科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VideoSSM通过结合自回归扩散与混合状态空间记忆,实现了具有全局一致性和运动稳定性的长视频生成,支持提示自适应交互并提升内容多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04222 2025-12-05 cs.CV 57%

ReasonX: MLLM-Guided Intrinsic Image Decomposition

ReasonX: 基于多模态大语言模型的内在图像分解

Alara Dirik, Tuanfeng Wang, Duygu Ceylan, Stefanos Zafeiriou, Anna Frühstück

机构 * Imperial College London(伦敦帝国学院) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ReasonX通过多模态大语言模型提供相对比较监督,提升内在图像分解的泛化能力与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25998 2025-12-05 cs.CV cs.AI 57%

VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing

VRWKV-Editor: 降低基于变换器的视频编辑中的二次复杂度

Abdelilah Aitrouga, Youssef Hmamouche, Amal El Fallah Seghrouchni

机构 * International Artificial Intelligence Center of Morocco University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥国际人工智能中心摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) Sorbonne University, LIP6 - UMR 7606 CNRS, France(索邦大学,LIP6 - UMR 7606 CNRS,法国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VRWKV-Editor通过引入线性时空聚合模块,降低基于变换器的视频编辑模型的计算复杂度,实现3.7倍加速和60%内存节省,同时保持高质量的帧一致性和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04779 2025-12-05 cs.SD cs.AI 50%

YingMusic-Singer: Zero-shot Singing Voice Synthesis and Editing with Annotation-free Melody Guidance

YingMusic-Singer: 基于无标注旋律引导的零样本歌唱语音合成与编辑

Junjie Zheng, Chunbo Hao, Guobin Ma, Xiaoyu Zhang, Gongyu Chen, Chaofan Ding, Zihao Chen, Lei Xie

机构 * AI Lab, GiantNetwork(GiantNetwork人工智能实验室) ASLP Lab, Northwestern Polytechnical University(西北工业大学自动化学院实验室) University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 YingMusic-Singer通过无标注旋律引导的方法实现了零样本歌唱语音合成与编辑,提高了旋律稳定性和音频质量。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04720 2025-12-05 cs.SD 50%

M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis

M3-TTS: 多模态DiT对齐与梅尔-潜在空间用于零样本高质量语音合成

Xiaopeng Wang, Chunyu Qiang, Ruibo Fu, Zhengqi Wen, Xuefei Liu, Yukun Liu, Yuzhe Liang, Kang Yin, Yuankun Xie, Heng Xie, Chenxing Li, Chen Zhang, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 M3-TTS通过多模态扩散变换器实现零样本高质量语音合成,采用联合扩散层和梅尔-变体编码器,实现高效且自然的语音生成。

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏