arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2512.03520 2026-02-09 cs.CV 79%

FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation

FloodDiffusion:针对流式运动生成的定制扩散强迫

Yiyi Cai, Yuhan Wu, Kunhang Li, You Zhou, Bo Zheng, Haiyang Liu

机构 * Shanda AI Research Tokyo(上海沙达人工智能研究东京) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FloodDiffusion通过定制扩散强迫框架,在流式运动生成中达到SOTA性能,FID为0.057。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06195 2026-02-09 cs.CV 79%

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

DeDPO:用于扩散模型的去偏直接偏好优化

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

机构 * Cornell University(康奈尔大学) Rutgers University(罗格斯大学) NYU(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05605 2026-02-06 cs.LG cs.AI cs.CV 79%

Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers

Shiva-DiT:基于残差的可微Top-k选择用于高效扩散变换器

Jiaji Zhang, Hailiang Zhao, Guoxuan Zhu, Ruichao Sun, Jiaju Wu, Xinkui Zhao, Hanlin Tang, Weiyi Lu, Kan Liu, Tao Lan, Lin Qu, Shuiguang Deng

机构 * AIOS, Alibaba Group(阿里云人工智能实验室,阿里巴巴集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Shiva-DiT通过基于残差的可微Top-k选择,在保持端到端可学习性的同时,实现了高效扩散变换器的剪枝,提升了计算效率并减少了硬件开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05492 2026-02-06 cs.GR 79%

Monte Carlo Rendering to Diffusion Curves with Differential BEM

蒙特卡罗渲染到扩散曲线的差分边界元法

Ryusuke Sugimoto, Christopher Batty, Siddhartha Chaudhuri, Iliyan Georgiev, Toshiya Hachisuka, Kevin Wampler, Michal Lukáč

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出了一种基于差分边界元法的算法,能够直接从噪声蒙特卡罗样本生成带阴影信息的扩散曲线矢量图形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05434 2026-02-06 cs.CV 79%

LD-SLRO: Latent Diffusion Structured Light for 3-D Reconstruction of Highly Reflective Objects

LD-SLRO: 基于潜在扩散的结构光用于高反射物体的3-D重建

Sanghoon Jeon, Gihyun Jung, Suhyeon Ka, Jae-Sang Hyun

机构 * Department of Mechanical Engineering, Yonsei University(机械工程系,延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LD-SLRO通过潜在扩散模型和改进的结构光技术,提升高反射物体的3-D重建精度与光栅质量。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16001 2026-02-06 cs.CV 79%

Image-to-Image Translation with Diffusion Transformers and CLIP-Based Image Conditioning

基于扩散变换器和CLIP的图像到图像翻译

Qiang Zhu, Kuan Lu, Menghao Huo, Yuxiao Li

机构 * Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) University of Houston(休斯顿大学) School of Engineering(工程学院) Santa Clara University(圣克拉拉大学) School of Electrical and Computer Engineering(电气与计算机工程学院) Cornell University(康奈尔大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Northeastern University(东北大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散变换器和CLIP的图像到图像翻译方法,通过CLIP嵌入引导实现高质量、语义一致的图像转换,为配对图像翻译任务提供新方案。

Comments Published in: 2025 6th International Conference on Computer Vision, Image and Deep Learning (CVIDL)

Journal ref 2025 6th International Conference on Computer Vision, Image and Deep Learning (CVIDL), pp. 626-632,

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01411 2026-02-06 cs.CV 79%

Human Body Restoration with One-Step Diffusion Model and A New Benchmark

一步扩散模型与新基准的人体恢复

Jue Gong, Jingkai Wang, Zheng Chen, Xing Liu, Hong Gu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University, China(上海交通大学) vivo Mobile Communication Co., Ltd, China(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种一步扩散模型OSDHuman和新基准数据集PERSONA,用于提升人体恢复的视觉质量和定量指标。

Comments 8 pages, 9 figures. Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04873 2026-02-05 cs.CV 79%

Laminating Representation Autoencoders for Efficient Diffusion

对扩散模型进行表示编码器的封装以提高效率

Ramón Calvo-González, François Fleuret

机构 * University of Geneva(日内瓦大学) FAIR, Meta(FAIR与Meta)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FlatDINO通过将DINOv2的补丁特征压缩为一维序列,显著降低了扩散模型的计算成本,实现了更高的效率和更优的图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03122 2026-02-05 cs.CV cs.AI 79%

HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion

HAVIR: 基于CLIP引导的多功能扩散模型的分层视觉到图像重建

Shiyi Zhang, Dong Liang, Hairong Zheng, Yihang Zhou

机构 * Research Center for Medical AI, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(医学人工智能研究中心,深圳先进技术研究所,中国科学院) Research Center for Biomedical Imaging, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(生物医学成像研究中心,深圳先进技术研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HAVIR通过分层结构生成和语义提取,结合CLIP引导的多功能扩散模型,提升复杂场景下的图像重建质量。

Journal ref 2025 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19742 2026-02-05 cs.CV 79%

HAODiff: Human-Aware One-Step Diffusion via Dual-Prompt Guidance

HAODiff: 人类感知的单步扩散 via 双提示引导

Jue Gong, Tingyu Yang, Jingkai Wang, Zheng Chen, Xing Liu, Hong Gu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HAODiff通过双提示引导方法,针对人类运动模糊和通用噪声问题,提升图像修复的鲁棒性和视觉质量。

Comments 9 pages, 8 figures. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04300 2026-02-05 cs.CV 79%

Light Up Your Face: A Physically Consistent Dataset and Diffusion Model for Face Fill-Light Enhancement

点亮你的脸:一个物理一致的数据集和扩散模型用于人脸填充光增强

Jue Gong, Zihan Zhou, Jingkai Wang, Xiaohong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出LightYourFace-160K数据集和FiLitDiff模型,通过物理一致的渲染器和扩散模型实现高质量的人脸填充光增强,提升光照处理的可控性和保真度。

Comments 8 pages, 7 figures. The code and model will be available at https://github.com/gobunu/Light-Up-Your-Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04220 2026-02-05 cs.CV 79%

Adaptive 1D Video Diffusion Autoencoder

自适应一维视频扩散自编码器

Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, Xihui Liu

机构 * The University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司) CUHK(香港中文大学) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种自适应一维视频扩散自编码器,通过改进的编码和解码机制实现更高效的视频压缩与重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21610 2026-02-05 cs.CV 79%

WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models

WMVLM:通过视觉-语言模型评估扩散模型图像水印

Zijin Yang, Yu Sun, Kejiang Chen, Jiawei Zhao, Jun Jiang, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WMVLM通过视觉-语言模型提出首个统一且可解释的扩散模型图像水印评估框架,重新定义了残差和语义水印的评估指标,并通过三阶段训练策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17957 2026-02-05 cs.CV 79%

DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing

DiffVax: 面向扩散编辑的无优化图像免疫方法

Tarik Can Ozden, Ozgur Kara, Oguzhan Akcin, Kerem Zaman, Shashank Srivastava, Sandeep P. Chinchali, James M. Rehg

机构 * UIUC(伊利诺伊大学香槟分校) UT Austin(得克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffVax通过无优化的损失项实现高效的图像免疫,显著提升防御扩散编辑的速度和鲁棒性。

Comments Accepted into ICLR 2026. Project webpage: https://diffvax.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03533 2026-02-04 cs.CV 79%

PnP-U3D: Plug-and-Play 3D Framework Bridging Autoregression and Diffusion for Unified Understanding and Generation

PnP-U3D: 无缝接入3D框架,连接自回归与扩散以实现统一的理解与生成

Yongwei Chen, Tianyi Wei, Yushi Lan, Zhaoyang Lyu, Shangchen Zhou, Xudong Xu, Xingang Pan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PnP-U3D提出结合自回归与扩散的统一3D理解和生成框架,通过轻量级Transformer实现跨模态信息交换,提升3D生成与编辑性能。

Comments Yongwei Chen and Tianyi Wei contributed equally. Project page: https://cyw-3d.github.io/PnP-U3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03523 2026-02-04 cs.SD cs.AI cs.MM 79%

D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation From Lead sheet

D3PIA: 一种用于从乐谱生成钢琴伴奏的离散去噪扩散模型

Eunjin Choi, Hounsu Kim, Hayeon Bang, Taegyun Kwon, Juhan Nam

机构 * Graduate School of Culture Technology, KAIST, Republic of Korea(文化科技研究生院,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 D3PIA通过离散扩散模型和邻域注意力机制,有效生成符合乐谱约束的钢琴伴奏,优于连续扩散和Transformer基线模型。

Comments Accepted at 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03372 2026-02-04 cs.CV cs.AI 79%

SLIM-Diff: Shared Latent Image-Mask Diffusion with Lp loss for Data-Scarce Epilepsy FLAIR MRI

SLIM-Diff:共享潜在图像-掩码扩散模型与Lp损失用于数据稀缺的癫痫FLAIR MRI

Mario Pascual-González, Ariadna Jiménez-Partinen, R. M. Luque-Baena, Fátima Nagib-Raya, Ezequiel López-Rubio

机构 * ITIS Software, University of M\'alaga, Spain Department of Computer Languages Computer Science, University of M\'alaga, Spain IBIMA Plataforma BIONAND, Instituto de Investigaci\'on Biom\'edica de M\'alaga, Spain Department of Radiology, Hospital Regional Universitario de M\'alaga, Spain

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SLIM-Diff通过共享瓶颈U-Net和L_p损失提升癫痫FLAIR MRI中稀少病变的联合生成效果。

Comments 6 pages, 2 figures, 1 table, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03137 2026-02-04 cs.CV 79%

FSOD-VFM: Few-Shot Object Detection with Vision Foundation Models and Graph Diffusion

基于视觉基础模型和图扩散的少样本目标检测:FSOD-VFM

Chen-Bin Feng, Youyang Sha, Longfei Liu, Yongjun Yu, Chi Man Vong, Xuanlong Yu, Xi Shen

机构 * University of Macau(澳门大学) Intellindust AI Lab(Intellindust AI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FSOD-VFM通过结合视觉基础模型和图扩散技术,有效解决少样本目标检测中的边界框碎片化问题,提升检测精度和效率。

Comments Accepted by ICLR 2026. Code is available at: \url{https://intellindust-ai-lab.github.io/projects/FSOD-VFM}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02722 2026-02-04 cs.LG cs.CV cs.RO 79%

Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion

分层实体导向强化学习与分因子子目标扩散

Dan Haramati, Carl Qi, Tal Daniel, Amy Zhang, Aviv Tamar, George Konidaris

机构 * Brown University(布朗大学) UT Austin(得克萨斯大学) Carnegie Mellon University(卡内基梅隆大学) Technion(技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出分层实体导向强化学习方法,通过分因子子目标生成模型提升多实体领域中长周期任务的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14565 2026-02-04 cs.CV 79%

DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising

DiffVL: 基于扩散模型的2D地图视觉定位 via BEV条件化GPS去噪

Li Gao, Hongyang Sun, Liu Liu, Yunhao Li, Yang Cai

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffVL通过将视觉定位转化为GPS去噪任务,利用扩散模型在不依赖HD地图的情况下实现亚米级精度的可扩展定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04568 2026-02-04 cs.CV 79%

DDTracking: A Deep Generative Framework for Diffusion MRI Tractography with Streamline Local-Global Spatiotemporal Modeling

DDTracking: 一种用于扩散磁共振成像束追踪的深度生成框架,结合流线局部-全局时空建模

Yijie Li, Wei Zhang, Xi Zhu, Ye Wu, Yogesh Rathi, Lauren J. O'Donnell, Fan Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanjing University of Science and Technology(南京理工大学) Brigham and Women’s Hospital(布里奇沃特医院) Harvard Medical School(哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DDTracking通过深度生成框架结合局部-全局时空建模,实现更精确的扩散磁共振成像束追踪。

Comments Preprint version. The content may be updated in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22782 2026-02-04 cs.CV cs.AI cs.LG 79%

Patronus: Interpretable Diffusion Models with Prototypes

Patronus:基于原型的可解释扩散模型

Nina Weng, Aasa Feragen, Siavash Bigdeli

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Patronus通过原型网络实现可解释的扩散模型,揭示生成过程中的视觉模式及语义演变,提升对扩散模型的理解与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05743 2026-02-04 cs.LG cs.CV 79%

Understanding Representation Dynamics of Diffusion Models via Low-Dimensional Modeling

通过低维建模理解扩散模型的表示动态

Xiao Li, Zekai Zhang, Xiang Li, Siyi Chen, Zhihui Zhu, Peng Wang, Qing Qu

机构 * University of Michigan(密歇根大学) Ohio State University(俄亥俄州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过低维建模研究扩散模型中单峰表示动态的形成机制及其在分类任务中的泛化能力

Comments First two authors contributed equally. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02107 2026-02-03 cs.CV 79%

Teacher-Guided Student Self-Knowledge Distillation Using Diffusion Model

教师引导的学生自知识蒸馏使用扩散模型

Yu Wang, Chuanguang Yang, Zhulin An, Weilun Feng, Jiarui Zhao, Chengqing Yu, Libo Huang, Boyu Diao, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 教师引导的学生自知识蒸馏使用扩散模型,通过轻量级扩散模型和局部敏感哈希方法提升学生模型对教师知识的学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02092 2026-02-03 cs.CV 79%

FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space

FSVideo: 一种在高度压缩潜在空间中的快速速度视频扩散模型

FSVideo Team, Qingyu Chen, Zhiyuan Fang, Haibin Huang, Xinwei Huang, Tong Jin, Minxuan Lin, Bo Liu, Celong Liu, Chongyang Ma, Xing Mei, Xiaohui Shen, Yaojie Shen, Fuwen Tan, Angtian Wang, Xiao Yang, Yiding Yang, Jiamin Yuan, Lingxi Zhang, Yuxin Zhang

机构 * FSVideo Team Intelligent Creation(FSVideo团队智能创作)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FSVideo通过高度压缩的潜在空间和改进的扩散Transformer架构,在速度和质量上实现了高效视频生成。

Comments Project Page: https://kingofprank.github.io/fsvideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01949 2026-02-03 cs.LG cs.CV 79%

Boundary-Constrained Diffusion Models for Floorplan Generation: Balancing Realism and Diversity

边界约束扩散模型用于布局生成:在真实感与多样性之间平衡

Leonardo Stoppani, Davide Bacciu, Shahab Mokarizadeh

机构 * University of Pisa(比萨大学) H&M Group(H&M集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出边界约束扩散模型,通过引入BCA模块提升边界一致性,并引入DS指标平衡布局生成中的真实感与多样性。

Comments Accepted at ESANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01570 2026-02-03 cs.CV 79%

One-Step Diffusion for Perceptual Image Compression

单步扩散用于感知图像压缩

Yiwen Jia, Hao Wei, Yanhui Zhou, Chenyang Ge

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) School of Information and telecommunication(信息与电信学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种单步扩散图像压缩方法,通过紧凑特征表示和判别器提升感知质量,实现46倍更快的推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18623 2026-02-03 cs.CV 79%

Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation

扩散模型中自适应域偏移用于跨模态图像翻译

Zihao Wang, Yuzhou Chen, Shaogang Ren

机构 * Laplace Lab at University of Tennessee(田纳西大学Laplace实验室) University of California Riverside(加州大学河滨分校) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种自适应域偏移方法,通过在扩散模型生成过程中嵌入域偏移动态,提升跨模态图像翻译的结构保真度和语义一致性。

Comments Paper accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04456 2026-02-03 cs.CV cs.AI 79%

GuidNoise: Single-Pair Guided Diffusion for Generalized Noise Synthesis

GuidNoise:单对引导扩散用于通用噪声合成

Changjin Kim, HyeokJun Lee, YoungJoon Yoo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GuidNoise通过单对引导扩散模型实现通用噪声合成,无需额外元数据,提升去噪性能,尤其适用于轻量模型和有限数据场景。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13745 2026-02-03 cs.CV 79%

UniCalli: A Unified Diffusion Framework for Column-Level Generation and Recognition of Chinese Calligraphy

UniCalli: 一种统一的扩散框架,用于中文书法的列级生成与识别

Tianshuo Xu, Kai Wang, Zhifei Chen, Leyi Wu, Tianshui Wen, Fei Chao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) China University of Geoscience Beijing(中国地质大学(北京)) Xiamen University(厦门大学) HKUST(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniCalli提出一种统一的扩散框架,通过联合训练实现中文书法列级生成与识别,提升生成质量和识别性能,同时扩展至其他古代文字。

Comments Page: https://envision-research.github.io/UniCalli/

详情

展开后加载摘要…

URL PDF HTML 收藏