arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2604.22649 2026-04-27 cs.NE cs.CV 83%

Structure-Guided Diffusion Model for EEG-Based Visual Cognition Reconstruction

基于结构引导的扩散模型用于EEG视觉认知重建

Yongxiang Lian, Yueyang Cang, Pingge Hu, Yuchen He, Li Shi

机构 * China Academy of Information and Communications Technology(信息与通信技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出结构引导扩散模型(SGDM),通过整合结构信息提升EEG视觉重建的精度与泛化能力,实现更高质量的视觉内容解码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20816 2026-04-23 cs.LG cs.CV 83%

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

ParetoSlider:扩散模型后训练用于连续奖励控制

Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) Lightricks(Lightricks公司) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 ParetoSlider提出多目标强化学习框架,通过连续变化的偏好权重训练单个扩散模型,实现推理时对冲突目标的精细控制。

Comments Project page: https://shelley-golan.github.io/ParetoSlider-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20796 2026-04-23 cs.CV 83%

LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model

LLaDA2.0-Uni:通过扩散大语言模型统一多模态理解和生成

Inclusion AI, Tiwei Bie, Haoxing Chen, Tieyuan Chen, Zhenglin Cheng, Long Cui, Kai Gan, Zhicheng Huang, Zhenzhong Lan, Haoquan Li, Jianguo Li, Tao Lin, Qi Qin, Hongjun Wang, Xiaomei Wang, Haoyuan Wu, Yi Xin, Junbo Zhao

机构 * AGI Research Center, Inclusion AI(AGI研究中心,Inclusion AI)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LLaDA2.0-Uni结合全语义离散分词器、MoE-based dLLM和扩散解码器,实现多模态理解和生成,通过SigLIP-VQ离散化视觉输入,提升推理效率,支持交错生成与推理,展现强大的图像生成与编辑能力。

Comments LLaDA2.0-Uni Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18201 2026-04-21 cs.CV cs.LG 83%

DiffuSAM: Diffusion Guided Zero-Shot Object Grounding for Remote Sensing Imagery

DiffuSAM: 基于扩散的零样本目标定位用于遥感影像

Geet Sethi, Panav Shah, Ashutosh Gandhe, Soumitra Darshan Nayak

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiffuSAM,结合扩散模型与先进分割模型,提升遥感影像目标定位精度,实验显示在Acc@0.5上提升超14%。

Comments Accepted at ICLR 2026 ML4RS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17773 2026-04-21 cs.CV 83%

Structure-Adaptive Sparse Diffusion in Voxel Space for 3D Medical Image Enhancement

针对体素空间的结构自适应稀疏扩散用于3D医学图像增强

Hongxu Jiang, Fei Li, Boxiao Yu, Ying Zhang, Kaleb Smith, Kuang Gong, Wei Shao

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学电气与计算机工程系) Department of Medicine, University of Florida, Gainesville, FL, USA(佛罗里达大学医学系) Department of Biomedical Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学生物医学工程系) Research Computing, University of Florida, Gainesville, FL, USA(佛罗里达大学研究计算中心) NVIDIA, Santa Clara, CA, USA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种稀疏体素空间扩散框架,通过结构感知轨迹调制模块实现结构自适应去噪,提升3D医学图像的去噪和超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17492 2026-04-21 cs.CV 83%

Coevolving Representations in Joint Image-Feature Diffusion

联合图像-特征扩散中的共进化表示

Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis

机构 * Archimedes, Athena RC(阿基米德,雅典RC) University of Crete(克里特大学) National Technical University of Athens(雅典技术大学) IACM-Forth(IACM-第四研究机构)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CoReDi框架,通过共进化语义空间提升图像生成质量,实验显示其收敛更快且样本质量更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16483 2026-04-21 cs.CV cs.AI 83%

Dynamic Eraser for Guided Concept Erasure in Diffusion Models

动态擦除器:扩散模型中的引导概念擦除

Qinghui Gong

机构 * Southwest Jiaotong university(西南交通大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出动态语义引导(DSS)框架,通过敏感语义边界建模和敏感语义引导实现可控的概念擦除,提升安全内容生成效果。

Comments 26 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15911 2026-04-20 cs.CV 83%

Efficient Video Diffusion Models: Advancements and Challenges

高效视频扩散模型:进展与挑战

Shitong Shao, Lichen Bai, Pengfei Wan, James Kwok, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文综述了高效视频扩散模型的进展与挑战,分析了四种主要范式,探讨了减少函数调用次数和降低每步开销的核心目标,并讨论了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15521 2026-04-20 cs.CV 83%

Frequency-Aware Flow Matching for High-Quality Image Generation

面向频率的流匹配用于高质量图像生成

Sucheng Ren, Qihang Yu, Ju He, Xiaohui Shen, Alan Yuille, Liang-Chieh Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) ByteDance(字节跳动)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出FreqFlow,通过时间依赖的自适应加权将频率感知条件融入流匹配框架,以提升图像生成的全局结构和细节质量,在ImageNet-256上取得最佳FID成绩。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14570 2026-04-17 cs.CV 83%

Deepfake Detection Generalization with Diffusion Noise

基于扩散噪声的深度伪造检测泛化

Hongyuan Qi, Wenjin Hou, Hehe Fan, Jun Xiao

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出利用扩散噪声特征提升深度伪造检测的泛化能力,通过引入注意力引导的噪声学习框架,增强模型对真实与合成图像差异的捕捉,实验表明在多个基准上取得最佳性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07069 2026-04-17 cs.CV cs.AI 83%

Bird-SR: Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution

Bird-SR:双向奖励引导扩散用于现实世界图像超分辨率

Zihao Fan, Xin Lu, Yidi Liu, Jie Huang, Dong Li, Xueyang Fu, Baocai Yin

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, School of Information Science and Technology, University of Science and Technology of China(脑启发智能感知与认知MoE实验室,信息科学与技术学院,中国科学技术大学) iFlytek Research, iFlytek Co., Ltd., Hefei, China(科大讯飞研究院,科大讯飞股份有限公司,合肥,中国)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Bird-SR通过双向奖励引导扩散框架,结合合成和真实图像数据,提升现实世界超分辨率的结构一致性与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21045 2026-04-15 cs.CV cs.AI 83%

LPNSR: Optimal Noise-Guided Diffusion Image Super-Resolution Via Learnable Noise Prediction

LPNSR: 通过可学习噪声预测实现最优噪声引导扩散图像超分辨率

Shuwei Huang, Shizhuo Liu, Zijun Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出LPNSR,通过可学习噪声预测器替代随机高斯噪声,优化扩散模型中的中间噪声,实现高感知性能,无需依赖大规模文本到图像先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21697 2026-04-15 cs.CV cs.LG 83%

Visual Diffusion Models are Geometric Solvers

视觉扩散模型是几何求解器

Nir Goren, Shai Yehezkel, Omer Dahary, Andrey Voynov, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文展示视觉扩散模型可直接解决几何问题,通过像素空间推理,解决四边形内接问题及Steiner树问题等,将几何推理转化为图像生成。

Comments Project page: https://kariander1.github.io/visual-geo-solver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17384 2026-04-15 cs.LG cs.CV stat.ML 83%

Variational Autoencoding Discrete Diffusion with Enhanced Dimensional Correlations Modeling

变分自编码离散扩散与增强的维度相关性建模

Tianyu Xie, Shuchen Xue, Zijin Feng, Tianyang Hu, Jiacheng Sun, Zhenguo Li, Cheng Zhang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Statistical Science, Peking University(北京大学统计科学中心) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Huawei Foundation Model Dept(华为基金会模型部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出VADD框架,通过潜在变量建模增强离散扩散,提升样本质量,尤其在少量去噪步骤时表现优异。

Comments ICLR 2026 Poster; 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20093 2026-04-15 cs.CV cs.AI 83%

StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback

StableSketcher: 通过视觉问答反馈增强扩散模型以生成基于像素的素描

Jiho Park, Sieun Choi, Jaeyoon Seo, Jihie Kim

机构 * Dongguk University(东国大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StableSketcher框架,通过优化潜在解码和视觉问答反馈提升扩散模型生成手绘素描的逼真度和语义一致性。

Comments Under review at IEEE Access. Author-submitted preprint. Not the IEEE-published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12242 2026-04-13 cs.CV cs.AI cs.LG 83%

OmniPrism: Learning Disentangled Visual Concept for Image Generation

OmniPrism: 学习解耦的视觉概念用于图像生成

Yangyang Li, Daqing Liu, Wu Liu, Allen He, Xinchen Liu, Yongdong Zhang, Guoqing Jin

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 OmniPrism通过自然语言引导学习解耦的视觉概念表示,结合扩散模型生成高质量图像,解决多方面概念混淆问题。

Comments WebPage available at https://tale17.github.io/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08301 2026-04-10 cs.CV 83%

GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis

GroundingAnomaly: 基于空间的扩散用于少样本异常合成

Yishen Liu, Hongcang Chen, Pengcheng Zhao, Yunfan Bao, Yuxi Tian, Jieming Zhang, Hao Chen, Zheng Zhi, Yongchun Liu, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) Beijing Jiaotong University(北京交通大学) Li Auto(理想汽车) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出GroundingAnomaly框架,通过空间条件模块和门控自注意力模块实现精准异常合成,提升少样本异常检测性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07879 2026-04-10 cs.CV cs.AI 83%

FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding

FlowGuard: 通过线性潜在解码实现扩散模型生成过程中的轻量级安全检测

Jinghan Yang, Yihe Fan, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 FlowGuard通过线性近似和课程学习方法,在生成过程中检测不安全内容,提升扩散模型的安全性和效率,F1分数优于现有方法30%以上,同时显著降低GPU内存占用和投影时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04678 2026-04-10 cs.CV 83%

ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing

ChangeBridge: 多模态控制下的遥感时空图像生成

Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06916 2026-04-09 cs.LG cs.AI cs.CV 83%

FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling

FP4探索,BF16训练:通过高效的回放缩放实现扩散强化学习

Yitong Li, Junsong Chen, Shuchen Xue, Pengcuo Zeren, Siyuan Fu, Dinghao Yang, Yangyang Tang, Junjie Bai, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA(英伟达) HKU(香港大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Sol-RL框架,通过FP4量化与BF16训练结合,提升扩散模型的对齐性能,实现训练效率与精度的平衡,实验显示在多个指标上表现优异,训练收敛速度提升4.64倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06568 2026-04-09 eess.IV cs.CV 83%

A Noise Constrained Diffusion (NC-Diffusion) Framework for High Fidelity Image Compression

一种面向高保真图像压缩的噪声约束扩散(NC-Diffusion)框架

Zhenyu Du, Yanbo Gao, Shuai Li, Yiyang Li, Hui Yuan, Mao Ye

机构 * Shandong University(山东大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出噪声约束扩散框架,通过将量化噪声作为扩散过程中的噪声,提升压缩效率和图像保真度,同时引入自适应频域滤波模块和零样本引导增强方法,实验证明其优于现有方法。

Comments Accepted by IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHNOLOGY

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17812 2026-04-09 cs.CV cs.AI cs.LG 83%

ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation

ChopGrad:通过截断反向传播实现基于像素的潜在视频扩散模型

Dmitriy Rivkin, Parker Ewen, Lili Gao, Julian Ost, Stefanie Walz, Rasika Kangutkar, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出ChopGrad,通过截断反向传播减少视频生成的内存消耗,实现高效的像素级损失微调,适用于视频超分辨率、修复和增强等任务。

Comments Project website: https://light.princeton.edu/chopgrad

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15510 2026-04-09 cs.CV cs.RO 83%

Exploring Conditions for Diffusion models in Robotic Control

探索扩散模型在机器人控制中的条件

Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) NAVER AI Lab(NAVER人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究利用预训练文本到图像扩散模型获取任务适应的视觉表示,提出ORCA方法以动态视觉信息提升机器人控制性能。

Comments Accepted to CVPR 2026. Project page: https://orca-rc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14685 2026-04-09 cs.CV cs.AI 83%

DiffSketcher: Text Guided Vector Sketch Synthesis through Latent Diffusion Models

DiffSketcher: 通过潜在扩散模型实现文本引导的向量草图合成

Ximing Xing, Chuang Wang, Haitao Zhou, Jing Zhang, Qian Yu, Dong Xu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiffSketcher,通过扩展的SDS损失优化贝塞尔曲线,实现从自然语言提示直接生成向量草图,提升生成质量与可控性。

Comments Accepted by NeurIPS 2023. Project page: https://ximinng.github.io/DiffSketcher-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05906 2026-04-08 cs.CV cs.AI 83%

Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation

选择性聚合注意力图提升基于扩散的视觉解释

Jungwon Park, Jungmin Ko, Dongnam Byun, Wonjong Rhee

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过选择性聚合相关注意力头提升文本到图像生成模型的可解释性,相比DAAM方法在均值IoU上表现更优,并发现相关注意力头能更准确捕捉概念特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05524 2026-04-08 cs.CV 83%

Cross-Resolution Diffusion Models via Network Pruning

通过网络剪枝实现跨分辨率扩散模型

Jiaxuan Ren, Junhan Zhu, Huan Wang

机构 * Westlake University(西湖大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CR-Diff方法,通过参数剪枝提升扩散模型在不同分辨率下的视觉一致性,保持默认分辨率性能,支持提示特定优化。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03674 2026-04-07 cs.CV 83%

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

DiffSparse: 通过学习的令牌稀疏性加速扩散变换器

Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(超威半导体公司) Tsinghua University(清华大学) BNRist(北京信息科学与技术国家研究中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiffSparse框架,通过学习令牌稀疏性优化扩散变换器的推理效率,减少计算成本并提升生成质量。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01514 2026-04-03 cs.CL cs.CV 83%

Why Instruction-Based Unlearning Fails in Diffusion Models?

为何基于指令的反学习在扩散模型中失效?

Zeliang Zhang, Rui Sun, Jiani Liu, Qi Wu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) UCLA(加州大学洛杉矶分校) UCSB(加州大学圣塔芭芭拉分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究探讨了基于指令的反学习在扩散模型中的有效性,发现扩散模型在仅依赖自然语言反学习指令时无法有效抑制目标概念,揭示了提示级指令的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12094 2026-04-02 cs.CV 83%

Error Propagation Mechanisms and Compensation Strategies for Quantized Diffusion

量化扩散模型中的误差传播机制与补偿策略

Songwei Liu, Chao Zeng, Chenqian Yan, Xurui Peng, Xing Wang, Fangmin Chen, Xing Mei

机构 * ByteDance Inc.(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于理论框架的误差传播建模与补偿策略,通过数学推导得到每一步量化误差传播方程,并在多个图像数据集上验证了该策略对误差传播的抑制效果,显著提升了PTQ方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29029 2026-04-01 cs.CV cs.AI 83%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏